「多模态文档」共找到 1219 篇相关文章
谷歌发布最强 AI“全家桶”、一句话就让AI拍大片!这一夜,谷歌Gemini贯穿始终,网友:果然Android“靠边站”了
谷歌在I/O大会推出AI“全家桶”,含Gemini 2.5模型更新、搜索新AI模式等。谷歌已发布十多个新模型、20多个重大AI产品与功能,多项数据显示AI发展迅速,还有多项目融入产品,多模态模型升级。
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%
Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知
多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。
AI上清北,普通人该怎么办?|甲子光年
2025年AI模拟高考成绩达清北线,引发对人类努力意义的思考。三位嘉宾围绕AI能力进步、与人类能力差异、对教育和创作的影响等展开对谈,探讨人类在AI时代的定位、专业选择、教育变革等问题。
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
本文整理自新加坡国立大学Show Lab负责人寿政教授在ECCV 2026的分享,团队研发融合自回归与离散扩散的Show-o/Show-2统一架构,解决多模态理解与生成融合痛点,延伸至具身智能领域,突破数据稀缺、推理延迟等核心瓶颈。
阿里首个世界模型:快乐…生蚝
刚成立一个月的阿里ATH事业群发布全球首个主动式实时交互世界模型HappyOyster(快乐生蚝),它搭载原生多模态架构,有漫游、导演、创造、分享等玩法,目前需邀请码体验。其技术突破让它区别于传统文生视频模型。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG已成大模型落地标配技术,但存在搜到对的文档、模型答案却离谱的痛点。德国萨尔大学等组成的团队诊断出问题在阅读理解,提出Disco - RAG框架,在“搜”和“答”间加“读懂”环节,已被ACL 2026主会录用。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。