「多模态指令数据合成」共找到 3412 篇相关文章
准确率腰斩!大模型视觉能力一出日常生活就「失灵」
EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。
100万亿Token看懵硅谷!全球一半算力写代码,另一半在「搞颜色」 ?
OpenRouter和a16z联合发布报告,基于100万亿Token实证数据揭秘2025年AI发展。开源模型流量占比达30%,推理模型成主流,编程和角色扮演是主要使用场景,亚洲付费使用量翻倍,中文成全球第二大交互语言。
AI引发K型分化:Gemini 3 加剧技术劳动力分化,判断力为王,基础岗位将被AI完全替代,程序员也不例外
2025年11月Google发布Gemini 3,依托多模态MoE架构和“Deep Think”模式,在软件工程等领域实现推理能力质的飞跃。它使前端开发工作重心转移,重构软件工程工作流,赋能白领但带来隐患,还冲击劳动力市场,提升软件掌握门槛。
LLM 语境下,「持续学习」是否是 「记忆」 问题的最优解?
本期通讯解读 3 个 AI 业内要事,包括谷歌嵌套学习范式引争议、AI 产品记忆方向探讨、英伟达合成数据等。谷歌 NL 范式想规避遗忘问题,测试中 HOPE 表现优,但也遭质疑,当前 LLM 研究更关注改善记忆。
华为世界模型来了!单卡30分钟生成272㎡场景
华为联合上海交通大学、华中科技大学推出世界模型WordGrow,可生成1800㎡超大室内场景,单卡30分钟跑272㎡。它用数据精准预处理、3D块补全机制、粗到精生成策略填3D场景构建的坑,指标优、速度快。
浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力
浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。
313页的StateofAI2025报告全解读:今年AI圈发生了什么
本文解读了313页的《State of AI 2025》报告,回顾去年预测,盘点今年AI圈大事,如DeepSeek崛起、OpenAI开源、NVIDIA循环投资等,还提及AI安全、数据使用情况,最后给出2026年10个预测并为普通人提供关注建议。
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。
开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜
继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。
字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式
字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。