算法论文8
EMMA揭示MLLMs图文联动推理危机
深度学习自然语言处理
AI 摘要
当前MLLMs在图文深度融合推理能力上有挑战,EMMA基准评估该能力。评测9个前沿MLLMs,发现其与人类专家有性能鸿沟,思维链提示和测试时计算扩展作用有限,揭示了MLLMs视觉推理缺陷。
阅读原文 · 深度学习自然语言处理
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文7
大模型看图能力差,与人类有近 9 倍鸿沟
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
机器之心
推荐文章8
Protocol - H:解决 RAG 模态鸿沟难题
企业 AI 团队面临 RAG 系统在处理结构化与非结构化数据时的难题。本文探讨用分层多智能体编排解决“模态鸿沟”,介绍 Protocol - H 架构,阐述组件、机制、实现与集成,经基准测试验证其优势,还提及未来研究方向。
InfoQ
新闻资讯7
陈博远揭秘OpenAI GPT Image 2幕后花絮
OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。
机器之心
开源动态8
北大开源OpenWorldLib搞定多类推理任务
世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。
量子位