算法论文8
MME - Emotion 评测:多模态大模型情感智能不足
机器之心
AI 摘要
香港中文大学和阿里通义实验室团队:提出 MME - Emotion 评测基准,评测 20 个主流多模态大模型,发现模型情感智能不足,未来发展需关注视觉建模、信息融合和推理机制。
阅读原文 · 机器之心
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
开源动态8
具身智能评测:机器人距通用操作还差得远
原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。
量子位
开源动态8
MemoBench:捅破世界模型评测最大盲区
过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。
机器之心
开源动态8
上海交大开源 HLL,测 Agent 验证码处理能力
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。
深度学习自然语言处理