算法论文8
南大团队:最强模型视频理解得分远低于人类
新智元
AI 摘要
南大傅朝友团队推出Video - MME - v2评测基准。评测显示人类得分90.7,最强商业模型Gemini - 3 - Pro仅49.4。还发现传统Acc指标虚高,‘Thinking’依赖文本线索,未必总能提升性能。
阅读原文 · 新智元
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Agent在真实工作场景成功率低
作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。
数字生命卡兹克
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
新闻资讯7
卡帕西:《指环王》接棒评测大模型
大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。
量子位
开源动态8
开源项目让Claude具备看视频能力
平时找视频信息效率低,而开源项目让Claude等大模型 “看懂” 视频,能提取画面、音频并理解内容。介绍了其工作原理、帧预算、去重、细节模式等,安装使用门槛低,还给出了应用场景和项目地址。
GitHubStore