算法论文8
南大傅朝友发布 Video-MME-v2 挤干模型高分水分
机器之心
AI 摘要
南大傅朝友团队推出 Video-MME-v2 评测基准。它用分层能力体系和组级非线性评分,发现最强商业模型 Gemini-3-Pro 得分 49.4,与人类差距大,还揭示 “Thinking” 不总有效。
阅读原文 · 机器之心
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Agent在真实工作场景成功率低
作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。
数字生命卡兹克
新闻资讯7
林俊旸创业做Agent,腾讯已投估值20亿美元
前Qwen一号位林俊旸官宣创业公司Pragmatik Labs,方向为做横跨数字与物理世界的下一代Agent。公司获高榕、红杉、腾讯等投资,投后估值达20亿美元。虽无产品模型,但凭借林俊旸过往成绩受关注。
量子位
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
新闻资讯7
卡帕西:《指环王》接棒评测大模型
大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。
量子位