算法论文7
大模型视觉推理远逊人类
量子位
AI 摘要
清华等团队:发布RBench - V评估大模型视觉推理能力,o3准确率25.8%排首位,但远低于人类的82.3%,开源模型表现更差,现有模型在复杂多模态推理任务中能力严重不足。
阅读原文 · 量子位
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文7
Gemini、GPT进《我的世界》评测,新框架破瓶颈
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
AI科技评论
开源动态8
Genspark开源免费AI办公套件GenOffice
Genspark团队开源AI办公套件GenOffice,全平台免费无广告。它界面类似微软Office,零成本上手,AI能直接编辑文档。虽处Alpha阶段,但可切换多种模型,还给出了配置第三方模型的方法。
CourseAI
新闻资讯7
谷歌拆分DeepMind,布林力促Gemini
DeepMind换帅一周后震荡持续,谷歌将拆分它,把部分非技术团队转入谷歌汇报体系。谷歌联合创始人谢尔盖·布林重新介入Gemini。此外,Gemini因算力、内讧、官僚等问题落后。
量子位
新闻资讯7
谢尔盖・布林推动Google押注AI自我进化
据路透社报道,Google联合创始人谢尔盖・布林深度介入AI研发,推动递归式自我改进(RSI)方向。此前Google新一代Gemini旗舰模型发布推迟,内部测试显示在关键领域落后对手,此次调整或为提升研发效率。
机器之心