算法论文7
大模型看图能力差,与人类有近 9 倍鸿沟
机器之心
AI 摘要
作者团队发布 ActiveVision 测量大模型「主动观察」能力。评测显示,无工具时大模型与人类准确率差距近 9 倍;用工具虽提升但仍有距离,且使用工具代价大,瓶颈仅转移。
阅读原文 · 机器之心
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
百融智能“硅基客服”跨行业上岗
今年7月,一家头部物流企业和大型综合类头部券商上线百融智能的AI客服,业务量和部署规模增长显著。百融智能正战略升级,以新一代AICC智能联络技术向多行业拓展,其创始人张韶峰分享了相关思考与技术优势。
机器之心
7
小扎:Meta新模型逼平Fable 5还便宜
Meta推出新模型Muse Spark 1.3,在Artificial Analysis榜单中与Fable 5打平手。小扎称其在Coding和Agent工作有大幅提升,还便宜。网友实测它真能肝、真能省,Meta团队核心研究员也透露背后改动。
量子位
新闻资讯7
Anthropic发布Fable 5.1,性能性价比双提升
昨晚,Anthropic发布Fable 5.1和Mythos 5.1,这代沿用Fable 5参数,性能提升聚焦长任务,还降低缓存读取价。它在游戏、视频等多个领域表现出色,与同类模型对比进步明显,虽价格贵,但能力、速度有提升。
鲸选AI
产品应用8
Anthropic发布Claude 5.1,性能价格双优
Anthropic发布Claude Fable 5.1和Claude Mythos 5.1两款大模型,性能登顶且解决开发者关注问题。缓存读取费用降75%,跑分屠榜,科研能力强,安全系统重构,合作实测效果好,盲测风格与GPT - 5.6 Sol不同。
AI寒武纪