新闻资讯7
ClockBench测试:AI认表远不如人类
AI工程化
AI 摘要
ClockBench测试让11个多模态大模型与人类认表,人类准确率近9成,AI最高仅13.3%。AI处理抽象指令强,但复杂钟面表现差,暴露视觉AI空间推理缺陷,对评估有启发。
阅读原文 · AI工程化
ClockBench:一个简单的钟表测试让AI全线溃败
ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
GPT-5.6 Sol视觉能力跃升,性价比战刚开场
第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。
新智元
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
产品应用7
RabbitVis:引领视觉AI进入创作流程
随着AI生图能力提升,如何让AI进入创作流程成新问题。兔展智能基于UniWorld - Design视觉AI大模型推出RabbitVis,推动视觉AI从图片生成走向可编辑、可交付的创作流程,解决创作流程断点问题。
机器之心
开源动态8
上海交大开源 HLL,测 Agent 验证码处理能力
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。
深度学习自然语言处理