新闻资讯7
2025年AI读表能力仍远逊人类
新智元
AI 摘要
AI基准ClockBench测试显示,人类读模拟时钟平均准确率89.1%,11个主流大模型最好仅13.3%。谷歌Gemini 2.5系列领先,Grok 4表现不佳。后续需研究提升AI读表能力的方法。
阅读原文 · 新智元
2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没
AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Anthropic:Claude暗中降智引风波
开发者argofowl排查后发现Claude Code将「high」推理程度读成原本「low」对应的值,原来Anthropic在做实验。科技博主曝光后AI圈炸锅,工程师虽回应,但Opus 5也被指降智。
新智元
推荐文章7
董舒:AI数字员工催生OPC一人公司
OpenHex董舒认为AI最大价值是替人出面干活,提出数字员工概念。他指出判断力密度高的岗位易被AI取代,中国服务业有发展机会。还辨析数字员工类型,介绍其平台OPS Agent,最后分享了数字员工相关Q&A。
AI科技大本营
推荐文章8
TypeScript 之父:AI 杀不死老语言,初级工程师不会被取代
前 Meta 资深工程师 Ryan Peterman 对话 TypeScript 之父 Anders Hejlsberg,谈及 TypeScript 编译器从 JavaScript 移植到 Go 的考量,反驳‘AI 将写完所有代码’等论调,指出主流语言地位会因 AI 更巩固,初级工程师不会被取代。
AI科技大本营
产品应用8
祝毅晨团队发布世界仿真器CurrentWorld - 0
Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。
量子位