新闻资讯8
Opus 5通关测试:强模型需简单环境
新智元
AI 摘要
新智元报道,Opus 5经开发者Jeremy Berman测试,借助电脑ARC - AGI - 3测试正确率从30.2%升至96.2%。代码开源后测试其他模型效果差。Berman认为强模型需简单环境,架子会成束缚。
阅读原文 · 新智元
Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子
ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Anthropic:Claude暗中降智引风波
开发者argofowl排查后发现Claude Code将「high」推理程度读成原本「low」对应的值,原来Anthropic在做实验。科技博主曝光后AI圈炸锅,工程师虽回应,但Opus 5也被指降智。
新智元
新闻资讯7
Anthropic新模型补位,Fable 5爆冷遇尴尬
Anthropic提前曝光两个新模型claude-mashmallow-eap和claude-melon-eap,早期实测Marshmallow更佳。此前上线的最强Fable 5爆冷,企业调用少,营收低,其弟Opus 5反而胜出,开源模型也在抢占份额。
新智元
新闻资讯7
三款LLM新品发布,社区实测性能大比拼
LLM大爆发,一天内推出Grok 4.6、Qwen3.8 - Max、DeepSeek - V4 - Pro - 0813三款前沿产品。社区对它们进行多场景测试,如3D场景、Flappy游戏、飞机滑行动画等,并对比了不同模型的性能、价格和输出质量。
PaperAgent
新闻资讯7
Karpathy:10美元两小时做出《指环王》3D游戏
Andrej Karpathy 让 Opus 5 根据《指环王》开篇文字,用 Three.js 制作三维场景,成本约 10 美元,两小时写出 5500 行代码。虽效果粗糙但有趣,他设想未来大模型能按需生成虚拟世界,不过也暴露大模型难以检查成果的问题。
机器之心