新闻资讯7
卡帕西:《指环王》接棒评测大模型
量子位
AI 摘要
卡帕西:Anthropic用《指环王》开启大模型新评测,Opus 5生成粗糙3D场景。网友测试创意足,但新测试成本高引争议,其或考验模型通用推理能力。
阅读原文 · 量子位
Show me《指环王》!卡帕西强推大模型评测新基准
大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Anthropic:Claude暗中降智引风波
开发者argofowl排查后发现Claude Code将「high」推理程度读成原本「low」对应的值,原来Anthropic在做实验。科技博主曝光后AI圈炸锅,工程师虽回应,但Opus 5也被指降智。
新智元
新闻资讯7
Anthropic新模型补位,Fable 5爆冷遇尴尬
Anthropic提前曝光两个新模型claude-mashmallow-eap和claude-melon-eap,早期实测Marshmallow更佳。此前上线的最强Fable 5爆冷,企业调用少,营收低,其弟Opus 5反而胜出,开源模型也在抢占份额。
新智元
新闻资讯7
Agent在真实工作场景成功率低
作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。
数字生命卡兹克
新闻资讯8
Opus 5通关测试:强模型需简单环境
ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。
新智元