新闻资讯7
GPT - 5编程测评:实际成绩比Claude高一倍
量子位
AI 摘要
Scale AI的SWE - BENCH PRO测试,‘御三家’表面解决率低。前OpenAI研究员称GPT - 5已提交任务准确率比Claude高一倍。此基准题新且难,当前模型解决商业问题能力欠佳。
阅读原文 · 量子位
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
Claude联手Alpöge终结78年数学悬案
78年数学难题“六维球面上有无复结构”被哈佛数学家Levent Alpöge和Claude解决,他们绕开老路造出答案,还给出108页论证,数学家挑不出毛病。Alpöge在35天内三次用AI破难题,这次性质不同,是模型创造新对象。
新智元
新闻资讯7
A社Fable 5卖不动,神秘模型将现身
支付平台Ramp统计显示,A社旗舰Fable 5上线两月销量不佳,收入仅占整体的11.4%。其价格高、性价比低,拖累公司收入未达预期。同时,X上出现Claude的两个神秘内测代号,或几周内上线。
量子位
开源动态7
前Google工程师为Agent打造超火设计系统
Anthropic的frontend - design是Claude首个广泛使用设计技能,Impeccable由此起步并扩充功能。它有一次设置流程、23条命令、59条确定性检测规则等,还给出反模式,介绍多种安装方式及使用方法。
GitHubStore
新闻资讯7
Claude两个新模型曝光,或下月发布
开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。
机器之心