新闻资讯7
OpenAI让GPT-5跳过难题超Claude?
新智元
AI 摘要
OpenAI发布会上称GPT-5代码能力全球第一,在SWE-bench Verified测试中获74.9%通过率。但它跳过23道难题,若计入,实际通过率或低于Claude Opus 4.1的74.5%,引发评测公平性争议。
阅读原文 · 新智元
深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题
OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Claude新模型实测流出,性能与算力双惊人
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。
新智元
新闻资讯8
OpenAI亲儿子自研模型选中国K3
OpenAI投资的法律AI公司Harvey,首个自研模型Harvey Tenet选中国开源模型Kimi K3作底座。因原用闭源模型成本高、有竞争风险。Tenet训练成本低、性能佳,显示出可复制路径。
新智元
新闻资讯7
Tibo 揭秘 OpenAI 额度重置及产品发展策略
围绕 Codex 与 Claude Code 使用额度问题,社区不满额度机制不透明不可预测。Codex 团队 Tibo 公开额度重置逻辑源于补偿,并非营销。此外,还谈及产品融合、技术创新、算力决策等多方面内容。
InfoQ
新闻资讯8
OpenAI Tibo:指明Agent方向与产品规划
近期OpenAI Codex负责人Tibo接受采访,透露产品方向与技术路线,如让Agent深度理解用户、合并ChatGPT和Codex等,还谈及保持迭代、对竞争态度、重置用量限额等问题。
AI工程化