新闻资讯7
GPT 5.5破编程基准0纪录,反超Claude!
AIGC开放社区
AI 摘要
此前编程领域由Claude引领,现在GPT 5.5打破最难编程基准零通过率纪录。在ProgramBench测试中,GPT 5.5高和超高推理模式表现出色,不同模式解题风格有别,Claude Opus 4.7则因低级漏洞惨败。
阅读原文 · AIGC开放社区
Claude最强领域被GPT反超!GPT 5.5最难编程基准破0
编程领域曾由Claude引领,如今GPT 5.5在大模型解决率为0%的最难编程基准上实现突破。程序重建基准测试(ProgramBench)考验严苛,过往模型解决率为0,GPT 5.5高和超高推理模式成功破局,展现了不同解题风格。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
英伟达首测Vera Rubin,Agent时代格局重写
英伟达公布下一代旗舰级机柜Vera Rubin NVL72片上实测数据,用DeepSeek - V4 - Pro跑任务,每兆瓦吞吐量最高升30倍、Token成本最高降35倍。还宣布Groq 3 LPX量产,推出Agent专属Vera CPU,被SpaceXAI采用。
新智元
新闻资讯8
斯坦福教授直播训练535B大模型
斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。
机器之心
8
欧洲论文揭三大巨头 AI 安全漏洞
欧洲两位安全研究员的论文《从专有 LLM API 中窃取推理轨迹》爆火。他们揭示 OpenAI、Anthropic 和 Google 用的“无状态架构”有漏洞,能利用小模型解码大模型推理轨迹,导致隐私泄露等风险。
AI科技大本营
开源动态8
腾讯A.I.G:给AI系统做全面安全体检
文章介绍腾讯朱雀实验室开发的AI安全红队测试平台A.I.G,能对AI系统做全面“安全体检”,覆盖AI基础设施、MCP、LLM等风险。它功能实用,安装简单,适合折腾AI服务或MCP的人。
开源先锋