OpenAI MLE - Bench」共找到 1988 篇相关文章

新闻资讯7

GPT-5 的秘密武器:Universal Verifiers

OpenAI开发「Universal Verifier」(通用验证器)技术助力GPT - 5。该技术让一个AI模型检查另一个模型输出质量,解决了强化学习难题,使GPT - 5在多领域表现出色,不过技术可能因人员流动扩散。

AGI Hunt
新闻资讯7

GPT-5.2发布,真正的牛马打工人专属AI来了。

OpenAI十周年凌晨2点发布GPT - 5.2。它在部分跑分上提升不大,但在ARC - AGI - 2和GDPval评测集表现亮眼,上下文处理能力也大幅加强。将开放给会员使用,价格比5.1贵。

数字生命卡兹克
开源动态8

阿里开源创新AI Agent:媲美Deep Research,Github每日增长第一

人类信息检索能力受限,OpenAI的Deep Research虽能解决难题但闭源。阿里巴巴通义实验室开源AI Agent框架WebSailor,在多基准测试表现出色,核心技术围绕复杂任务生成和强化学习模块展开,在Github成绩亮眼。

AIGC开放社区
新闻资讯7

Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!

Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。

新智元
新闻资讯8

GPT-5编程专用版发布!独立连续编程7小时,简单任务提速10倍,VS Code就能用

OpenAI推出GPT-5-Codex特化版模型,支持独立连续编程7小时,有IDE插件版。新模型有“真·动态思考”能力,简单任务提速10倍,复杂任务推理更久。还重构了Codex产品体系,升级IDE扩展等。

量子位
新闻资讯8

GPT-5.6泄露了!

GPT-5.6泄露,150万Token+神级极简UI下月上线。它在前端有质变,能生成高质量UI,上下文窗口达1.5M tokens。OpenAI采取双版本策略,6月还将迎来Anthropic、Google等模型混战,模型迭代周期也在缩短。

新智元
新闻资讯7

Sam Altman亲晒GPT-5实测问答,发布进入倒计时

今日凌晨,OpenAI的Sam Altman晒出GPT - 5实测问答图,意味着其基本完成基础开发,很快发布。不过其回答与其他模型差异不大,但爆料称它代码和商业化能力强,网友对此看法不一,还猜测其对SaaS行业的影响。

AIGC开放社区
新闻资讯7

打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?

OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。

AI科技评论
算法论文8

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

Einsia AI旗下Navers lab发布Agent Benchmark——Frontier-Eng Bench,让AI在47个多学科交叉的硬核任务中做工程优化,测试其迭代优化能力。研究总结出AI进化规律,初步勾勒接近真实工程循环的AI系统。

量子位
新闻资讯8

AI 的经济账根本算不通

文章指出AI经济账算不通,如GitHub Copilot将按用量计费,此前微软补贴用户算力;AI订阅服务成本波动大,欺骗用户;AI数据中心建设和运营成本高、收入少,依赖少数客户,OpenAI和Anthropic盈利难,可能影响相关企业。

宝玉AI