编程测试」共找到 2634 篇相关文章

新闻资讯7

贴广告的ChatGPT,一夜之间让全球网友破了防

周六凌晨,OpenAI 公告计划在 ChatGPT 加广告,测试将在美国率先启动。此前已上线低价订阅版 ChatGPT Go。此外,马斯克与 OpenAI 官司相关文件解封,案件将进入审判。

机器之心
开源动态8

AAAI 2026 Oral|InfiGUI-G1模型来了,刷新GUI Grounding SOTA

多模态大语言模型发展下,GUI Grounding任务是难题,现有RLVR方法有瓶颈。浙江大学等团队提出AEPO框架,推出InfiGUI - G1系列模型,小参数量刷新GUI基准测试SOTA,代码已开源。

机器之心
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔
推荐文章8

翁荔最新万字长文:Why We Think

北大校友、前OpenAI华人VP翁荔发布万字长文《Why We Think》,围绕“测试时计算”和“思维链”,探讨提升模型性能的方法,涉及心理学类比、基于Token的思考、分支与编辑等多方面内容。

量子位
新闻资讯8

首个Gemini桌面端曝光,系统级Agent空降PC!

5月20日Google I/O 2026前夕,谷歌提前“放大招”,Gemini桌面端曝光,Mac版先上线。它具备四大核心功能,如系统级Agent操控PC等。全新Gemini 3.2闪现,编程能力惊人,谷歌还更新Workspace应用图标。

新智元
新闻资讯7

马斯克亲口承认xAI「建废了」,急挖Cursor大牛反击Claude

xAI重组引发创始高管动荡,马斯克承认其一开始就没搭对,不得不推倒重建。2026年1月起大规模裁员,Macrohard和Grok Imagine受冲击大。前Cursor两位核心高管入职,或助力编程方向发展。

新智元
新闻资讯8

GPT-5.4 vs Opus 4.6 vs Gemini 3.1:五条结论

2026年3月前沿AI竞争激烈,GPT - 5.4、Opus 4.6、Gemini 3.1 Pro各有千秋。GPT - 5.4领先知识和计算机使用,Gemini 3.1 Pro以低价主导推理,Opus 4.6编程能力强,无单一模型通吃各领域。

PaperAgent
算法论文8

英伟达发布 Jet-Nemotron 系列小模型,理论最大加速比 56 倍

英伟达发布 Jet - Nemotron 系列小模型,在多项基准测试中表现出色,实现高吞吐量加速和高准确率。其训练采用 PostNAS 方案,对既有模型针对性优化,展示了在小模型优化上的可行技术路径。

AI科技评论
开源动态8

斯坦福开源复杂推理AI Agent,融合超10种工具

传统AI助手应对复杂任务能力有限,斯坦福开源OctoTools,这一复杂推理AI Agent融合11种工具。它在16项基准测试中准确率高,能应对多领域复杂场景,框架含工具卡片、规划器等构件。

AIGC开放社区
算法论文7

AI人格分裂实锤!30万道送命题,撕开OpenAI、谷歌「遮羞布」

Anthropic联合Thinking Machines研究,用30万个场景和压力测试拷问OpenAI、谷歌等前沿大模型。发现模型规范有矛盾漏洞,不同模型价值优先模式不同,如Claude重道德,Gemini重情感等。

新智元