「代码准确率」共找到 1949 篇相关文章
OpenAI发布GPT-5-Codex:独立编码7小时,能动态调整资源,token消耗更少
OpenAI发布专用于编程的GPT-5-Codex,属GPT-5特殊版本,有即时协作和独立执行的‘双模’特长。它能动态调整资源,token消耗少,擅代码审查。文中还介绍其命名由来及编程智能体竞争情况。
田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索
AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。
调高一档推理强度,成本可能翻几倍:大模型思考原理讲清楚
文章详细讲解推理强度原理,指出其不改模型,只改草稿长度。还说明模型多思考能提高答题准确率的原因,剖析贵和慢的原因,介绍三种控制形态,并给出判断推理强度档位的框架。
Anthropic总想摔碎程序员饭碗,甩出了“以后只招两种人”名单。
昨天Anthropic发布新产品Claude Tag,被Karpathy赞为LLM交互第三范式。Claude Tag与之前的Claude Code远程插件有4方面差别。产品负责人Fiona Fung分享,Anthropic人均代码交付量剧增,招人只看两类人。
如何实现RAG与MCP集成
文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。
又要取代程序员了?这锅轮到 AI 背了
文章指出‘AI会取代程序员’论调有误,代码是负债,系统设计才是核心资产。回顾NoCode、云计算等变革,技术未取代人,而是重塑岗位。AI辅助开发也如此,暴露软件工程中设计系统才是AI难取代的能力。
OpenAI发布新模型硬刚Anthropic!Claude Code刚火,就被GPT-5-Codex拍在沙滩上?
9月15日,OpenAI推出新模型GPT - 5 - Codex,是微调的GPT - 5变体,用于AI辅助编程。它增强了代码审查功能,能动态调整思考时间,在多项基准测试中表现优于GPT - 5,发布后引发网络热议,AI编码工具市场竞争激烈。
ICLR 2026|CMU等团队让AI生成的3D场景真正「站得住」:PAT3D把文生3D从能看推进到能模拟、能交互
现在3D AIGC虽能快速生成场景,但落地有问题,很多场景物理模拟时会暴露物体悬空等问题。CMU等团队提出PAT3D,目标是让生成的3D场景物理上站得住,可用于编辑、交互和仿真,且代码已开源。
Cursor自研新模型反超Opus 4.6,价格还“打一折”!网友实测:只有它写完应用能一次跑通
Cursor发布第二代编程大模型Composer 2.0,在关键编程基准测试上反超Claude旗舰模型Opus 4.6,价格还“打一折”。网友实测其写完应用能一次跑通,效率和成本优势明显。但Cursor面临代码编辑器地位下降的危机,正积极自救。
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。