「编程评测」共找到 1657 篇相关文章
打破 AI 辅助开发碎片化困境,阿里巴巴 R2C Agent 的 AI 编程实践
文章围绕阿里巴巴 R2C Agent 的 AI 编程实践展开。指出当前 AI 辅助开发存在与生产链路结合难、协作碎片化等问题,介绍了 R2C Agent 如何驱动研发链路,阐述其框架、实施情况及未来提升 AI 渗透率的目标。
亲历两场编程语言迁移“惨案”,谷歌大佬揭露技术选型真相:90%决策与技术无关
谷歌大佬 Steve Francia 结合自身经历,指出技术选型常受身份认同等非技术因素影响。如早期创业公司因 CTO 执意换语言错失市场,谷歌团队跟风选 Rust。还分析了背后原因及代价,并给出破局建议。
15个前沿大模型,100个职业场景:谁才是最强AI打工人?
通义千问与港中文联合发布OccuBench,用语言世界模型评测AI Agent职业能力。评测15个前沿模型,发现无全能选手,隐式故障难处理,Scaling定律有效,做Agent和环境模拟器能力不同,还给出具体案例。
“天才少年”5年0收入造JS核武!Claude天价收购Bun,Node.js生态地震,AI工具链战争正式打响!
当地时间12月2日,Anthropic宣布收购热门开发者工具初创公司Bun。Bun能解决智能体分发和运行的效率问题,受AI编程工具青睐。虽收入为0,但因AI编程发展,Bun团队认为加入Anthropic是更好选择。
Sam Altman宣告软件开发即将进入"快时尚时代"!机遇还是危机
Sam Altman宣告SaaS将进入快时尚时代,新的GPT - 5编程能力或让开发SaaS像Zara出新款般轻松。但此概念最早由Patricio提出,他认为AI编程会带来‘代码污染’,与Sam态度不同。
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布
近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
Claude Sonnet 4.5被炸出来了,依旧最强编程,连续30小时自主运行写代码
新发布的Claude Sonnet 4.5在SWE - bench等多项测试中成绩提升,能连续30小时自主写代码,还改善了对齐和安全性指标,且提质不加价。此外,Anthropic官宣Claude Agent SDK,发布Imagine with Claude功能。
告别“氛围编程”:基于 Harness 治理和 SDD 的团队级 AI 研发范式演进与实践
本文作者王树新分享团队级AI研发范式演进与实践。指出AI Coding存在自由发挥、效率降低、关键信息丢失问题,分析出码率提升却未提效的原因,引入SDD与Harness解决问题,并介绍全流程自动化实践。
推进科研和工程,编程跻身顶级人类竞赛榜:谷歌Gemini 3 Deep Think重大升级
谷歌发布Gemini 3 Deep Think重大更新,剑指科研和工程。它在编程算法竞赛等多项测试中成绩亮眼,能模拟人类科学家深度思考,处理复杂问题,还可重塑工程设计流程,已向部分用户和企业开放。