编码基准」共找到 1213 篇相关文章

新闻资讯8

7 小时连续重构不掉线!一骑绝尘的Claude 终于遇到对手:Greg Brockman亲自解读AI编程重大突破

9月16日,OpenAI推出新模型GPT-5-Codex,专为AI辅助编程工具设计。它在代理编码基准测试中表现佳,形成了覆盖各种需求的交互界面,还具有更优的后训练特性,能连续工作7小时完成复杂重构。

InfoQ
新闻资讯7

太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首

大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。

机器之心
新闻资讯8

谷歌Gemini 3杀疯了!陶哲轩亲测:10分钟干翻百年数学难题

Gemini 3本周一发布后开启横扫基准测试之旅。在FrontierMath基准测试创纪录,Epoch能力指数超GPT - 5.1。陶哲轩用Gemini Deepthink十分钟解决埃尔德什问题关键证明,同时它还霸榜物理基准测试CritPt。

新智元
算法论文8

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。

机器之心
算法论文8

具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统

香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。

机器之心
产品应用7

Claude正式登陆Xcode

Xcode 26更新对Claude原生支持,将AI编程助手融入代码编辑器。开发者可在Xcode用Claude加速开发,有代码助手和编码工具等功能,订阅机制合理,还给出启用方式。

AI工程化
新闻资讯8

刚刚,AI大牛Karpathy又提新概念:像细菌一样写代码?

AI大牛Andrej Karpathy继Vibe Coding后提出「细菌式编码」,受细菌代码启发,有小而精简、模块化、自包含特点,其核心是让代码利于共享。它适合快速原型开发,也有局限,建议兼顾两者。

机器之心
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
开源动态8

具身智能“高考”难疯了!人类100分,最强模型12.8

原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。

量子位
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位