代码评测」共找到 2202 篇相关文章

开源动态8

鹏城实验室 X 中大hcp实验室推出 RADAR : 具身智能评测的新标杆

RADAR是鹏城实验室与中大hcp实验室为具身智能领域设计的评测基准,解决现有评测体系三大缺陷,通过创新设计揭示模型不足,为研究者提供方向,推动具身智能实用化。

AI科技评论
新闻资讯7

再见,人类程序员!OpenAI自曝:一行代码都不写了,100%用Codex

OpenAI研究员Roon称Codex已接管其100%代码编写工作,内部爆料还显示Codex助力三天搭服务器、三周推APP。Codex CLI更新至0.9+,但AI代码审查成难题,开发者和非开发者面临不同挑战。

新智元
开源动态8

NeurIPS 2025 | 蚂蚁CGM:图融合架构重塑代码大模型,探索非 Agent 新范式

在NeurIPS 2025上,蚂蚁将展示Code Graph Model (CGM)。它把代码库图结构集成到开源LLM,开启新范式,在代码库级任务上以非Agent方案登顶开放权重模型榜首,解决了复杂软件工程的Agent依赖难题。

PaperAgent
新闻资讯8

OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复

OpenAI发布由GPT - 5驱动的白帽Agent——Aardvark,能在大规模代码库自动发现并修复安全漏洞。它不依赖传统技术,工作流程清晰,已开启内测。10月多家科技巨头也布局Agentic AI + 代码安全。

量子位
推荐文章7

完全相信 AI 代码的 Uncle Bob,坦诚这条路还没走通

在AI代码普及当下,Uncle Bob放弃人工评审代码,搭建管控框架引争议,Grady Booch反对,认为AI无法替代资深工程师。Uncle Bob设强约束体系,虽有成效但自动化架构规划未达理想,还给出开发建议。

AI前线
算法论文8

CVPR 2025 Highlight|北大联手智元发布首个基于说明书的家电操作评测基准

北大联合智元团队提出全新家电操作评测基准 CheckManual,被 CVPR 2025 接收并评为 Highlight。它有拟真说明书与多样资产、契合实际的评测任务、首个操作规划模型 ManualPlan 等优势,还做了相关实验。

机器之心
产品应用7

AI 写代码老出错?Code Rabbit 来给 Cursor 当“纠错教练”,边写边改。

Cursor的AI Agent写代码虽强但易出错,Code Rabbit可当“纠错教练”。它本用于审查GitHub PR和commit,现推出VS Code、Cursor等插件,能分析代码改动、提建议,与Cursor配合可减少bug。

AI进修生
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
新闻资讯8

曾对AI嗤之以鼻,如今2周生成7万行代码:Rust大佬与Claude联手打造新语言Rue

2025年,Rust社区早期核心人物Steve Klabnik心态转变,开始借助Claude编写代码。他重启念头设计新语言Rue,探索编程语言‘中间地带’,两周生成约7万行代码,开发中人与AI分工明确。

机器之心
推荐文章7

先设计再写代码,还是先实现再重构?AI 编程让这种选择变的简单

传统手工编程时代,先设计再写代码和先实现再重构存在争论。AI编程让选择变简单,可先设计生成代码,再改进设计生成。还需在开发工具和流程上配合,新人更易适应。

宝玉AI