「代码修复评测」共找到 2319 篇相关文章
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
原力灵机的DM0.5登顶具身评测RoboDojo,在记忆维度表现突出,还在其他权威评测中成绩优异。它有强泛化能力,在多场景表现佳。其从数据、架构、效率全面升级,且全面开源,赋能具身生态。
对话AutoCoder宿文:做5000万程序员的AI IDE,不如做10亿软件消费者的Vibe Coding
2025年AI Coding赛道火热,大厂纷纷布局。AutoCoder创始人宿文认为不应与大厂卷辅助编程,要走出差异化,做面向10亿软件消费者的Vibe Coding。团队迭代代码模型,产品数据表现佳,还分享了创业、产品、市场等多方面看法。
Kotlin Multiplatform 评估:跨平台开发中的优势与权衡
文章评估了 Kotlin Multiplatform(KMP)在跨平台开发中的优劣势。KMP 可共享代码,编译成原生代码获出色性能,保留原生 UI 选项。虽生态小、有学习曲线等问题,但 Netflix 等大公司已用,未来潜力大。
程序员的提示工程实战手册
文章围绕程序员如何利用提示工程让AI编程助手成为可靠开发伙伴展开。介绍给AI代码助手的提示词技巧、高效代码提示原则,还阐述调试、重构、实现新功能的提示模式,指出常见反模式及应对方法。
游戏研发中的 AI 转型:网易多 Agent 系统与知识工程实践
本文整理自网易游戏高级技术经理林香鑫分享,其团队通过代码知识谱图构建、多 agent RAG 召回等技术打造超级助手,在多业务场景落地效果好。还介绍知识工程、多 Agent 赋能代码编写、AI 审查等实践及未来展望。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
TRAE Work 上线 Design 模式:产品经理还需要 Figma 吗?
TRAE Work 上线 Design 模式,可将一句话描述变成可编辑设计稿,还能将设计稿转代码,在同一平台完成从需求到代码的链路。作者测试后发现其效率大幅提升,并分析了该模式与其他工具的区别及 AI 设计趋势。
同一个模型,换套框架成绩差27%:SWE-bench分数到底谁说了算?
编程Agent评测是笔糊涂账,SWE - bench虽成事实标准,但分数不适合直接横向比较。基元律动等机构发布Claw - SWE - Bench基准,将模型、harness和任务集拆分,通过实验揭示harness对成绩影响大,还解决通用Agent评测问题,推出低成本Lite版。
6 天、96 万行 Rust、直接合并?Claude Code 被 Bun 的内存泄漏拖垮后,Bun 让 Claude 亲手重写了自己
2026 年 5 月,Bun 创始人 Jarred Sumner 宣布将合并 Rust 重写版本,终结 Zig 版。此次迁移仅用六天,涉及 96 万行代码。此前,Bun 内存泄漏影响 Claude Code,促使 Anthropic 让 Claude 重写 Bun。不过,AI 重写也引发对代码质量和流程的争议。
R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式
复旦大学与美团LongCat Team联合推出R - HORIZON,它是首个系统性评估与增强LRMs长链推理能力的方法与基准。提出Query Composition方法构建评测基准和训练数据,评测发现主流模型长链推理性能断崖式下降,还分析出三大瓶颈,训练后模型性能双重提升。