「编程能力评估」共找到 4430 篇相关文章
DeepSeek有点含蓄了,实测V3.1有进步,编程等个别场景硬刚GPT-5
DeepSeek悄悄更新V3.1,官方仅提及上下文长度拓展至128K。实测其代码能力与前端审美提升,逻辑推理也有进步,在编程等个别场景能硬刚GPT - 5,但处理复杂任务还有距离,更新不大却有进步且降价。
Anthropic 再发长文:首次详细揭秘Agent的评估全过程「Claude code开发过程的经验总结」
Anthropic在Claude Code等开发及与客户合作中总结出AI Agent评估方法。文章介绍评估基本结构、构建原因、评分器类型、不同Agent评估法、应对不确定性指标、构建路线图及与其他方法协同方式。
我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准
在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。
GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了
GPT-5.2登场,有即时版、思考版与专业版。它在多方面大幅升级,能碾压44类专业工作。经济性强,编程能力佳但速度慢,还自评‘最优科研模型’,幻觉现象减少。今日起推送,优先面向付费用户。
GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了
GPT - 5.2 登场,有 Instant、Thinking、Pro 三个版本,在多方面大幅升级,能覆盖 44 类专业工作。它经济性强、编程能力佳、推理出色,但存在速度慢的问题,其价格 API 端有调整,未来还将推 Codex 优化版。
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
AI编程到底有没有护城河?RL+Agent重塑代码世界!
作者作为cursor重度用户和算法出身玩家,分享AI编程赛道技术内幕。探讨AI编程视角下RL的难题,介绍AI编程体验进化要素,还聊了cursor 1.0更新,最后指出AI编程工具发展趋势。
工程知识引擎:Harness Engineering体系下的工程知识底座
现代软件开发中,AI编程智能体虽能写代码但难理解代码,缺乏工程约束与上下文支撑。为此构建工程知识引擎,整合多维数据源,有向量检索等六大能力,经评估可提升智能体效率与代码质量。
谁是2025年度最好的编程语言?
在2025年IEEE Spectrum编程语言排行榜上,Python十连冠且成三冠王,与第二名差距大,还借AI放大优势。JavaScript排名波动大,SQL宝座被冲击。同时,编程社区文化衰落,AI或终结编程语言多样性。
当 AI 写了几乎所有代码,软件工程会怎样?
文章探讨 AI 写大部分代码时软件工程的走向。最新模型让开发者有‘顿悟时刻’,如 Google 工程师用 Claude Code 一小时完成去年的工作。AI 编程能力在 11、12 月迎来拐点,专业知识贬值,软件工程师核心能力更重要,也带来诸多挑战。