代码能力评测」共找到 4821 篇相关文章

开源动态8

不用人类手写训练框架了!AI自己写代码,训出1B端侧「小钢炮」

5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预训练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。

机器之心
推荐文章8

把 UI 生成接进流水线:基于半监督评测体系的 UI 自动化生产实践

本文来自蚂蚁集团黄兆嵩在 QCon 2026 的演讲,探讨生成式 UI 技术重塑生产方式。提出系列工程实践,包括高质量生成、LUI 场景应用及质量监控迭代,让前端生产自动运转、用户体验随需而变。

InfoQ
算法论文8

东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026

东南大学耿新团队针对模型多任务融合问题提出论文《Model Merging in the Essential Subspace》。指出多任务融合失败源于关键方向重叠冲突,提出 ESM 方法,能让不同任务在模型中稳定共存,实验显示其性能更优。

AI科技评论
开源动态8

AI自己写代码做科研还跑赢了前沿算法?清华团队开源Alchemy框架

清华团队开源 Alchemy 框架,它是面向自动化 AI 科研的标准化研究环境,能让 AI Scientist 摆脱工程负担,专注算法创新,还支持多领域、多任务,具有多种特性,在多模态推荐任务中表现出色。

机器之心
推荐文章7

99%的人只发挥出了龙虾的1%的能力:龙虾邪修养法

博主Alex Finn分享让OpenClaw效能提升100倍的核心方法论,即构建专属任务控制中心。介绍了任务看板、日历面板等核心工具模块,还指出不要盲目抄袭,要用反向提示词定制工具面板。

AI寒武纪
产品应用7

Claude Code 10天写完Cowork 全部代码!Anthropic 新品抢白领饭碗,争议拉满!

Anthropic推出基于Claude Code架构的Cowork,定位是协作智能工作体。它能操作文件、解决工作流断裂问题,但有操作和提示注入风险。目前是研究预览版,后续会改进,引发能否被信任的讨论。

AI前线
产品应用7

Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构

Cursor 2.0正式发布,搭载自研大模型Composer。它30秒完成复杂任务,比同行快400%,每秒生成250个tokens。还带来原生浏览器工具等新功能,基于强化学习,但模型底子透明度遭质疑。

量子位
算法论文8

AI「上班流」首次完整曝光!不点鼠标,只写代码,PPT也当函数调

CMU与斯坦福研究团队追踪AI工作过程,发现其用编程方式处理问题,执行方式与人类不同。AI速度快成本低,但存在伪造输出、工具误用等问题。人类虽慢,但在规范细节和实践判断上有优势,未来人机可按任务可编程性分工。

新智元
新闻资讯8

Claude Sonnet 4.5来了!能连续编程30多小时、1.1万行代码

十一假期前,DeepSeek 开源新模型 V3.2 - Exp,深夜 Anthropic 发布 Claude Sonnet 4.5,自称世界最好编码模型,自主编码时长超 30 小时,还带来系列产品升级,在多方面表现优异。

机器之心
产品应用8

告别胶水代码,5倍飚速!无问芯穹首次揭秘,Infra智能体蜂群登场

无问芯穹推出基础设施智能体蜂群,这是新一代基础设施智能化解决方案。它封装多个智能体模块,构建全生命周期智能闭环,提升资源利用率等。在重点客户业务流程落地效果好,能让开发者解放价值。

新智元