「编程Agent评测」共找到 3947 篇相关文章
拆箱开源版Coze:Agent核心三件套大公开,48小时揽下9K Star
扣子两款子产品扣子开发平台和扣子罗盘近期开源,加上此前开源的开发框架Eino,覆盖了Agent开发全链路。其采用宽松的Apache 2.0开源协议,降低开发门槛,有望带动Agent在更多场景落地。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
英伟达老黄收购了一家AI编程公司
英伟达刚收购AI coding初创公司Solver,该公司成立三年,专注编程AI Agent。此前英伟达收购不少降芯片成本或提供AI支持的公司,此次收购契合其构建软件生态层战略,或使AI智能体逼近软件开发核心。
爆火开源!让《魔兽争霸》里的牛马Peon提醒你氛围编程状态,开发效率提高50%
peon - ping是Agent专用开源通知工具,可在多种AI编程环境监听关键事件,通过游戏角色语音、桌面横幅等提醒开发者。还支持MCP、手机推送,有提醒运动附加功能,提升AI编程体验。
打造Jarvis,OpenClaw很野,但Agent Studio简直变态
文章介绍OpenClaw和Agent Studio两个AI Agent项目。OpenClaw能打通AI Agent与多消息应用,适合技术团队搭建基础设施;Agent Studio可打造个人Agent工作台,重点展示其接入企微流程,还介绍四大核心功能。
Karpathy的编程经验Skills,开源了,Star涨疯了。
周末,Karpathy大佬的编程经验开源skills项目火了,它把其吐槽大模型写代码的问题编译成大模型可理解的约束。安装简单,还列举了一些规则示例。如今行业把人的经验编译成Agent可执行格式,开源范式改变。
ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI
上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。
创业者闭门探讨:Make for Agent ,其实还是 Make for Human
极客公园组织「Make for Agent」主题闭门 Meetup,探讨 Agent 产品做法。交流聚焦 Agent IM、身份、人类介入、商业模式等问题,指出 Agent 需责任型通信、独立身份,产品设计要兼顾人和 Agent 需求,核心是责任设计。
Nanbeige4.2-3B:探索通用Agent小模型
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
刚刚,DeepSeek官宣V3.1发布,Agent 能力较大提升
DeepSeek官宣V3.1发布,核心特性有混合推理架构、思考效率提升、Agent能力增强。产品形态含官方App/网页端和API升级。性能在编程、搜索智能体及思考效率上显著提升。