算法论文8
12个AI编程Agent PK,贵的不一定强
CourseAI
AI 摘要
上海交大和美团:将12个AI编程Agent放入50个Python项目测试,发现基础模型写代码强,如Claude 4.5;商业版调试好,像Claude Code;大模型改bug易搞砸;PRDJudge当裁判更靠谱。
阅读原文 · CourseAI
12个Ai编程Agent同台PK,最贵的不一定是最强的
上海交大和美团联合发布PRDBench论文,将12个主流AI编程Agent放入50个真实Python项目测试。结果显示,基础模型写代码强,商业版调试优势明显;专门训练的裁判模型比通用大模型靠谱。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
7
Shopify CEO考虑禁用Claude Code
Shopify CEO Tobi Lütke考虑禁止公司使用Claude Code,除非其支持读取AGENTS.md和.agents/skills。Claude Code团队称正在改进,但坚持自有体系。AGENTS.md获众多工具支持,A社是相关基金会创始方,Claude Code却未原生支持。
新智元
新闻资讯7
Shopify CEO考虑禁用Claude Code
Shopify CEO Tobi Lütke 考虑在 Shopify 禁用 Claude Code,因其坚持读取`CLAUDE.md`,与团队常用的`AGENTS.md`等不兼容,可能使开发者获不同项目规则。开发者社区给出解决办法,Lütke仍担忧大规模维护难题,Claude Code 团队称会跟进。
机器之心
新闻资讯7
Claude Code拒绝标准引开发者不满
当所有AI编程工具向行业标准靠拢时,Anthropic的Claude Code拒绝支持AGENTS.md格式,引发Shopify CEO公开威胁。开发者多次要求其支持该格式无果,Anthropic回应未让开发者满意,引发争议升级。
InfoQ
新闻资讯7
Tibo 揭秘 OpenAI 额度重置及产品发展策略
围绕 Codex 与 Claude Code 使用额度问题,社区不满额度机制不透明不可预测。Codex 团队 Tibo 公开额度重置逻辑源于补偿,并非营销。此外,还谈及产品融合、技术创新、算力决策等多方面内容。
InfoQ