开源动态8
MiniMax:Coding Agent 评测需关注过程规范
Founder Park
AI 摘要
用户对 Agent 不满多因它不遵循指令和规范,现有评测重结果,与实际使用错位。MiniMax 开源 OctoCodingBench 评测,发现模型过程合规差,未来训练应引入过程监督。
阅读原文 · Founder Park
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
近5w星!Orca可同时指挥多AI写代码
现在写代码,很多人想开多个AI助手。Orca是支持多AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持多系统安装。
GitHubStore
产品应用7
Cherry Studio:从Chat到Agent的产品重构
Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。
Founder Park
产品应用8
MemoraX Code 让 Coding Agent 拥有长期记忆
过去一年,Coding Agent 改变开发者写代码方式,但进入长期开发仍会遗忘项目经验。MemoraX Code 试图解决此问题,构建了本地与云端记忆,让关键信息能被识别召回,且在赛事中表现出色,还能沉淀工程经验。
机器之心
算法论文8
SWE - Touch揭示Coding Agent共享协作能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。
深度学习自然语言处理