算法论文8
SWE - Touch揭示Coding Agent共享协作能力缺口
深度学习自然语言处理
AI 摘要
中科院自动化所团队:现有Coding Agent评测忽视用户直接改代码情况,用SWE - Touch测试9模型,发现用户干预下性能普降,模型排名洗牌,当前模型在共享空间协作能力有缺口。
阅读原文 · 深度学习自然语言处理
Coding Agent 自主解题很强,但用户改一行代码就"翻车"?自所团队提出 SWE-Touch 揭示共享工作空间下的能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
E - Commerce Bench揭秘大模型网店经营能力
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
千问大模型
开源动态8
近5w星!Orca可同时指挥多AI写代码
现在写代码,很多人想开多个AI助手。Orca是支持多AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持多系统安装。
GitHubStore
产品应用7
Cherry Studio:从Chat到Agent的产品重构
Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。
Founder Park
产品应用8
MemoraX Code 让 Coding Agent 拥有长期记忆
过去一年,Coding Agent 改变开发者写代码方式,但进入长期开发仍会遗忘项目经验。MemoraX Code 试图解决此问题,构建了本地与云端记忆,让关键信息能被识别召回,且在赛事中表现出色,还能沉淀工程经验。
机器之心