推荐文章8
Claw - SWE - Bench:揭秘编程Agent评测真相
AIGC开放社区
AI 摘要
基元律动等机构:发布Claw - SWE - Bench基准,拆分模型、harness和任务集。实验显示harness对成绩影响大,还解决通用Agent评测难题,推出低成本Lite版,提醒看SWE - bench成绩要关注harness。
阅读原文 · AIGC开放社区
同一个模型,换套框架成绩差27%:SWE-bench分数到底谁说了算?
编程Agent评测是笔糊涂账,SWE - bench虽成事实标准,但分数不适合直接横向比较。基元律动等机构发布Claw - SWE - Bench基准,将模型、harness和任务集拆分,通过实验揭示harness对成绩影响大,还解决通用Agent评测问题,推出低成本Lite版。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Codex负责人:Codex两三月后将过时
Codex负责人称两三个月后Codex将过时,因下一代模型要处理大规模并发Agent,非其能应对。Huggingface实验显示大小模型在不同harness下排名差异大,脱离模型谈harness过时或不适配说模型Agent能力都不妥。
探索AGI
推荐文章7
前Kimi负责人:模型强,Harness更厚!
AI编程圈两极分化,围绕底层Harness是否消失争议不断。前Kimi CLI负责人stdrc提出反常识观点,认为模型越强Harness越厚,复杂度从“能力层”转移到“协作层”,还以Kimi CLI实践及Raft创业为例阐述。
AI科技评论
产品应用7
池建强:揭秘 Kimi K3 慢且贵的真相
作者用 Kimi K3 为墨问的 CatReader 增加发现页,实操中它多数时候快且抗用,不过周五晚变慢,收尾工作交给了 GLM 5.2。对用户觉得 K3 又慢又贵的问题进行分析,还区分了 Kimi App 和 Kimi Code 使用场景。
MacTalk
新闻资讯8
2026 中国 AGI 创新影响力机构 TOP 30 发布
过去一年 AI 行业变化溢出模型层,Coding Agent 铺开,视频生成实现商业变现,具身智能供应链成型。Founder Park 从四维度选出「中国 AGI 创新影响力机构 TOP 30」,涵盖多领域团队。
Founder Park