开源动态8
腾讯 WorkBuddy 开源评测,曝光多模型底牌
PaperAgent
AI 摘要
腾讯 WorkBuddy 团队开源 Benchmark,公开多模型选型底牌。如 GLM - 5.2 在安全域强,GPT - 5.5 最省 token,Claude Opus 综合强。各赛道评测有特色,不同模型在各赛道表现差异大。
阅读原文 · PaperAgent
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
SWE - Touch揭示Coding Agent共享协作能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。
深度学习自然语言处理
算法论文7
MLS - Bench评测:AI科研创新能力待提升
新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。
新智元
产品应用7
OpenCode结合路由低成本开发游戏
文章介绍用 OpenCode 结合 DigitalOcean 推理路由器开发点球大战游戏 PK Shootout。其按任务选模型,多数任务路由到 MiMo V2.5 和 GLM - 5.2,成本约 8.25 美元,远低于只用前沿模型。文中还分析开发各环节及适用场景。
AI工程化
产品应用8
Opus 5实测炸场,半价性能超Fable 5
Anthropic新模型Opus 5登场,多项评测中追平或反超Fable 5,价格仅为一半。网友实测表现出色,还具备硬核自检流程,性价比高。另外,Claude Code提示词删减八成,成绩未降。
量子位