返回首页
开源动态8

腾讯 WorkBuddy 开源评测,曝光多模型底牌

PaperAgent
AI 摘要

腾讯 WorkBuddy 团队开源 Benchmark,公开多模型选型底牌。如 GLM - 5.2 在安全域强,GPT - 5.5 最省 token,Claude Opus 综合强。各赛道评测有特色,不同模型在各赛道表现差异大。

阅读原文 · PaperAgent
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。

相关文章