返回首页
算法论文8

最强AI Agent团队仅完成半数协作任务

InfoQ
AI 摘要

多国研究者推出多智能体长时程协作评测基准AgentWorld,测试显示当前最强大模型驱动的Agent团队主任务成功率仅52%,聊天多不代表协作质量好,还提出CCE指标量化协作贡献。

阅读原文 · InfoQ
让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?
单个AI Agent能力不断提升,但多智能体协作能力缺乏系统评测。本文介绍新推出的AgentWorld评测基准,结合长时程任务、角色不对称与黑盒交互,评测多智能体协作能力,给出主流大模型的协作表现数据。

相关文章