算法论文8
最强AI Agent团队仅完成半数协作任务
InfoQ
AI 摘要
多国研究者推出多智能体长时程协作评测基准AgentWorld,测试显示当前最强大模型驱动的Agent团队主任务成功率仅52%,聊天多不代表协作质量好,还提出CCE指标量化协作贡献。
阅读原文 · InfoQ
让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?
单个AI Agent能力不断提升,但多智能体协作能力缺乏系统评测。本文介绍新推出的AgentWorld评测基准,结合长时程任务、角色不对称与黑盒交互,评测多智能体协作能力,给出主流大模型的协作表现数据。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯9
OpenAI发722篇数学成果搅乱学界
OpenAI公开722篇由内部未发布前沿模型生成的数学成果,覆盖多数学方向,部分附带形式化证明,发布后引发数学界巨大冲击,消化验证需数年,不少青年学者研究项目遭毁灭性打击,本文梳理各方反应与争议。
机器之心
新闻资讯8
谷歌下一代Gemini 4 Carbon曝光
外媒爆料谷歌下一代Gemini 4模型Carbon已进入内部测试,性能逼近Anthropic Opus 5.5,核心进展来自递归自我提升RSI技术,业内对谷歌拖沓的发布策略争议不断。
新智元
产品应用8
Google推出企业级Gemini agent
本文介绍Google Cloud推出的Gemini agent,面向企业工作流的智能体产品,支持跨多模型调度,AI可拥有独立企业身份,可接入多款企业常用工具,解决企业部署AI的权限、审计痛点。
AIGC开放社区
产品应用8
实测豆包新版多模态写代码
本文为豆包Doubao-Seed-2.1-pro-0915新版本实测内容,展示该模型的多模态编程能力,以生成鱼类识别微信小程序为例,给出基准测试成绩,介绍其适用开发场景。
机器学习AI算法工程