「多 Agent 协作」共找到 6215 篇相关文章
DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查
Agent 进入日常研发流程后,使用方关注耗时、Token 消耗和失败回溯。DeepSeek Harness(DSH)是开源 Agent 框架,腾讯云 Agent 可观测提供 DSH 采集插件,构成全景可观测方案,还介绍接入实践与其他能力。
模型一个没换,正确率翻了近三倍,这个项目有点东西啊!
GitHub开源项目AutoResearch用同一模型答题,其EvoMap蜂群模式使正确率近三倍于单Agent和常见Sub - Agent模式。它是多Agent评审系统,靠蜂群机制让AI自动科研,还有诸多防幻觉等特点,能用于多场景优化。
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。
微软 Agentic 组织:下一代 AI 系统
微软研究院提出全新推理范式AsyncThink,让LLM从单打独斗进化成带团队的项目经理。它把并发控制转为纯文本协议,经两阶段训练,实验中全方位碾压传统方法,还具跨领域泛化能力。
小米MiMo Agent 跨会话进化
多数AI编程Agent任务一长就忘事,业界主流靠堆上下文窗口应对,但有缺陷。小米MiMo团队开源的MiMo Code,靠显式存储 - 检索机制,200步以上任务胜率超Claude Code达65%,介绍了其设计及优缺点。
阿里最新开源王炸Agent!性能全面SOTA!
阿里WebAgent更新频繁,基本一月一版。它是类似DeepResearch的通用智能体,历经WebWalker到WebWatcher多阶段演进,各阶段解决不同问题,如网页导航、自主信息搜集等,还不断优化训练数据生成与处理方式。
LLM-based Agent的代码生成综述
这篇2025年的综述指出,传统代码生成技术难完成复杂开发任务,而基于大语言模型(LLM)的代码生成代理应运而生。它把LLM作为“大脑”,具备自主规划等能力。文章梳理了该领域的核心特征、技术体系、应用实践等,也剖析了挑战与未来方向。
Agentic的风又吹到了世界模型~
这篇42位作者联合完成、综述400余篇工作的论文,第一次用'能力×法则'双轴框架,把所有叫'世界模型'的系统放到同一张地图上,为领域建立公共语言,还得出了关键结论。
综述:LLM 驱动AI Agent通信协议与策略
文章指出传统互联网用户完成行程繁琐,而代理互联网可让代理自动完成。随着LLM驱动智能体应用深入,其发展专业化,需多智能体协同,有效通信成关键。介绍了智能体通信定义、分类及多种通信协议。
豆包,成了人人可用的办公 Agent
作者使用新版豆包工作任务模式,用它分析宇树科技招股书、采集舆情信息,体验云电脑接力等。指出其亮点如云端本地可切换、Skill 生态丰富,也提到云网络限制、手机端无停止按钮等不足。