Multi - Agent系统」共找到 3926 篇相关文章

算法论文8

北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
算法论文8

AI画手总是六根手指?阿大/美团/上交首次系统量化扩散模型计数幻觉

阿德莱德大学、美团和上海交通大学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据集套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。

量子位
产品应用8

MiniMax把自家“实习生”放出来了!

曾经割裂需求、设计与代码的流水线正在消融,MiniMax上线的AI原生工作台Agent 2.0为此而来。它通过Desktop App与Expert Agents两大载体,可嵌入工作环境,现已开启封闭内测,能帮用户提升工作效率。

量子位
开源动态8

Python逆天改命!开源Hermes首次击败OpenAI Codex

纯Python写的开源项目Hermes Agent,在11项基准测试中以6:5战绩击败OpenAI用Rust写的Codex。它通过三大工程优化,将启动时间从701ms降至258ms。这表明在AI Agent领域,架构比语言性能更重要。

新智元
推荐文章7

又要取代程序员了?这锅轮到 AI 背了

文章指出‘AI会取代程序员’论调有误,代码是负债,系统设计才是核心资产。回顾NoCode、云计算等变革,技术未取代人,而是重塑岗位。AI辅助开发也如此,暴露软件工程中设计系统才是AI难取代的能力。

AI科技大本营
新闻资讯7

贴脸对打Opus 4.5!最新Codex自己写自己,网友实测“放手”8小时不崩

Claude Opus 4.6发布不到半小时,OpenAI就上线GPT - 5.3 - Codex,这是其最强的Agent化编程模型。它多项跑分超Claude Opus 4.6,网友实测长链路稳定性好,虽慢但稳。OpenAI总裁称Agent正重构软件开发。

InfoQ
开源动态7

从组件到 OS 的跃迁,MemOS 深度拆解:构建企业级 Agent 的高性能记忆底座【上】

本文深入剖析开源记忆方案MemOS,它将记忆从“外挂组件”升为“系统资源”。介绍其设计理念、核心架构,分析记忆需加工、分层调度和治理的原因,还阐述记忆三态及流转,最后展示MemOS Cloud的使用方法。

AI大模型应用实践
7

专为宅男打造系统提示词,“二次元女友”爆火后马斯克开 44 万刀抢工程师

xAI 在 Grok iOS 应用推出 AI“虚拟伴侣”角色后,发布“全栈工程师 – Waifus”招聘,年薪高达 44 万美元。岗位负责打造实时虚拟形象系统,引发热议。不过,Grok 部分内容引 App Store 内容边界担忧。

InfoQ
开源动态8

首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽

南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。

量子位
算法论文8

百度沧海·存储 Mantle 系统架构演进之路,SOSP'25 论文背后的故事

文章讲述百度沧海·存储Mantle系统架构演进故事。面对云存储挑战及业界方案局限,团队经多阶段探索,构建Mantle及MantleX架构,解决性能难题,并规划后续升级方向,为业界提供新思路。

InfoQ