「多工具推理」共找到 6807 篇相关文章
告别单一大模型依赖!北航等机构发布综述:大语言模型集成(LLM Ensemble)
北航等机构发布的论文系统性回顾了LLM Ensemble领域进展,介绍分类法、相关问题、方法、基准、应用和未来方向。LLM Ensemble指推理阶段综合利用多模型优势,现有推理前、中、后三大集成范式。
让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力
上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。
警惕!大模型成本倒挂:你正在为模型的多余「思考」买单
一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。
曾经年薪百万的架构师,如今是否要靠AI保饭碗?对话5位顶尖架构师:未来的架构师,不写代码也得懂AI
文章围绕AI时代架构师角色转型展开,多位专家认为AI引发架构师角色定位转变,新职业形态涌现。AI工具提升开发效率,架构师需转向战略层面,还探讨了AI对架构设计流程、团队协作的影响及应对建议。
Nsight Python 简介
Nsight Python 是基于 NVIDIA Nsight Tools 的 Python profiling 接口,能采集 CUDA kernel 性能指标。文章介绍其环境依赖、常用 API,还给出多个示例及限制,如可与 Agent 配合,辅助写出更快的 kernel 代码。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
字节Seed开源长线记忆多模态Agent,像人一样能听会看
字节Seed发布全新多模态智能体框架M3 - Agent,能听会看、有长期记忆且免费开源。团队还开发新长视频问答基准M3 - Bench并开源。实验显示,M3 - Agent在多基准测试中显著优于基线模型。
Theory of Agent:构造知行合一的智能体
当前AI(如ChatGPT)存在行为随机性、效率黑洞等问题,论文指出AI缺乏认知地基,需明确认知框架。还提出革命性等式“推理 = 行动”,分析了知识与决策边界,给出最优行为四象限,介绍落地路径和未来发展方向。
昨晚,云计算一哥打造了一套Agent落地的「金铲子」
亚马逊云科技在纽约峰会推出全新 AgentAI 方案,涵盖开发架构、多模型支持及多种工具升级。如 AgentCore 改变开发规则,Strands Agents V1.0 降低多 Agent 协作门槛,还推出 Kiro 等应用,推动 Agentic AI 落地。