多工具推理」共找到 6807 篇相关文章

算法论文8

告别单一大模型依赖!北航等机构发布综述:大语言模型集成(LLM Ensemble)

北航等机构发布的论文系统性回顾了LLM Ensemble领域进展,介绍分类法、相关问题、方法、基准、应用和未来方向。LLM Ensemble指推理阶段综合利用模型优势,现有推理前、中、后三大集成范式。

PaperAgent
开源动态8

让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现模态智能体能力

上海交大等团队推出模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在任务超 GPT-4o。

机器之心
算法论文8

警惕!大模型成本倒挂:你正在为模型的余「思考」买单

一项来自所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
8

曾经年薪百万的架构师,如今是否要靠AI保饭碗?对话5位顶尖架构师:未来的架构师,不写代码也得懂AI

文章围绕AI时代架构师角色转型展开,位专家认为AI引发架构师角色定位转变,新职业形态涌现。AI工具提升开发效率,架构师需转向战略层面,还探讨了AI对架构设计流程、团队协作的影响及应对建议。

AI前线
产品应用7

Nsight Python 简介

Nsight Python 是基于 NVIDIA Nsight Tools 的 Python profiling 接口,能采集 CUDA kernel 性能指标。文章介绍其环境依赖、常用 API,还给出个示例及限制,如可与 Agent 配合,辅助写出更快的 kernel 代码。

GiantPandaLLM
开源动态8

阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备推理等能力,采用四阶段训练范式,模型和方法已开源。在个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
开源动态8

The Batch: 864 | GLM-4.5:一款开放的智能体竞争者

大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。

DeeplearningAI
开源动态8

字节Seed开源长线记忆模态Agent,像人一样能听会看

字节Seed发布全新模态智能体框架M3 - Agent,能听会看、有长期记忆且免费开源。团队还开发新长视频问答基准M3 - Bench并开源。实验显示,M3 - Agent在基准测试中显著优于基线模型。

量子位
算法论文7

Theory of Agent:构造知行合一的智能体

当前AI(如ChatGPT)存在行为随机性、效率黑洞等问题,论文指出AI缺乏认知地基,需明确认知框架。还提出革命性等式“推理 = 行动”,分析了知识与决策边界,给出最优行为四象限,介绍落地路径和未来发展方向。

深度学习自然语言处理
产品应用8

昨晚,云计算一哥打造了一套Agent落地的「金铲子」

亚马逊云科技在纽约峰会推出全新 AgentAI 方案,涵盖开发架构、模型支持及工具升级。如 AgentCore 改变开发规则,Strands Agents V1.0 降低 Agent 协作门槛,还推出 Kiro 等应用,推动 Agentic AI 落地。

机器之心