「多Agent并行推理」共找到 4649 篇相关文章
Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险
近年来,基于大语言模型的智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。
Think in Games:做一个在王者荣耀中会玩和思考的Agent
文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。
首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化
互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
数学编码超越O3-high,英伟达版「DeepSeek R1二代」推理模型开源~
Nvidia开源OpenReasoning-Nemotron系列模型合集,采用Qwen2.5架构,基于500万条轨迹训练。评测输出长度最高64K token,多版本刷新SOTA。其‘heavy’模式有独特能力,32B版在数学与编程基准超越O3(High)。
AlphaEvolve:陶哲轩背书的知识发现 Agent,AI 正进入自我进化范式
Google今年5月发布的AI系统AlphaEvolve,结合Gemini模型与evaluator,能发现新算法。它源于FunSearch,可多领域应用,运行机制类似自然进化,其关键组件evaluator对其发展很重要,也标志AI进入自我改进范式。
推理与操控能力双提升!具身机器人双系统VLA模型新突破
香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR
现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。