「多智能体学习算法」共找到 4803 篇相关文章
X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习
年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。
字节Seed最新版原生智能体来了!一个模型搞定手机/电脑/浏览器自主操作
字节Seed发布最新版原生智能体UI - TARS - 2,采用All in one原生设计,表现优于Claude和OpenAI Agent等。它通过多轮强化学习,解决智能体操作图形界面的四大难题,在多测试中表现出色。
AgentFly:重塑Agent,无需微调LLM,如我们一样的记忆和经验持续学习
现有LLM智能体依赖静态流程或微调参数,缺乏灵活性且成本高。论文提出基于记忆的在线强化学习框架AgentFly,不更新LLM权重,在多基准测试表现出色,为构建通用智能体提供新范式。
斯坦福7B智能体全面超越GPT-4o,推理流登顶HF
传统智能体系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。
让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器
当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。
狂揽16.1k星!清华开源交互式AI课堂,学霸打造的最懂学习的AI工具
清华开源的OpenMAIC是多智能体互动课堂平台,能将文档转化为互动学习场景,自动生成课件等内容,有五种交互式界面、AI教师指导,可在任何设备使用,对教育场景很有价值。
堆了一仓库GPU,却生产不出专业智能?九章云极用AI工厂给出解答
企业接入通用大模型到业务系统,却发现它难以执行任务。九章云极在发布会上推出‘AI工厂’战略,通过训练工厂和Token工厂填平执行鸿沟,前者用强化学习造专业模型,后者让专业智能规模化流通。
干货 | 算法岗校招经验分享+吐槽
作者分享算法岗校招经验与吐槽,涵盖个人背景、校招结果、面经。分析算法岗就业、算法与开发差异等情况,给出刷题、实习等方面建议,鼓励校招失利者别灰心。
Andrej Karpathy深度解读:强化学习之父为何说大模型违背了「苦涩教训」
Andrej Karpathy深度解读Sutton与Dwarkesh的播客对话。Sutton认为大模型不符合「苦涩教训」,因其训练依赖人类数据集。他追求类似动物通过强化学习与世界交互的系统。Karpathy认可批评,认为找到符合原则算法是突破。
通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果
阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。