多智能体强化学习」共找到 4536 篇相关文章

推荐文章8

GPT-5 = Scaling Law失效?毕树超:永远有效,因为它反应的是数据结构,客观规律

Shuchao Bi在哥大演讲阐述AI发展。回顾自监督与强化学习路径,指当前发展遇高质量数据瓶颈,认为Scaling Law不会失效。还探讨通往AGI面临的问题,畅想AI重塑世界,提出两个理解AI发展的心智模型。

AI寒武纪
开源动态8

DeepSeekV3.2技术报告还是老外看得细

ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。

量子位
开源动态8

机器人“狂踹不倒”视频刷屏!太空舱遍布城市街巷,银河通用这几手秀麻了

银河通用发布全新通用动作追踪框架Any2Track,让机器人精确模仿人类动作,还能抗干扰。团队将动作捕捉学习解耦为两阶段,兼顾精准模仿与抗干扰。其银河太空舱让机器人融入生活,全栈自研技术推动具身智能落地。

量子位
推荐文章8

Andrej Karpathy最新万字采访:AGI还需10年,RL其实很糟糕,AGI不会导致经济大爆发

Andrej Karpathy在两小时万字采访里阐述AI观点。他认为AGI还需十年,强化学习糟糕,其不会带来经济爆炸式增长。还分享创办Eureka的愿景,想构建“知识斜坡”,让人类在AI时代有更强认知力。

AI寒武纪
开源动态8

深夜开源首个万亿模型K2,压力给到OpenAI,Kimi时刻要来了?

昨晚,月之暗面发布并开源 Kimi K2 大模型,同步上线更新 API,价格 16 元/百万 token 输出。它超过多个开源和闭源模型成新 SOTA,展示出领先能力,还介绍训练关键技术,或成模型智能进化关键。

机器之心
算法论文8

首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!

上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。

机器之心
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
算法论文8

腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」

腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。

机器之心
推荐文章7

刚刚,Thinking Machines Lab博客提出在策略蒸馏,Qwen被cue 38次

Thinking Machines Lab发布《在策略蒸馏》博客,提出在策略蒸馏可结合强化学习纠错与SFT奖励密度,成本低且能让小模型有强大性能。该成果受Qwen团队启发,大量用Qwen3模型。还对比了不同训练方法。

机器之心
算法论文8

Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini

Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。

深度学习自然语言处理