残差学习」共找到 1694 篇相关文章

开源动态8

LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力

LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。

Hugging Face
开源动态8

机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习

端到端策略模型在物理世界失灵,现有在线学习路径未走通。清华 AIR 与域变换联合推出 Zetta ζ,通过三个闭环实现闭环物理智能体在线学习,实验显示其任务成功率高,还让机器人出现‘Aha Moment’。

机器之心
算法论文8

以星为舵:LLM的Post-Train与Rest-Time奖励学习综述

这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。

深度学习自然语言处理
算法论文8

强化学习的两个「大坑」,终于被两篇ICLR论文给解决了

现有强化学习算法基于理想化交互模式,难应对真实环境。Mila 实验室两篇 ICLR 2025 论文提出实时强化学习框架,分别解决推理延迟和动作缺失问题,还可结合使用,对关键领域意义重大。

机器之心
开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
算法论文8

强化学习+大模型记忆:Mem-α,让智能体第一次学会“如何记忆”

在大语言模型发展中,‘记忆’是智能体具备长期智能的关键。现有外部记忆系统有局限,Mem-α将强化学习引入大模型记忆管理体系,解决记忆难题,在性能、泛化等多方面表现出色。

机器之心
开源动态8

世界模型+强化学习=具身智能性能翻倍!清华&加州伯克利最新开源

具身智能发展中样本效率成瓶颈,传统无模型强化学习依赖盲目试错。清华与加州伯克利团队提出BOOM框架,通过自举循环机制解决在线规划与策略学习矛盾,实验表现卓越,为具身智能落地提供支撑。

量子位
算法论文8

10行代码,AIME24/25提高15%!揭秘大模型强化学习熵机制

来自多机构的研究者揭示大模型强化学习中熵变化机制。发现策略熵在训练中急剧下降致性能停滞,提出 Clip - Cov 与 KL - Cov 两种正则化技术调控高协方标记,遏制熵塌缩,在部分数据集上性能提升显著。

机器之心
算法论文8

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。

机器之心
算法论文8

ACL 2026 | 中科大&上海AILab揭示强化学习后训练的Scaling Law

中国科学技术大学和上海人工智能实验室等团队,在Qwen2.5和Llama 3模型开展研究,揭示强化学习后训练的Scaling Law,提出幂律公式预测模型学习效率与训练轨迹,成果被ACL 2026接收。

机器之心