「真机强化学习」共找到 1838 篇相关文章
JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略
浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。
NeurIPS25高分论文|以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题
德州农工大学博士生李港在NeurIPS25高分论文中,分析GRPO优化目标,发现难度偏差局限及与判别式监督学习联系,提出DisCO框架强化大型推理模型,其优势显著,实验表现优于GRPO及其变体。
Andrew Karpathy最新访谈:RL很糟糕、人类学习和教育、智能和文化的演变、AGI还要十年,将带来2%的GDP增长
Dwarkesh Patel 播客对 Andrej Karpathy 进行深度访谈。他认为 AGI 还需十年,目前算法有缺陷;强化学习虽有问题但必要;分析了 LLM 局限,探讨人类学习机制、AGI 经济影响等多方面内容。
突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO
先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。
Karpathy 回应争议:RL 不是真的不行,Agent 还需要十年的预测其实很乐观
Andrej Karpathy 在与知名播客主持人 Dwarkesh Patel 的对谈中指出当下 LLMs 研究进展、Agents 存在的实际问题,如‘AGI 仍需十年时间’‘LLM 认知有缺陷’‘强化学习很糟糕’等。他还对关键争议点做了补充回应,包括对 AGI 时间线、强化学习局限性等的看法。
北航,清华,北大联合发布: 异构智能体协同强化学习!
北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。
Sutton判定「LLM是死胡同」后,新访谈揭示AI困境
强化学习之父Rich Sutton直言LLM是死胡同,因其无法从持续实际互动中学习,违背他坚持的原则。在新访谈和圆桌讨论中,多位专家碰撞观点,探讨AI研究问题、强化学习困境及LLM发展走向等。
对话 Befreed 创始人:从「个人学习」切入的 AI Agent,把学习变成一种生活方式
文章对话 Befreed 创始人 Jisong Liu ,介绍其以「强个性化学习 Agent」为核心的音频学习产品,它能把零散学习累积成知识路径,采用订阅制,有付费转化,还分享了创业、社媒运营等经验。
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
MeanFlow再下一城,北大提出机器人学习新范式MP1,实现速度与成功率双SOTA
北大研究团队提出机器人学习新范式MP1,将MeanFlow引入机器人学习,实现毫秒级推理速度。还引入分散损失提升少样本泛化能力,在仿真和真机测试中,实现速度与成功率双SOTA。