最大似然强化学习」共找到 903 篇相关文章

算法论文8

北航,清华,北大联合发布: 异构智能体协同强化学习!

北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。

机器之心
新闻资讯7

OpenAI明年上市,万亿美元估值将成史上最大IPO

OpenAI正筹备史诗级IPO,估值或达1万亿美元。其通过架构重组削弱微软控制、强化自身独立性,为上市铺路。若成功,将改写AI产业格局,也考验其平衡商业利益与使命的能力。

新智元
推荐文章7

清华叉院教授手把手教你用强化学习训练智能体

在大模型智能体时代,智能体强化学习训练通用智能体很关键。ASearcher 是相关项目,AReaL 有交互次数和代码设计优势。本次吴翼教授将带团队成员,以多轮搜索智能体为例,教用最少代码实现训练。

机器之心
算法论文8

自搜索强化学习SSRL:Agentic RL的Sim2Real时刻

本文由多机构联合完成,引入自搜索强化学习SSRL。它利用结构化prompt和format reward提取模型world knowledge,降低幻觉。还探索Sim2Real有效性,验证SSRL训练模型在真实场景泛化性,且所有训练数据等已开源。

机器之心
算法论文8

西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速

扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。

量子位
开源动态8

7万个模型、1600万开发者,阿里魔搭已建成中国最大AI开源社区

首届魔搭开发者大会公布,魔搭社区开源模型超7万个,用户达1600万,成中国最大AI开源社区。阿里云CTO周靖人认为‘云端协同’是重要课题,魔搭要覆盖模型全生命周期,减少模型落地差距。

量子位
算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
算法论文8

突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR

现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。

机器之心