推荐文章7
曹宇:强化学习系统发展与挑战
InfoQ
AI 摘要
阿里巴巴曹宇:强化学习对工程化需求多,业内实践结合人类与机器反馈。核心算法关注奖励函数设计,如PPO、GRPO等。超大规模RL系统各环节挑战大,国内厂商推出众多开源框架,未来需协同设计。
阅读原文 · InfoQ
强化学习 AI 系统的设计实现及未来发展
本文是阿里巴巴算法专家曹宇在AICon 2025北京站的分享。从RLHF系统出发,结合实践展示RL系统现状与发展,探讨超大规模RL方向,涉及理论、业界实践、开源生态等,还介绍了AICon北京站活动。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心
算法论文8
牛津、NUS 提出心智世界建模新方向
牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。
机器之心
开源动态8
OpenMOSS开源WCM,让VLA强化学习起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
机器之心