算法论文8
伯克利InFOM:强化学习预训练效果提升20倍
新智元
AI 摘要
伯克利团队提出InFOM新方法,不依赖奖励信号。在多任务测试中,它比八个基线方法表现优,如在jaco任务提升20倍,还能更高效推断用户意图。
阅读原文 · 新智元
强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!
伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心
开源动态8
OpenMOSS开源WCM,让VLA强化学习起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
机器之心
推荐文章7
他山科技:为机器人触觉打造全栈方案
本文指出机器人产业正补触觉这一课,2026年以来触觉成具身智能热门方向。但给机器人装传感器不代表其有触觉。以他山科技为例,剖析其全栈布局,探讨让机器人从物理世界获经验的路径及产业发展机会。
甲子光年