算法论文8
中期训练策略让 Llama 追平 Qwen
机器之心
AI 摘要
上海创智学院和上海交大团队研究发现,通过中期训练策略,可将 Llama 改造成适配强化学习的推理基础模型,缩小与 Qwen 差距。还指出高质量语料、数据格式等对提升 RL 性能很重要,后续将多方向探索。
阅读原文 · 机器之心
首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!
上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心
开源动态8
OpenMOSS开源WCM,让VLA强化学习起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
机器之心
推荐文章7
他山科技:为机器人触觉打造全栈方案
本文指出机器人产业正补触觉这一课,2026年以来触觉成具身智能热门方向。但给机器人装传感器不代表其有触觉。以他山科技为例,剖析其全栈布局,探讨让机器人从物理世界获经验的路径及产业发展机会。
甲子光年