返回首页
算法论文8

小偏差为何带偏大模型RL训练

深度学习自然语言处理
AI 摘要

Together AI团队发现,大模型RL中采样与训练端的微小偏差会产生策略漂移,循环累积带偏训练;提出Score Centering校正漂移,提升失配场景训练稳定性,但仍有应用边界。

阅读原文 · 深度学习自然语言处理
一点点偏差,为什么会把大模型 RL 带跑偏?
本文解读Together AI的新算法论文,讲解大模型强化学习中,采样端与训练端的微小偏差如何累积放大导致训练跑偏,介绍Score Centering校正方法的原理、效果与应用边界。

相关文章