「奖励信号」共找到 374 篇相关文章
算法论文8
SAPO:让强化学习告别“硬剪切”
强化学习是提升大语言模型推理能力的核心技术之一,但现有基于组的策略优化方法面临 token 级重要性比率高方差问题。GRPO 和 GSPO 采用硬剪切有学习信号丢失等缺点。为此提出 SAPO,用平滑门控函数替代硬剪切,实验效果良好。
通义千问Qwen
算法论文8
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
深度学习自然语言处理
新闻资讯7
Fable 5开始灰度解禁?6月26日大限倒计时
被禁用多日的Fable 5疑似开始部分解禁,在少部分用户的Claude手机App中出现,代码更新也释放其将整合进Claude订阅服务的信号。同时,Claude Sonnet 5可能落地,且旧版Sonnet使用限制取消。6月26日美国商务部需对大模型访问权限答复。
新智元
算法论文8
10步优化超越强化学习,仅需1条未标注数据!后训练强势破局
无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。
新智元