算法论文8
DYPO:让SFT与RL协同提升大模型推理
量子位
AI 摘要
清华大学等团队:提出DYPO方法应对SFT和RL融合难题,先判断样本学习阶段再选优化路径,在多场景实验中提升效果明显,虽有边界但提供新方向。
阅读原文 · 量子位
当SFT遇上RL:基于样本学习阶段的动态策略优化机制
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
具身智能:告别通用模型,走向异构编排
当VLA、WAM等机器人控制策略在各自任务中表现出色,如何为子任务匹配合适策略成完成复杂长时序任务关键。RoboHarness解决异构策略协同难题,通过协同调用策略提升成功率。
机器之心
算法论文8
腾讯混元:SFT训练有15.3%“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
量子位
算法论文8
腾讯混元论文展望SFT研究新方向
本文从不完全学习现象出发,展望SFT领域未来研究方向,如未知根因探索、检测方法改进等,还提及推广到其他训练范式、CPT精细化研究等,给出研究优先级和社区建议。
InfoQ
新闻资讯7
OpenAI 推芯片,挑战英伟达霸权
OpenAI 展示与博通联合打造的定制 AI 芯片 Jalapeño,性能媲美英伟达 Blackwell 或谷歌 TPU。计划年底部署,是多代芯片开发首步。它专为大模型推理设计,设计周期短,成本低,OpenAI 借此扩展全栈能力。
InfoQ