「后训练技术」共找到 5908 篇相关文章
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
RL后训练步入超节点时代!华为黑科技榨干算力,一张卡干俩活
在大模型竞赛白热化当下,强化学习后训练成突破LLM性能天花板核心路径,但算力浪费和集群效率低是难题。华为团队祭出两大黑科技破局,在超节点实现训推共卡,资源利用率翻倍,还提升训练速度。
开发者狂喜:Thinking Machines发布首款产品Tinker,后训练麻烦全给包了
OpenAI前CTO创办的Thinking Machines推出首款产品Tinker,这是用于微调语言模型的API,能简化LLM后训练过程,支持前沿模型,使用LoRA技术降低成本,还发布开源库,多高校团队已试用。
95后,边改造业务边发AI顶会论文,是怎样的体验?
当下AI人才竞争激烈,企业各出奇招。今年5月京东技术沙龙零售专场,技术团队分享成果。几位95后青年专家讲述成长历程,如洛川解决CTR模型训练瓶颈,谦屹发表多篇顶会论文。京东还推出人才计划吸引人才。
科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生
文章深入解读大模型后训练,先对比 PPO 与 GRPO,指出 GRPO 优势及成本问题。又介绍 GRPO 后续改进算法,如 DAPO 解决训练问题、GSPO 提升训练稳定性、GFPO 可优化多属性,还提及 GRPO 其他缺陷。
一文解读 LLM Posting-Train技术
文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。
NeurIPS 25 | GRPO进阶版来了,GVPO重构大模型后训练范式
大模型后训练越发关键,GRPO 有缺陷。作业帮与香港科技大学(广州)团队在 NeurIPS 2025 提出 GVPO 方法,解决 GRPO 稳定性难题,理论有最优解保证,实验表现超现有方法。
LLM后训练太烧钱?清华&腾讯有了破解法门:关键是得会Rollout
大模型强化学习后训练中,rollout预算易成瓶颈,且并非所有rollout都有用。清华和腾讯研究者提出TRACE框架,将Agent轨迹视为树,分配预算给易产生“成功/失败对比”的节点,实验显示其效果良好。
ACL 2026 | 中科大&上海AILab揭示强化学习后训练的Scaling Law
中国科学技术大学和上海人工智能实验室等团队,在Qwen2.5和Llama 3模型开展研究,揭示强化学习后训练的Scaling Law,提出幂律公式预测模型学习效率与训练轨迹,成果被ACL 2026接收。