「优化训练」共找到 3075 篇相关文章
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
10步优化超越强化学习,仅需1条未标注数据!后训练强势破局
无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。
千卡集群破壁之道:vivo视觉多模态大模型训练效率跃迁实战
多模态大模型在多领域需求增长,但千卡级 GPU 训练挑战大。vivo AI 架构师王兆雄在大会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。
昇腾+鲲鹏联手上大招!华为爆改MoE训练,吞吐再飙升20%,内存省70%
最近华为在MoE训练系统给出算子和内存优化新方案,三大核心算子全面提速,系统吞吐再提20%,Selective R/S实现内存节省70%,为大规模MoE模型训练扫清障碍。
从后训练回到预训练,LLM+RL 的潜力兑现有有机会走更远吗?
RL与LLM结合是重要技术方向,应用从后训练延伸至预训练。虽看似为LLM+RL带来希望,但RL本身有局限。微软等提出的RPT有潜力,不过训练语料等未广泛验证,且需大量计算资源。
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。
斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?
斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
小钢炮开源,一张3090两小时「从零训练0.1B全模态模型」,模型训练彻底平民化
MiniMind - O是开源超轻量级端到端全模态大模型,采用双轨架构。仅需一张RTX 3090,2小时就能从零训练全链路。有两套训练数据,具备零样本声音克隆等特点,实现大模型训练平民化。
破局大模型训练黑盒,MegatronApp开源实现万亿参数「可视可控」训练
在2025上海QCon大会上,算秩未来赵伯罕博士指出万亿级大模型训练困境。上海期智研究院和算秩未来联合研发MegatronApp,以低入侵方式补齐链路,其四个模块形成闭环,让训练从黑盒变白盒,项目已开源。