「强化预训练」共找到 2550 篇相关文章
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。
华为发布如何利用RL训练强大的Deep Research Agent综述!
华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。
小米罗福莉:MiMo-V2.5如何做到又快又强又便宜? | ICML 2026
2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。
ICML 2025 | CoTo:让LoRA训练「渐入佳境」,模型融合、剪枝样样精通
来自多机构研究者提出CoTo渐进式训练策略,解决LoRA训练难题。该策略在训练早期随机失活部分适配器,后期提高激活概率,提升模型融合、剪枝能力,还能增强单任务性能与训练效率,已被ICML 2025接收。
智能体时代的强化学习:AReaL 框架与 Agent 最佳实践
本文整理自吴翼博士在 2025 年 QCon 全球软件开发大会的分享。他介绍 AReaL 框架及 Agent 最佳实践,阐述强化学习与大模型联系,指出 Agent 是 AGI 未来 5 年关键,强化学习是 Agent 技术核心,还分享团队成果与经验。
自搜索强化学习SSRL:Agentic RL的Sim2Real时刻
本文由多机构联合完成,引入自搜索强化学习SSRL。它利用结构化prompt和format reward提取模型world knowledge,降低幻觉。还探索Sim2Real有效性,验证SSRL训练模型在真实场景泛化性,且所有训练数据等已开源。
AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?
普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。
挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力
香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
每2秒吃透一道高数大题!华为终于揭秘准万亿MoE昇腾训练系统全流程
华为揭秘准万亿MoE昇腾训练系统全流程,通过“昇腾+Pangu Ultra MoE”实现国产算力与模型自主可控训练闭环,从集群利用率、单节点算力、后训练技术三方面突破,实现大模型高效训练。