「低成本训练」共找到 3843 篇相关文章
告别微调!斯坦福提出Agentic上下文工程
当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明新方向。
这家公司刚成立7个月,正在打磨通用具身智能的终极形态
超维动力(Kinetix AI)于2025年7月注册,9月研发,不足一年便举办独特发布会,让KAI人形机器人“自己发布自己”。其认为高拟人是训练强世界模型前提,构建了含本体、世界模型等的技术体系,但面临工程与成本挑战。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。
清华团队:1.5B 模型新基线!用「最笨」的 RL 配方达到顶尖性能
清华团队用两个 1.5B 模型证明,用最基础的 RL 配方可达到小模型数学推理能力 SOTA。单阶段训练加固定超参数实现 SOTA 性能且省一半算力,训练曲线还很平滑。
deepseek-V4算法工程技术深入浅出
文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
快手提出强化学习创新框架RLEP,突破大模型推理瓶颈
OpenAI等模型用强化学习提升推理能力,但面临训练不稳定等挑战。快手Klear团队提出RLEP框架,引入经验回放技术,分经验收集和回放训练两阶段,还采用优化策略,提升大模型训练效率和性能。
DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO
论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。
RL 效率无损飙升 3 倍:厦大-Shopee-清华联合首创,将投机解码首次引入 RL,推理能力稳如初!
传统RLVR训练中,rollout阶段耗时成瓶颈。厦大 - Shopee - 清华联合团队提出SPEC - RL,将投机解码引入RL,训练提速2 - 3倍,避免重复生成,与主流算法兼容,在多项基准测试中性能稳定。