后训练阶段」共找到 4130 篇相关文章

算法论文8

Anthropic最新论文:检测LLM内省意识的方法

Anthropic与MIT等研究表明,LLM能‘感知’被注入的steering vector,‘内省意识’在DPO等后训练阶段涌现。研究构建实验,发现内省能力行为稳健、检测非简单线性关联等,还揭示检测与识别机制不同及两阶段电路。

PaperAgent
算法论文8

DeepMind 颠覆机器人学习范式:让机器像人一样 “自由成长”

谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机器人学的两阶段训练方法,含监督微调与自我提升。实验显示该方法让机器人自主习得新技能、广泛泛化,但研究也存在标注成本高等局限。

AI科技评论
开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段训练和多阶段处理,团队成果多,推动多模态技术落地。

量子位
开源动态8

训练效率提升25%、成本降23%!上海期智研究院、算秩未来联合推出MegatronApp:专为万亿参数大模型训练打造的系统工具包

上海期智研究院联合算秩未来在WAIC 2025大会发布开源项目MegatronApp,它是国内首个围绕Megatron - LM的增强工具链。经实际数据,其在该框架下训练效率提25%、成本降23%,含四大模块解决训练难题。

AI前线
算法论文8

手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里

中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。

量子位
产品应用8

英伟达祭出NVFP4核弹:大模型训练根本性转变,GB300效率狂飙7倍

英伟达推出新格式NVFP4,能以4 - Bit速度与效率实现16 - Bit生产件级训练精度,是LLM开发重大飞跃。虽处于研究阶段,但正与多组织合作。还介绍其方法、优势,实验也证明它在大规模训练的有效性。

AI寒武纪
算法论文8

为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练

社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。

机器之心
算法论文7

LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!

文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。

AINLPer
算法论文8

AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。

量子位
算法论文8

无需训练的LLM对齐方法综述

大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。

深度学习自然语言处理