微调训练」共找到 2290 篇相关文章

产品应用8

英伟达祭出NVFP4核弹:大模型训练根本性转变,GB300效率狂飙7倍

英伟达推出新格式NVFP4,能以4 - Bit速度与效率实现16 - Bit生产件级训练精度,是LLM开发重大飞跃。虽处于研究阶段,但正与多组织合作。还介绍其方法、优势,实验也证明它在大规模训练的有效性。

AI寒武纪
算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
算法论文8

微调已死?Agentic上下文工程登场,无需微调实现模型进化

斯坦福大学等团队提出 Agentic Context Engineering 技术,让语言模型无需微调自我提升。它将上下文视为作战手册,引入三种协作角色与三项创新,实验显示其在两类任务上表现优异,成本和延迟显著下降。

机器之心
算法论文8

手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里

中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。

量子位
新闻资讯7

DeepSeek刚提到FP8,英伟达就把FP4精度推向预训练,更快、更便宜

DeepSeek提及针对国产芯片的FP8量化设计,引发对大模型量化策略关注。不久后英伟达发力低精度量化,将NVFP4策略拓展到预训练阶段,其方案能解决核心挑战,实验证明NVFP4在大规模训练中可行。

机器之心
算法论文8

NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调的静态瓶颈

在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调

机器之心
开源动态8

阿里通义开源「推理+搜索」预训练新框架:小模型媲美大模型,多个开放域问答数据集表现显著提升

阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美大模型,还验证了训练方式、策略及奖励函数的效果。

量子位
算法论文8

英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限

学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。

机器之心
产品应用7

Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍

Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。

机器之心
算法论文8

Sea AI Lab 揭秘:你费尽心力调的 LLM 一直在崩溃?罪魁祸首可能只是一个参数:BF16

Sea AI Lab 和新加坡国立大学研究指出,强化学习微调训练不稳定和性能瓶颈,根源是数值精度 BF16。其低精度造成“训练 - 推理不匹配”,使训练易失败。将精度切换到 FP16 可解决问题,提升模型表现。

AI寒武纪