轨迹蒸馏」共找到 194 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
产品应用8

Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

Anthropic发布Fable 5.1和Mythos 5.1,8项基准测试夺冠,价格最高降45%。展示科研成果,如蛋白质设计、生成金星地图等。上线反蒸馏机制,防止篡改上下文,还给出替代方案。

量子位
新闻资讯7

Meta CEO X 微软 CEO 对话解读:「蒸馏工厂」为何成为开源的魅力之源?

Meta CEO Mark Zuckerberg 和微软 CEO Satya Nadella 在 LlamaCon 2025 闭幕会议对话,探讨AI对技术平台等影响,如使文档、应用和网站界限模糊,还谈及开源与闭源模型战略价值及‘蒸馏工厂’概念。

机器之心
算法论文8

数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真

数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。

新智元
开源动态8

Thinking Machines 发布又一神作「在线策略蒸馏」 ,LLM后训练效率飙升50-100倍

Mira的THINKING MACHINES开源「在线策略蒸馏」LLM后训练方法,结合两种主流后训练范式优点,提升训练效率50 - 100倍,成本降低9到30倍,可用于数学推理、模型个性化等场景。

AI寒武纪
开源动态8

1.58bit不输FP16!微软推出全新模型蒸馏框架,作者全是华人

微软推出蒸馏框架BitNet Distillation,实现几乎无性能损失的模型量化。它含三阶段,经实验在多下游任务表现近全精度模型,降内存开销、提推理速度,作者全是微软研究院华人。

量子位
产品应用7

阿里通义发布Z-Image非蒸馏版基础模型版本,支持完整CFG和负向提示

阿里通义发布Z-Image基础图像生成模型,采用单流扩散Transformer架构,具核心创新技术。它是非蒸馏模型,支持完整CFG和负向提示,注重输出多样性和创意控制,已在Hugging Face开放下载。

AI工程化
算法论文8

多轮Agent蒸馏终于不翻车!港中文x通义新方法成功率暴涨18点,训练还快32%

香港中文大学联合阿里通义事业群提出TCOD训练方法,解决多轮Agent蒸馏稳定性难题。它只需对现有OPD代码做极少改动,提升了模型成功率,压缩行动步数,还减少训练时间,未来或成训练长程Agent标配。

量子位
开源动态8

Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位
算法论文8

清华联手英伟达打造扩散模型新蒸馏范式!视频生成提速50倍,4步出片不穿模

清华大学朱军教授团队与NVIDIA Deep Imagination研究组联合提出分数正则化连续时间一致性模型(rCM),将连续时间一致性蒸馏扩展至大模型,解决现有方法瓶颈,提升推理速度兼顾质量与多样性。

量子位