稀疏蒸馏」共找到 208 篇相关文章

开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。

新智元
新闻资讯7

GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力

GitHub代码确认GLM - 5架构细节,它采用DeepSeek - V3/V3.2架构,含稀疏注意力和多Token预测,参数量745B。OpenRouter上神秘「Pony Alpha」被指是其测试版,受消息影响智谱AI港股两日涨60%。

量子位
算法论文8

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

一篇前沿大模型安全漏洞论文引发热议,指出各大模型 API 设计缺陷,可提取隐藏思维链。同一模型家族安全能力不对称,攻击者可利用此漏洞,还介绍了攻击路径、实验及修复建议。

机器之心
产品应用8

美团龙猫LongCat技术升级!新注意力机制解码速度快10倍,还能处理1M超长文本

美团龙猫LongCat系列发布全新稀疏注意力机制LoZA,重点解决长文本任务难题。它在MLA机制基础改造,计算复杂度降至线性,处理128K上下文解码快10倍,性能不缩水,后续还计划支持动态稀疏比例。

量子位
算法论文8

ICML 2026 | 将多教师冲突转化为动态约束,破解多模态大模型推理对齐难题

在多模态大模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技大学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态大模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。

机器之心
开源动态7

The Batch: 907 | 小而高效模型的“制作”方法

Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。

DeeplearningAI
产品应用7

再也不怕面瘫脸!YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑

YouTube在Shorts相机里实现AI实时「重绘」人脸,效果自然。它通过知识蒸馏将大模型「瘦身」成小模型,用迭代蒸馏打磨细节,PTI保证身份特征,MediaPipe搭建推理管道,还将拓展视频生成功能。

新智元
开源动态7

OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE

OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。

量子位
产品应用7

Codex自我蒸馏玩法火了!OpenAI员工亲授:复制粘贴就能让AI消灭重复劳动

OpenAI员工Vaibhav Srivastav爆出Codex「自我蒸馏」秘籍,复制提示词就能让它找出重复工作并打包。提示词从初版迭代到2.0版,覆盖更多场景且能直接创建项目。此外还介绍了Codex新功能及Vaibhav的其他玩法。

量子位
算法论文8

斯坦福与Adobe新研究,模仿蒸馏技术轻松让200亿参数图像生成高质量大模型

斯坦福大学和Adobe研究院联手,用pi - Flow技术让200亿参数文本到图像大模型4步内生成高质量、高多样性图片。此前少步生成有质量和多样性问题,他们推出GMFlow和pi - Flow解决难题,LakonLab是其背后工程支撑。

AIGC开放社区