算法论文8
上海交大:扩散模型推理加速9倍
量子位
AI 摘要
上海交大EPIC Lab团队:提出dLLM - Cache机制,复用特征降低计算量,可让扩散语言模型推理最高加速9.1倍,还能保持生成质量,通用于主流架构。
阅读原文 · 量子位
扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧
上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
人大蚂蚁团队发布LLaDA MoE v2及扩展定律
中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。
机器之心
开源动态8
openJiuwen 协同昇腾,Agent 推理效率飙升
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
机器之心
新闻资讯8
小米MiMo-V2.5:架构训练推理协同破大模型难题
2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。
AI科技评论
开源动态7
DeepSeek V4定档7月,推理提速80%
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
AIGC开放社区