开源动态8
PyTorch加速Diffusion模型推理速度
GiantPandaLLM
AI 摘要
Sayak Paul 和 Patrick von Platen:介绍用纯原生 PyTorch 加速文本到图像的 diffusion 模型推理速度的方法,如用 bfloat16 降低精度、SDPA 计算 attention 等,还验证其在其他模型的有效性,后续可探索更多量化应用。
阅读原文 · GiantPandaLLM
PyTorch博客翻译 Accelerating Generative AI Part III: Diffusion, Fast
这篇博客介绍用纯原生 PyTorch 技术将文本到图像的 diffusion 模型(特别是 Stable Diffusion XL)推理速度提升高达 3 倍的方法,讲解五种优化技术,还验证了方法在其他 diffusion 模型上的通用性和有效性。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章8
金煜阳:大模型推理加速全链路方案揭秘
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
InfoQ
新闻资讯8
小米MiMo-V2.5:架构训练推理协同破大模型难题
2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。
AI科技评论
开源动态7
DeepSeek V4定档7月,推理提速80%
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
AIGC开放社区
算法论文8
TransPrune:视觉Token推理加速60%
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
AI科技评论