开源动态8
零开销技术将Wan2.2推理速度加速60%
GiantPandaLLM
AI 摘要
作者在优化SGLang对Wan2.2支持时,发现推理性能问题。通过零开销逐层权重卸载技术,将推理速度提升60%,突破显存墙。还实现All2All预热,消除第1步延迟,该技术适用于大型模型等场景。
阅读原文 · GiantPandaLLM
通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%
文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
算法论文7
SGLang:两代Custom AllReduce实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
GiantPandaLLM
算法论文8
PKINet - v2:遥感检测精度速度双提升
PKINet - v2是改进的遥感目标检测模型,能处理复杂形状和尺度变化问题。它在PKINet基础上升级,统一条带与方形卷积,部署时折叠为单大核。在多数据集上精度和速度提升,可服务多领域,但对特殊目标仍有检测问题。
新智元
开源动态7
SGLang:编译产物评审揭示执行路径变化
本文从「编译产物评审」视角,分析 SGLang 的 PR、FlashInfer DeepGEMM 及 Ampere→Hopper 架构迁移案例。指出算法面和编译产物面会有分歧,编译产物 diff 能提前揭示执行路径变化,对开源项目有增益。
GiantPandaLLM