开源动态7
SGLang开发、编译及Profile技巧分享
GiantPandaLLM
AI 摘要
作者分享SGLang开发等技巧:Tom神解决perfetto可视化kernel丢失问题,提供多Rank结果合并脚本;yyihuang教PR切换分支法;给出SGLang无视版本运行命令定位bug。
阅读原文 · GiantPandaLLM
记录下SGLang 开发,编译和Profile的几个小技巧
作者记录在SGLang开源一年学到的开发和Profile技巧。包括解决perfetto可视化PyTorch Profiler结果时kernel丢失问题、PR切换分支方法,还介绍让SGLang无视版本运行以定位bug的方法。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
Qwen3.8 - Flash - Next开源,SGLang首日支持
2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8 - Flash - Next,它是Qwen4架构早期预览版。SGLang在发布首日就提供完整支持,模型架构多方面升级,亮点众多,还给出启动命令及配置建议参考。
GiantPandaLLM
开源动态8
Qwen团队开源Qwen3.8-Flash-Next,SGLang首日支持
2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8-Flash-Next,是Qwen4架构早期预览版。SGLang在发布首日提供完整支持,模型架构多方面升级,亮点众多,还介绍各组件优化及PLE架构与卸载优势。
GiantPandaLLM
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
算法论文7
SGLang:两代Custom AllReduce实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
GiantPandaLLM