开源动态8
2025年8月SGLang框架性能优化记录
GiantPandaLLM
AI 摘要
BBuf记录2025年8月SGLang性能优化,如在GPT - OSS和DeepSeek - V3等模型应用优化技术,像allreduce_add_rmsnorm、量化内核优化等,提升了端到端吞吐,减少延迟和内存开销。
阅读原文 · GiantPandaLLM
SGLang 2025-8月性能优化技巧记录
本笔记记录2025年8月SGLang框架性能优化实践,涉及GPT - OSS、DeepSeek - V3等模型,采用allreduce_add_rmsnorm、量化、通信、内核融合等优化技术,在性能提升、减少延迟等方面效果显著。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
开源动态8
面壁智能开源ForgeStencil,1周优化百款工业软件
中国正从「制造大国」迈向「智造强国」,国产工业软件面临性能瓶颈。面壁智能联合OpenBMB开源全球首个Stencil优化AI系统ForgeStencil,1周自动优化100+软件,全程0人干预,提升研发效率,切中制造业升级诉求。
新智元
算法论文7
SGLang:两代Custom AllReduce实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
GiantPandaLLM
产品应用8
快手:Doris 让 AB 场景提速 145 倍
快手 AB 指标生产场景从 Spark 切换到 Doris 提速 145 倍、资源消耗降 72%,刷新 Doris 单机群最大规模。本文介绍选择 Apache Doris 的原因,以及在存储、计算、调度、稳定性等方面的优化,对构建 AB 实验平台有参考价值。
InfoQ