开源动态8
蚂蚁开源:GEMM+AllReduce重叠内核实践
GiantPandaLLM
AI 摘要
蚂蚁开源分享:RowParallelLinear的GEMM后AllReduce,tile算完即处理更易重叠;Blackwell硬件适配;kernel内用warp分工;two - shot分区避免重复工作;注意内存顺序;SGLang PR已接入部分层,但有环境限制。
阅读原文 · GiantPandaLLM
蚂蚁开源 x SGLang Meetup技术回放解读之基于CUTE DSL的通信计算重叠算子实践
文章是对蚂蚁开源x SGLang Meetup分享的回放解读,聚焦基于CuTe DSL的通信 - 计算重叠内核实践。探讨不同通信计算重叠方案,分析在Blackwell上做GEMM + AllReduce融合算子的优势,介绍multimem指令等,还提及接入模型执行路径和性能结果。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
Qwen3.8 - Flash - Next开源,SGLang首日支持
2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8 - Flash - Next,它是Qwen4架构早期预览版。SGLang在发布首日就提供完整支持,模型架构多方面升级,亮点众多,还给出启动命令及配置建议参考。
GiantPandaLLM
开源动态8
Qwen团队开源Qwen3.8-Flash-Next,SGLang首日支持
2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8-Flash-Next,是Qwen4架构早期预览版。SGLang在发布首日提供完整支持,模型架构多方面升级,亮点众多,还介绍各组件优化及PLE架构与卸载优势。
GiantPandaLLM
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
推荐文章8
腾讯程序员:揭秘大模型输出确定性结果之道
文章探讨大模型输出确定性结果的问题。指推理引擎底层动态组批与算子调度策略,因浮点加法顺序变化使结果波动。还分析GEMM、RMSNorm等算子影响,给出vLLM实现Batch Invariance的方法。
腾讯技术工程