sglang」共找到 68 篇相关文章

开源动态8

蚂蚁开源 x SGLang Meetup技术回放解读系列之面向DeepSeek系列模型的深度优化与实践

文章是对蚂蚁开源x SGLang Meetup中「蚂蚁Theta面向DeepSeek系列模型的深度优化和实践」分享的解读,详细介绍了在H20-96G上对DeepSeek系列模型推理的优化方案,包括Prefill和Decode阶段的优化、通信优化、观测诊断等,并给出了评测结果。

GiantPandaLLM
产品应用7

Codex在推理框架上能蹬出什么优化

作者复盘用Codex在SGLang中的实践,原本需3 - 4个月的工作量现缩短为1个半月。介绍保证代码质量方法,分享印象深刻的debug经历,列举在SGLang用Codex一个月的优化成果,还提及Claude Code使用遇阻。

GiantPandaLLM
算法论文8

142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要

文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。

GiantPandaLLM
开源动态8

SGLang Hierarchical Sparse Attention 技术深度解析

阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。

阿里云开发者
新闻资讯7

Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河

在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从长任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。

Founder Park
产品应用7

Codex正在重塑传统推理框架开发流程

作者用Codex完善SGLang Diffusion的SKILLS流程,修复诸多bug。让其做benchmark脚本,发现不同rmsnorm性能差异。应用flashinfer rmsnorm遇问题,Codex找出原因并修复,还提升了模型性能,体现强大生产力。

GiantPandaLLM
产品应用7

jiSGLang集成ktransformers:2TB内存运行Kimi K2 Thinking模型

对于内存多但GPU资源有限的用户,SGLang集成ktransformers的CPU内核,支持直接运行Kimi K2 Thinking模型。它无需等量化,还能微调,虽性能与GPU方案有差距,但给用户新选择。

AI工程化
开源动态8

如何在24GB显存里,塞下一个万亿参数的巨兽?KTransformers入选顶会SOSP

清华大学与趋境科技联合研发的KTransformers系统,可让消费级显卡跑万亿级参数模型,其论文入选SOSP 2025。该系统解决MoE模型本地部署难题,技术创新多,还与SGLang合作,提升硬件利用率。

AIGC开放社区
开源动态7

在 Cache-DiT 框架下实现原生 Serving功能

Cache-DiT 是唯品会开源的 PyTorch 原生 DiT 推理加速引擎,此前聚焦离线推理。现实现完整 Serving 功能,支持单卡与分布式推理模式。文章介绍其实现过程、借鉴 SGLang 的设计,还总结踩坑及使用方法。

GiantPandaLLM
推荐文章7

Harness Engineering?不过是把工程常识换个名字

Chayenne Zhao 发文炮轰 harness 概念,认为它只是工程常识换个名字。她以 SGLang 社区构建多智能体系统为例,阐述解决问题的方案和关键决策,还指出真正驱动改进是环境层面,而非模型。

AI工程化