开源动态8
KTransformers:异构推理成大模型新范式
量子位
AI 摘要
趋境科技与清华团队联合研发的KTransformers,论文入选SOSP 2025。它创新异构推理架构,加入专家延迟机制,与SGLang合作推动架构融合,成广泛复用框架,未来想让AI能力普惠。
阅读原文 · 量子位
KTransformers入选计算机系统顶会、与主流框架合作,趋境&清华让「异构」成为推理新范式
KTransformers由趋境科技与清华团队联合研发,是高性能异构推理框架。其论文入选SOSP 2025,还与SGLang合作。它有算子优化等创新,能让CPU与GPU协同,推动推理架构融合,已成广泛复用的底层框架。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
算法论文7
SGLang:两代Custom AllReduce实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
GiantPandaLLM
开源动态7
SGLang:编译产物评审揭示执行路径变化
本文从「编译产物评审」视角,分析 SGLang 的 PR、FlashInfer DeepGEMM 及 Ampere→Hopper 架构迁移案例。指出算法面和编译产物面会有分歧,编译产物 diff 能提前揭示执行路径变化,对开源项目有增益。
GiantPandaLLM
开源动态8
英伟达开源NeMo:MoE微调加速3.7倍
英伟达开源NeMo AutoModel,基于Hugging Face Transformers v5,不改代码API,添一行import就能更快速微调MoE模型。实验显示,它能提升3.4 - 3.7倍训练吞吐,减少29% - 32% GPU显存占用。
量子位