推荐文章8
NVIDIA:大规模EP优化技术创新揭秘
GiantPandaLLM
AI 摘要
NVIDIA技术沙龙介绍大规模EP优化方案:PD分离等五项关键技术创新,可优化GPU利用率、提升吞吐量。对比多模型架构,展示推理服务架构性能特点与优化策略,各项技术结合构成高效推理系统。
阅读原文 · GiantPandaLLM
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
新闻资讯7
黄仁勋拉华尔街搞5000亿AI基建融资
黄仁勋宣布NVIDIA与多家金融机构合作,建立融资平台,撬动超5000亿美元第三方资本建设AI基础设施。他推出AI工厂概念,称算力能成可投资资产,还回应了循环投资质疑。
量子位
新闻资讯8
黄仁勋:AI算力要成「可投资资产」
今天,黄仁勋在X发布长文,宣布NVIDIA与六家大型金融机构合作,推动AI工厂算力成新「可投资基础设施资产类别」,目标动员超5000亿美元第三方资本支持全球AI基建。
机器之心
算法论文7
SGLang:两代Custom AllReduce实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
GiantPandaLLM