推荐文章7
NVIDIA Blackwell:低精度GEMM新特性揭秘
GiantPandaLLM
AI 摘要
文章聚焦NVIDIA Blackwell架构低精度数据类型支持,探讨PTX和硬件细节,分析CUTLASS实现,如创建SMEM布局、指示TMA格式化数据等。还提及低精度优势,块缩放讨论留待下篇。
阅读原文 · GiantPandaLLM
一起聊聊Nvidia Blackwell新特性之低比特GEMM
本文是NVIDIA Blackwell架构GEMM研究系列文章第三部分,介绍低精度计算,探讨Blackwell GEMM如何执行,关注6位和4位格式及对内存布局影响。还提及低精度优势、数据格式、UMMA实现、操作限制、CUTLASS抽象方式等。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章8
腾讯程序员:揭秘大模型输出确定性结果之道
文章探讨大模型输出确定性结果的问题。指推理引擎底层动态组批与算子调度策略,因浮点加法顺序变化使结果波动。还分析GEMM、RMSNorm等算子影响,给出vLLM实现Batch Invariance的方法。
腾讯技术工程
开源动态8
蚂蚁开源:GEMM+AllReduce重叠内核实践
文章是对蚂蚁开源x SGLang Meetup分享的回放解读,聚焦基于CuTe DSL的通信 - 计算重叠内核实践。探讨不同通信计算重叠方案,分析在Blackwell上做GEMM + AllReduce融合算子的优势,介绍multimem指令等,还提及接入模型执行路径和性能结果。
GiantPandaLLM
推荐文章7
杨远航:实现多精度GEMM算子及自定义FP8内核
文章介绍实现支持不同精度的 GEMM 算子,解析精度转换技术细节,还介绍根据 PTX 文档实现自定义 FP8 精度的 GEMM kernel,包括揭开 MMA Atom 面纱、分析 TV 与 MN Layout 等,最后完成精度验证。
GiantPandaLLM
推荐文章8
BBuf:一文速览 CuTe DSL
本文是 CuTe DSL 4.3.5 文档翻译,介绍了其核心概念、使用方法、与 CUTLASS C++ 关系等。它通过 Python DSL 降低 CUDA Kernel 开发门槛,支持 JIT 编译、多种架构,还说明了当前限制与未来计划。
GiantPandaLLM