GEMM Kernel」共找到 57 篇相关文章

产品应用7

关于Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti的理解

文章分析Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti异常现象。通过实验和推算,发现ncu对L20 GPU上特定指令用错误执行延迟算指标,导致异常,还给出GEMM Kernel性能分析建议。

GiantPandaLLM
推荐文章7

[Triton编程][基础]vLLM Triton Merge Attention States Kernel详解

文章详细介绍vLLM中Triton Merge Attention States Kernel的实现,与PyTorch原生实现对比,该Triton kernel最高可实现3 - 5倍以上算子加速。内容涵盖Merge Attention States概念、PyTorch实现、Triton基础算子、分析及性能评估等。

GiantPandaLLM
开源动态7

一个Dispatch Dtype引起的fp8 quant kernel性能问题

文章记录SGLang社区在sgl-kernel中解决的fp8 quant kernel性能问题,因错误使用`c10::Float8_e4m3fn`数据类型,未用硬件加速指令,通过软件调用致性能下降,现已修复,vLLM也应用此修复。

GiantPandaLLM
推荐文章7

【博客转载】CUDA Kernel Execution Overlap

文章讨论CUDA kernel执行重叠,指出有足够计算资源时可重叠,通过调整`blocks_per_grid`值,观察到不同并行化程度。还提到隐式同步会影响重叠,可启用`per-thread` default Stream 禁用。

GiantPandaLLM
推荐文章7

关于CUTLASS Grouped GEMM中Alignment参数的分析

文章围绕CUTLASS Grouped GEMM的Alignment参数展开。介绍其含义与自然对齐有关,既代表访问粒度也指明地址对齐要求。针对CUTLASS 2.x和3.x API分别阐述设置Alignment的方法及原理,还给出编译期推导代码示例。

GiantPandaLLM
算法论文7

谈一谈TP推理场景下MoE Group GEMM的优化思路

作者在使用H20测试SGLang CUTLASS MoE时,发现其在中小Batch Size场景下性能不佳。为此设计Expert Specialization方案,启动多个不同配置Kernel,依Expert计算特性选合适的。还介绍了该方案在H20和Hx00上的实现细节及性能测试结果。

GiantPandaLLM
产品应用7

使用 Hugging Face 轻松构建并共享 ROCm 内核

自定义内核是高性能深度学习基础,但构建整合麻烦。Hugging Face的kernel - builder和kernels库可助轻松构建、分享自定义内核。本文聚焦构建ROCm兼容内核,展示构建、测试与分享步骤。

Hugging Face
推荐文章7

[Triton编程][基础] Triton Fused Softmax Kernel详解: 从Python源码到PTX分析

文章详细介绍Triton Fused Softmax Kernel实现,从Naive Softmax到Triton实现,分析访存量、row索引计算、num_stages作用等,还修复官方年久失修代码,性能测试带宽吞吐提升约4倍。

GiantPandaLLM
推荐文章7

迈向可编程观测:在GPU Kernel中构建类eBPF风格的性能探针

文章从CUDA基础讲起,以矩阵乘法为例介绍性能调优,再到PTX汇编知识,最后引入Neutrino框架构建可编程GPU性能探针。展示了GPU Kernel性能分析从宏观到微观的技术演进,提供新分析视角。

阿里云开发者
开源动态8

面向 SGLang 的 Profile Analysis SKILL:3 张表定位 Kernel Fuse 和 Overlap 机会

文章介绍了面向SGLang的Profile Analysis SKILL,其工作流统一,输出3张表定位Kernel Fuse和Overlap机会,支持多种分析方式和模型。还给出Qwen/Qwen3.5 - 4B和openai/gpt - oss - 20b的分析结果,并表明该SKILL能节省token、缩短工期,作者厌恶Torch Compile。

GiantPandaLLM