产品应用7
ncu计算L20 GPU指令延迟有误致性能指标异常
GiantPandaLLM
AI 摘要
作者分析L20 GPU上Batched GEMM Kernel性能问题,发现Tensor Pipe Utilization异常。经研究,ncu用错指令执行延迟算指标。建议分析GEMM Kernel先看Roofline模型,按流程分析。
阅读原文 · GiantPandaLLM
关于Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti的理解
文章分析Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti异常现象。通过实验和推算,发现ncu对L20 GPU上特定指令用错误执行延迟算指标,导致异常,还给出GEMM Kernel性能分析建议。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
技术分析类文章7
Pingpong调度策略在新GPU上性能不佳
SGLang社区开发者反馈,SM90 FP8 Blockwise Scaling Grouped GEMM从H20迁移至H800后性能下降。文章分析是Pingpong调度策略所致,因算力提升,其使TensorCore未充分利用、TMA效率低,建议用Cooperative策略。
GiantPandaLLM
技术分享7
Lei Mao:谈NVIDIA Docker CUDA兼容性与Nsight Compute
本文围绕NVIDIA Docker CUDA兼容性及Nsight Compute展开。指出使用NVIDIA NGC CUDA Docker容器时,要保证宿主机CUDA驱动与容器内运行时库版本一致,否则会有问题。还介绍了在Docker中安装和使用Nsight Compute的方法及示例。
GiantPandaLLM
产品应用8
阿里云平台完成 DeepSeek Harness 评测
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
阿里云开发者
产品应用7
企业官网GEO优化:适配AI推荐模板来袭
文章提供企业官网GEO优化方案,含首页、FAQ页结构化代码及llms.txt模板,还有通用FAQ选题。介绍使用方法、上线校验步骤和生效判断标准,助企业适配AI推荐。
孔生SEO