推荐文章7
Lei Mao:CUDA归约操作实现与性能分析
GiantPandaLLM
AI 摘要
Lei Mao介绍CUDA归约操作,实现两个批量归约求和kernel,其性能相似,有效带宽约为GPU峰值带宽94%。对于大数组归约,可拆分计算或用原子操作,后者性能或有变化。
阅读原文 · GiantPandaLLM
【博客转载】CUDA Reduction
文章来自Lei Mao,介绍CUDA归约操作。先阐述归约操作在并行计算中的常见性,接着实现两个批量归约求和kernel,还给出构建和运行示例的命令及结果。最后探讨大数组归约求和的方法及性能影响。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
英伟达与 AMD 争夺 AI 制药计算入口
每年的 Advancing AI 大会,AMD 都要回答 Instinct GPU 除训练大模型外的应用问题。今年大会上,AMD 把一个位置留给 AI 制药公司 MindWalk。而其对手英伟达已在生命科学领域布局多年,生命科学成两家竞争新战场。
DeepTech深科技
8
Claude周末跑通AMD新GPU,CUDA护城河被跨
一个周末,Claude直接把自家最前沿模型跑在全新AMD MI355X机架,人类工程师没改一行代码。AMD还给AI开发调GPU的工具,ROCm.AI可让Agent自己部署操作。Agent补生态积累短板,对CUDA生态形成降维打击。
新智元
新闻资讯7
AMD能否撬动英伟达CUDA?
过去AMD GPU虽性能强但难敌英伟达CUDA生态。2024年有机构认为其缩小软件差距概率为0,但如今判断改变,AMD软件团队进步,客户回归,可它仍需解决软件集群稳定性和Helios量产问题。
DeepTech深科技
新闻资讯7
黄仁勋开源倡议,Anthropic员工硬刚
黄仁勋发公开信站台开源模型,签开源倡议书的公司和机构从25家增至70多家,微软CEO等力挺。除Anthropic外都签了,其员工怒怼,吴恩达为黄仁勋辩护,还探讨了倡议背后英伟达的算盘。
量子位