推荐文章7
CUDA 常量内存:访问模式决定性能优劣
GiantPandaLLM
AI 摘要
Lei Mao:CUDA 常量内存有 64KB 且被缓存。测试发现,块或 warp 一次访问时,常量内存比全局内存快 10%;线程一次或伪随机访问时,慢 70% - 800%,使用时需考虑访问模式。
阅读原文 · GiantPandaLLM
【博客转载】CUDA Constant Memory
文章介绍 CUDA 常量内存,它是设备上 64KB 被缓存的只读特殊内存空间。通过示例比较不同访问模式下常量内存和全局内存性能,指出块或 warp 一次访问时,常量内存快 10%;线程一次或伪随机访问时,慢很多。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
英伟达与 AMD 争夺 AI 制药计算入口
每年的 Advancing AI 大会,AMD 都要回答 Instinct GPU 除训练大模型外的应用问题。今年大会上,AMD 把一个位置留给 AI 制药公司 MindWalk。而其对手英伟达已在生命科学领域布局多年,生命科学成两家竞争新战场。
DeepTech深科技
8
Claude周末跑通AMD新GPU,CUDA护城河被跨
一个周末,Claude直接把自家最前沿模型跑在全新AMD MI355X机架,人类工程师没改一行代码。AMD还给AI开发调GPU的工具,ROCm.AI可让Agent自己部署操作。Agent补生态积累短板,对CUDA生态形成降维打击。
新智元
新闻资讯7
AMD能否撬动英伟达CUDA?
过去AMD GPU虽性能强但难敌英伟达CUDA生态。2024年有机构认为其缩小软件差距概率为0,但如今判断改变,AMD软件团队进步,客户回归,可它仍需解决软件集群稳定性和Helios量产问题。
DeepTech深科技
新闻资讯7
黄仁勋开源倡议,Anthropic员工硬刚
黄仁勋发公开信站台开源模型,签开源倡议书的公司和机构从25家增至70多家,微软CEO等力挺。除Anthropic外都签了,其员工怒怼,吴恩达为黄仁勋辩护,还探讨了倡议背后英伟达的算盘。
量子位