推荐文章7
Simon V:PTX指令高效处理矩阵
GiantPandaLLM
AI 摘要
Simon V:介绍用PTX指令高效加载和存储矩阵方法。阐述`ldmatrix`和`stmatrix`指令,给出不同矩阵数量的实现代码,助读者理解操作及地址计算逻辑,代码见其仓库。
阅读原文 · GiantPandaLLM
【CUDA 博客】使用PTX指令更高效地加载和存储矩阵
文章围绕使用PTX指令高效加载和存储矩阵展开,介绍`ldmatrix`和`stmatrix`指令格式、适用GPU版本、地址计算逻辑等,给出不同矩阵数量的实现代码示例,助读者理解和应用。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
英伟达与 AMD 争夺 AI 制药计算入口
每年的 Advancing AI 大会,AMD 都要回答 Instinct GPU 除训练大模型外的应用问题。今年大会上,AMD 把一个位置留给 AI 制药公司 MindWalk。而其对手英伟达已在生命科学领域布局多年,生命科学成两家竞争新战场。
DeepTech深科技
8
Claude周末跑通AMD新GPU,CUDA护城河被跨
一个周末,Claude直接把自家最前沿模型跑在全新AMD MI355X机架,人类工程师没改一行代码。AMD还给AI开发调GPU的工具,ROCm.AI可让Agent自己部署操作。Agent补生态积累短板,对CUDA生态形成降维打击。
新智元
新闻资讯7
AMD能否撬动英伟达CUDA?
过去AMD GPU虽性能强但难敌英伟达CUDA生态。2024年有机构认为其缩小软件差距概率为0,但如今判断改变,AMD软件团队进步,客户回归,可它仍需解决软件集群稳定性和Helios量产问题。
DeepTech深科技
新闻资讯7
黄仁勋开源倡议,Anthropic员工硬刚
黄仁勋发公开信站台开源模型,签开源倡议书的公司和机构从25家增至70多家,微软CEO等力挺。除Anthropic外都签了,其员工怒怼,吴恩达为黄仁勋辩护,还探讨了倡议背后英伟达的算盘。
量子位