推荐文章7
GPU同步性能:scope越小,性能越好
GiantPandaLLM
AI 摘要
作者通过实验对比GPU同步代码实现性能。在H20 GPU测试,发现scope越小同步性能越好,内存屏障开销随scope增大而增加。还介绍多种实现方式,推荐用atomic_ref,称其可读性好、灵活且兼容性强。
阅读原文 · GiantPandaLLM
关于现代GPU体系结构内存一致性(Memory Consistency)模型的一些猜想(二)——同步性能
文章聚焦GPU应用层面,通过实验对比不同同步代码实现的性能。在H20 GPU上测试,发现scope越小同步性能越好,内存屏障开销随scope增大而增加,还介绍非PTX及官方推荐实现方式并给出性能对比。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用7
Sora为何输给Codex?算力调度是关键
本文探讨Sora输给Codex的原因。奥特曼称因Sora太吃compute,Codex优先级更高。Sora算力连续独占,成本难摊薄;Codex算力碎片可复用,能交错服务多任务,资源回报曲线更好。
AI科技评论
新闻资讯7
英伟达推 AI 智能体 CPU,消费者或为产能变化买单
2026 年英伟达宣布量产为 AI 智能体打造的 CPU Vera。此前 AI 产业硬件焦虑多围绕 GPU,如今 AI Agent 改变任务形态,CPU 负担加重,芯片厂商纷纷布局,产能变化或让消费者买单。
DeepTech深科技
新闻资讯7
黄仁勋锁定OpenAI 20年芯片收入
英伟达推出‘LPS’概念,联合投资机构出5000亿美元建数据中心,为客户担保。首个项目为在美为OpenAI建150万GPU数据中心,20年或带来巨额芯片收入。黄仁勋也对相关风险做了澄清。
量子位
新闻资讯7
黄仁勋拉华尔街5000亿,为AI算力融资
8月11日,英伟达宣布与六家金融机构合作,成立算力融资平台,欲动员超5000亿美元,把算力做成可融资生意。其将英伟达全栈AI基础设施当可投资资产,客户按需付费,但英伟达股价不涨反跌,这场豪赌结果待察。
新智元