「GPU芯片」共找到 935 篇相关文章
Kernel Design Agent(KDA) 的B200 GPU Kernel 编程准则 Skill
文章围绕 Kernel Design Agent(KDA) 的 B200 GPU Kernel 编程展开,介绍目标平台、架构参数,阐述独有特性与编程要点,给出关键性能准则调整方向,详述 16 条准则及特殊 Kernel 类型优化策略和编写前检查清单。
CUDA-MODE第77课课程笔记:用于GPU kernels的DSL
该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。
刚刚,AMD、OpenAI联合发布超强AI芯片,推理提升35倍
今天凌晨,AMD举办2025全球AI发展大会,与OpenAI联合发布Instinct MI400、Instinct MI350系列超强AI芯片。MI350推理性能提升35倍,MI400内存配置大幅提升。AMD还开源ROCm7平台,7大AI平台与其合作。
霍尔木兹海峡封锁18天后,芯片产业还能撑多久?
霍尔木兹海峡封锁18天,全球半导体产业担忧能源储备还能撑多久。芯片产业存在‘能源软肋’,关键材料供应有‘垄断性风险’,全球供应链有关联性风险,凸显了产业在效率与安全间寻求平衡的必要。
英伟达亲手终结CUDA「护城河」?传奇芯片架构师引发争议
英伟达CUDA宣布20年来最重大更新,引入CUDA Tile技术,降低开发门槛。芯片界传奇人物Jim Keller质疑此次更新是否终结CUDA「护城河」,文章分析了相关问题,指出瓦片架构对英伟达内外移植性的不同影响。
大型挂机现场:马斯克的55万英伟达GPU,利用率才11%
《The Information》报道,马斯克旗下xAI有55万英伟达GPU,利用率仅11%。原因包括大规模部署协调难、数据传输瓶颈和训练间歇性。这是行业普遍问题,xAI着手解决,设定50%利用率目标。
最小模型仅 25MB,老设备无 GPU 也能流畅跑!
开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,无需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。
市值3055亿!摩尔线程敲钟,国产通用GPU第一股来了
国产通用GPU第一股摩尔线程今日敲钟上市,开盘价650元,较发行价高出469%,开盘市值超3055亿元。它88天过会创科创板纪录,将募资用于研发,收入结构转向AI智算领域。
GPU-MODE Leaderboards之vector_add histogram 以及一些有趣发现
文章介绍GPU-MODE Leaderboards中vector_add和histogram任务。分析vector_add实现、带宽利用率,rank1代码用cccl,带宽利用率超80%;histogram算子瓶颈在atomic冲突等,rank1也多用cccl,还给出rank2代码,最后提及任务中Hack行为及代码提交方式。
英伟达GPU被曝严重漏洞,致模型准确率暴跌99.9%
英伟达GPU被白帽黑客发现严重漏洞,通过GPUHammer攻击可使大模型准确率从80%降至0.02%。此攻击属Rowhammer类,直接对显存“物理动手”。英伟达建议的防御措施会使模型性能下降。