「块稀疏GPU内核」共找到 555 篇相关文章
面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文
面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。
GPU荒还没结束,CPU可能要被抢起来了
2026 年英伟达宣布量产为 AI 智能体打造的 CPU Vera。此前 AI 产业硬件焦虑多围绕 GPU,如今 AI Agent 改变任务形态,CPU 负担加重,芯片厂商纷纷布局,产能变化或让消费者买单。
17 万模型背后:魔搭联合 AMD 送 1000 小时 GPU 的算盘
魔搭社区联合 AMD 推出「AMD 开发者激励计划」,提供最高 1000 小时 GPU 算力额度。魔搭社区对标 Hugging Face,托管超 17 万个开源模型。此次激励是三方匹配的生意,还释放了硬件去美元化和模型托管社区升级的信号。
Kernel Design Agent(KDA) 的B200 GPU Kernel 编程准则 Skill
文章围绕 Kernel Design Agent(KDA) 的 B200 GPU Kernel 编程展开,介绍目标平台、架构参数,阐述独有特性与编程要点,给出关键性能准则调整方向,详述 16 条准则及特殊 Kernel 类型优化策略和编写前检查清单。
CUDA-MODE第77课课程笔记:用于GPU kernels的DSL
该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。
大型挂机现场:马斯克的55万英伟达GPU,利用率才11%
《The Information》报道,马斯克旗下xAI有55万英伟达GPU,利用率仅11%。原因包括大规模部署协调难、数据传输瓶颈和训练间歇性。这是行业普遍问题,xAI着手解决,设定50%利用率目标。
学界大佬吵架金句不断,智谱和MiniMax太优秀被点名,Agent竟然能写GPU内核了?!
卡内基梅隆大学助理教授蒂姆·德特默斯与加州大学圣地亚哥分校助理教授丹·傅,就AGI是否会实现展开争论。他们还谈到算力、Agent应用等话题,看好小模型、开源模型等发展,认可中国大模型进步。
最小模型仅 25MB,老设备无 GPU 也能流畅跑!
开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,无需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。
市值3055亿!摩尔线程敲钟,国产通用GPU第一股来了
国产通用GPU第一股摩尔线程今日敲钟上市,开盘价650元,较发行价高出469%,开盘市值超3055亿元。它88天过会创科创板纪录,将募资用于研发,收入结构转向AI智算领域。
GPU-MODE Leaderboards之vector_add histogram 以及一些有趣发现
文章介绍GPU-MODE Leaderboards中vector_add和histogram任务。分析vector_add实现、带宽利用率,rank1代码用cccl,带宽利用率超80%;histogram算子瓶颈在atomic冲突等,rank1也多用cccl,还给出rank2代码,最后提及任务中Hack行为及代码提交方式。