「CUDA」共找到 94 篇相关文章
产品应用7
Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍
Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。
机器之心
算法论文7
SGLang Custom AllReduce v1 与 v2 实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
GiantPandaLLM
7
当英伟达收购Groq引发行业震动,中国存算一体赛道正在发生什么?|甲子光年
2025年底英伟达200亿美元收购Groq,让存算一体成产业刚需。传统GPU受存储墙限制,算力利用率低。Groq采用SRAM成本高,而亿铸科技以消费级显卡价格提供H卡性能,兼容CUDA,或成产业真需求。
甲子光年
新闻资讯8
刚刚,英伟达祭出下一代GPU!狂飙百万token巨兽,投1亿爆赚50亿
昨天,英伟达发布专为海量上下文AI打造的CUDA GPU——Rubin CPX,将大模型推理带入「百万Token时代」。它性能强大,能带来高回报,可重写推理经济,还将得到英伟达全栈AI生态支持,预计2026年底可用。
新智元