产品应用7
Cursor重写MoE层,释放Blackwell潜能
机器之心
AI 摘要
Cursor团队升级到Blackwell B200s后,因MoE层效率问题训练速度被拖慢。他们从零重写MoE训练层,解决瓶颈,使MoE层提速3.5倍,端到端训练快1.5倍,还分享了技术细节和经验。
阅读原文 · 机器之心
Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍
Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
OpenAI:Jalapeño芯片性能反杀英伟达
北京时间昨日凌晨,OpenAI 公布自研推理芯片 Jalapeño 实测结果,其在多指标挑落英伟达 GB300。OpenAI 用 GPT - 6 和加强版 Codex 造芯,9 个月完成硬件设计优化,3 个月搞定软件栈,威胁英伟达 CUDA 根基。
AI前线
新闻资讯8
OpenAI首颗芯片压倒英伟达!CUDA危险?
OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」实测成绩亮眼,AI推理性能超英伟达全系,功耗仅为一半。它从设计到流片仅用九个月,得益于GPT - Astra协助。有观点认为CUDA护城河或已死,OpenAI正打造算力版图。
新智元
新闻资讯7
SpaceXAI发布Grok 4.6,性能优成本低
SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。
DeeplearningAI
新闻资讯7
Cursor:晒Claude退订截图送200美元!
Cursor员工Lauren公开喊话,让考虑切换到Cursor加Grok Bot的人发取消其他订阅截图,送一个月免费Ultra(每月200美元)。大量网友行动,但很多人私信石沉大海,有人吐槽处理慢。这或是Cursor借被SpaceX收购之势进攻Claude Code。
新智元