产品应用8
华为Pangu Ultra MoE模型亮点多
机器之心
AI 摘要
华为盘古团队:Pangu Ultra MoE全流程在昇腾NPU训练。通过创新架构和方法解决训练难题,还在负载均衡、推理等方面优化,在评测集表现一流,兼顾计算成本与推理能力。
阅读原文 · 机器之心
还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型
华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
DeepSeek V4 Pro上线,性能追平价仅Claude 2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
DeepTech深科技
产品应用8
美团LongCat-2.0:国产算力万亿模型扛把子
美团推出LongCat-2.0,是首个在国产算力上实现全链路训推闭环的万亿参数模型。它多项性能强,适配主流编程工具,架构设计原创,还证明了国产算力有支撑大模型迭代的能力,训推成本更低。
量子位
开源动态8
英伟达开源NeMo:MoE微调加速3.7倍
英伟达开源NeMo AutoModel,基于Hugging Face Transformers v5,不改代码API,添一行import就能更快速微调MoE模型。实验显示,它能提升3.4 - 3.7倍训练吞吐,减少29% - 32% GPU显存占用。
量子位
推荐文章8
昇腾NPU支撑千亿级生成式推荐落地
文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。
InfoQ