推荐文章7
华为张君揭秘昇腾大模型推理优化秘籍
InfoQ
AI 摘要
华为张君指出大模型推理在prefill和解码阶段有挑战,如访存、算力利用率等问题。介绍昇腾硬件亲和的FA融合算子及基于Ascend C的通算融合算子优化实践,强调推理要考虑计算与通信并行。
阅读原文 · InfoQ
破局大模型推理困局!华为张君详解昇腾“融合算力”的优化秘籍
华为高级开发工程师张君在AICon大会演讲,围绕大模型推理优化,从模型、框架、算子层展开,结合案例阐述技术方案。分析大模型推理现状挑战,介绍加速技术,分享昇腾硬件算子优化实践及通算融合算子优化方法。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
openJiuwen 协同昇腾,Agent 推理效率飙升
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
机器之心
新闻资讯7
OpenAI 推芯片,挑战英伟达霸权
OpenAI 展示与博通联合打造的定制 AI 芯片 Jalapeño,性能媲美英伟达 Blackwell 或谷歌 TPU。计划年底部署,是多代芯片开发首步。它专为大模型推理设计,设计周期短,成本低,OpenAI 借此扩展全栈能力。
InfoQ
新闻资讯8
OpenAI推出自研芯片,2026年吉瓦级部署
OpenAI和博通联合发布自研AI推理芯片Jalapeño,它专为大模型推理设计,每瓦性能优于当前最先进水平,九个月完成设计制造,是全栈战略一部分,2026年底开始吉瓦级部署。
AI寒武纪
算法论文8
清华微软STAR - PólyaMath超GPT - 5.5 13.5%
清华大学与微软亚洲研究院团队提出推理多智能体系统 STAR - PólyaMath,构建探索 - 推理 - 验证框架,解决大模型长程数学推理瓶颈,在八大数学竞赛基准获最优成绩,还可泛化到其他推理场景。
机器之心