「高性能计算芯片」共找到 2890 篇相关文章
一文读懂:GPU到底是怎么工作的?
文章详细介绍GPU工作原理,对比其与CPU差异。指出GPU擅并行计算、能解决复杂问题,还分析FLOPS、延迟、内存等因素对性能的影响,最后讲了GPU通过多线程和超量订阅获高吞吐量。
揭秘超节点,AI算力需要“统一的语言”
AI大模型热潮带动算力行业发展,中国AI芯片崛起,但单颗芯片算力不足、不同设备沟通有障碍成行业难题。华为发布“超节点”架构与“灵衢”技术,搞出“算力普通话”,目标是让算力系统更高效、灵活、省钱。
FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾
文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。
国民技术发布面向AI数据中心的3 kW数字电源参考设计方案
在AI算力增长与能源转型驱动下,电力供给变革。国民技术发布面向AI数据中心的3 kW数字电源参考设计方案NS3KW53V5P2L3,基于N32H474芯片和Hunter OS生态,有高转换效率等优势。
卷进“芯片的窄门”
文章指出国内EDA领域目前实力弱,企业多为“点工具公司”,与美国差距大。但作者对国产EDA乐观,基于中国市场增长快、海外巨头有断供风险、国内竞争未到最激烈时。还分析海外崛起模式及中国困境,提出“特色化整合”路线。
加州理工用AI攻克量子化学60年难题,1块显卡做完7800块的活!
加州理工学院Anima Anandkumar团队8月24日发文,用AI模型将量子化学计算复杂度从立方级压到近线性级。单块GPU就能完成含82500个电子的金属缺陷模拟,而2019年同类计算用了约7800块GPU。
关于Pingpong和Cooperative的一些感性理解
作者团队在SGLang支持Hopper架构相关GEMM,经分析发现多数场景Pingpong调度策略性能优于Cooperative,K维度小的场景DeepGEMM性能优于CUTLASS。本文重点介绍Pingpong性能优势及Cooperative无法Overlap Epilogue的原因。
华为海思老兵上海创业,拿到亿元投资!
过去两年汽车行业竞争激烈,智能驾驶芯片成关键领域。近日,上海为旌科技完成A2轮融资首次交割,获君信资本1亿元。其创始人郑军是海思老兵,带领公司研发多款芯片,还提出诸多行业见解。
The Batch: 930 | DeepSeek 放弃 Nvidia 转向华为
中国开源权重模型开发者 DeepSeek 在 DeepSeek-V4 最新更新中未给美国芯片厂商适配机会,却向华为提供预发布版。美国限制出口芯片反促中国发展本土芯片,该决定加深中美 AI 生态分裂。
Megatron 1F1B流水线并行中的负载不均衡问题研究
文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。