「共享存储」共找到 323 篇相关文章
通过查看GPU Assembly分析CUDA程序
文章是关于通过分析SASS代码提高内存受限CUDA程序性能的笔记。以向量复制程序为例,对比普通和向量化版本,通过查看SASS代码,解释向量化版本性能更快的原因是加载/存储数据量更大、启动块数更少。
AI驱动增长,国产半导体设备加速突围
2025年全球半导体设备市场在AI拉动下增长,销售额预计达1330亿美元。中国市场领跑,国产企业加速突围。AI算力、存储芯片需求及后道封装测试成增长动力,本土企业在多领域取得进展,但也面临挑战。
大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率
Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。
HBM Roadmap和HBM4的关键特性
文章介绍 KAIST TERALAB 公布的 HBM 技术,涵盖 HBM 路线图和 HBM4 特性。HBM 路线图展示从容量升级到计算存储融合的进化,HBM4 在电气规格、封装冷却、架构等方面有突破,AI 工具也用于研发。
19年不丢数据,擦写6万次不坏,原子级材料重新定义未来芯片
上海大学王震宇副教授团队在《自然·电子学》发文,用二硫化铌和二硫化钼做出新型非易失存储器,能保持数据约19年、擦写超6万次,还具备计算和存储两种本领,对未来低功耗计算和存内计算有吸引力。
【博客转载】CUDA Shared Memory Swizzling
文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。
当英伟达收购Groq引发行业震动,中国存算一体赛道正在发生什么?|甲子光年
2025年底英伟达200亿美元收购Groq,让存算一体成产业刚需。传统GPU受存储墙限制,算力利用率低。Groq采用SRAM成本高,而亿铸科技以消费级显卡价格提供H卡性能,兼容CUDA,或成产业真需求。
GPU利用率不到15%,AI产业最大的浪费正在被这家公司改写|甲子光年
AI产业发展中算力成本高、利用率低问题凸显。趋动科技押注‘软件定义GPU’,试图把独占GPU变为共享算力池,其产品使客户GPU利用率平均提升约4倍,已服务超200家头部客户。
半导体股大涨!千亿市值芯片企业全景图一览
本文结合2026年5月6日收盘数据,盘点国内A股和港股市值破千亿的半导体企业格局,剖析产业推手,探讨隐忧与走向。AI算力芯片、晶圆代工、设备、存储芯片企业表现亮眼,市值飙升有产业逻辑,但部分企业估值存风险。
让方程发现走向超大规模系统——《Predicting Dynamics of Ultra-Large Complex Systems by Inferring Governing Equations》精读笔记
论文《Predicting Dynamics of Ultra-Large Complex Systems by Inferring Governing Equations》提出Sparse Identification Graph Neural Network(SIGN),将方程发现工作流重新安排,在多类系统实验中展现可扩展性与长期预测能力,还在海表温度数据中恢复出共享动力学表达。