「并行计算」共找到 881 篇相关文章
Claude Code 团队的 10 个内部技巧,但你不一定都要学
Claude Code团队分享10条内部技巧,像并行运行、Plan Mode等。介绍各技巧做法、价值及注意点,如并行运行虽提升效率但非适合所有人,投资CLAUDE.md性价比高,且强调找到适合自己的使用方式。
中国半导体显示产业之父,将带出一个超级IPO
投资界消息,奕斯伟计算向港交所递交招股书,有望成“RISC-V第一股”。其掌门人为王东升,曾带领京东方走向全球霸主地位。奕斯伟计算聚焦RISC - V架构,获多轮融资,王东升还投资半导体产业链多企业。
颠覆无线电常识!新技术把干扰信号变算力,自动驾驶掉线难题有望解决
一项名为空中计算(OAC)的新技术有望颠覆无线网络系统设计标准,它能将无线信号干扰转化为计算能力,降低拥塞和能耗。目前已有原型机实现95%图像识别准确率,预计30年代走向标准化,但面临移动性等挑战。
万字长文 | 异构算力技术架构与核心组件解析
文章聚焦异构算力技术架构与核心组件,解析主流AI芯片特点、国产芯片技术路线;介绍高速互联技术、网络拓扑结构及优化方法;阐述大模型存储需求、分布式存储技术及数据预处理与加载技术,为AI计算提供全面方案。
SCPMA|清华大学 张宇飞团队:基于改进傅里叶神经算子的翼型流场快速预测模型
传统计算流体力学在工程场景计算成本高,深度学习方法预测精度与泛化性不佳。本研究基于傅里叶神经算子构建流场预测模型,经改进能精确预测超临界翼型流场与气动力系数,误差低且泛化能力优。
时隔九年,中国超级计算机重登世界榜首
当地时间6月23日,第67届TOP500超级计算机排行榜发布,国家超级计算深圳中心的‘灵晟’(LineShine)夺冠,运算速度达2.198 ExaFLOP/S。它仅用CPU,性能超美国El Capitan超20%,引发对未来计算架构思考。
算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性
用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。
【博客转载】CUDA Cooperative Groups
文章介绍CUDA cooperative groups,它让开发者创建和管理能同步通信的线程组,为GPU并行算法编程提供更灵活高效方式。文中讨论并行归约算法及用cooperative groups的实现,还对比不同归约求和方法及性能。
语言反思>强化学习:伯克利新架构碾压传统RL
大型语言模型下游任务优化依赖强化学习,但计算成本高。伯克利等机构论文提出GEPA新型优化器,将LLM执行轨迹转化为诊断信号,用语言反馈替代标量奖励,仅用传统方法1/35计算量,性能最高提升19%。