GPU集群」共找到 498 篇相关文章

新闻资讯8

英伟达自毁CUDA门槛!15行Python写GPU内核,性能匹敌200行C++

英伟达发布CUDA 13.1,称是自2006年诞生以来最大进步。推出CUDA Tile编程模型,能用15行Python代码实现200行CUDA C++代码性能。芯片界传奇Jim Keller质疑其会终结CUDA“护城河”。

量子位
新闻资讯7

谷歌TPU能撼动英伟达吗?前TPU工程师首次揭秘

在AI算力争霸时代,英伟达GPU市值狂飙,但蛋糕正被分食。前谷歌TPU工程师Henry揭秘TPU,从架构、产能、软件等维度分析其优缺点,指出在特定条件下TPU可挑战GPU,未来芯片市场将百花齐放。

芯师爷
产品应用8

深度拆解沐曦MXMACA软件栈功能,算力自主+生态兼容,破解国产GPU落地难题

近日,刚 IPO 的沐曦股份发布 MXMACA 软件栈 3.3.0.X 版本。该软件栈可实现多语言支持、算子自动优化与跨框架平滑适配,能让现有 CUDA 项目近乎‘开箱即用’迁移,还兼容主流 AI 框架,助力国产 GPU 解决落地难题。

机器之心
新闻资讯8

时隔多年,AI芯片又是华为发布会主角了

华为全联接大会上,轮值董事长徐直军带来全球最强算力超节点和集群。公布昇腾、鲲鹏芯片未来2年演进规划,还开创灵衢互联协议。虽单芯片受限,但集群层面有望实现超越。

量子位
新闻资讯7

英伟达50亿美元入股英特尔,将发布CPU+GPU合体芯片,大结局来了?

9月18日英伟达与英特尔宣布达成合作,英伟达投资50亿美元购其股份。双方将合作开发多代定制数据中心和PC产品,包括定制CPU、集成RTX GPU的x86 SoC等,此前二者有竞争历史。

机器之心
算法论文8

GPU搞定高清长视频生成,效率×10!引入Mamba机制突破DiT瓶颈 | 普林斯顿&Meta

普林斯顿大学和Meta联合推出新框架LinGen,以MATE线性复杂度块取代传统自注意力,使单张GPU能在分钟级生成高质量视频。它在视频质量上优于DiT,减少FLOPs和延迟,与先进模型相当。

量子位
新闻资讯8

马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI

马斯克将xAI变成「算力包租公」,租数万GPU给Cursor训练模型,还挖来Cursor高管。同时,特斯拉AI5芯片流片成功,AI6也有规划,Dojo 3项目重启,他正用「硬件思维」重塑AI竞争格局。

新智元
算法论文8

32B逆袭GPT-5.2:首个端到端GPU编程智能体框架StitchCUDA问世

现有LLM自动化CUDA方法难处理端到端GPU程序,StitchCUDA提出多智能体框架+基于Rubric Reward的Agentic RL方案,分解任务、优化训练,在实验中成功率和加速比远超其他方法,解决Reward Hacking问题。

机器之心
开源动态8

OpenAI携手五巨头开源革命性超算协议:一举解决超大集群LLM训练不稳定和网络性能难题

OpenAI联合英伟达等五巨头推出超算开放网络协议MRC并正式向行业开放。MRC目标是性能可预期,有多平面网络、自适应包喷射、SRv6源路由三大核心机制,已在OpenAI多台超级计算机上部署。

AI寒武纪
开源动态8

装机量超2000万、全球主流GPU与AI框架“开箱即用”!OpenCloudOS成AI时代优先选项

在大模型训练迭代快、算力需求高但 GPU 利用率低、生态碎片化的背景下,2025 OpenCloudOS 操作系统生态大会举办。OpenCloudOS 围绕 AI 升级技术,构建能力闭环,还发布智能基座,降低产业链技术摩擦。

InfoQ