CUDA Compatibility」共找到 94 篇相关文章

推荐文章7

CUDA博客】关于TensorCore和Inline PTX Assembly的一个超简短笔记

文章围绕TensorCore和Inline PTX Assembly展开,介绍利用PTX指令发挥TensorCore潜力。讲述矩阵乘法和累加操作,给出半精度及替代浮点指令形式,有代码示例并分析,还提到不同数据类型用法及SASS指令。

GiantPandaLLM
产品应用7

CUDA 博客】TMA简介 & 让矩阵转置在Hopper GPUs上变得更快

文章介绍Hopper GPU新特性TMA,它能高效传输多维数组数据。文中展示用TMA对2D数组操作,如创建张量映射、编写kernel等。还讲了避免共享内存bank冲突的交织方法,最后介绍在Hopper GPU上实现高效矩阵转置的多种方式及性能。

GiantPandaLLM
开源动态8

写Verilog、调CUDA,总翻车?工业代码大模型开始学会「先想后写」了

工业代码大模型缺的往往是‘想’的能力。北航联合多家单位提出的InCoder - 32B Thinking,让模型结合工业环境思考,通过ECoT从错误中学习,用ICWM提前预判结果,还能自适应思考深度,且模型与代码已开源。

机器之心
产品应用7

新手入门 | 搭建 AI 模型开发环境

文章为新手提供AI模型开发环境搭建方法,涵盖安装显卡驱动、CUDA、cuDNN、Miniconda、PyTorch、Transformers等,还介绍用Modelscope下载加载模型、PyCharm配置及解决常见问题。

机器学习AI算法工程
新闻资讯7

谷歌训出Gemini 3的TPU,已成老黄心腹大患!Meta已倒戈

谷歌酝酿TPU@Premises计划,允许客户将TPU搬进自家数据中心,首个目标是Meta。谷歌Ironwood TPU v7与英伟达B200性能相当,还拥抱PyTorch拆解CUDA壁垒,欲夺英伟达10%市场份额。

新智元
新闻资讯8

黄仁勋 GTC 2026 演讲实录:所有SaaS公司都将消失;Token成本全球最低;“龙虾”创造了历史;Feynman 架构已在路上

北京时间 2026 年 3 月 17 日,英伟达 CEO 黄仁勋在 GTC 演讲,介绍一整套 AI“全家桶”。回顾 CUDA 20 年,提及数据处理新软件库,还展示 Vera Rubin 平台等,预测 SaaS 公司将消失,英伟达 2027 年营收或达万亿美元。

InfoQ
新闻资讯7

国产GPU芯动科技发布最新芯片,单卡直接堆上了112GB以上的超大显存

9月22日,芯动科技在珠海正式发布“风华3号”全功能GPU,它有诸多亮点,如集成国产RISC - V CPU与兼容CUDA的GPU、原生支持DICOM显示等,还构建了国产GPU完整生态。

AIGC开放社区
新闻资讯8

黄仁勋 GTC 2026 演讲实录:所有SaaS公司都将消失;Token成本全球最低;“龙虾”创造了历史;Feynman 架构已在路上

北京时间2026年3月17日,英伟达CEO黄仁勋在GTC演讲,展示AI“全家桶”。他回溯CUDA 20年,介绍数据处理新软件库,还提及AI原生企业爆发、Token成本优势、Vera Rubin平台等,强调英伟达在AI领域的全面布局。

AI前线
推荐文章7

迈向可编程观测:在GPU Kernel中构建类eBPF风格的性能探针

文章从CUDA基础讲起,以矩阵乘法为例介绍性能调优,再到PTX汇编知识,最后引入Neutrino框架构建可编程GPU性能探针。展示了GPU Kernel性能分析从宏观到微观的技术演进,提供新分析视角。

阿里云开发者
新闻资讯7

英伟达重返中国!6月大量生产特供AI芯片,价格暴降40%

路透社消息,英伟达为突破美出口限制,将为中国推特供AI芯片,6月量产,价格降40%。该芯片基于RTX Pro 6000D,简化设计以控成本和符合管制。虽计算力低,但CUDA生态有优势。

AIGC开放社区