「GPU语言」共找到 1481 篇相关文章
NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型
NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。
Kernel Design Agent(KDA) 的B200 GPU Kernel 编程准则 Skill
文章围绕 Kernel Design Agent(KDA) 的 B200 GPU Kernel 编程展开,介绍目标平台、架构参数,阐述独有特性与编程要点,给出关键性能准则调整方向,详述 16 条准则及特殊 Kernel 类型优化策略和编写前检查清单。
Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集
Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务。
CUDA-MODE第77课课程笔记:用于GPU kernels的DSL
该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。
Meta发布Omnilingual ASR:支持1600+语言的开源语音识别系统
Meta发布全新自动语音识别系统Omnilingual ASR,支持超1600种语言,核心创新是零样本和少样本学习能力,降低小语种语音识别门槛。项目提供不同规模模型,安装调用简单,目前仅支持40秒内音频,数据集和项目均开源。
大型挂机现场:马斯克的55万英伟达GPU,利用率才11%
《The Information》报道,马斯克旗下xAI有55万英伟达GPU,利用率仅11%。原因包括大规模部署协调难、数据传输瓶颈和训练间歇性。这是行业普遍问题,xAI着手解决,设定50%利用率目标。
最小模型仅 25MB,老设备无 GPU 也能流畅跑!
开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,无需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。
一封AI邮件,竟让Go语言之父爆起粗口
Go语言之父Rob Pike被AI写的感谢邮件惹毛爆粗口,Python之父Guido van Rossum也被骚扰。这反映出部分人对AI生成代码的厌恶,也体现了AI给程序员群体带来的恐慌,不过也有人建议顺应趋势使用AI编程工具。
市值3055亿!摩尔线程敲钟,国产通用GPU第一股来了
国产通用GPU第一股摩尔线程今日敲钟上市,开盘价650元,较发行价高出469%,开盘市值超3055亿元。它88天过会创科创板纪录,将募资用于研发,收入结构转向AI智算领域。
GPU-MODE Leaderboards之vector_add histogram 以及一些有趣发现
文章介绍GPU-MODE Leaderboards中vector_add和histogram任务。分析vector_add实现、带宽利用率,rank1代码用cccl,带宽利用率超80%;histogram算子瓶颈在atomic冲突等,rank1也多用cccl,还给出rank2代码,最后提及任务中Hack行为及代码提交方式。