开源动态8
PyTorch加速Seamless M4T - v2,端到端推理2.7倍提速
GiantPandaLLM
AI 摘要
文章围绕用纯原生PyTorch加速Seamless M4T - v2模型。经分析发现text decoder和vocoder是CPU瓶颈模块,采用torch.compile + CUDA Graph优化,实现text decoder 2倍、vocoder 30倍加速,端到端推理2.7倍加速。
阅读原文 · GiantPandaLLM
【博客翻译】使用PyTorch加速生成式AI第四部分:Seamless M4T,快速优化
这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部分,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,端到端推理2.7倍加速。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
SGLang:CUDA Graph 进阶技术突破
本文介绍 SGLang 构建 CUDA Graph 支持及改动。如 Runner/Backend 解耦与灵活组合;首创 Breakable CUDA Graph 并开源,能提高捕获灵活性;还实现 Prefill 的 Full CUDA Graph,同时介绍显存管理方法。
GiantPandaLLM
开源动态8
清华团队开源OpenRath,革新Agent管理
当Agent数量增多,管理难题凸显。清华与中大团队开源OpenRath,以Session为核心,让多Agent共享状态。它借鉴PyTorch,解决了证据存储、状态流动等问题,使Agent集群管理更高效。
新智元
开源动态8
Sand.ai开源MagiCompiler突破编译界限
大模型开发者面临速度与显存的两难选择,原生torch.compile有局限。Sand.ai开源MagiCompiler,突破传统编译界限,提出Compiler as Manager理念,解决算力与显存墙难题,性能实测亮眼,且接入简单。
机器之心
产品应用7
Hugging Face:轻松构建共享ROCm内核
自定义内核是高性能深度学习基础,但构建整合麻烦。Hugging Face的kernel - builder和kernels库可助轻松构建、分享自定义内核。本文聚焦构建ROCm兼容内核,展示构建、测试与分享步骤。
Hugging Face