「内核延迟」共找到 291 篇相关文章
LLM加速利器LMCache,极大降低GPU资源消耗
LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于长上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。
TileLang vs Triton 详解:谁该握住控制面——编译器还是开发者?
文章对比 TileLang 与 Triton 两个框架,解释控制面设计、并发协议、编译管线的本质差异,以及这些差异如何影响性能上限、工程投入。明确 TileLang 追求榨干内核,性能上限高但对开发者要求高;Triton 追求快速落地,生态成熟。
刚刚,英伟达革了自己的命:智能体自主进化7天,干掉所有算子工程师、GPU专家
英伟达新研究AVO构建了新型进化变异算子,用自主编码智能体取代经典方法。智能体7天自主进化,优化MHA内核,性能超cuDNN和FlashAttention - 4,还能快速适配GQA,展现强大泛化能力。
突破瓶颈,嵌入式AI神经持续学习引擎—Replay4NCL
阿联酋、纽约、巴基斯坦大学研究人员推出Replay4NCL,解决嵌入式AI持续学习难题。它优化记忆重放,有创新架构和训练策略。实验显示其精度高、延迟低、省内存、能耗少,成果将在2025年DAC大会展示。
从 SQL 到自然语言,下一代 Lakehouse 为何必须「AI 优先」
随着大模型技术爆发,数据分析范式重构,未来数据多模态、分析复杂、查询方式转变。文章指出构建下一代 AI-First Lakehouse,要在存储计算、内核能力、架构适配、平台自治等方面升级,打破数据壁垒。
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。
豆包19亿次互动背后的技术真相:春晚级体验是如何炼成的?
2026 年春晚 AI 元素亮眼,豆包 AI 互动达 19 亿次。火山引擎作为独家 AI 云合作伙伴,用智能视频云等技术打造节目效果,解决视频画质、空间逻辑、机器人互动延迟等难题,还保障全民互动和实时字幕。
科幻!谷歌放出Gemini Robotics-ER 1.5:机器人有了真正的思考力
谷歌推出首个广泛开放给开发者的机器人具身推理模型Gemini Robotics - ER 1.5,可作为机器人高级推理大脑。它能解决物理问题,有新能力如快速空间推理等,还能让开发者平衡延迟与准确性。
互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
本地可运行的高质量的文本转语音模型
介绍Kyutai的Pocket TTS,一款轻量级文本转语音应用,可在CPU高效运行,模型小且低延迟,支持Python API和CLI,能语音克隆,还可在浏览器试用,目前仅支持英语,也有社区浏览器端实现。