「推理加速技术」共找到 4880 篇相关文章
国产 AI 昇腾推理不再高门槛?开源技术栈推理性能对比解析
文章聚焦昇腾 NPU 大模型推理,对比 MindIE 和 vLLM Ascend 推理性能。因 MindIE 使用门槛高,昇腾联合 vLLM 社区推出插件。实验用 GPUStack 平台,结果显示二者在不同场景各有优势,呼吁构建国产 AI 基础设施体系。
时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8
在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
openJiuwen协同昇腾打造智能体「算力亲和」技术,首token时延砍半,推理存储占用下降25%
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
破局大模型推理困局!华为张君详解昇腾“融合算力”的优化秘籍
华为高级开发工程师张君在AICon大会演讲,围绕大模型推理优化,从模型、框架、算子层展开,结合案例阐述技术方案。分析大模型推理现状挑战,介绍加速技术,分享昇腾硬件算子优化实践及通算融合算子优化方法。
DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂大模型推理技术!
DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码可读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。
构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践
在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。
阿里云飞天企业版X平头哥“真武”芯片,推理性能跃迁13倍,底层逻辑是什么?| Q推荐
过去几年,模型虽强但使用成本高,阻碍企业级AI深度应用。今年‘模型推理’成AI关键词,4月13日19:00,InfoQ联合阿里云邀专家围绕推理加速底层破局展开对话,探讨算力博弈、芯片性能跃迁等问题。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
斯坦福大模型推理课免费了,谷歌推理团队创始人主讲
谷歌DeepMind推理负责人Denny Zhou在斯坦福大学CS25讲“LLM推理”课。大模型推理是给出答案前的中间思考步骤,能让复杂问题可解、提升答案准确性。还介绍了让模型输出推理答案的方法及提升推理能力要点。