「推理部署」共找到 2636 篇相关文章
MCP进阶:一键批量搞定MCP工具部署
在AI应用复杂当下,传统MCP工具集成有痛点。文章提出基于阿里云计算巢的一站式方案,可多MCP工具批量部署,首创双通道调用能力,还介绍部署、使用、增减工具及问题排查等内容。
万字长文!大模型LLM推理优化技术总结
文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
智元邓泰华宣布:具身智能行业进入「部署态」
2026年4月17日,智元创始人邓泰华在APC2026合作伙伴大会提出,具身智能赛道存在XYZ发展曲线,2026年是从开发态迈入部署态元年。还介绍智元发展、发布方案等,具身行业下半场将是部署落地竞赛。
SRO赋能Qwen-2.5-VL推理性能飙升16.8%
文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。
OpenAI没做到,DeepSeek搞定了!开源引爆推理革命
文章围绕大语言模型推理能力展开,介绍了推理模型概念,回顾RLHF训练流程,对比OpenAI的PPO和DeepSeek的GRPO,还阐述了GRPO开源升级版DAPO的关键技术点及训练中模型的新能力。
只用2700万参数,这个推理模型超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型(HRM),该模型仅2700万参数、1000个训练样本,就在复杂推理任务上超越DeepSeek和Claude等模型,还引入近似梯度等创新设计。
低延迟、高吞吐,LLM优化与高效推理引擎综述
LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。
关键技术详解|腾讯一念 LLM 分布式推理优化实践
InfoQ 邀请袁镱分享《一念 LLM 分布式推理优化实践》。介绍了“一念 LLM”设计思路、推理优化挑战与突破等,还对比不同框架,指出优化方向,如先实现 PP,再推进 EP 与 PD 分离。
AI Infra入门干货总结:大模型是如何高效推理的
作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。