推荐文章7
图解vllm v1:KVCacheManager与Prefix Caching
GiantPandaLLM
AI 摘要
文章围绕vllm v1,指出其调度不再区分prefill和decode,从token粒度处理请求。详细介绍Prefix Caching节省显存原理,以及KVCacheManager管理机制,还说明了block分配释放策略与流程。
阅读原文 · GiantPandaLLM
图解Vllm V1系列6:KVCacheManager与PrefixCaching
文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章7
猛猿:图解Vllm V1调度器策略
本文是图解Vllm V1系列5,聚焦调度器策略。先回顾vllm v1整体运作流程,接着阐述调度 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调度策略等,还对比了不同场景下的函数及调度逻辑。
GiantPandaLLM
推荐文章8
Nick Jennings:智能体AI走向智能社会
8月18日,IJCAI 2026大会上,研究卓越奖得主Nick Jennings回顾智能体发展历程,指出当下智能体AI火热,它并非新概念,而是经数十年积累。还分享经验,展望从智能体到智能社会的未来。
AI科技评论
推荐文章8
金煜阳:大模型推理加速全链路方案揭秘
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
InfoQ
推荐文章7
董舒:AI数字员工催生OPC一人公司
OpenHex董舒认为AI最大价值是替人出面干活,提出数字员工概念。他指出判断力密度高的岗位易被AI取代,中国服务业有发展机会。还辨析数字员工类型,介绍其平台OPS Agent,最后分享了数字员工相关Q&A。
AI科技大本营