推荐文章7
猛猿:图解Vllm V1调度器策略
GiantPandaLLM
AI 摘要
猛猿:介绍图解Vllm V1系列中调度器策略,涵盖调度 - 推理流程,如请求添加、单步调度等,对比不同函数实现及调度逻辑,还提及vllm v1调度策略简化,允许同时调度prefill和decode请求。
阅读原文 · GiantPandaLLM
图解Vllm V1系列5:调度器策略(Scheduler)
本文是图解Vllm V1系列5,聚焦调度器策略。先回顾vllm v1整体运作流程,接着阐述调度 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调度策略等,还对比了不同场景下的函数及调度逻辑。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章7
mini - sglang:消息流转揭秘与调度预告
文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。
GiantPandaLLM
推荐文章7
图解vllm v1:KVCacheManager与Prefix Caching
文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。
GiantPandaLLM
推荐文章8
Nick Jennings:智能体AI走向智能社会
8月18日,IJCAI 2026大会上,研究卓越奖得主Nick Jennings回顾智能体发展历程,指出当下智能体AI火热,它并非新概念,而是经数十年积累。还分享经验,展望从智能体到智能社会的未来。
AI科技评论
推荐文章8
金煜阳:大模型推理加速全链路方案揭秘
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
InfoQ