推荐文章8
姜慧强:KV Cache 优化破解长上下文难题
AI前线
AI 摘要
微软姜慧强在 AICon2025 指出,长上下文大语言模型有计算和内存挑战。他分享 SCBench 基准测试工具,介绍 KV Cache 全生命周期优化方法,如 MInference 等,还提出新方法并得出关键结论。
阅读原文 · AI前线
长上下文不再难:KV Cache 全生命周期优化实战
长上下文大语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
openJiuwen 协同昇腾,Agent 推理效率飙升
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
机器之心
开源动态7
Wafer:AMD跑GLM 5.2成本仅英伟达一半
推理优化公司Wafer公布数据,用AMD的MI355X芯片跑GLM 5.2,单节点吞吐达2626 tok/s,单流吞吐213 tok/s,成本不到英伟达B200的一半。该公司详述部署过程,还提及AMD软件生态的变化及英伟达面临的挑战。
量子位
新闻资讯8
百度:旧AI供给到极限,推新全栈云破局
当下企业应用AI时,Token成本高、推理效率低问题凸显。百度Create大会释放旧供给达极限信号,推出新全栈AI云,含Agent Infra和AI Infra两层架构,多个场景应用初显成效。
InfoQ
推荐文章7
智谱揭秘GLM - 5“降智”背后的Scaling之痛
智谱最新技术博客大倒苦水,称从GLM - 5以来遭遇「Scaling Pain」。团队排查出高负载下推理状态管理等问题致异常,还给出避坑指南,如在线异常监控策略,优化后系统更稳定,吞吐量提升。
量子位