产品应用8
AI缓存不该困在单台服务器
InfoQ
AI 摘要
焱融科技推出分层共享AI缓存架构,通过ContextBox打通跨节点KV缓存复用,实测长输入场景首Token时延最高降94%,吞吐量提升3-6倍,有效降低大模型推理综合成本。
阅读原文 · InfoQ
缓存不该困在一台服务器里
本文分析大模型推理阶段KV缓存的行业痛点,指出传统单机缓存孤立无法跨节点复用的问题,介绍焱融科技的分层共享缓存方案,公开了方案的实测性能数据,展现AI存储的新发展方向。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章9
GPT-6破多项数学难题引学界争议
OpenAI推出GPT-6 Astra,接连在埃尔德什单位距离猜想、纳维-斯托克斯方程等多个顶级数学难题上取得突破性进展,引发顶尖数学家对学术伦理与传统研究模式的争议,本文为OpenAI内部研究员的深度对谈编译,拆解AI数学推理的核心逻辑。
AI科技大本营
新闻资讯8
XSKY MeshFS:AI存储测试斩获九项第一
9月1日,MLPerf Storage 3.0基准测试结果发布,XSKY星辰天合旗下MeshFS首次参赛,在并行文件存储赛道获九项第一。该测试覆盖多类负载,可多维度衡量存储系统性能,MeshFS兼顾性能与成本效率。
甲子光年
开源动态8
openJiuwen 协同昇腾,Agent 推理效率飙升
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
机器之心
新闻资讯7
OpenAI 推芯片,挑战英伟达霸权
OpenAI 展示与博通联合打造的定制 AI 芯片 Jalapeño,性能媲美英伟达 Blackwell 或谷歌 TPU。计划年底部署,是多代芯片开发首步。它专为大模型推理设计,设计周期短,成本低,OpenAI 借此扩展全栈能力。
InfoQ