KV 缓存缩减」共找到 146 篇相关文章

新闻资讯8

最强编码模型Claude 4来了!Mcp集成无需Client,扩展提示缓存增强Agent长上下文保持能力

Anthropic 昨日推出新一代 Claude 模型,包括 Claude Opus 4 和 Claude Sonnet 4,在编码、高级推理和 AI Agent 方面树立新标准,有卓越编码能力、显著提升的 Agent 能力、全新 API 功能,Claude Code 也全面上市。

AI工程化
产品应用7

更省 Token 的国产 Codex:ZCode,加上 DeepSeek 更夯!

介绍国产 Codex 平替 ZCode,它有 100 万用户,能接 DeepSeek,模型选择开放,缓存命中率高省 Token,插件生态完善,还介绍了安装、接入方法及多种实用功能。

AI产品自由
推荐文章7

AI Agent的上下文工程:构建Manus的经验教训

上下文工程是AI智能体的“系统一”,决定其速度、恢复力与扩展边界。Manus通过试错与用户验证,给出可复用经验,如利用大模型“上下文学习”能力、关注KV - cache命中率等。

PaperAgent
推荐文章8

吴恩达老师分享的做 MVP(最简可行产品,minimum viable product) 的技巧

吴恩达分享做MVP技巧,建议时间有限时缩减项目范围,如一小时内借助代码助手做小部分。他以做虚拟观众模拟器为例,说明此方法能推动项目、收集反馈,让创意快速落地。

宝玉AI
推荐文章7

“烧掉94亿个OpenAI Token后,这些经验帮我们省了43%的成本!”

作者以月耗94亿OpenAI Token实战经历,分享优化成本经验,如选对模型、用提示词缓存、设账单预警等,降低成本43%,不过网友对此有不同看法。

AI科技大本营
新闻资讯7

Cloudflare 构建了面向 LLM 的高性能基础设施

Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。

InfoQ
推荐文章7

来自 Manus 的一手分享:如何构建 AI Agent 的上下文工程?

Manus 公司联合创始人季逸超分享为 Manus 搭建上下文工程的经验。文章探讨构建 AI 智能体时的关键抉择,给出围绕 KV - Cache 设计、通过掩码约束行为等构建原则,助开发者少走弯路。

Founder Park
推荐文章8

深度解读《AI 智能体的上下文工程》:构建高效 Agent 的七个宝贵教训

作者解读 Manus 团队文章,结合自身理解总结出构建高效 Agent 的 7 个关键点,如依赖上下文工程、提升 Prompt 缓存命中率等,还给出总结与核心启示,对 Agent 开发有借鉴意义。

宝玉AI
推荐文章8

vLLM PIECEWISE CUDA Graph 技术学习笔记

文章围绕vLLM PIECEWISE CUDA Graph技术展开,介绍了vLLM Compilation架构、分片编译技术、算子融合、集合通信融合、编译缓存、装饰器系统等内容,PIECEWISE技术让vLLM在prefill阶段性能提升。

GiantPandaLLM
开源动态8

英伟达开源上瘾了!推出了一款实时语音智能体的终极 ASR:24ms 极速锁定。

英伟达开源了Nemotron Speech ASR模型,它是低延迟、实时流式语音识别模型,单句转录锁定仅需24毫秒。其核心能力包括缓存感知、运行效率高、动态运行灵活,还被放进完整语音智能体方案。

开源星探