「图片缓存」共找到 261 篇相关文章
超棒!打造顶级智能体Claude Code的经验教训
Claude Code工程师Thariq文章受开发者盛赞,揭示打造智能体经验。提示词缓存是关键,要合理排列顺序;管理动态上下文需避免破坏缓存;为智能体选适配工具,随模型进化调整行动边界。
Claude Fable 5.1 发布:缓存读降价 75%,但实际更贵了
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1。Fable 5.1 性能全面上涨,但出现价格悖论,缓存读降价 75% 实际更贵。在 Agent 类任务与 Opus 5 基本持平,推出 EFS 应对数据留存争议,还有多项科研演示。
Claude Code 省 Token 指南:慎用 1M 上下文,不开新会话或者总是开新会话都不对
文章聚焦Claude Code省Token问题,分析配额消耗快的原因,介绍提示缓存机制,给出省钱策略、操作规则,还提及委派工作及澄清误解,强调让缓存多命中、上下文少装无关内容。
天工Skywork开始"看"小红书了,1247个帖子的图片信息被它吃透!
昆仑万维技术发布周推出Skywork Deep Research Agent v2。它整合多模态检索理解和跨模态生成能力,有信息检索、小红书Agent等功能,Office Agent也有升级,还新增积分预估等特性,邀测后将全量开放。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
LLM加速利器LMCache,极大降低GPU资源消耗
LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于长上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。
ACL 2026 | LCA:DeepSeek 长文本加速神器,90% KV 缓存缩减 + 2.5 倍推理提速
琶洲实验室等团队提出潜在空间压缩注意力(LCA),入选 ACL 2026。LCA 突破传统注意力机制瓶颈,适配不同大模型,降低硬件门槛与成本,提升推理效率。论文与代码已开源。
不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍
英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。
Couchbase与爱奇艺的十年之约:Magma引擎如何破解TB级缓存性能与成本难题?
在AI驱动应用革新浪潮下,海量数据处理的性能与成本平衡成挑战。Couchbase技术直播中,爱奇艺专家分享实践经验,揭秘其如何破解性能、扩展性与成本难题,还介绍了Capella AI Services等。
Agnes AI 实测:AI 编程真正的瓶颈,99%的人想错了
本文实测Agnes AI,指出AI编程瓶颈在于缓存命中率,而非模型智商。介绍其产品线、评测成绩与价格优势,还分享客户端体验,包括亮点、回滚事故及日志结论,最后点明智能免费后验证更稀缺。