「缓存复用」共找到 200 篇相关文章
大模型最难的AI Infra,用Vibe Coding搞定
Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。
让chrome浏览器变成你的智能助手,浏览器转变为强大的 AI 控制自动化工具
Chrome MCP Server是基于chrome插件的模型上下文协议服务器,能让大模型或chatbot接管浏览器。它有chatbot/模型无关、用原本浏览器等特性,与同类项目比优势明显,还介绍了使用步骤、工具及示例。
智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法
Uber AI已嵌入软件开发全流程,超70%代码合并请求由智能体生成,半年内智能体请求暴增9.4倍,通过多项优化实现AI总支出稳定,本文公开其整套AI降本方法论。
4.4k星!给Agent接上「本地免费搜索爬虫」,内置11个skill执行数据搜索、爬取、自动研究
文章推荐开源本地搜索工具wigolo,它是专门给Agent使用的本地网络能力层,可解决本地运行Agent查找资料时使用API麻烦费钱的问题。它功能多样,有搜索、缓存等工具,自带11个Skill。
别再无脑开高推理!Opus 5高配会擅自重构代码乱加戏
有人用FrontierCode编程基准测试Opus 5推理档位,发现性能顶峰在medium档,高档位推理预算多余,会让模型反复校验、偏离需求,在代码场景还会擅自重构代码。Anthropic也建议调低推理档位。
分享一个 Skill:如何找到值得做的创业 idea
作者分享找创业想法的方法,认为AI时代想法重要性回归。介绍通过AI获取各平台信号,还推荐Tabbit浏览器,其能创建复用妙招扫描机会,给出结构化清单,还可定时执行,有共享社区。
别再给AI送钱:10款开源工具省80%Claude Code Token,大项目直接砍49倍
使用Claude Code等AI编码工具常遇额度用完、账单超预期问题,80%钱浪费在冗余输出等。社区博主整理10款开源工具,适配主流AI编码工具,最高能将大项目Token消耗砍到1/49,还介绍省Token习惯及互助项目。
Claude Code一周份额,一天就烧完一半?有人逆向工程发现了7个bug
Claude Code在快速更新中问题频发,如思考深度大幅下降,还存在7个叠加的bug,浪费用户token配额。开发者给出应对建议,新版本增加账单透明度和缓存过期提醒,该工具正面临信任危机。
MiniMax把自家“实习生”放出来了!
曾经割裂需求、设计与代码的流水线正在消融,MiniMax上线的AI原生工作台Agent 2.0为此而来。它通过Desktop App与Expert Agents两大载体,可嵌入工作环境,现已开启封闭内测,能帮用户提升工作效率。
Hybrid Model Support:阿里云 Tair 联合 SGLang对 Mamba-Transformer 等混合架构模型的支持方案
文章介绍阿里云 Tair KVCache 团队与SGLang社区在推理框架上支持混合架构模型的工程化实践。分析混合架构崛起原因、面临挑战,阐述内存管理、关键技术优化方案,验证性能,并指出未来演进方向。