双层缓存」共找到 126 篇相关文章

新闻资讯7

重要!LiteLLM 供应链攻击:你的 API 密钥可能已经泄露

3月24日,LiteLLM的PyPI发布页面出现恶意版本,1.82.7和1.82.8被嵌入恶意代码。恶意代码会收集敏感文件、外传信息、进行横向移动。文章还给出检查、处理方法,此事件给开发者提了醒。

AI工程化
开源动态7

还需付费卸载龙虾?这只龙虾能直接「杀死」OpenClaw

OpenClaw曾引发安装热潮,如今因安全风险引发卸载潮。国家相关部门发布风险提示,网上出现卸载服务。而GenericAgent既能装也能卸OpenClaw,还能自我卸载,展现出硬核技术。

机器之心
开源动态7

马斯克说到做到:开源X平台核心推荐算法

X(原Twitter)开源内容推荐Feed on X召回、精排推理、策略代码,模型参数配置较小,应是简化Demo版。召回用双塔模型,精排用双层Transformer,还介绍了系统架构、模型细节等。

腾讯技术工程
算法论文8

扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧

上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。

量子位
开源动态7

4.4k星!给Agent接上「本地免费搜索爬虫」,内置11个skill执行数据搜索、爬取、自动研究

文章推荐开源本地搜索工具wigolo,它是专门给Agent使用的本地网络能力层,可解决本地运行Agent查找资料时使用API麻烦费钱的问题。它功能多样,有搜索、缓存等工具,自带11个Skill。

开源AI项目落地
产品应用7

别再无脑开高推理!Opus 5高配会擅自重构代码乱加戏

有人用FrontierCode编程基准测试Opus 5推理档位,发现性能顶峰在medium档,高档位推理预算多余,会让模型反复校验、偏离需求,在代码场景还会擅自重构代码。Anthropic也建议调低推理档位。

量子位
新闻资讯7

Claude Code一周份额,一天就烧完一半?有人逆向工程发现了7个bug

Claude Code在快速更新中问题频发,如思考深度大幅下降,还存在7个叠加的bug,浪费用户token配额。开发者给出应对建议,新版本增加账单透明度和缓存过期提醒,该工具正面临信任危机。

机器之心
产品应用8

Hybrid Model Support:阿里云 Tair 联合 SGLang对 Mamba-Transformer 等混合架构模型的支持方案

文章介绍阿里云 Tair KVCache 团队与SGLang社区在推理框架上支持混合架构模型的工程化实践。分析混合架构崛起原因、面临挑战,阐述内存管理、关键技术优化方案,验证性能,并指出未来演进方向。

阿里云开发者
算法论文8

突破长视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底

当前AI长视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量长视频稳定生成,效率显著提升。

机器之心
算法论文8

砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈

大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。

深度学习自然语言处理