算法论文7
OTT:抓出捣乱分子压缩KV Cache
深度学习自然语言处理
AI 摘要
论文提出OTT压缩方法:追踪异常令牌单独高精度保存,其余大胆压缩。实验显示,它在多任务和模型中近乎无损,内存减6.4倍、吞吐量提2.3倍,但在极短文本等场景有局限。
阅读原文 · 深度学习自然语言处理
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
斯坦福教授直播训练535B大模型
斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。
机器之心
8
欧洲论文揭三大巨头 AI 安全漏洞
欧洲两位安全研究员的论文《从专有 LLM API 中窃取推理轨迹》爆火。他们揭示 OpenAI、Anthropic 和 Google 用的“无状态架构”有漏洞,能利用小模型解码大模型推理轨迹,导致隐私泄露等风险。
AI科技大本营
开源动态8
腾讯A.I.G:给AI系统做全面安全体检
文章介绍腾讯朱雀实验室开发的AI安全红队测试平台A.I.G,能对AI系统做全面“安全体检”,覆盖AI基础设施、MCP、LLM等风险。它功能实用,安装简单,适合折腾AI服务或MCP的人。
开源先锋
算法论文8
MedGuard:为在线诊疗安全保驾护航
蚂蚁AI安全实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安全基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程。
机器之心