「上下文压缩」共找到 817 篇相关文章
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
谷歌公开全新极限压缩算法:LLM提速8倍、内存占用狂降6倍,精度零损失
谷歌推出全新量化算法 TurboQuant,瞄准大模型键值缓存吃内存、高维向量搜索算力瓶颈痛点,能砍内存、提速度且精度零损失。分 PolarQuant 和 QJL 两步,实验数据表现优异,将改变搜索格局。
爆删80%系统提示词!Anthropic核心成员揭秘Claude 5最新玩法:上下文工程全面大换血
Anthropic针对Claude Opus 5、Claude Fable 5等新模型,删超80%Claude Code系统提示词,编码测试成绩无明显下降。CC技术团队成员发文指上下文工程规则重写,还总结新旧规则对比,并给出内容撰写建议,还上线新命令。
Claude Code 省 Token 指南:慎用 1M 上下文,不开新会话或者总是开新会话都不对
文章聚焦Claude Code省Token问题,分析配额消耗快的原因,介绍提示缓存机制,给出省钱策略、操作规则,还提及委派工作及澄清误解,强调让缓存多命中、上下文少装无关内容。
Anthropic 技术栈里的「五宗罪」由何而来?
Anthropic的Claude模型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、模型能力、定价、长上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
DeepSeek V4 借实习生获奖论文“起飞”?梁文峰剑指上下文:处理速度提 10 倍、要“完美”准确率
ACL公布2025年获奖论文,中国作者比例超51%。DeepSeek梁文锋通讯、实习生袁境阳一作的论文获Best Paper奖。其提出NSA机制,实验显示性能优、准确率高、速度提升显著,成果或用于DeepSeek V4。
JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略
浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。
推理成本太高、算力不够用?单纯堆卡没用,得靠极致的“压缩”与“调度” | AICon
大模型落地面临推理成本高、算力需求大的问题。AICon大会上,阿里云刘峥、ModelTC龚睿昊、阿里巴巴马腾、OPPO宋晓辉、清程极智汤雄超等专家将分享从压缩到调度的推理优化方案,覆盖云到边缘、多算力平台。