算法论文8
浙大&阿里MetaCompress:多轮VQA Token压缩率90%精度不降
量子位
AI 摘要
浙大与阿里团队:现有Token压缩方法在多轮视觉问答场景失效,提出MetaCompress框架,可自适应生成压缩映射,在高压缩率下精度优、开销小,还具良好泛化性。
阅读原文 · 量子位
只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026
多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
浙大开源PhyEdit实现单图精准3D物体操作
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
新智元
开源动态8
浙大开源PhyEdit,3D图像编辑超Nano Banana Pro
当前图像编辑模型处理三维状态常出错。浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导图像编辑,还加入深度监督,构建数据集和评测基准,成绩超Nano Banana Pro,且GUI也开源。
量子位
开源动态7
大神开源插件,Claude、Fable5账单降6成
外网大神周末开源插件,将模型上下文等渲染成图片,可让账单降低59% - 70%。原理是图片token只与像素尺寸有关。此前因模型识图能力差难落地,fable5证明其极限省钱且效果保留。
探索AGI
算法论文8
浙大阿里云:用Token Economics透视LLM Agent
浙江大学联合阿里云发布综述论文,提出Token Economics框架,从经济学视角理解LLM Agent中Token使用与资源分配。梳理关键问题,构建分类体系,还指出未来发展趋势与新兴机会。
深度学习自然语言处理