「视觉 - 文本压缩」共找到 1202 篇相关文章
12秒生成1万token!谷歌推出文本「扩散模型」Gemini Diffusion,研究员:演示都得降速看
谷歌将图像生成常用的“扩散技术”引入语言模型,推出Gemini Diffusion,12秒能生成1万tokens,速度比Gemini 2.0 Flash - Lite更快。它通过逐步优化噪声学习生成输出,目前是实验性演示,可申请体验。
Transformer创新架构SALA:上下文更长,推理更快
面壁智能发布行业首个大规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理上表现出色,还发起大奖赛探索性能极限。
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
ACL 2026 | LCA:DeepSeek 长文本加速神器,90% KV 缓存缩减 + 2.5 倍推理提速
琶洲实验室等团队提出潜在空间压缩注意力(LCA),入选 ACL 2026。LCA 突破传统注意力机制瓶颈,适配不同大模型,降低硬件门槛与成本,提升推理效率。论文与代码已开源。
如何选择最佳多模态大模型压缩方案?哈工大、度小满开源EFFIVLM-BENCH基准测试框架
金融科技智能化转型中,LVLM部署受算力瓶颈制约。哈工大与度小满联合开源EFFIVLM - BENCH基准测试框架,能为多模态大模型压缩方案出具‘体检报告’,还揭示LVLM加速复杂性,推动技术发展。
Meta刚刚开源DINOv3,横扫60+任务,无标注封神!
今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
AI文本转语音进入“Next Level”!独角兽ElevenLabs发布Eleven v3:狠狠拿捏情感控制
独角兽ElevenLabs发布最新版TTS模型Eleven v3,支持70多种语言,能进行多人对话,生动展现情绪语气。官方称其为“迄今为止最具表现力的文本转语音模型”,网友实测好评居多,但中文效果不如英文。
谷歌公开全新极限压缩算法:LLM提速8倍、内存占用狂降6倍,精度零损失
谷歌推出全新量化算法 TurboQuant,瞄准大模型键值缓存吃内存、高维向量搜索算力瓶颈痛点,能砍内存、提速度且精度零损失。分 PolarQuant 和 QJL 两步,实验数据表现优异,将改变搜索格局。