「多模态语音理解大模型」共找到 1763 篇相关文章
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
多模态RAG哪家强?9 个 Embedding、4 类 MLLMs、4 大框架实景比拼
现有文档 RAG 评测存在不足,华南理工和华科推出 DOUBLE - BENCH 进行多模态 RAG 实战评测,结果显示检索是瓶颈,模型爱胡说。快手开源 Keye - VL - 1.5 - 8B,PaperAgent 有实操指南。
多模态卷王阶跃星辰Step 3登场,推理效率可达DeepSeek-R1 300%
新一代多模态推理基模Step 3登场,它采用原创MFA架构,具“多开好省”亮点,推理效率高、性价比优。7月31日将开源,能适配各芯片,还发起“模芯生态创新联盟”推动应用落地。
Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!
Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
CVPR 2025 | 多模态统一学习新范式来了,数据、模型、代码全部开源
中国人民大学、清华和腾讯合作的CVPR 2025论文指出,当前多模态学习范式有缺陷。为此提出新范式,构建AV - UIE数据集、Crab框架,实现任务互助,在多任务上超垂类专家模型,数据、模型、代码开源。
关于多模态大模型Token压缩技术进展,看这一篇就够了
多模态大模型跨模态融合带来高计算成本,催生MLLM Token Compression研究。北大等机构人员基于压缩位置对方法系统归类,讨论特定场景压缩机制选择,还探讨了挑战与前景方向。
首个GUI多模态大模型智能体可信评测框架+基准:MLA-Trust
MLA-Trust 是首个针对 GUI 环境下多模态大模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
刚刚,大模型装上「鹰眼」!首创高刷视频理解,谷歌Gemini 2.5完败
面壁智能开源MiniCPM-V 4.5多模态端侧模型,8B参数越级反超72B巨无霸,在多领域达SOTA。它首创高刷视频理解,性能强、效率高、适合端侧部署,还实现多技术创新,是开源端侧多模态AI的革命。