「多模态感知」共找到 1183 篇相关文章
突破三维感知瓶颈:魔芯科技发布VGGT系列成果,实现动态高保真重建并获新一轮融资
魔芯科技联合同济大学等团队,基于 VGGT 架构发布四项成果,突破三维感知在流式处理、动态鲁棒性和精细感知上的瓶颈。还获新一轮融资,后续将加大对空间智能与世界模型技术投入。
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
神秘模型「牛来」真身曝光,是智谱刚开源的 GLM - 5.3 Flash,为 5 系列首个原生多模态模型。它尺寸小能力强、价格低,用国产卡,实测多模态和 Coding 能力出色,架构全新,开源后将模型、算力和生态结合。
比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临
近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。
ICML 2025|多模态理解与生成最新进展:港科联合SnapResearch发布ThinkDiff,为扩散模型装上大脑
现有扩散模型缺乏多模态推理创作能力,在算力和数据不充裕时实现该功能是难题。ICML2025上,港科联合SnapResearch提出ThinkDiff,以较少资源让扩散模型有思考能力,开辟多模态理解生成新路径。
5个月估值120亿!OpenAI前CTO自曝首个多模态AI,竟要免费开源
OpenAI前CTO Mira Murati创立的Thinking Machines Lab获20亿美元融资,估值达120亿美元。未来几个月将发布首个多模态AI产品,还会开源部分组件,团队全力构建多模态AI以增强人类能力。
工具增强的多模态LLM综述
多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。
多模态技术爆发元年,行业应用如何落地?
InfoQ《极客有约》X AICon 直播栏目,邀上海交大赵波、快手高欢、腾讯邵帅探讨多模态大模型。谈及技术挑战、开源闭源、行业落地等,还分享精彩观点,如先大后小蒸馏提效,垂直模型现阶段更优。
智源悟界·RoboBrain Orca:多模态表征世界模型
智源研究院悟界·RoboBrain Orca团队发布技术报告,探索让模型学习世界表征,从‘预测下一个词’走向‘预测下一状态’。它通过多模态数据学习,经实验验证有效,虽处早期阶段,但提出值得扩展的方向。
Jina Embeddings v4 的量化感知训练
文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。
HAMi × NVIDIA:GPU 拓扑感知调度实现详解
HAMi社区在v2.7.0版本推出针对NVIDIA GPU的拓扑感知调度功能,解决多卡通信瓶颈。文章深入剖析其设计与实现原理,介绍核心特性、阶段及代码,用双策略寻优算法保障性能与资源健康。