「多模态视觉理解模型」共找到 1933 篇相关文章
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
本文整理自新加坡国立大学Show Lab负责人寿政教授在ECCV 2026的分享,团队研发融合自回归与离散扩散的Show-o/Show-2统一架构,解决多模态理解与生成融合痛点,延伸至具身智能领域,突破数据稀缺、推理延迟等核心瓶颈。
10万引普林斯顿刘壮最新访谈:架构没那么重要,数据才是王道
普林斯顿大学助理教授刘壮在访谈中指出,架构没那么重要,数据、规模和记忆才是决定AI成败的关键。他认为ConvNet和Transformer性能差异源于训练细节;当前数据集远不够多样;大语言模型有语言空间的世界模型,但视觉空间的还缺失;记忆是瓶颈,智能体只是权宜之计;AI目前还替代不了研究生。
大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力
现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。
2025,大模型文档解析(OCR)年终盘点
2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。
触觉具身来了个梦之队:天使轮近亿
5月27日,上海新智具身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉具身智能,构建技术闭环,在数据采集、模型训练等方面有进展,已在工厂落地POC验证订单。
专访酷哇杨学:世界模型的下半场,是把一次成功变成长期服务|甲子光年
在2026世界人工智能大会上,具身智能行业关注点从机器人能动转向能否进入真实场景干活。酷哇科技宣布杨学出任首席科学家,共建通用具身智能联合实验室。杨学认为行业应从证明技术转向证明实用,解决机器人在真实场景的长期稳定运营问题。
作为软件架构师使用 AI 的经验
Avraham Poupko 在 OOP 大会分享软件架构师用 AI 经验,认为软件架构师不会被 AI 取代,AI 适合探索权衡、提炼语言,但缺乏情境推理和情感智能,人类在这方面更有优势。
刚刚,智源全新「悟界」系列大模型炸场!AI第一次真正「看见」宏观-微观双宇宙
6月6日第七届智源大会,智源研究院推出全新「悟界」系列大模型,含原生多模态世界模型Emu3、脑科学多模态通用基础模型见微Brainμ等,反映其对大模型发展的研判,推动AI向物理世界迈进。
普林斯顿大学等Nature揭秘:人类大脑与大语言模型共享同一套语言处理时钟
普林斯顿大学等机构研究发现,大语言模型层级计算序列精确映射人类大脑处理语言的毫秒级时间动态,其与人类大脑理解语言的先后顺序高度一致,为理解大脑和开发神经网络架构开辟途径。
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。