「多模态CAD重建模型」共找到 1045 篇相关文章
拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩
昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。
打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA
北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。
NeurIPS 2025 | 告别全量扫描!浙大提出COIDO:破解多模态数据选择「高耗」难题
浙大提出 COIDO 框架解决多模态数据选择「高耗」难题。它摒弃全量扫描,用轻量级评分器和小样本采样,将重要性和多样性的优化统一。实验显示,它性能与效率双优且有强泛化性。
Meta扩张继续!挖走OpenAI 2名多模态AI研发人员,收购语音初创公司PlayAI
据报道,Meta 首席执行官扎克伯格从 OpenAI 挖走 2 名多模态 AI 研发人员,还完成对语音初创公司 PlayAI 的收购。Meta 近期在 AI 人才争夺上攻势猛,想补足短板,其超级智能团队未来表现值得关注。
OpenClaw带火AI记忆,DeepMind用混合记忆把3D重建拉到近2万帧
近期,全球爆火的 Agent 私人助手 OpenClaw 接连更新,其长期记忆能力获关注。谷歌 DeepMind 联合加州大学伯克利分校提出 LoGeR 架构,将 3D 重建扩展到极长序列,在多数据集上表现超越先前方法。
无需多视角,单图重建可交互3D模型!南洋理工开源结构推理框架
南洋理工大学团队提出MonoArt,将单目可动物体重建建模为渐进式结构推理过程,通过四个关键模块逐步推理,无需外部先验,在PartNet - Mobility基准测试中表现领先,兼顾推理效率,还可用于下游任务。
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
IBM推出轻量多模态文档神器!OCR与QA超GPT-4o,识别率高达98%!
日常文档处理麻烦,现有工具或体积大、算力消耗高,或识别精度不够。IBM 开源轻量多模态文档处理模型 Granite - Docling,仅258M参数,性能超 GPT - 4o,适用于多场景。
北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
北大王选所彭宇新团队在论文中提出TARA方法,引入生物分类学知识与多模态模型中间表征对齐。实验显示,TARA能提升模型层级识别和未知类别识别能力,还可加速训练收敛,计算开销小。