「统一多模态基础模型」共找到 1751 篇相关文章
工业异常检测新突破,复旦等多模态融合监测入选CVPR 2025
复旦大学等机构联合发布高精度多模态数据集Real - IAD D³,提出多模态融合检测方法D³M,成果被CVPR 2025收录。该数据集含多类数据,提升检测性能,此前相关工作也被CVPR 2024收录。
多模态BUG修复新SOTA:慕尼黑工大GUIRepair登上SWE-bench Multimodal榜单第一
自动化修复软件缺陷是长期目标,多模态问题修复受关注。慕尼黑工业大学团队提出GUIRepair,融合APR与GUI Testing知识,登上SWE - bench Multimodal榜单第一,为多模态软件自动修复开辟新路。
AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图大题
火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图大题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。
社区发布丨全面开源!商汤日日新SenseNova U1发布,迈向模型理解生成统一时代
商汤科技正式发布并开源商汤日日新SenseNova U1系列原生理解生成统一模型,基于NEO - unify架构,实现模态集成向原生统一跨越,其轻量版在多项测试达同量级开源SOTA,还能连续性图文创作。
4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源
上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。
告别AI「鬼画符」!一行指令「复活」王羲之、苏轼,带连笔、懂排版,项目已开源丨ICLR'26
UniCalli由香港科技大学(广州)等团队推出,是全新统一扩散框架,能精准生成书法排版和连笔,将书法生成和古籍识别统一,工作被ICLR2026接收,代码、数据集开源,还有在线Demo。
大模型狙击黑产:挚文集团社交生态攻防实战全揭秘
挚文集团生态技术负责人李波在AICon大会分享大模型在社交生态落地实践。介绍集团生态问题,提出构建治理框架,还阐述多模态大模型研发方案、细粒度用户画像建设及审核侧应用,最后总结现状并展望未来。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
多模态Qwen3-VL-Embedding开源&技术剖析
互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。