多模态理解与生成」共找到 3413 篇相关文章

算法论文8

CVPR 2025 | 如何稳定且高效地生成个性化的多人图像?ID-Patch带来新解法

本文围绕个性化多人图像生成展开,指出其面临身份特征泄露等挑战。介绍了早期方法的不足,提出全新的ID-Patch方案,阐述其设计思路、实验效果等,还探讨了提升空间与未来方向,该方案在多人物图像生成中有突破式提升。

机器之心
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务上超越顶尖闭源模型,多模态综合能力领先主流开源模型。

OpenMMLab
开源动态8

刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。

智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。

数字生命卡兹克
开源动态8

NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务

华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。

新智元
算法论文8

从捍卫者到引路人,上交&上海AI Lab提出LEGION:不仅是AI图像伪造克星,还能反哺生成模型进化?

AIGC技术发展使AI图像滥用问题严重,公众面临信任危机。上交与上海AI Lab等团队在论文中从构建数据集、设计模型、实现检测与生成统一三方面破局,LEGION能检测伪造,还可反哺生成模型进化。

机器之心
开源动态8

NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!

继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。

开源星探
产品应用8

太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗

火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。

量子位
开源动态8

标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估

Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。

量子位
产品应用8

业界首个高质量原生3D组件生成模型来了!来自腾讯混元团队

腾讯混元3D团队推出业界首个高质量原生3D组件生成模型Hunyuan3D - Part。现有3D生成算法有局限,该模型提出新范式,含P3 - SAM和X - Part,在多数据集评估中超越现有工作,还给出体验地址和论文地址。

量子位
产品应用7

上手“设计界的Manus”,朱啸虎点赞,Lovart这波魔法破圈了丨TIP 002

国产出海产品Lovart被称为“设计界的Manus”,获朱啸虎点赞。它是设计领域首个Agent,能用自然语言驱动生成多模态视觉作品,可生成VI体系、短片等,适合文创领域,还能人工编辑,调用多模型。

鲸选AI