「空间生成模型」共找到 8792 篇相关文章
视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖
清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。
业界首个高质量原生3D组件生成模型来了!来自腾讯混元团队
腾讯混元3D团队推出业界首个高质量原生3D组件生成模型Hunyuan3D - Part。现有3D生成算法有局限,该模型提出新范式,含P3 - SAM和X - Part,在多数据集评估中超越现有工作,还给出体验地址和论文地址。
上海交大DENG Lab提出「LatentUM」:Unified Model的真正「战场」在视觉推理与世界模型
上海交通大学 DENG Lab 提出的 LatentUM,尝试让统一模型把生成的视觉内容纳入推理闭环。它在多项任务上超越基线,其核心思路是生成与语言共享语义空间的离散 visual semantic tokens,模型含三大关键设计。
VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%
前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出无VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。
统计可控数据合成!新框架突破大模型数据生成局限,麦吉尔大学团队推出LLMSynthor
麦吉尔大学团队提出新方法LLMSynthor,让大模型成结构感知的数据模拟器,为隐私敏感、数据稀缺场景生成不泄密的高质量替代数据。它通过结构推理、统计对齐等步骤实现,有理论保障,多场景实测效果佳。
美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局
近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。
AAAI|东方理工陈云天等:教会视频扩散模型“理解科学现象”,从初始帧生成整个物理演化
东方理工陈云天等团队在论文中提出让视频扩散模型学习“潜在科学知识”的框架,方法分三步,在流体和台风数据实验中表现超主流方法,展示生成式AI在科学建模的探索。
ICML 2025 Oral!北大和腾讯优图破解AI生成图像检测泛化难题:正交子空间分解
OpenAI推出GPT - 4o图像生成功能,AI生图安全挑战凸显,区分生成与真实图像成难题。北大与腾讯优图研究人员用正交子空间分解解决AI生图检测泛化难题,论文被ICML 2025接收。
统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解
港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。
突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知
视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。