三维场景生成」共找到 3827 篇相关文章

算法论文8

港中文薛天帆团队:实现 4K 全景视频生成,普通视频也能「长出空间」丨CVPR 2026

香港中文大学薛天帆团队提出CubeComposer框架,可将普通视角视频扩展成原生4K的360°视频。研究在两个数据集测试,结果显示其在多指标上优于基线。该成果突破技术上限,让普通人也能制作360°视频。

AI科技评论
产品应用8

谷歌Veo 3魔性切水果刷屏全网!逼真视频狂吸10万粉,全体网友颅内高潮

谷歌AI视频工具Veo 3生成的解压切水果视频在全网病毒式传播,TikTok号主粉丝量猛涨。今天凌晨谷歌官宣其正式上线,网友热情高涨。此外,它还能实现多种创意视频生成,一位制作人用它两天做出3000万播放量广告。

新智元
产品应用8

实测参考生之王Vidu Q3:这已经不叫AI生成了,这叫AI驱动整个剧组

4月13日生数科技发布视频大模型Vidu Q3,在SuperClue榜单断层登顶。它从‘生成视频’转向‘驱动剧组’,升级后能嵌入内容生产流程,实现‘万物可参,声画同出’,在多赛道表现亮眼。

机器之心
产品应用7

“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影

约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。

带你学AI
开源动态8

阿里开源 Qwen3-TTS 全家桶!语音设计、克隆、生成全打包,开源 2 天 3K Star!

阿里通义团队开源 Qwen3 - TTS 全家桶,含语音设计、克隆、生成功能,开源 2 天获 3K + Star。它有秒级克隆、语音设计等能力,有 0.6B 和 1.7B 两种规格,双轨架构等技术创新保障性能。

开源星探
产品应用7

480P的元宇宙入口:Midjourney不是在做视频,是在造"任意门"

Midjourney发布首个视频模型Video V1,它只能图生视频,操作便捷。虽分辨率仅480P,但采样率高。生成成本低,会员就能用。其美学表现好、生成速度快,不过在提示词理解等方面较弱。该公司有独特愿景。

歸藏的AI工具箱
产品应用7

实测国内首个对话式AI音乐创作Agent:聊个天就能谱曲填词混剪生成MV

实测国内首个对话式AI音乐创作Agent Tunee,玩法像Suno+ChatGPT结合体。它操作简约功能全,能反复修改创作,还具备多模态内容处理能力,虽有小瑕疵,但体现国产AIGC应用发展趋势。

量子位
推荐文章8

当数据库的主要用户不再是人类:我们在 AI Agent 场景下的架构实践与思考

文章分享了服务 AI 公司时在 Agent 场景下数据库架构的实践与思考。介绍 Agent 工作负载特征,通过三个案例说明数据库面临的挑战及解法,还提到新需求催生开源项目 mem9,并给出实践教训,指出 AI 时代数据基建重要性。

InfoQ
开源动态8

昆仑万维开源的SkyReels-V3,把马斯克请来带货了

1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。

机器之心
算法论文8

SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃

文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。

机器之心