多视角视频扩散框架」共找到 1329 篇相关文章

算法论文8

视频生成一长就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是长视频稳定关键

自回归视频生成模型存在训推不一致导致的误差累积问题,使生成视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化生成。

量子位
产品应用8

刚刚,美团推出 136 亿参数视频生成模型

美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。

AGI Hunt
算法论文7

重塑你的vlog!PickStyle打造稳定的视频风格迁移模型

Pickford提出PickStyle,这是基于扩散模型的视频视频风格迁移框架。它结合上下文–风格适配器和CS–CFG机制,能在保持画面连贯时准确迁移风格,还能避免闪烁等问题,不过也继承了基础模型部分缺陷。

带你学AI
算法论文7

手机上实现AI视频实时生成,DiT模型上移动端

扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。

带你学AI
新闻资讯7

断层碾压Seedance 2.0:神秘「欢乐马」空降榜首,视频AI变天了

周二晚间,代号「HappyHorse - 1.0」的神秘视频生成模型在 Artificial Analysis 平台空降榜首,不论文字生视频还是图像生视频都排第一,拉开 Seedance 2.0 很大差距,不过在「视频 + 音频」综合排名上屈居第二,引发诸多猜测。

机器之心
算法论文8

真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试

浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。

新智元
新闻资讯8

刚刚,全球视频模型新王诞生了!

天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。

量子位
新闻资讯8

人跑光了,AI视频炸了!马斯克狂发推:Grok Imagine三金封神

xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像转视频视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将推动AI从“蛮力计算”向“智能理解”转变。

新智元
新闻资讯8

AI 视频生成的未来在中国

当地时间3月24日,OpenAI宣布关闭视频生成应用Sora,这是其冲刺IPO前的战略调整。Sora曾是AI视频生成领域明星产品,性能卓越,但因内容生态缺失、商业变现难而关停。中国AI视频生成赛道崛起,应用场景丰富,形成生态壁垒。

AI科技评论
算法论文8

CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影

3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。

机器之心