音视频生成模型」共找到 8835 篇相关文章

算法论文8

港中文薛天帆团队:实现 4K 全景视频生成,普通视频也能「长出空间」丨CVPR 2026

香港中文大学薛天帆团队提出CubeComposer框架,可将普通视角视频扩展成原生4K的360°视频。研究在两个数据集测试,结果显示其在多指标上优于基线。该成果突破技术上限,让普通人也能制作360°视频

AI科技评论
算法论文8

让AI生成视频「又长又快」:Rolling Forcing实现分钟级实时生成

南洋理工大学与腾讯ARC实验室联合研究,由博士生刘坤昊等完成,提出Rolling Forcing方法,通过滚动窗口联合降噪等创新设计,突破实时长视频生成瓶颈,实现分钟级实时生成,还支持交互控制,但仍有优化方向。

机器之心
开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
产品应用8

刚刚,霸榜神秘视频模型身份揭晓,原来它就是「David」

几天前登上Artificial Analysis榜首的神秘视频模型揭晓,是Runway最新发布的Gen - 4.5。它树立行业新标杆,在多方面表现出色,但也存在一些视频模型常见的局限性,Runway正探索解决办法。

机器之心
算法论文8

CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测

香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。

机器之心
算法论文7

PolyVivid实现多主体视频定制,身份一致性超越现有模型

现有视频生成模型在多主体定制中难保持身份一致与自然交互,上交和腾讯提出PolyVivid框架解决此问题。它在多方面优于现有方法,还介绍技术原理、演示效果,证明其在多领域有实用价值。

带你学AI
开源动态7

视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源

腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。

量子位
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
开源动态8

腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容

腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型

量子位
算法论文8

简单即强大:全新生成模型「离散分布网络DDN」是如何做到原理简单,性质独特?

本文作者杨磊介绍全新生成模型离散分布网络DDN,它建模目标分布机制简洁独特,有零样本条件生成等特性。文中详述其原理、网络结构、损失函数,还展示实验效果,最后给出未来研究方向。

机器之心