「视频扩散技术」共找到 3750 篇相关文章
机器人WAIC现场抢活讲PPT?商汤悟能具身智能平台让机器人「觉醒」
具身智能火爆但面临数据瓶颈等难题。商汤在WAIC推出具身智能平台「悟能」,以世界模型为引擎,有感知、导航、交互等功能,其开悟世界模型能生成多视角视频,为机器人提供数据支持。
X-Actor 惊艳登场!长时唇动+情感同步人像动画生成
字节提出 X - Actor,一个音频驱动自回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。
弯道超车?国产具身,千小时人类数据激发智能涌现
近日,深度机智用人类学习范式在国际 Benchmark 上击败巨头,成果两会首日被央视报道。其全新架构源于一年多积累。英伟达也有人类学习尝试。深度机智构建全栈技术矩阵,成果显著,3 月底成果将开源。
拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景
昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。
国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路
北大卢宗青是国内第一视角数据最早押注者和隐空间路线推进者。他认为人类视频是具身智能唯一可规模化的数据路径,创立BeingBeyond走隐空间世界动作模型路线,成本低、推理快,还发布全球首个隐式触觉世界动作模型Being - H0.8。
阿里首个世界模型:快乐…生蚝
刚成立一个月的阿里ATH事业群发布全球首个主动式实时交互世界模型HappyOyster(快乐生蚝),它搭载原生多模态架构,有漫游、导演、创造、分享等玩法,目前需邀请码体验。其技术突破让它区别于传统文生视频模型。
5张 H800 带来 20 FPS 高保真实时虚拟人生成
传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。
Qwen负责人转发2025宝藏论文,年底重读「视觉领域GPT时刻」
2025年末,Qwen大模型技术负责人林俊旸转发谷歌DeepMind入选ICCV 2025的论文,指出视觉领域“GPT时刻”要来了。研究用实验数据证明,视频模型正跳出任务专属局限,实现一个模型完成多视觉任务,推理过程还能被CoF“演”出来。
“参考生”之王回归:Vidu Q3持续进化,剧张力拉满|甲子光年
近期,AI视频公司生数科技的Vidu Q3正式上线参考生视频并全面升级。它能解决视频内容创作痛点,让爆款人设等稳定复现。在榜单上表现出色,经测试在多场景降本增效,提升了视频“剧张力”。
腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容
腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。