实时视频世界模型」共找到 2017 篇相关文章

新闻资讯7

Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情

Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力大。

量子位
开源动态8

SOTA级视频编辑新方法:无需训练一句话编辑视频,背景保持100%

传统视频编辑工作流被AI重塑,但现有AI方法存在问题,多源于反演 - 编辑范式。西湖大学AGILab提出无需反演和训练的FlowDirector,开销低、支持广且能100%保持背景,还采用新策略优化。

量子位
新闻资讯8

谷歌深夜放出「创世引擎」Genie 3!一句话秒生宇宙,终极模拟器觉醒

谷歌DeepMind推出通用世界模型Genie 3,能以每秒20 - 24帧速度实时生成720p画面,一句话即可生成动态世界,可模拟物理、自然等多种场景,但也存在有限动作空间等局限。

新智元
新闻资讯8

李飞飞发布世界模型新成果:一个提示,生成无限3D世界

李飞飞创业团队World Labs宣布能生成持久、可导航且能自定义操控的3D世界。该模型专注构建3D环境,有更好几何形状、多样风格、更大规模,还支持无限畅游,已推出beta版。

量子位
开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
算法论文8

训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命

英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。

新智元
新闻资讯7

The Batch: 937 |OpenAI 退出视频生成领域

OpenAI计划关闭视频生成器Sora,将资源重新分配到更有盈利性的投资中。Sora虽能生成高质量视频,但生成耗时久、计算成本高,日亏损约100万美元,其与迪士尼的合作也将结束。

DeeplearningAI
开源动态8

多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成

香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和两阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。

AIGC开放社区
产品应用8

AI无限生成《我的世界》,玩家动动键盘鼠标自主控制!国产交互式世界模型来了

昆仑万维带来交互式世界模型Matrix - Game,可让用户用键鼠探索创作虚拟内容。它发布了Matrix - Game - MC数据集、主模型和GameWorld Score评测体系,在多项评测中领先,还能在多领域发挥作用。

量子位
推荐文章8

Efficiency Law, 物理精确世界模型,及世界模型引擎驱动的具身智能学习新范式

2025年秋具身智能赛道火热,特斯拉、英伟达动作不断,数据问题成落地症结。跨维智能贾奎、港中大(深圳)刘桂良探讨突破具身智能学习枷锁的方法,提出Efficiency Law和GS - World世界模型引擎及新学习范式。

机器之心