算法论文8
VEGA - 3D:释放视频模型3D知识
机器之心
AI 摘要
华中科技大学与百度团队:提出VEGA - 3D框架,挖掘视频生成模型隐式3D知识,提升场景理解、空间推理与具身任务表现,无需额外3D标注,为3D推理提供新路径。
阅读原文 · 机器之心
VEGA-3D:释放视频生成模型中的隐式3D知识,重塑3D场景理解与具身交互
华中科技大学与百度联合提出VEGA - 3D,释放视频生成模型隐式3D知识。它将视频生成模型作‘潜在世界模拟器’,用自适应门控融合机制,提升场景理解等任务表现,无需额外3D标注数据。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
Wan3.0上线千问AI平台,多领域表现亮眼
今天,视频生成模型Wan3.0正式上线千问AI平台。它在多维度全面升级,公测以来收到大量反馈,获创作者、企业用户等好评。在多领域经检验表现出色,还持续进化,部分API限时7折,已被多平台接入。
阿里云开发者
开源动态8
Sand.ai开源千亿MoE视频生成模型
Sand.ai团队开源全球首个千亿MoE视频生成模型MAGI - 2 - preview,总参数114B,单次前向激活约6B,成本低效果好。该模型解决了视频生成Scaling难题,架构、系统设计出色,开源将改变行业规则。
量子位
开源动态8
MemoBench:捅破世界模型评测最大盲区
过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。
机器之心
8
快手拟分拆可灵AI,估值200亿美元
The Information爆料,快手计划分拆旗下视频生成模型可灵AI,目标估值200亿美元并计划明年IPO。可灵已开始盈利,在海外表现出色。快手拆分是因估值重构、资源压力和人才等三层压力。
量子位