多视角视频扩散框架」共找到 1329 篇相关文章

新闻资讯8

小扎「芒果」生图只输GPT Image 2,没人教它改稿,它自己学会了

Meta推出图像生成模型Muse Image(代号「芒果」)和视频模型Muse Video预览版。Muse Image在文生图榜单排第二,改变画图方式,能自我修正。它与Muse Spark打通,Muse Video文生视频排第3。不过,其@功能有隐私隐患。

新智元
新闻资讯8

马斯克还在卷10秒,中国AI直接掀桌!16秒一镜到底,全球唯二

2026年AI视频圈竞争激烈,硅谷巨头激战正酣,马斯克Grok Imagine上线生成10s视频功能。在此背景下,中国AI的Vidu Q3登场,16s音画直出一镜到底,还支持多种功能,位列中国第一、全球第二。

新智元
产品应用8

给 Happy Horse-1.0 讲完戏,我无痛当上导演了

文章聚焦阿里新发布的视频模型Happy Horse-1.0,经测试它在多镜头一致性、人物表现力和视频编辑功能上表现出色,能产出电影质感画面,且价格有竞争力,但物理拟真短板明显,已具影视工业应用潜力。

AI科技评论
算法论文8

ICML26 | 浙江理工大学马啸讲师和南京大学李武军教授课题组联合提出EMCES:为强化学习合成更有价值的样本

强化学习获取高质量样本成本高、风险大,现有基于扩散模型的样本增强方法有局限。浙江理工大学马啸讲师和南京大学李武军教授课题组提出 EMCES,将情景记忆机制引入可控扩散模型,提升下游强化学习算法表现,论文已被 ICML2026 录用。

机器之心
产品应用7

给 AI 一张陶罐碎片图,它能还原破裂过程吗?Minimax H3 vs Seedance 2.0 Fast 实测

文章实测 MiniMax H3 和 Seedance 2.0 Fast,给模型一张破碎陶罐图,让其生成破碎过程视频。分析 H3 技术逻辑,对比两模型效率、质感和物理细节等差异,指出开放与闭源模型的特点及视频模型待解决的问题。

AI科技评论
新闻资讯8

宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

一条10分钟一镜到底的Demo视频引发关注,视频中宇树和智元的机器人同用一个“大脑”,完成多种任务,如擦窗、收纳等,还展现出跨本体协作等能力。该模型跳出主流具身模型固有框架,或改写具身智能行业认知。

量子位
新闻资讯8

美国视频生成老炮儿,入局世界模型

Runway发布首个通用世界模型GWM - 1及一系列变体,包括GWM Worlds、GWM Avatars、GWM Robotics,均基于Gen - 4.5构建。还对Gen - 4.5升级,新增原生音频生成、编辑和多镜头编辑功能。

量子位
产品应用7

教你用 Lovart 生成超炫 PPT 视频封面

受海外老哥启发,探索出用 Lovart 生成动态 PPT 背景的提示词,提示词放评论区。

歸藏的AI工具箱
算法论文8

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

机器人走出实验室后,训练数据需覆盖真实世界情况。OVOW由多团队完成,被ECCV 2026接收。它从单目视频出发,输出可编辑、可碰撞的实例级Mesh,串联视觉基础模型完成流水线工作,能用于物理仿真。

机器之心
推荐文章7

扩散架构 or「NoThinking」,AI 对话的「1Hz 壁垒」如何突破?

当红通用人形机器人公司 1X 的 AI 副总裁 Eric Jang 提出「智能频谱」概念,阐述当前 AI 面临的「1Hz 壁垒」及实现「Ultra Instinct」能力的先决条件。不同推理方案有望解决部分问题,但通用智能体仍有瓶颈。

机器之心