3D 立体视频」共找到 2799 篇相关文章

算法论文8

ICLR神秘论文曝光!SAM3用「概念」看世界,重构视觉AI新范式

2023年Meta推出SAM,后SAM 2扩展到视频分割。近日,SAM 3现身ICLR 2026盲审论文,带来「基于概念的分割」新范式,强调按「语义概念」理解和分割图像,还构建数据引擎提升性能。

新智元
开源动态8

国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线

蚂蚁灵波发布开源SOTA级世界模型LingBot - World,全面对标谷歌Genie 3,部分性能指标超越。它有高保真、长视频生成等优势,还能解决具身智能痛点,发布后引发海外关注,促使Genie将开源。

新智元
算法论文8

CVPR 2026|1分钟单图变4D视频!AI看图直接脑补物理规律

北京理工大学和理想汽车等团队提出全新框架PhysGM,引入DPO实现端到端快速前馈推理,能1分钟内将单图生成为4D动态视频,在速度和评价指标上超越主流模型,相关工作被CVPR 2026接收且代码已开源。

机器之心
新闻资讯8

马斯克偷偷憋了个大招!Grok秒出《阿凡达》画质,好莱坞瑟瑟发抖?

马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方式创作。

新智元
算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位
新闻资讯8

Veo 3逼真脱口秀爆火全网,网友:彻底超越恐怖谷!Sora已被完爆

Veo 3生成的脱口秀视频全网爆火,人物、场景真实,声音和嘴型能对上,已超越恐怖谷。它或让人类进入‘模糊时代’,还会颠覆游戏、电影、广告等行业,未来AI生成内容或远超非AI内容。

新智元
开源动态8

AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源

快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。

新智元
算法论文8

ICCV 2025 | 小红书AIGC团队提出图像和视频换脸新算法DynamicFace

小红书AIGC团队提出图像和视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。

机器之心
推荐文章7

深度解析世界模型:新范式的路线之争,实时交互与物理仿真

文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频3D结构化两条路线,介绍不同公司产品并以四象限框架分类。

海外独角兽
开源动态8

蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。

蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。

数字生命卡兹克