视频具身基座模型」共找到 8072 篇相关文章

开源动态8

蚂蚁发布全球首个视频-动作世界模型,开源即刷新世界纪录

从Sora惊艳亮相到谷歌开放Genie 3线上体验,世界模型从概念走向交互世界。蚂蚁旗下蚂蚁灵波开源全球首个视频 - 动作世界模型LingBot - VA,可驱动机器人完成复杂操作,解决长时漂移等问题,还提出工程化解法。

MacTalk
算法论文8

VDC+VBench双榜第一!强化学习打磨的国产视频模型,超越Sora、Pika

复旦大学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。

机器之心
新闻资讯7

独家 | 开普勒联合创始人胡德波成立「索塔无界」,聚焦通用基座模型+海外市场

AI科技评论独家消息,开普勒机器人联合创始人胡德波2026年4月成立索塔无界。该公司聚焦通用基座模型,以统一潜空间世界动作模型为核心,提出物理智能大脑技术路线,已与欧美企业达成合作意向。

AI科技评论
开源动态8

创智刘鹏飞、Sand.ai曹越,两大AI青年学者团队联手,开源音视频基座模型

开源多模态生成领域获架构级底层突破。上海创智学院与 Sand.ai 联合研发的 daVinci - MagiHuman 正式开源,打破开源界音视频联合同步生成三重局限。它采用单流 Transformer 架构,能力强、推理效率高。

机器之心
推荐文章7

不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine

UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。

量子位
产品应用7

用AI把一段视频变成可视化网页,Google的新模型又卷飞了。

Google将Gemini 2.5 Pro更新为05 - 06版,此版代码能力在WebDev Arena盲测竞技场登顶,还提升视频理解能力,可将视频变成可视化网页,虽产品有不足,但模型进步值得肯定。

开源星探
算法论文8

视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖

清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。

量子位
产品应用8

实测可灵AI的新视频模型,它生成的动作戏酷到封神。

作者实测可灵2.5新视频模型,它已灰度内测并登上釜山电影节。与可灵2.1对比,可灵2.5在运动和表演能力上大幅提升,还增强了文生视频与理解能力,让创作者有更多创作自由。

数字生命卡兹克
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区