通用视频生成模型」共找到 3280 篇相关文章

产品应用8

创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界

李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。

Founder Park
推荐文章7

抖音、视频号、小红书、公众号、百家号、网站、DeepSeek AI等SEO排名关键词布局怎么做?【收藏】

白杨SEO分享多平台SEO排名关键词布局方法。先讲核心步骤,包括确定主题、做话题树、定优先级和内容类型,后详细介绍抖音、视频号等7个平台的关键词布局具体做法。

白杨SEO优化教程
算法论文8

公里级场景也能稳住了,国产团队把长视频3D重建又往前推了一步

浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,能处理超万帧几千米的场景。

机器之心
产品应用8

编码封神,Gemini 2.5 Pro (I/O 版)视频秒转 App!网友:比 o3/Claude 强,Vibe 程序员集结!

谷歌 I/O 大会前,Gemini 2.5 Pro 预览版升级,重点在编码。它搞前端、做 UI 出色,能将视频变互动学习 App,推理速度提升。对标 GPT - 4.1 等,性价比高、表现优,获开发者好评。

AI进修生
算法论文8

BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026

BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
开源动态8

银河通用LDA定义全域数据利用范式,跨本体世界动作大模型开启具身GPT-2时刻

当下具身智能赛道两大流派各有短板,银河通用推出跨本体「隐式世界 - 动作基础模型」LDA - 1B,走自研WAM路线,成果已开源。它打破数据割裂难题,解锁具身智能「GPT - 2时刻」,在多方面展现优势。

量子位
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
产品应用7

当Sora2遇上国产 Vidu Q2,国产参考生真的更香了!一手亲测

国庆假期Sora 2吸睛,其客串功能将它拉到“AI版抖音”高度。但Vidu去年9月就提出【参考生】视频功能,Vidu Q2已是第5个迭代版本。文章对Vidu Q2参考生视频和Sora 2从一致性、物理规律遵循、运镜等维度进行PK。

量子位
算法论文8

AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026

上海交通大学等团队构建v-HUB评测基准,分析多模态大模型视频幽默理解能力。评测7个前沿模型发现,模型依赖文字、主动发现笑点能力弱,声音作用有限,还需考虑隐形线索。

AI科技评论
开源动态8

Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!

Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式生成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。

开源星探