「实时视频世界模型」共找到 2017 篇相关文章
用3D几何先验驱动视频扩散,实现更一致的世界生成
视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。
Vidu Q2的参考生视频,是AI视频多参党的胜利。
作者分享使用Vidu Q2多图参考生视频的体验,认为它是AI视频多参党的胜利,是新工作流范式。Q2在一致性、表演能力和多风格表现力上大幅进化,价格实惠,还推出APP,多图参考生视频未来可期。
微软推出深度视频探索智能体,登顶多个长视频理解基准
尽管LLMs和VLMs在视频分析和长语境处理有进展,但处理数小时长视频有局限。微软提出智能体Deep Video Discovery (DVD),以简洁框架在LVBench取得高准确率,将以MCP Server形式开源。
视频生成比播放还快:开源VDN-H3,14秒视频11秒搞定
近期,网络出现“无限流”视频,源于MiniMax H3。OpenVDN团队开源Video Delta Net(VDN),基于MiniMax H3使视频生成速度提升75到90倍,14.4秒的768p视频11.23秒就能生成。它采用混合思路,性能提升显著。
ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。
ElevenLabs推出“视频到音乐”功能,其“Eleven Music”模型能分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还能添加画外音和音效,为创作者提供端到端音视频解决方案。
物理引擎 + 视频生成!输入一张图,让AI演给你看真实物理世界
WonderPlay将物理仿真与视频生成结合,从单张图像生成动态3D场景。它引入混合生成模拟器,形成物理求解器与视频生成器闭环。与其他方法对比,WonderPlay在多种场景和材质下表现更优。
米哈游蔡浩宇AI公司首个视频模型曝光了
米哈游蔡浩宇的AI公司Anuttacon首个视频模型LPM 1.0曝光。它可通过多模态形式生成动态角色,有超绝情绪演绎、实时视频生成等能力,背后技术架构复杂,目前未正式上线。
Claude 终于能“看”视频了!这个开源项目让我刷视频效率翻倍
平时找视频信息效率低,而开源项目让Claude等大模型 “看懂” 视频,能提取画面、音频并理解内容。介绍了其工作原理、帧预算、去重、细节模式等,安装使用门槛低,还给出了应用场景和项目地址。
机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路
UC Berkeley团队提出端到端流程,跑通从网络视频生成真实灵巧手实机执行轨迹链路。解决了单目RGB视频手-物交互重建、带噪声参考轨迹动作重定向及遥操作规模化难题。还给出数据筛选要点。
直播预约 | 世界模型,点燃下一个AI爆点(第二期)
本周三‘世界模型’沙龙反响热烈,决定加场。4月23日19:00 - 20:30,机器之心集结4位专家探讨世界模型前沿话题,包括刘子纬、赵行、贾奎、刘桂良,直播在机器之心视频号进行。