「实时视频世界模型」共找到 2017 篇相关文章
豆包19亿次互动背后的技术真相:春晚级体验是如何炼成的?
2026 年春晚 AI 元素亮眼,豆包 AI 互动达 19 亿次。火山引擎作为独家 AI 云合作伙伴,用智能视频云等技术打造节目效果,解决视频画质、空间逻辑、机器人互动延迟等难题,还保障全民互动和实时字幕。
LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!
Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。
三位AI殿堂级人物罕见同框:LeCun、李飞飞、谢赛宁团队用空间超感知让AI像人一样理解三维世界
谢赛宁团队联合杨立昆、李飞飞发布Cambrian - S研究,提出空间超感知概念,指出现有AI视频理解或被高估,推出VSI - SUPER基准测试,虽Cambrian - S模型有提升但仍有局限,预测性感知或成新范式。
生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收
现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。
被“网暴”两个月后,Yann LeCun 携最新世界模型杀回!小扎千万美元激励抢人,Meta AI 内部权利之争开始
Meta推出新的“世界模型”V-JEPA 2,可提升AI物理推理能力。它是V-JEPA扩展版,在百万小时视频上训练,能让机器人完成任务。Meta还发布三项基准测试,且已开源。LeCun力挺,小扎为追进度亲自招人才。
AI 互动游戏的 GPT 时刻到了!谷歌Genie 3首测!太牛了!
谷歌去年发布世界模型Genie 3,支持实时生成可交互视频内容,因成本高未开放。现美国18岁以上Ultra用户可试玩,其操控延迟低、画面清晰、物理交互真实,还介绍了操作流程等。
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
73%人类认同率!Video-Bench实现视频质量精准打分
上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。
并行扩散架构突破极限,实现5分钟AI视频生成,「叫板」OpenAI与谷歌?
近日,CraftStory 推出 Model 2.0 视频生成系统,凭借并行扩散架构破解视频时长难题,可生成长达五分钟视频。其由 OpenCV 创建者 Victor Erukhimov 创立,此次突破或为企业带来商业价值,还计划开发新模型。
RF-DETR-首个突破60 AP的实时检测器(附实战教程)
RF-DETR在COCO数据集上,实时检测精度首破60 mAP,兼顾实时性与高精度。它通过NAS找到Transformer实时运行的‘最优解’,迭代快,适用于多场景,还给出完整实战教程。