「超长视频理解」共找到 1684 篇相关文章
火了!刚刚,李飞飞2篇最新文章发布!
AI圈近期被李飞飞两篇重磅文章刷屏,一篇阐述空间智能愿景,指出当前AI缺乏空间智能,其创办的World Labs提出世界模型;另一篇论文揭示当前视频理解基准自欺欺人,还提出新基准VSI - SUPER及预测性感知新范式。
Runway深夜炸场:一口气发布5大更新,首个通用世界模型来了
主攻AI视频与多媒体生成技术的独角兽Runway发布5大更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。
CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模
计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。
SkyReels-Audio让嘴型和音频完美匹配不再难
音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。
LeCun 对线 DeepMind:LLM 永远造不出机器人水管工
图灵奖得主 Yann LeCun 和 Google DeepMind 的 Adam Brown 就 LLM 是否真正理解世界展开争论。LeCun 认为 LLM 虽在符号操作领域出色,但难理解物理世界;Adam Brown 则觉得 LLM 正涌现对宇宙的真正理解。
这是我花9毛钱拍的《Meta老板砸钱把我从苹果挖走》
国产AI开启新Level,生数科技的Vidu Q1参考生视频功能,9毛钱+4张图就能生成视频。它重新定义叙事,砍分镜、拍摄等流程;有业内最强一致性;价格低,让AI视频生成“快、好、省”。
比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎
谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。
当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?
在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。
ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理
现有视频虚拟试衣方法受限于固定相机视角,难以满足用户自由观察需求。本文提出 TryOnCrafter 框架,定义可控相机视频虚拟试衣任务,引入可渲染 4D 试衣代理,支持多种下游应用,为虚拟试衣开辟新路径。