「视频推理数据集」共找到 4900 篇相关文章
更快更省!Vidu Q3硬核升级打响AI视频普惠第一枪 | 甲子光年
2026年AI视频行业内容产出增长迅猛,但成本上涨、生成慢等问题凸显。生数科技的Vidu Q3模型全面升级,生成速度提升5倍、价格降低,适配多场景,为AI视频普惠工业化提供范例。
AI视频进入“加速度”时代:30%加速+细节随手P,等等党和抽卡党都有救了!
AI视频进入“加速度”时代,拍我AI(PixVerse)V5 Fast上线。其生成速度提升超30%,还推出Modify精修功能,支持万物替换、局部修改、人物编辑等,让AI视频从一次性生成走向可反复打磨。
视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理
谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。
单卡4090也能高质量视频编辑!西湖AGI Lab无训练框架FlowDirector来了
视频编辑门槛高、现有方法开销大且效果不佳。西湖大学AGI Lab团队提出无需训练的FlowDirector框架,可将基于流的视频生成模型改造成编辑工具,质量高、功能广、开销低,解决了时序、结构和编辑幅度问题。
上海AI Lab、浙大EagleLab等提出RRVF:利用「验证非对称性」,只输入图片学习视觉推理
上海AI Lab、浙大EagleLab等联合完成研究,提出RRVF框架,利用「验证非对称性」,仅输入图片学习视觉推理。它构建闭环系统,通过迭代推理、视觉反馈等步骤训练模型,实验显示效果佳,证明验证法则力量。
CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分
Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。
10人团队千万融资,这个原生AI产品要做“人人可用的数据Agent”丨对话ChatExcel
ChatExcel是国内首款原生AI DataAgent,专注自然语言对话处理分析数据。其不到10人团队获近千万融资,定位平民化数据产品,核心是多模型结合,已近百万用户,正拓展海外市场。
为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本
近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。
马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一
实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达端到端终局的新路径。
统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解
港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。