视频时长预测」共找到 1950 篇相关文章

算法论文8

苹果新作:内化视觉思考,推理提速 5 倍

Apple研究团队提出Internalized Visual Thinking(IVT),一种将预测性世界建模能力内化到模型表征中的后训练框架。它在训练预测未来,推理直接回答,相比Visual CoT推理提速超5倍。

机器之心
算法论文8

从「找视频」到「产视频」:快手RaG推动推荐系统迈向完全生成

快手最新论文提出的 Recommendation-as-Generation(RaG),把推荐系统从「在已有视频里找答案」推进到「根据用户兴趣生成答案」,已在快手大规模广告系统中部署,带来广告收入提升。

机器之心
推荐文章7

不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine

UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。

量子位
产品应用8

一个全新的世界模型,终于让AI视频进入了“无限流”代。

AI视频公司PixVerse推出实世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉视频会自行延续。该模型为世界模型补上实视频生成方向,实测体验乐趣十足。

数字生命卡兹克
算法论文8

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。

机器之心
产品应用7

谷歌 AI Studio 实视频对话终于支持中文了!屏幕共享+语音,Gemini 2.5 Flash 原生音视频加持。

谷歌AI Studio实视频对话支持中文,有Gemini 2.5 Flash原生视频对话模型。使用方便,还提供多种音色,有让模型在无声发音视频等功能,可用于设计、学习、修电脑等场景。

AI进修生
开源动态7

视频搜索像聊天一样简单!本地也能跑的视频语义搜索工具

SentrySearch是基于语义的视频搜索工具,输入文字描述就能从视频中找到对应片段并剪辑成短视频。它可借助Google Gemini Embedding API或本地Qwen3 - VL模型,还适配特斯拉行车记录仪,能叠加车速等信息。

GitHubStore
产品应用8

Google Omni首发「AI视频编辑」功能,AI视频的下一种形态终于来了!

Google Omni首发全模态AI视频编辑功能,是继Banana后AI圈重大技术进步。它能改变视频内容、重绘风格、多轮修改,支持全模态输入,精通物理概念,让AI视频更逼真。

开源AI项目落地
算法论文8

用155万模拟视频给模型上课!GVE模型一次学会9种视频检索技能

当前视频检索研究陷入困境,现有模型难以应对复杂检索需求。香港科技大学(广州)联合阿里巴巴通义实验室推出通用视频嵌入模型GVE,其在零样本设置下超越14个主流模型,全链条创新为视频检索通用化奠定基础。

量子位
开源动态8

国产AI视频炸了!SkyReels-V3三大功能重磅开源,1张图生成逼真视频

昆仑天工SkyworkAI团队开源多模态视频生成模型SkyReels-V3,它能在一个架构内搞定参考图像转视频视频延长、音频驱动虚拟形象三大核心能力,超越主流商业模型,且真正开源。

新智元