「音视频处理」共找到 1876 篇相关文章
Sora2不够香了!这款国产AI视频模型已经能边看边生成,生成快还互动佳
国内AI视频玩家弯道超车,百度蒸汽机(文心专精版)开卷实时流式生成。它能边看边生成,生成快还互动佳,实现生成迅速、实时交互、无限续写,重新定义AI视频生成领域。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
仅看视频就能copy人类动作,宇树G1分分钟掌握100+,UC伯克利提出机器人训练新方式
UC伯克利团队研发出名为VideoMimic的新系统,能将视频动作迁移到真实机器人。它已让宇树G1模仿100多段人类动作,还能适应各种地形。其工作流程含视频转仿真、仿真训练策略、策略迁移到实体机器人。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。
10秒视频token超5万,O(n²)跑不动?用后训练线性化框架实现1.71倍加速,推理成本大降|CVPR'2026
视频生成进入大规模时代,但计算成本高,自注意力复杂度O(n²)跑不动。研究团队提出LINVIDEO后训练框架,无需数据和重新预训练,实现视频扩散模型线性化替换,保持生成质量,加速推理并降低成本。
阿里开源14B电影级视频模型!实测来了:免费可玩,单次生成时长可达分钟级
昨夜阿里发布14B视频模型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该模型发布即开源,可在通义万相官网免费体验,单次生成时长可达分钟级。
无需NeRF/高斯点后处理,视频秒变游戏模型成现实!新方法平均每帧仅需60秒 | ICCV 2025
KAUST团队提出全新方法V2M4,能从单目视频直接生成高质量、显式的4D网格动画资源。该方法构建多阶段流程,涵盖相机轨迹恢复等关键步骤,平均每帧约60秒,比现有方法显著提速,论文已被ICCV 2025接收。
NVIDIA 推出Rubin CPX,专为AI推理设计的GPU
NVIDIA发布专为大规模上下文AI推理设计的Rubin CPX GPU,性能提升显著,集成视频编解码器和长文本推理处理。新平台算力强,适用于代码生成与视频处理,多家公司将采用,2026年底上市。
AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型
火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。