「视频质量」共找到 1524 篇相关文章
周杰伦发的1400万人点赞的AI视频,是怎么做出来的?
周杰伦抖音首条1400多万点赞的AI视频,将其人生节点与专辑串联,有史诗叙事感。文章介绍用AI视频首尾帧功能制作视频的方法,还举例岳云鹏、《甄嬛传》、科比等,称AI能倒转时空。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。
SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”
北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。
视频生成一长就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是长视频稳定关键
自回归视频生成模型存在训推不一致导致的误差累积问题,使生成视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化生成。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
刚刚,霸榜神秘视频模型身份揭晓,原来它就是「David」
几天前登上Artificial Analysis榜首的神秘视频模型揭晓,是Runway最新发布的Gen - 4.5。它树立行业新标杆,在多方面表现出色,但也存在一些视频模型常见的局限性,Runway正探索解决办法。
全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%
MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。
腾讯胡文博:引领 3D 视频世界模型新趋势丨GAIR 2025
2025年12月12 - 13日,第八届GAIR全球人工智能与机器人大会将在深圳举办。腾讯ARC实验室高级研究员胡文博将在13日《世界模型》论坛分享《迈向三维感知的视频世界模型》。他深耕视频生成模型,成果显著。
Sora没做到的,LongVie框架给解决了,超长视频生成SOTA
视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。