「图像与视频合成」共找到 1504 篇相关文章
长视频AI数字人来了!字节×浙大推出商用级音频驱动数字人模型InfinityHuman
随着内容创作智能化需求爆发,长时长、高质量数字人视频生成是痛点。字节跳动联合浙大推出商用级模型InfinityHuman,打破传统技术局限,解决身份漂移和细节失真难题,已实现多场景商用。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
NeurIPS 2025 Spotlight | 你刷到的视频是真的么?用物理规律拆穿Sora谎言
随着生成式AI发展,合成视频以假乱真,现有检测方法难泛化。本文介绍发表于NeurIPS 2025的文章,提出NSG统计量和NSG - VD检测方法,对未知生成范式检测效果好,实验表现超越现有方法。
真碾压Sora了!谷歌Veo 3首次实现音画同步,视频模型直接「开口说话」
谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时长和使用门槛限制,但已足够震撼。
AI 视频生成的未来在中国
当地时间3月24日,OpenAI宣布关闭视频生成应用Sora,这是其冲刺IPO前的战略调整。Sora曾是AI视频生成领域明星产品,性能卓越,但因内容生态缺失、商业变现难而关停。中国AI视频生成赛道崛起,应用场景丰富,形成生态壁垒。
阿里电影级视频模型万相2.6系列上线,功能比Sora2还全,人人都能当导演
12月16日,阿里发布通义万相2.6系列模型,5款新模型同时上线,覆盖图像到视频多环节。它是国内首个支持角色扮演的视频模型,功能比Sora2全,已上线阿里云百炼和万相官网。
nano-banana已登陆AI studio 和 Gemini ?果真是谷歌的gemini-2.5-flash图像预览版。。
作者分享玩AI视频创作的经历,介绍神秘AI图像生成和编辑模型Nano - Banana,它在LMArena平台出现,被猜测与谷歌新一代图像模型相关,功能出色。还体验了谷歌aistudio更新的gemini - 2.5 - flash - image - preview,认为其不如nano - banana。
Codex+hyperframe做视频,让剪辑师们慌了?
开源项目Hyperframes刷屏,它是基于HTML的视频渲染框架,不用视频大模型,用普通语言模型就能生成可控视频。它与Remotion有区别,选了对AI友好的路,还介绍了安装、使用方法和适用场景。
AI 视频制作也接近了 GPT 时刻
AI产品有可用性易用性临界点,跨过该点即GPT时刻。纳米AI让AI视频接近此时刻,普通人用简单提示词就能做视频,其超级搜索基于多智能体架构,像小视频团队分工工作。
LibTV这个邪修功能,大大减少AI视频抽卡次数!
作者分享在LibTV用「深度动作捕捉」功能做AI视频,将视频动作提取成深度图,可减少AI视频生成失败率,且不花积分,深度图管几何,提示词管外观,提一次能用多次。