「视频生成技术」共找到 5005 篇相关文章
从科学论文自动生成视频
该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。
清华系DeepSeek时刻来了,硅谷沸腾!单卡200倍加速,视频进入秒级时代
清华大学TSAIL实验室与生数科技开源视频生成加速框架TurboDiffusion,引发全球AI社区热议。它能在几乎不影响生成质量的前提下,让视频生成速度飙升100 - 200倍,将AI视频带入实时生成时代。
Code2Video:代码驱动、智能体协同、精准可控的教学视频生成
新加坡国立大学 ShowLab 团队提出 Code2Video,一种基于代码驱动的视频生成新范式。它以可执行代码为媒介,结合三智能体协同框架,解决了现有文生视频方法在教育场景的不足,在美学和教学效果指标上有明显提升。
根据 YouTube 视频生成 Blog 文章的提示词
文章给出根据YouTube视频生成Blog文章的提示词,涵盖核心创作原则、文章生成流程与要求、全局风格与限制等,指导创作者将视频内容转化为优质博客文章。
腾讯开源Stand-In!轻量级身份保留视频生成新突破
生成符合指定身份的高保真视频挑战大,现有方法依赖大参数且兼容性不足。腾讯开源轻量级、即插即用的Stand - In框架,在身份保留文本生成视频任务中性能先进,兼容性强,有广阔应用潜力。
OVI:统一的音视频生成模型,声音与画面同步诞生
音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。
Vidu Q3:「参考生」之王,让视频生成走向工业化量产时代
Vidu Q3 上线「参考生」功能,解决 AI 视频生成结果不可控问题。其画面参考范围扩大,特效、音效提升显著,还优化特定场景,接入企业级能力,让 AI 视频从创意验证走向实际生产。
手机上实现AI视频实时生成,DiT模型上移动端
扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。
OpenAI版抖音要来了!Sora 2加持,只能发AI生成视频
OpenAI正为视频生成模型Sora 2推独立社交应用,形态似TikTok,内容须AI生成,不可上传外部媒体。有独特身份验证功能,已内部测试获积极反馈,将与Meta、Google、TikTok竞争。
用3D几何先验驱动视频扩散,实现更一致的世界生成
视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。