图像转视频」共找到 1433 篇相关文章

产品应用7

实测惊艳全球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心
开源动态8

一夜颠覆Sora神话,H200单卡5秒出片!全华人团队开源AI引爆视频

UCSD等机构发布FastWan系模型,用「稀疏蒸馏」训练方案,让视频去噪速度飙升70倍。FastWan在单张H200上5秒生成480p视频,模型权重等全开源,改写AI视频生成格局。

新智元
开源动态8

GitHub爆款神器 | IOPaint:21.7k star 开源AI图像修复项目,竟能秒删水印、拓展画幅!

IOPaint 是 Sanster 团队出品的开源图像处理工具,集 SOTA AI 模型于一体,支持图像擦除、对象替换等功能,还支持多平台部署,能解决旅游照、电商图等处理痛点。

小华同学ai
算法论文8

ICCV 2025|训练太复杂?对图片语义、布局要求太高?图像morphing终于一步到位

图像处理中‘图像morphing’常见又有创意,但以往技术有训练复杂等问题。南洋理工大学等团队提出FreeMorph方法,无需训练实现图像变形,通过改进注意力机制解决特征丢失和过渡不连贯问题,实验效果佳。

机器之心
开源动态8

HeyGen 开源了一个"用 HTML 写视频"的框架,我研究了一下,发现事情没那么简单

HeyGen 开源了 Hyperframes 项目,可让 AI 用 HTML 写视频。文章从其定义、上手教程、竞品对比等方面展开,指出它虽有短板,但代表视频制作新范式,建议相关从业者关注尝试。

AI Reading Hub
开源动态8

阿里开源电影级AI视频模型!MoE架构,5B版本消费级显卡可跑

阿里开源新一代视频生成模型通义万相Wan2.2,含文生视频等功能。它率先将MoE架构用于视频生成扩散模型,5B版本可在消费级显卡部署。对比前代和Sora表现更优,还推出电影级美学控制系统。

量子位
产品应用8

首个接入GPT-5的视频Agent!一句话生成商业级广告大片,分镜配音字幕等全包了

AI视频生成进入Agent时代,Video Ocean是首个接入GPT - 5的视频Agent,输入提示词就能自动完成分镜、画面等生成爆款视频。它有自动化创作生态系统,操作简单,新手也能上手。

量子位
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。

PaperAgent
开源动态8

一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成

新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。

AIGC开放社区
开源动态8

SOTA级视频编辑新方法:无需训练一句话编辑视频,背景保持100%

传统视频编辑工作流被AI重塑,但现有AI方法存在问题,多源于反演 - 编辑范式。西湖大学AGILab提出无需反演和训练的FlowDirector,开销低、支持广且能100%保持背景,还采用新策略优化。

量子位