「图像和视频换脸」共找到 7588 篇相关文章
从「找视频」到「产视频」:快手RaG推动推荐系统迈向完全生成时代
快手最新论文提出的 Recommendation-as-Generation(RaG),把推荐系统从「在已有视频里找答案」推进到「根据用户兴趣生成答案」,已在快手大规模广告系统中部署,带来广告收入提升。
“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感
5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率超95%,还发布实时绘画板功能,后续将推原生多模态模型。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
Google发布"Nano Banana"图像生成模型,号称全球第一
Google推出新图像生成和编辑功能,社区称其为‘Nano Banana’,号称‘世界第一’且免费开放。它有风格转换、背景编辑等亮点,用户反馈整体积极,但也存在API限制等问题,与对手有差距也有优势。
Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标
谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。
首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」
UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。
CVPR 2025 Tutorial:从视频生成到世界模型 | MMLab@NTU团队&快手可灵等联合呈现
图像生成普及,视频生成也有高质量发展,可灵、Sora等模型不断拓宽边界。CVPR 2025 Tutorial将探讨视频生成能否成世界模型桥梁、具身智能核心能力等问题,汇聚一线研究者分享。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
机器人「看片」自学新技能:NovaFlow从生成视频中提取动作流,实现零样本操控
布朗大学和机器人与人工智能研究所团队提出 NovaFlow 框架,利用视频生成模型常识知识,让机器人“看片”自学。它将任务理解与控制解耦,通过生成视频提取动作流,实现零样本操控,为通用机器人提供新路径。
突破长视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底
当前AI长视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量长视频稳定生成,效率显著提升。