图像和视频换脸」共找到 7588 篇相关文章

新闻资讯7

The Batch: 938 | Gemini 的音乐生成器

Google将音乐生成器Lyria 3加入GeminiYouTube,它接收文本或图像生成30秒音频,支持多语言歌词。在质量遵循提示上优于前身,采取版权保护措施,对特定用户免费或提供高额度使用。

DeeplearningAI
7

AI Video Is Eating The World,创作者、创业者的机会在哪?

AI视频生成虽仍有技术问题,但已重塑短视频创作生态,衍生出新的内容商业化模式。a16z合伙人分享创作经验、变现方式与创业机会,还提到爆款公式、成本挑战及不同平台内容特点。

Founder Park
开源动态8

群核科技开源两款空间大模型,想解决 Genie3 没能彻底解决的问题

2025年8月25日群核科技举办TechDay,发布专注3D室内场景的空间大模型,开源SpatialLM 1.5SpatialGen。两款模型分别解决理解交互空间一致性问题,有实际应用价值,还介绍了数据飞轮效应及模型相关问答。

Founder Park
新闻资讯8

画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军

CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。在NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。

腾讯技术工程
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式适用任务。

量子位
开源动态8

Qwen新开源,把AI生图里的文字SOTA拉爆了

通义模型家族新开源图像生成模型Qwen - Image,是通义千问系列首个图像生成基础模型。实测其对提示词理解到位,文字渲染高保真。它具备复杂文本渲染、一致性图像编辑能力,在多基准测试达SOTA。

量子位
产品应用8

拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景

昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。

量子位
开源动态8

重磅开源!240亿参数力压Nano Banana 2

4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商具身智能场景极具价值。

新智元
算法论文7

好玩!AI模仿人类‘空像错觉’,开启想象力之旅

越南国立大学提出Shape2Animal框架,模仿人类‘空想性错觉’,将自然物体轮廓转化为动物图像。该框架经多阶段流程,结合多种技术生成画面,但也继承了基础模型的一些局限性。

带你学AI
产品应用8

可灵 2.1 首尾帧藏师傅外挂教程:两张图→大片,附万能提示词

作者分享可灵 2.1 首尾帧模型测试与使用教程,解决图片提示词生成难题。介绍三种拿图法,给出 AI 生成提示词方法及原则,还指出可将流程固化、特效升维,提升视频创作效率与价值。

歸藏的AI工具箱