图像与视频合成」共找到 1503 篇相关文章

算法论文8

X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA

中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。

机器之心
新闻资讯8

让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间

谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。

量子位
算法论文7

TransDiff--最简洁的AR Transformer + Diffusion图像生成方法

文章分享图像生成新方法TransDiff,它结合AR Transformer与Diffusion,提出MRAR范式。通过Q&A解答其使用Transformer原因、小Diffusion Deocder效果等问题,还指出它有连续帧生成潜力,将用于视频生成。

PaperAgent
开源动态8

最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频

今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。

量子位
算法论文8

从「找视频」到「产视频」:快手RaG推动推荐系统迈向完全生成时代

快手最新论文提出的 Recommendation-as-Generation(RaG),把推荐系统从「在已有视频里找答案」推进到「根据用户兴趣生成答案」,已在快手大规模广告系统中部署,带来广告收入提升。

机器之心
产品应用8

Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标

谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。

Founder Park
算法论文8

ICCV 2025 | 小红书AIGC团队提出图像视频换脸新算法DynamicFace

小红书AIGC团队提出图像视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。

机器之心
新闻资讯7

CVPR 2025 Tutorial:从视频生成到世界模型 | MMLab@NTU团队&快手可灵等联合呈现

图像生成普及,视频生成也有高质量发展,可灵、Sora等模型不断拓宽边界。CVPR 2025 Tutorial将探讨视频生成能否成世界模型桥梁、具身智能核心能力等问题,汇聚一线研究者分享。

量子位
产品应用7

480P的元宇宙入口:Midjourney不是在做视频,是在造"任意门"

Midjourney发布首个视频模型Video V1,它只能图生视频,操作便捷。虽分辨率仅480P,但采样率高。生成成本低,会员就能用。其美学表现好、生成速度快,不过在提示词理解等方面较弱。该公司有独特愿景。

歸藏的AI工具箱
开源动态8

全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品

蚂蚁通用人工智能中心自然语言组联合香港大学自然语言组推出PromptCoT 2.0,押注任务合成。它让30B - A3B模型在数学代码推理任务达SOTA,全面升级效果、数据和方法,还将考虑多方向发展。

量子位