「扩散图像生成」共找到 2479 篇相关文章
「香蕉革命」首揭秘!谷歌疯狂工程师死磕文字渲染,竟意外炼出最强模型
谷歌最新图像模型nano banana横空出世,能融合图片、理解地理等结构,实现多轮创作。它凭借Gemini知识与交错生成技术,重塑AI图像生成边界。谷歌团队揭秘其技术,还谈及未来发展方向。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
AI视频生成走向“演技生成”时代,生数科技Vidu全球发布Vidu Q2 | 甲子光年
9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,实现从“视频生成”到“演技生成”跨越。它在表情生成、运镜、语义理解、时长选择等方面有提升,分闪电和大片模式,已在多端上线。
SFT+RL双管齐下:ReasonGen-R1如何破解文生图「指令不遵」难题?
上海科技大学等机构提出 ReasonGen-R1 框架,结合链式推理监督微调与强化学习,提升自回归图像生成模型推理和创作能力,已全面开源。介绍了其训练阶段、实验结果及推理链模式。
任意图像+视频=无限创意!港科大BiCo:AI视频进入组合时代,随意换角
BiCo是创新AI视觉内容生成方法,能灵活组合图像和视频视觉概念实现可控编辑。它解决现有方法在概念提取和组合上的问题,在多方面表现优异,可用于视频制作、艺术创作等领域。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
国产AI视频炸了!SkyReels-V3三大功能重磅开源,1张图生成逼真视频
昆仑天工SkyworkAI团队开源多模态视频生成模型SkyReels-V3,它能在一个架构内搞定参考图像转视频、视频延长、音频驱动虚拟形象三大核心能力,超越主流商业模型,且真正开源。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。
无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention
高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。