扩散图像生成」共找到 2479 篇相关文章

产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。

新智元
推荐文章8

LLM-based Agent的代码生成综述

这篇2025年的综述指出,传统代码生成技术难完成复杂开发任务,而基于大语言模型(LLM)的代码生成代理应运而生。它把LLM作为“大脑”,具备自主规划等能力。文章梳理了该领域的核心特征、技术体系、应用实践等,也剖析了挑战与未来方向。

深度学习自然语言处理
算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
算法论文8

用子模优化法为DeepResearch生成多样性查询

开发DeepResearch时,生成多样化查询是关键。多数开源项目处理方法粗放,本文提出结合句向量与子模优化的方法,设计子模目标函数,给出代码实现,实验显示该方法生成的查询组合多样性更高。

Jina AI
开源动态8

Z-Image标准版开源:更具可塑性的图像生成全能基座

Z-Image标准版开源,它是为开发者准备的强大画板,解决了生成模型同质化问题。其保留完整权重,在微调、风格化上潜力大,采用创新架构,训练定位SFT阶段,有完整CFG支持,还提供完善工具链。

AIGC开放社区
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
新闻资讯7

冲击自回归,扩散模型正在改写下一代通用模型范式

Google I/O 2025 开发者大会上,Gemini Diffusion 引发关注,它是采用扩散模型的语言模型。此前已有团队探索扩散式 LLM,如斯坦福、上海 AI 实验室等。蚂蚁集团和人大推出 LLaDA,后发展出多模态模型,国内团队跻身前列。

机器之心
产品应用8

太强了 Yan!腾讯打造的全能交互视频生成引擎

腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。

带你学AI
算法论文8

JustGRPO:扩散语言模型的极简主义回归

本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。

机器之心
开源动态7

OVI:统一的音视频生成模型,声音与画面同步诞生

音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。

带你学AI