扩散生成模型」共找到 8658 篇相关文章

算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
开源动态8

社区发布丨全面开源!商汤日日新SenseNova U1发布,迈向模型理解生成统一时代

商汤科技正式发布并开源商汤日日新SenseNova U1系列原生理解生成统一模型,基于NEO - unify架构,实现模态集成向原生统一跨越,其轻量版在多项测试达同量级开源SOTA,还能连续性图文创作。

Hugging Face
算法论文8

ICCV 2025 | SeaS: 工业异常生成+正常合成+精准掩码大一统框架,指标全面碾压SOTA

华中科技大学慢工团队提出少样本工业生成模型SeaS,依托U-Net,只需1 - 3张训练样本,单模型同步实现多样异常生成、正常产品合成及精确异常掩码标注,突破现有方法局限,在主流数据集上超越SOTA。

机器之心
开源动态8

GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”

智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。

量子位
开源动态8

混元3D世界模型1.0 lite版本发布,消费级显卡就能跑

腾讯混元3D世界生成模型HunyuanWorld 1.0发布即开源,可在消费级显卡运行,还能兼容传统CG管线。它分层实现3D生成,通过量化等技术降低显存开销,与同类模型相比优势明显。

量子位
开源动态8

不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B

上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。

量子位
开源动态8

GLM-5.1夺开源模型第一,长程任务更稳,一句话就能生成文章短视频

智谱官宣GLM-5.1开源,代码能力增强,在三项代码评测基准综合平均分上,取得全球模型第三、国产及开源模型第一。它专为长程任务设计,能8小时持续工作,还能一句话生成短视频,是平替Claude Sonnet 4.6的优选项。

AI工程化
开源动态8

“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节

复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。

量子位
开源动态8

阿里又上新!开源 7B 文生图模型,专治图中文字,效果媲美 20B+ 大模型

阿里 AIDC - AI 团队开源 7B 参数文生图模型 Ovis - Image,主打图中文字生成。它文本渲染能力强,在权威榜单成绩好,媲美 20B + 大模型,官方还提供使用方法,是设计类刚需模型

开源星探
推荐文章8

多模态大语言模型的核心技术架构与训练方法的进化

文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。

AIGC开放社区