图扩散架构」共找到 2260 篇相关文章

开源动态8

LTX-2开源:首个能同时生成视频和音频的模型

LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。

AI工程化
产品应用8

Qwen-lmage-Layered:片分层 指哪改哪

全新像生成模型Qwen-lmage-Layered采用自研架构,将片“拆解”成多个层,各层可独立操作。其提出新编辑思路,有RGBA - VAE等亮点,支持灵活迭代分解,能实现精准高效的像编辑。

通义千问Qwen
开源动态8

终于用上啦,3.9 万 Star archify,程序员福音!!!!

架构常与代码脱节,约3.9万Star的archify让Agent先把代码库或系统描述写成带类型的JSON,经布局、检查后交付可交互系统地,它先结构化、验证再交付,适用于特定场景。

小华同学ai
算法论文8

NIPS2025|小红书智创AIGC团队提出布局控制生成新算法InstanceAssemble

当下文本生成扩散模型有进展,但现有布局到像生成方法在复杂场景表现不佳。小红书智创AIGC团队提出InstanceAssemble框架,从架构和评测应对难题,实现复杂布局下精确像生成,有广阔应用潜力。

机器之心
算法论文8

ICCV 2025 | 小红书AIGC团队提出像和视频换脸新算法DynamicFace

小红书AIGC团队提出像和视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。

机器之心
算法论文8

DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了

DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。

机器之心
开源动态8

Qwen3.8-Flash-Next:SGLang Day-0 支持

2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8-Flash-Next,是Qwen4架构早期预览版。SGLang在发布首日提供完整支持,模型架构多方面升级,亮点众多,还介绍各组件优化及PLE架构与卸载优势。

GiantPandaLLM
产品应用8

TDSQL Boundless:AI时代的多模态数据库

在AI与数据分析处理技术融合的当下,传统数据库架构面临诸多挑战。腾讯云TDSQL Boundless推出,通过统一架构处理多模态数据。本文从核心架构、关键技术特性及对未来数据平台建设的启示三方面解读。

InfoQ
算法论文8

Graph工程的尽头是,Ontology工程

15家机构联合发布工程系统性综述,指出此前“XX工程”范式多优化单个智能体,而工程能将智能提升到系统层面。论文还指出工程语义局限,认为本体工程可作下一代系统智能语义地基。

PaperAgent
新闻资讯7

MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer

MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。

Founder Park