「一步扩散生成模型」共找到 2360 篇相关文章
谢赛宁新作:VAE退役,RAE当立
谢赛宁团队研究表明VAE时代结束,RAE将接力。RAE是用于扩散Transformer训练的新型自动编码器,能提供高质量重建结果,有语义丰富潜空间,支持可扩展架构,收敛快,在ImageNet图像生成效果强劲。
NeurIPS 2025 Spotlight | 只需一条演示,DexFlyWheel框架让机器人学会「自我造数据」
北京大学、哈工大联合 PsiBot 灵初智能提出 DexFlyWheel 框架,仅需单条演示就能自动生成多样化灵巧操作数据,缓解数据稀缺问题,已被 NeurIPS 2025 接受。此框架在成本、效率和数据多样性上优势明显。
干掉延迟!12G显存就能实现实时AI换脸直播,开源免费。
推荐开源项目PersonaLive,它是基于自回归流式扩散技术的实时人像动画生成框架。能平衡画质与低延迟,用一张照片在普通显卡实现数字分身实时驱动,有低显存、无限时长等特点。
UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由
随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。
ICCV 2025 | 小红书AIGC团队提出图像和视频换脸新算法DynamicFace
小红书AIGC团队提出图像和视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。
Gemini 3.5来了!今夜,谷歌亲手淘汰谷歌
谷歌I/O 2026大会火力全开,发布Gemini Omni、3.5 Flash、Spark等新品。Omni可接收任意输入生成视频,3.5 Flash性能强大,Spark是7×24h云端个人AI特工。谷歌多项能力同时到位,撕开了ASI入口。
蚂蚁开源世界模型LingBot-World:具有分钟级记忆的实时世界模拟器
蚂蚁集团旗下灵波科技开源具身智能模型及世界模型LingBot-World,它将视频生成模型进化成可交互世界模拟器,采用多阶段进化策略,有涌现记忆等能力,虽有不足,但为开源社区构建世界模型迈出坚实一步。
5张 H800 带来 20 FPS 高保真实时虚拟人生成
传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。
4步生图封神,GenEval从61%狂拉到92%,全面超越GPT-4o的TDM-R1模型来了
香港科技大学唐靖团队等提出全新通用强化学习框架 TDM - R1,仅 4 步采样就让组合式生成指标 GenEval 从 61% 升至 92%,超越 GPT - 4o。它解决少步扩散模型痛点,实现多方面性能提升,为少步生图发展带来新方向。
百万规模数据集打造人形机器人通用大模型,实现精细动作跨平台、跨形态动作迁移丨北大人大联合发布
北大和人大团队在通用人形机器人动作生成领域取得重大突破,首创通用动作生成框架Being - M0,构建百万规模动作生成数据集MotionLib,研发文本驱动动作生成模型,实现人体动作向多类型人形机器人迁移,文章将发表于ICML2025。