「图扩散架构」共找到 2260 篇相关文章
用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架
张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。
网络顶会获奖!华为提出端网协同RDMA传输架构,解决大规模AI集群网络可扩展性问题
全球网络通信顶会 ACM SIGCOMM 2025 落幕,华为与港科大合作的 DCP 研究成果获奖。该论文提出数控分离传输架构 DCP,解决大规模 AI 集群网络可扩展性难题,实验显示其性能优于现有 RDMA 方案。
拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景
昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。
三重Reward驱动的运维智能体进化:多智能体、上下文工程与强化学习的融合实践
文章阐述了AI原生时代下,面向技术风险领域的智能体系统(DeRisk)的架构设计、核心理念等。介绍运维智能体发展现状,提出其技术演进需找三类Reward,还介绍相关概念、DeRisk架构,给出实践案例并将开源技术产品。
智谱新模型也用DeepSeek的MLA,苹果M5就能跑
智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。
一张图生成「能动」的3D资产:VAST+香港大学AniGen把AIGC推向动画、游戏、仿真与具身智能 (SIGGRAPH 2026 TOG)
SIGGRAPH 2026论文AniGen,由VAST和香港大学研究,能从单张图片直接生成带骨架与蒙皮权重的可动画3D资产。它解决了现有方法的不足,在多方面表现出色,对多个领域意义重大。
AI在实时视频里秒“剪”出你想要的部分!输入文字/图/视频片段,它都能秒懂|ICCV2025
最新混合模态在线视频定位技术OVG - HQ开挂了!它能根据文字、图、视频片段等线索,在实时视频流中精准裁剪出关心的事件,已收录于ICCV2025,破局以往技术“离线”“词穷”缺陷。
探索 GPU 加速向量检索:NVDIA Cagra 在微信大规模推荐系统中的应用实践
本文分享腾讯团队将 Cagra GPU 图索引大规模应用于微信核心线上推荐业务的实践。介绍 Cagra 算法原理与优势,讲述线上化改造、架构演进、CPU/GPU 协同优化等,展示业务落地显著收益。
2026 AI Memory最新综述:从理论到实战,一文读懂AI记忆的进化全景
2026年北邮百家MemoryOS团队联合华为发表《Survey on AI Memory》,涵盖AI记忆理论基础、4W分类体系、单/多智能体架构、评估方法与前沿趋势,梳理详尽全景图,还剖析未来挑战与方向。