「扩散Transformer」共找到 462 篇相关文章
拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式
使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。
谷歌创始人罕见反思:低估 Transformer,也低估了 AI 编程的风险,“代码错了,代价更高”
谷歌创始人 Sergey Brin 在斯坦福公开对话中反思,谷歌曾低估 Transformer 和 AI 编程风险。他认为 AI 写代码易出错,更适合创意类工作。还回顾谷歌发展,指出虽有研发积累,但曾投入不足,强调算法比算力更关键。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
融资 1200亿后 Kimi 再扔王牌,新架构爆改 Transformer 老配件,比 DeepSeek 同款还省钱
Kimi 发布新论文,提出“注意力残差”架构改进 Transformer 残差连接,解决“稀释问题”,让 AI 更聪明、更省钱,还推出“分块注意力残差”优化成本。与 DeepSeek 方案对比,Kimi 方案性价比更高。
JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略
浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。
AAAI|东方理工陈云天等:教会视频扩散模型“理解科学现象”,从初始帧生成整个物理演化
东方理工陈云天等团队在论文中提出让视频扩散模型学习“潜在科学知识”的框架,方法分三步,在流体和台风数据实验中表现超主流方法,展示生成式AI在科学建模的探索。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
Transformers来到了v5时代:从工具包到真理之源,AI时代的操作系统内核的极简进化论
Transformers v5发布,通过极简定义和极致互通成AI生态核心。它做减法重构代码、拓展训练流程、成推理引擎弹药库、提升量化为核心功能,连接训练、推理与部署,是AI生态通用语言。
何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升
何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。