「扩散强制」共找到 286 篇相关文章
DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!
清华大学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。
"你的同事因没用AI编程被开除了",Coinbase 强制全员上手AI编程,否则开除
Coinbase CEO Brian Armstrong 称,公司为 GitHub Copilot 和 Cursor 买企业版许可后,拒绝尝试这些工具的员工被解雇。他强调 AI 非可选,是核心竞争力,公司目标是 9 月底让 AI 写 50% 代码。
OpenAI强制「处死」GPT-4o!80万老粉全网拯救:它不是代码是爱人
1月29日OpenAI官宣2月13日强制退役GPT - 4o,80万粉丝不满,发起“拯救4o”运动,提出缓冲期短、保留访问权等诉求,还指出模型停用影响订阅价值。此前GPT - 4o就曾面临下线危机,其使用也有安全隐患。
CVPR 2025 Oral | DiffFNO:傅里叶神经算子助力扩散,开启任意尺度超分辨率新篇章
本文由圣路易斯华盛顿大学与北京大学联合完成,提出DiffFNO以神经算子赋能扩散架构,支持高质、高效、任意连续倍率超分,介绍其核心思路、组件及优势,在多数据集上领先SOTA方法,为超分提供新思路,适用于多领域。
图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理
华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。
比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临
近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。
Qwen3-ASR开源:够稳定,能流式,多语言!
今日正式开源Qwen3-ASR系列模型,含两个语音识别与一个语音强制对齐模型,支持多语种。依托创新技术实现精准稳定识别,1.7B模型多场景达SOTA,0.6B兼顾性能效率,强制对齐模型精度超传统模型。
CVPR 2026新规:强制披露算力成本,高效率、高透明度论文可获三项认可奖
CVPR2026出台‘计算资源报告表(CRF)’试点计划,要求论文作者报告研究中使用的计算资源,提交报告不影响论文接收决策,展示出色计算效率和透明度的论文可获认可奖项。
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出
何恺明团队提出新方法Pixel Mean Flow(pMF),突破传统扩散模型/流模型限制,砍掉多步采样和潜空间,一步在像素空间生成图像,在ImageNet不同分辨率上取得佳成绩,还介绍了核心设计、实验结果对比等。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。