渐进式扩散建模」共找到 534 篇相关文章

开源动态8

谢赛宁等推出统一多模态模型!替代VAE实现图像理解/生成双SOTA,代码权重数据集全开源

谢赛宁等团队推出统一多模态模型Blip3 - o,用扩散Transformer生成CLIP图像特征,采用顺序预训练策略。对比多种设计方案,确定CLIP + Flow Matching最佳,模型在多任务测试表现卓越且全开源。

量子位
新闻资讯8

程序员都在给AI当“监工”!7万多条编程消息揭开当前编程现状

圣母大学和范德堡大学研究团队剖析超7万条编程指令,揭示开发者与AI编程助手协作现状。开发者多当“监工”,工作从敲代码转向指导AI、诊断错误等,还总结出人机协同的诸多规律。

AIGC开放社区
算法论文8

ICDE 2026 | 从匹配困境到推理突破:阿里REG4Rec 激活生成式推荐的个性化潜力

阿里国际智能技术团队提出生成式推荐模型 REG4Rec,从表征学习、训练目标和推理策略层面设计,提升推理能力与稳定性。离线实验表现优,已在 Lazada 部署,带来显著商业收益,成果被 ICDE 2026 接收。

机器之心
算法论文8

40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画

ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4倍训练收敛加速,微调极少参数,在多模型验证效果出色。

量子位
产品应用7

阿里通义发布Z-Image非蒸馏版基础模型版本,支持完整CFG和负向提示

阿里通义发布Z-Image基础图像生成模型,采用单流扩散Transformer架构,具核心创新技术。它是非蒸馏模型,支持完整CFG和负向提示,注重输出多样性和创意控制,已在Hugging Face开放下载。

AI工程化
开源动态7

干掉延迟!12G显存就能实现实时AI换脸直播,开源免费。

推荐开源项目PersonaLive,它是基于自回归流式扩散技术的实时人像动画生成框架。能平衡画质与低延迟,用一张照片在普通显卡实现数字分身实时驱动,有低显存、无限时长等特点。

开源AI项目落地
新闻资讯8

算力十年狂飙100000倍,他却每天担心破产!黄仁勋亲述:如何用“30天危机感”逆袭万亿AI市场

英伟达推出 CUDA Toolkit 13.1,带来 Tile 编程等多项变革。CEO 黄仁勋有强烈危机感,回顾创业阶段。访谈中他谈 AI 发展、意识、工作影响等,认为技术竞赛重要,AI 融入生活但不会有真正意识。

InfoQ
算法论文8

AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型

火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。

机器之心
算法论文8

世界模型==VQA?机器人不用想象画面,预测语义就够了

华盛顿大学、索尼AI研究者在新论文中质疑机器人世界模型是否需想象精确未来画面。指出多数模型还原画面不适合决策,提出语义世界模型SWM,能预测未来语义信息,实验效果良好。

机器之心
算法论文8

TPAMI 2025 | AI对抗迁移性评估的「拨乱反正」:那些年效果虚高的攻防算法们

本文第一作者赵正宇来自西安交大,针对现有迁移攻击方法缺乏系统公平对比分析的问题,将其分为五大类,在 ImageNet 上对 23 种攻击与 11 种防御方法开展评估,证实评估缺陷会误导结论,解决后有新见解。

机器之心