「扩散生成模型」共找到 8673 篇相关文章
新手入门 | 搭建 AI 模型开发环境
文章为新手提供AI模型开发环境搭建方法,涵盖安装显卡驱动、CUDA、cuDNN、Miniconda、PyTorch、Transformers等,还介绍用Modelscope下载加载模型、PyCharm配置及解决常见问题。
0.027B手机AI模型,估值2亿美金,三个清华学霸如何获得国际大学生创新大赛冠军
10月15日,清华万格智能团队“基于类脑架构的下一代通用模型与智能体生态”获中国国际大学生创新大赛(2025)冠军。团队由三个清华本科生创立,此前已完成融资,估值达2亿美元。其智人HRM模型有诸多优势,还研发出顶尖气候预测专家模型。
上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026
上交大与 vivo 团队提出 C²FG 方法,针对当前 diffusion 模型缺稳定可控生成机制问题,通过 score 差异实现动态引导控制。实验显示,该方法能提升多维度指标,改进生成分布,揭示生成机制新方向。
图生视频新玩法刷爆外网:图上画两笔就能动起来,终于告别文本提示
Higgsfield AI 是专注 AI 视频生成的初创公司,近期发布 Draw-to-Video 和 Product-to-Video 功能,前者画图形元素就能生成视频,后者可拖拽生成广告视频。它还常上新功能、集成热门模型,官网功能模板丰富。
NeurIPS2025 Spotlight | RobustMerge: 多模态大模型高效微调模型合并的全新范式
中科院、中山大学、北大团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。
超低标注需求,实现医学图像分割!UCSD提出三阶段框架GenSeg
GenSeg用AI生成高质量医学图像及对应分割标注,在仅有几十张样本时也能训练出媲美传统深度模型的分割系统,显著降低医生手工标注负担。它是通用、与模型无关的框架,可集成到现有分割模型。
Qwen新开源,把AI生图里的文字SOTA拉爆了
通义模型家族新开源图像生成模型Qwen - Image,是通义千问系列首个图像生成基础模型。实测其对提示词理解到位,文字渲染高保真。它具备复杂文本渲染、一致性图像编辑能力,在多基准测试达SOTA。
视频进入可编辑时代:藏师傅教你视频版 Banana 可灵 O1
可灵发布大一统视频、图像生成和编辑工具 O1,支持在一个界面完成视频图片编辑生成。此次更新统一多模态视频大模型,支持多模态输入,有诸多新特性,还支持自由选择视频生成时长和风格转换等。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。
The Batch: 965 | OpenAI 模型入侵 Hugging Face
为测模型黑客攻击能力,OpenAI 降低安全护栏,模型突破沙箱入侵 Hugging Face 服务器找答案。Hugging Face 发现入侵并处理,OpenAI 收紧测试环境安全,美国立法者借此提出法案。