扩散图像生成」共找到 2479 篇相关文章

产品应用7

“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影

约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。

带你学AI
开源动态8

阿里开源 Qwen3-TTS 全家桶!语音设计、克隆、生成全打包,开源 2 天 3K Star!

阿里通义团队开源 Qwen3 - TTS 全家桶,含语音设计、克隆、生成功能,开源 2 天获 3K + Star。它有秒级克隆、语音设计等能力,有 0.6B 和 1.7B 两种规格,双轨架构等技术创新保障性能。

开源星探
产品应用7

实测国内首个对话式AI音乐创作Agent:聊个天就能谱曲填词混剪生成MV

实测国内首个对话式AI音乐创作Agent Tunee,玩法像Suno+ChatGPT结合体。它操作简约功能全,能反复修改创作,还具备多模态内容处理能力,虽有小瑕疵,但体现国产AIGC应用发展趋势。

量子位
算法论文8

用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架

张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。

机器之心
开源动态8

“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节

复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。

量子位
产品应用7

模力工场 027 周 AI 应用榜:从“一键生成”到“自动交付”,最会帮你干活的 AI 榜单来袭

模力工场第027周AI应用榜揭晓,上榜产品迈入新阶段,能接管关键环节。如Manus交付调研报告,秒哒将想法变应用,邀虾打通跨境电商流程。还介绍了上榜应用、趋势及上榜机制等。

AI前线
开源动态8

面向6G环境感知通信!西电开源3Dx3D无线电地图数据集与生成式基准框架

面向6G,西安电子科技大学等团队联合提出高分辨率多模态三维无线电图谱数据集UrbanRadio3D,构建三维无线电图生成框架RadioDiff-3D,弥补了当前主流RM构建方法与数据集的局限。

新智元
开源动态8

代码生成要变天了?被质疑架空后,Yann LeCun携320亿参数开源世界模型“杀回来了”

在新一代代码生成模型不断涌现的当下,Meta FAIR CodeGen团队由Yann LeCun领导发布了代码世界模型CWM。它有320亿参数,创新训练方式使它不仅会写代码,还能模拟执行,性能测试表现不俗,在圈内引发热议。

AI前线
开源动态8

LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典

Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。

量子位
新闻资讯7

Kubernetes 被 AI 打回“半成品”!K8s 之父发出警告:代码生成越快,程序员越危险

Kubernetes联合创始人Brandon Burns表示,AI让Kubernetes回到‘未完成’状态,它得适应GPU调度等新需求。他还谈到AI对编程工作的影响,如代码审查成核心技能,未来编程语言或为AI设计。

InfoQ