「一站式生成」共找到 3080 篇相关文章
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
告别AI「鬼画符」!一行指令「复活」王羲之、苏轼,带连笔、懂排版,项目已开源丨ICLR'26
UniCalli由香港科技大学(广州)等团队推出,是全新统一扩散框架,能精准生成书法排版和连笔,将书法生成和古籍识别统一,工作被ICLR2026接收,代码、数据集开源,还有在线Demo。
"Slop"当选年度词汇:AI垃圾内容有了正式名分
韦氏词典宣布“slop”当选2025年度词汇,指AI生成的低质量数字内容。过去一年它频繁用于形容AI内容,如今AI生成网络文章占比超50%,还催生“slop经济”,但AI内容或优胜劣汰。
对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”
阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。
Nano Banana Pro或将引爆新安全危机
基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。
任意条件,「可控」文生图扩散模型综述 | TPAMI'25
北京邮电大学团队在顶级期刊IEEE TPAMI发布综述,探讨文生图扩散模型可控生成技术,将核心问题概括为如何注入新型条件信号并稳定控制,从任务和方法层面梳理技术,还提及应用场景与未来方向。
谷歌深夜放出「创世引擎」Genie 3!一句话秒生宇宙,终极模拟器觉醒
谷歌DeepMind推出通用世界模型Genie 3,能以每秒20 - 24帧速度实时生成720p画面,一句话即可生成动态世界,可模拟物理、自然等多种场景,但也存在有限动作空间等局限。
SFT+RL双管齐下:ReasonGen-R1如何破解文生图「指令不遵」难题?
上海科技大学等机构提出 ReasonGen-R1 框架,结合链式推理监督微调与强化学习,提升自回归图像生成模型推理和创作能力,已全面开源。介绍了其训练阶段、实验结果及推理链模式。