「图像创作模型」共找到 8083 篇相关文章
豆包上可以体验 Seedance 2.0 了,我已经试了一下。
Seedance 2.0是字节自研视频生成模型,已接入豆包App、电脑端和网页版。支持文生视频、图生视频、分身视频等,动作自然、镜头连贯,生成质量高,还解决了创作者出镜难题,操作也简单。
Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑
Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。
从 AI 3D生成转型AI原生影视公司,Utopai Studios想「稍微」改造下好莱坞
2022年创立的AI 3D生成公司Cybever转型为Utopai Studios,获好莱坞人士投资,还推出两部AI影片计划。其00后掌舵者Cecilia Shen称要变革制作范式,解决AI视频模型瓶颈,解放创作者。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。
3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B
文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习法用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。
港大开源ViMax火了,实现AI自编自导自演
香港大学黄超教授团队开源ViMax框架,在GitHub获高星标。它借助多智能体协作实现AI自编自导自演视频,突破主流模型在长视频制作的瓶颈,采用多种策略应对技术挑战,不过在多方面仍有提升空间。
新版GPT Image 2.5已经能伪造GPT-6发布会了
GPT-6还未发布,新版生图模型GPT Image 2.5就能伪造其发布会。它升级幅度大,测试显示能伪造奥特曼全员信等,在LMArena测试有生成快、图像逼真等特点,生图或成GPT-6主打功能。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
实测 Seedance 2.5 vs 可灵 3.0,谁能让我们无痛当上视频导演?
本文通过两大真实创作测试场景,对比Seedance 2.5与可灵VIDEO 3.0两款热门AI视频模型的表现,分析二者在画面表现、分镜执行、合规风控上的差异,为创作者提供选型参考。
NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则
文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。