图像一致性」共找到 583 篇相关文章

新闻资讯7

Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言

Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。

AGI Hunt
产品应用7

刚刚,OpenAI推出全新ChatGPT Images,奥特曼亮出腹肌搞宣传

OpenAI推出全新ChatGPT Images,由新旗舰图像生成模型驱动,特性有精准编辑、保留细节等,图像生成速度提升4倍。该功能今日向多数用户开放,价格降20%,旨在让图像生成更简单。

机器之心
算法论文8

NIPS2025|小红书智创AIGC团队提出布局控制生成新算法InstanceAssemble

当下文本生成图像扩散模型有进展,但现有布局到图像生成方法在复杂场景表现不佳。小红书智创AIGC团队提出InstanceAssemble框架,从架构和评测应对难题,实现复杂布局下精确图像生成,有广阔应用潜力。

机器之心
算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性

AI科技评论
新闻资讯7

一等奖20万,大佬们出题,最硬核视频生成全球挑战赛开启!

首个AI视频生成全球挑战赛来袭,多位大佬发起,20万大奖待拿。大赛聚焦AI视频生成「一致性」挑战,设主赛道和创意赛道,分别面向技术派和创作者,旨在推动视频生成技术发展。

新智元
新闻资讯7

The Batch: 920 | Nano Banana 2 在性能/价格比方面实现提升

Google发布Nano Banana 2(正式名称Gemini 3.1 Flash Image),是图像生成系统。它速度快约4倍、成本减半,支持多功能,在多个排行榜中位列前三,以低价接近文字 - 图片排行榜领先位置。

DeeplearningAI
算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
产品应用7

蚂蚁多模态统一框架Ming-Omni:能看懂世界、会说话、还能画画

文章介绍蚂蚁多模态统一框架Ming - Omni,它可统一处理图像、文本等多模态数据。该框架解决了多模态训练中模态表示差异、收敛速度不一致等问题,采用分阶段预训练,能用于图像、音频生成及多模态交互。

CourseAI
产品应用8

「香蕉革命」首揭秘!谷歌疯狂工程师死磕文字渲染,竟意外炼出最强模型

谷歌最新图像模型nano banana横空出世,能融合图片、理解地理等结构,实现多轮创作。它凭借Gemini知识与交错生成技术,重塑AI图像生成边界。谷歌团队揭秘其技术,还谈及未来发展方向。

新智元
产品应用8

谷歌Nano Banana全网刷屏,起底背后团队

谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。

机器之心