「图像着色」共找到 456 篇相关文章
又一个Genie 3来了!刚上线挤爆服务器,Mirage 2把世界模型玩成在线游戏
全球首款AI原生UGC游戏引擎Mirage迎来2.0版本。它能将图像转为可互动3D世界,还能用文本重塑。和Genie 3相比控制类别更丰富,虽有进展但仍有动作控制、视觉稳定等问题待解决。
图片生成仿真!这个AI让3D资产「开箱即用」,直接赋能机器人训练
南洋理工大学与上海人工智能实验室团队提出PhysX - Anything,首个面向仿真、具物理属性的3D生成框架。它仅需单张图像就能生成可用于仿真的3D资产,在多项测试中表现优异,有望推动3D重建范式转变。
苹果春季新品奔着龙虾来了!AI性能暴涨8倍,8499元起
苹果发布MacBook Pro M5系列、MacBook Air M5笔记本,8499元起,还更新了显示器。新款MacBook Pro搭载M5 Pro和M5 Max芯片,AI性能大幅提升,提示词处理速度快4倍,图像生成速度快8倍,存储、续航等方面也有优化。
仅隔一天,OpenAI同步上线o3和o4 mini,它们能调用ChatGPT里的多种工具,可基于图像思考。o3是强大推理模型,o4-mini专为快速经济推理优化。即日起部分会员可体验,还开源了Codex CLI。
Gemini 3.5 Pro绝密泄露,前端赶超Fable 5!
全网被Gemini 3.5 Pro泄露刷屏,传闻7月17日发布。它在前端生成表现出色,一次成型、精准零失误,性能超Fable 5,但在硬核推理等任务上不如Fable 5和GPT - 5.6。谷歌为其重预训练,还准备对标GPT - Image 2的图像模型。
CVPR 2025 多模态大一统:斯坦福 x 复旦提出符号主义建模生成式任务
来自多机构研究团队提出基于符号化表征的生成任务描述框架,将符号化思维引入生成任务建模。实验证明,该框架在跨模态生成任务中表现出色,为推进生成式人工智能能力提供了成本效益高且可扩展的基础。
UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由
随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
Snapchat提出Canvas-to-Image:一张画布集成 ID、姿态与布局
Canvas-to-Image 是面向组合式图像创作的全新框架,将不同控制信息整合在同一画布,简化图像生成控制流程。它解决了传统生成流程中控制方式分散的问题,能在推理阶段组合多种控制信号,实验效果良好。
AI生成的图片正在反向对齐人类的审美?ICML 2026观点论文Spotlight
UBC和Weathon Software研究指出,图像美学对齐削弱艺术表达。开发者用评估模型让图像生成模型产出符合人类审美的图片,但这导致图片同质化,限制艺术多元性,作者还提出六个相关担忧,并做多项测试验证。