「图像着色」共找到 456 篇相关文章
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
腾讯用AI把美术管线重新做了一遍,混元3D Studio架构曝光
腾讯推出专业级AI工作台混元3D Studio,可覆盖3D资产生产全流程,让生产周期大幅缩短。它有组件拆分、可控图像生成等七大核心技术模块,各模块对应关键阶段,实现无缝衔接与自动化。
刚刚,首个能在机器人上本地运行的具身Gemini来了
谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应新任务和环境。还将发布SDK助开发者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。
小扎「芒果」生图只输GPT Image 2,没人教它改稿,它自己学会了
Meta推出图像生成模型Muse Image(代号「芒果」)和视频模型Muse Video预览版。Muse Image在文生图榜单排第二,改变画图方式,能自我修正。它与Muse Spark打通,Muse Video文生视频排第3。不过,其@功能有隐私隐患。
奥特曼亲自上阵,Images 2.0登顶王座!大米刻字,生图跨入GPT-5时代
OpenAI上线ChatGPT Images 2.0,奥特曼称其是从GPT - 3到GPT - 5的飞跃。它是首个‘会思考’的图像AI,能精准听懂中文指令、渲染复杂UI,在Arena榜单登顶,解决了多语言、风格等痛点。
Qwen-Image-2.0: 字字清晰,张张细腻
阿里云推出Qwen-Image-2.0图像生成基础模型,具专业文字渲染、细腻真实质感等特色。在AI Arena盲测中表现优越,能精准生成复杂内容,文字渲染有准、多、美、真、齐特点,图像编辑能力也得到增强。
PyTorch博客翻译 Accelerating Generative AI Part III: Diffusion, Fast
这篇博客介绍用纯原生 PyTorch 技术将文本到图像的 diffusion 模型(特别是 Stable Diffusion XL)推理速度提升高达 3 倍的方法,讲解五种优化技术,还验证了方法在其他 diffusion 模型上的通用性和有效性。
小模型,大能量!200美金的GPT Pro竟然输给了它?
博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
谷歌Nano Banana Pro炸了!硅谷AI半壁江山同框,网友:PS已死
谷歌推出基于Gemini 3 Pro的图像生成模型Nano Banana Pro,在图像编辑和生成上实现史诗级进化,有更广知识储备、超强文字渲染和精准细节把控。它支持4K原生,知识推理强还能直连搜索,玩法多样但也有改进空间。