算法论文8
百度:用1%数据实现图像编辑近SOTA效果
量子位
AI 摘要
百度研究团队提出新视角,将图像编辑视为退化时间过程。Video4Edit利用视频预训练模型知识迁移,仅用1%监督数据,在多种图像编辑任务达近SOTA效果,降低数据依赖。
阅读原文 · 量子位
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
浙大开源PhyEdit实现单图精准3D物体操作
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
新智元
开源动态8
浙大开源PhyEdit,3D图像编辑超Nano Banana Pro
当前图像编辑模型处理三维状态常出错。浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导图像编辑,还加入深度监督,构建数据集和评测基准,成绩超Nano Banana Pro,且GUI也开源。
量子位
推荐文章8
美图影像研究院:让大众爱上用AI创作
过去两年,AI 生成图片、视频变得容易,但让 AI 理解并按创作者意图创作很难。美图影像研究院过去几年围绕高频创作场景痛点展开研究,11 篇论文被国际顶会接收,成果通过产品落地转化为 AI 影像能力。
机器之心
开源动态7
百度Unlimited - OCR:OCR迈向长文档解析新时代
百度开源的Unlimited - OCR项目目标是处理图片、长文档等资料,将其转化为Markdown等结构化结果。它提供多入口,解决传统OCR处理长文档的问题,有多种应用方向,但也有边界。
小华同学ai