「视觉外观编辑」共找到 874 篇相关文章
ICLR 2026 | 这道题是否需要用图思考?模型来告诉你!自适应思考模式切换助力通用视觉推理提升
本文来自复旦大学和阿里巴巴未来生活实验室,已中稿 ICLR 2026。目前视觉推理方法有纯文本和用图思考两种模式,各有优劣。研究者提出 Mixture-of-Visual-Thoughts 范式及 AdaVaR 框架、AdaGRPO 算法,让模型自适应选模式,实验显示其在多任务有提升。
RSS 2025|物理驱动的世界模型PIN-WM:直接从视觉观测估计物理属性,可用于操作策略学习
国防科大、深圳大学、武汉大学团队提出物理驱动的世界模型PIN - WM,能从视觉观测辨识刚体物理属性。还提出PADC提升迁移性能,经实验验证其在非抓握式操作技能Sim2Real迁移中表现出色。
牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练
牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。
新晋顶流Agent颠覆设计师!Lovart一手实测来了:是该刷屏爆火
新晋顶流Agent Lovart火爆全网,可一句话搞定专业视觉设计,支持二次编辑。量子位实测其设计能力强,背后是多模型融合调度。它定位人机协作,适合中小企业,官网可申请内测。
SkyReels-Audio让嘴型和音频完美匹配不再难
音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。
太强了 Yan!腾讯打造的全能交互视频生成引擎
腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。
NextStep-1:一次在图像生成上自回归范式的探索
阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。
ECCV 2026 | 一段视频,重建一个可仿真的动态世界
机器人走出实验室后,训练数据需覆盖真实世界情况。OVOW由多团队完成,被ECCV 2026接收。它从单目视频出发,输出可编辑、可碰撞的实例级Mesh,串联视觉基础模型完成流水线工作,能用于物理仿真。
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。