「轨迹编辑」共找到 309 篇相关文章
反超Nano Banana!OpenAI旗舰图像生成模型上线
OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。
3D领域的NanoBanana也来了,万物皆可用嘴操控。
3D领域的hyper3D推出Rodin Gen - 2,是首个能用嘴编辑3D模型的AI 3D产品。用户可上传三方模型修改编辑,还能图生3D。用嘴改3D能做局部可控修改,适合专业生产管线。
让扩散模型「可解释」不再降质,开启图片编辑新思路
过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。
LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?
经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。
人物一致性新王Nano Banana登基,AI图片编辑史诗级升级。
Nano Banana是神秘的AI绘图新模型,大概率出自Google。它生图一致性超强,在人物一致性、背景替换等多方面测评中完胜GPT - 4o等模型。虽仅在LMArena盲测随机出现,仍值得一试。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
OpenMAIC:一键生成互动课堂,视频+PPT全都有,还可以编辑
清华开源项目OpenMAIC是多智能体互动课堂,上传文档或描述主题,几分钟就能生成虚拟课堂,AI教授讲课、同学讨论,还有白板功能。底层用LangGraph编排,支持主流模型,有OpenClaw集成,架构完整。
4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源
上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式
在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。