「图像重建」共找到 568 篇相关文章
ICCV 2025 | RobustSplat: 解耦致密化与动态的抗瞬态3DGS三维重建
3DGS技术成研究热点,但现有方法在含动态物体场景建模精度不足。中山大学等研究者提出RobustSplat,有延迟高斯生长和尺度级联掩码引导两大核心设计,实验显示其在多指标上领先基线方法。
从写清 Spec 到看懂功能:在 Session 历史中使用 Routa 重建需求全景
文章指出在AI Coding中,Spec负责定义需求起点,大量实现走向内容留在Agent的session历史里。介绍了如何通过Feature Explorer将Spec和Session历史重新组织,让Agent基于功能证据分析,使项目保持整体性。
阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合
阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目
MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max
现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。
认知重建:Speckit 用了三个月,我放弃了——走出工具很强但用不好的困境
本文作者分享使用 Speckit 三个月的踩坑经历,探讨 AI 编程工具落地难题。介绍复合工程与上下文工程理念,提出 AI 工程化方案,对比传统工具,阐述其设计、落地策略及未来趋势,助力解决企业开发痛点。
SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了
3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。