「单图重建」共找到 145 篇相关文章
PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器
本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。
混元3D开源端到端全景深度估计器,代码+精选全景数据已上线,在线可玩
全景深度估计在3D视觉领域日益受关注,但因全景数据稀缺、球面畸变问题,以往方法零样本泛化和效率不佳。腾讯混元3D团队提出DA²,通过数据扩充引擎和SphereViT架构,提升性能,展现SOTA表现。
为什么GPT-5算得出微积分,却数不清积木?
文章对GPT - 5展开系统化空间能力测评,涵盖8个基准、超10亿token成本。提出“空间智能六维图谱”,发现GPT - 5在MM和SR达人类水平,但MR、PT等方面有短板,还揭示闭源与开源模型在复杂任务上差距小等情况。
视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖
清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。
首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测
现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。
4D通用世界模型!中科院NeoVerse用百万单目视频直接构建
中国科学院自动化研究所与CreateAI团队构建4D世界模型NeoVerse,它用全新端到端架构,从单目视频高效重建4D高斯泼溅,模拟成像退化提升生成鲁棒性,在多任务表现卓越。
简单即强大:全新生成模型「离散分布网络DDN」是如何做到原理简单,性质独特?
本文作者杨磊介绍全新生成模型离散分布网络DDN,它建模目标分布机制简洁独特,有零样本条件生成等特性。文中详述其原理、网络结构、损失函数,还展示实验效果,最后给出未来研究方向。
李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界
李飞飞创办的 World Labs 发布多模态世界模型 Atlas,可原生处理多类型数据,有世界生成、重建和模拟等能力。还介绍其研发历程、技术特点,以及 World Labs 收购、融资等情况。
开源人工智能:数字主权的基石
随着人工智能重塑各领域,数字主权成现实需求。开源人工智能可检查、可解释,能助力各国治理、审核和建设AI系统,是实现自主可控、激发创新、重建信任的关键,为数字主权各维度提供支持。
从海外断供到全国产闭环,安世中国做对了什么?
安世中国在2025年9月30日遭海外断供晶圆后,于次年8月23日新品全球发布会公开亮相。其从组织、供应链、研发、渠道四方面重构,取得12英寸量产等成果,还给出未来路线图,有重大产业意义。