「3D场景理解」共找到 4174 篇相关文章
一个md文件收获超400 star,这份综述分四大范式全面解析了3D场景生成
南洋理工大学研究者发表《3D Scene Generation: A Survey》综述,系统归纳300+篇论文,将3D场景生成方法分四大范式解析,还总结应用,探讨挑战与未来方向,如保真度提升、引入物理约束等。
新Vidu Q3参考生,这是冲着「剧」来的!万物皆可参考:特效音效场景都备好了
生数科技Vidu Q3发布参考生视频,为剧而生,万物可参。它能凭几张图和Prompt生成影视级特效、音效和场景。实测显示其特效、音效、场景表现出色,还解决AI视频创作痛点,兼顾专业与普惠。
SpAItial发布超逼真3D空间基础模型
德国AI初创平台SpAItial获1300万美元种子轮融资,发布超逼真3D基础模型。其核心技术能理解3D世界,可基于文本或图片生成3D场景,在多领域有革新可能,虽有竞争,但未来有望推动AI三维突破。
分割一切并不够,还要3D重建一切,SAM 3D来了
深夜 Meta 重大更新,上线 SAM 3D、SAM 3。SAM 3D 含物体与场景重建、人体形状与姿态估计两模型,能将 2D 图转 3D 重建结果。SAM 3 可检测、分割与跟踪图像视频物体。Meta 开放模型权重与代码,推体验平台。
一张俯视图,竟然能生成完整3D小镇?
获取高质量3D场景成本高、耗时长,现有3D生成模型扩展到完整场景生成时问题多。加州大学提出无需训练的3DTown框架,能从单张俯视图合成真实连贯3D场景,虽有挑战但表现优于基线方法。
Gemini 3.8,明日登场!
最新爆料,Gemini 3.8 Flash明日登场,谷歌已放弃Gemini 3.5 Pro。其编程实力强悍,之前还为Gemini植入智能体视频理解功能,降本提效,可应对多种高难度场景。近期多家AI发布计划撞车,混战升级。
CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据
北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。
3D生成到达3.0阶段,不止提升行业渗透率,也正催生3D原生新玩法 | 对话3D生成平台Tripo
AI 3D生成领域前景广阔但也有疑惑焦虑。量子位智库对话VAST创企,其创始人与CTO分享3D原生玩法、落地场景,还谈产品开发、需求发掘等认知,Tripo平台已覆盖众多用户。
SceneGen: 单图像驱动的多资产3D 场景生成
上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的多个3D资产。它一次前向传播即可完成生成,在效率与稳健性上优于现有方法,虽有局限但应用潜力大。
开源2天狂揽3.3K Star!超火的隐形AI桌面助手,实时捕捉屏幕与音频,生成结构化知识!
GitHub爆火的隐形AI桌面助手Glass,开源2天Star超3.3K。它由Pickle团队开发,能捕捉屏幕和音频活动,转化为结构化信息。适合会议记录等场景,有屏幕活动捕捉等核心能力,提供不同系统安装方式。