「3D场景理解」共找到 4174 篇相关文章
华为世界模型来了!单卡30分钟生成272㎡场景
华为联合上海交通大学、华中科技大学推出世界模型WordGrow,可生成1800㎡超大室内场景,单卡30分钟跑272㎡。它用数据精准预处理、3D块补全机制、粗到精生成策略填3D场景构建的坑,指标优、速度快。
让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%
如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。
2秒终结AI 3D不可能三角,我们和VAST首席科学家曹炎培聊了聊
速度、质量、管线可用性是AI 3D生成的不可能三角。VAST发布的Tripo P1.0首次在原生三维空间概率生成,2秒输出专业3D资产,效率提升百倍,生成结果可直接用于多场景,突破了这一困境。
腾讯混元开源世界模型!2.0版本一键生成3D空间,游戏关卡随心造
4月16日,腾讯正式发布并开源混元3D世界模型2.0(HY - World 2.0)。它是多模态模型,能理解多种输入,自动生成、重建和模拟3D世界,支持多格式3D资产导出,可与游戏工作流对接。
Nano Banana Pro上线!集成Gemini 3与Veo 3,谷歌不给竞争对手喘息机会
谷歌推出最强文生图模型Nano Banana Pro,又名Gemini 3 Pro Image,整合Gemini 3 Pro多模态理解能力与谷歌搜索知识库。它提升文字渲染等能力,支持多种分辨率和格式,还集成视频生成模型,覆盖多类用户。
3D版Nano Banana来了!AI修模成为现实,3D生成进入可编辑时代
2026年初市场关注3D生成领域,中国团队Hyper3D发布Rodin Gen - 2 Edit,实现3D模型局部编辑。它支持两种操作路径,将“3D生成”与“3D编辑”整合,还打通主流工作流,源于团队长期技术积累。
刚刚,阿里Qwen3.6又悄悄放出4个开源权重,卷疯了
继今年2月发布Qwen3.5系列后,阿里推出Qwen3.6多个开源权重版本。Qwen3.6优先保障稳定性与真实场景可用性,为开发者提供更好编码体验。介绍了Qwen3.6 - 27B和Qwen3.6 - 35B - A3B亮点。
Google 发布 Gemini 3.8 Flash:6 周内第 3 次升级
Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在多平台上线。
不用头显也能看3D:清华团队把裸眼3D视角扩大到150°
清华大学戴琼海、吴嘉敏团队在 Nature Photonics 发表研究,提出“超斯涅尔扫描光场显示(SSS - LiD)”方案,在 150°超宽视角下实现高分辨率裸眼 3D 显示,还分析了裸眼 3D 技术的商业化前景。
ICLR 2026惊现SAM 3,分割一切的下一步:让模型理解「概念」
9月12日,匿名论文‘SAM 3: SEGMENT ANYTHING WITH CONCEPTS’登陆ICLR 2026,外界猜测出自Meta。SAM 3定义了可提示概念分割任务,性能比之前系统提升至少2倍,在多基准测试获SOTA成绩,但也有人质疑是旧概念包装。