「3D场景建模」共找到 3808 篇相关文章
VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景
上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。
Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力
上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
超越GPT-5.2和Gemini-3-Pro!商汤多模态搜索、推理模型开源
商汤开源多模态自主推理模型SenseNova - MARS(8B/32B双版本),它通过强化学习整合工具,在多模态搜索与推理测试中超越Gemini - 3 - Pro与GPT - 5.2,还采用创新算法稳定训练,构建新基准评测。
基于LLM的Agentic Reasoning框架综述:从方面到场景的全面总结
近年来,大型语言模型虽能力强但有局限,研究者构建基于LLM的智能体系统。此综述论文提出系统、统一分类法梳理智能体推理框架,建立统一描述语言和通用算法,分析其在不同场景表现与评估方法。
中山大学梁小丹团队论文:让视频生成从「看起来真实」到「物理上正确」丨CVPR 2026
中山大学梁小丹团队提出《ProPhy: Progressive Physical Alignment for Dynamic World Simulation》,通过分层建模和逐步对齐,引入视觉语言模型作监督,解决视频生成模型物理建模问题,提升物理正确性和视频质量。
狂揽16.1k星!清华开源交互式AI课堂,学霸打造的最懂学习的AI工具
清华开源的OpenMAIC是多智能体互动课堂平台,能将文档转化为互动学习场景,自动生成课件等内容,有五种交互式界面、AI教师指导,可在任何设备使用,对教育场景很有价值。
CVPR 2025 多模态大一统:斯坦福 x 复旦提出符号主义建模生成式任务
来自多机构研究团队提出基于符号化表征的生成任务描述框架,将符号化思维引入生成任务建模。实验证明,该框架在跨模态生成任务中表现出色,为推进生成式人工智能能力提供了成本效益高且可扩展的基础。
快手 AB 场景提速 145 倍,从 Spark 到 Apache Doris 的加速实践
快手 AB 指标生产场景从 Spark 切换到 Doris 提速 145 倍、资源消耗降 72%,刷新 Doris 单机群最大规模。本文介绍选择 Apache Doris 的原因,以及在存储、计算、调度、稳定性等方面的优化,对构建 AB 实验平台有参考价值。
独家丨擎天租完成A轮及A+轮数亿元融资,估值达70亿元,具身赛道再添独角兽
AI 科技评论独家获悉,擎天租完成 A 轮及 A+ 轮数亿元融资,估值达 70 亿成独角兽。其定位 RaaS 平台,将业务重心推向产业场景,本轮融资用于体系建设和场景拓展。