空间理解」共找到 1223 篇相关文章

开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。

新智元
开源动态8

首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合

SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。

量子位
产品应用7

200K上下文突破:AI编程新星Augment崛起

AI编程新星Augment以65.4%的SWE - bench评分登顶榜首,估值超128亿美元。它能理解海量代码上下文,支持多环境集成。但新式AI编程工具存在安全风险,如Agent Memory恶意攻击等,文中给出应对建议。

腾讯技术工程
算法论文8

ACL 2026 | Spatial-Agent:地图Agent全新概念转换范式

论文 'Spatial-Agent' 提出地理空间问答应建模为 'concept transformation',引入 GeoFlow Graph 中间表示。它从自然语言问题构建图结构,再映射到工具调用。实验显示其对地图任务有帮助,还指出构建地图类 agent 需稳定数据源等。

PaperAgent
算法论文8

Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统

文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。

深度学习自然语言处理
产品应用8

豆包大模型 Seed 2.0,有点不一样

大模型升级频繁令人审美疲劳,但豆包大模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。

刘言飞语
产品应用7

网友兴奋了,重庆造了座“任意门”,3D元宇宙穿梭!

9月6日,重庆举办的2025世界智能产业博览会上,“梦界空间”作为“百项全球首发”项目发布。该3D+AIGC元宇宙项目由重庆广电、璧山区政府与元境联合推出,以可落地形态呈现,构建起庞大生态。

鲸选AI
产品应用8

央企出手,让选大模型更容易了!中国移动发布MoMA聚合服务引擎

7月26日,中国移动在世界人工智能大会发布MoMA多模型与智能体聚合及服务引擎。它汇聚优质模型与智能体,为复杂任务提供方案,解决调度、意图理解、成本收益平衡等难题,还应用于灵犀智能体2.0。

量子位
新闻资讯7

“现代 AI 九成突破都来自我们!”面对核心团队被挖,谷歌 DeepMind 掌门人的回应挺硬

谷歌股价下跌,核心团队被挖,引发对其大模型地位的担忧。但 DeepMind 创始人哈萨比斯回应有底气,谈技术观点,如靠文本模型难以实现 AGI,智能需理解物理世界,还提及水印、创意等问题。

AI科技大本营
产品应用8

工程知识引擎:Harness Engineering体系下的工程知识底座

现代软件开发中,AI编程智能体虽能写代码但难理解代码,缺乏工程约束与上下文支撑。为此构建工程知识引擎,整合多维数据源,有向量检索等六大能力,经评估可提升智能体效率与代码质量。

阿里云开发者