「空间注意力提示」共找到 1135 篇相关文章
开源多模态大模型EarthMind,观测地球统一框架
地球观测数据复杂,现有多模态模型难适用。意大利、德国多所高校研究人员联合开源多模态大模型EarthMind,引入空间注意力提示模块,实现跨模态融合和多粒度理解,解决地球观测难题。
Coding Agent 自主解题很强,但用户改一行代码就"翻车"?自所团队提出 SWE-Touch 揭示共享工作空间下的能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。
CVPR 2026 | 让AI视频不再「串戏」:免训练精准控制多段动作,SwitchCraft一招破解逻辑崩坏
随着文本到视频扩散模型发展,AI视频生成有进展,但开源模型处理多事件提示词时存在技术瓶颈。西湖大学团队提出免训练框架SwitchCraft,引入注意力控制机制,入选CVPR 2026,代码已开源。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
DeepMind 发布超真实世界模型 Genie 3,AGI 向前一步
谷歌旗下DeepMind发布通用型世界模型Genie 3,可通过文本提示生成动态世界并实时交互,其生成内容物理一致性达分钟级。它功能丰富,也受业内好评,但有行动空间有限等局限,对迈向AGI意义重大。
LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?
经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。
迎接范式革命:最新、最全的大模型Latent Space综述,NUS、复旦、清华等联合出品
大模型核心计算正从显式空间转向潜在空间,现有文献缺乏统一视角。NUS、复旦等机构的综述《The Latent Space》从五大视角构建框架,阐述潜在空间基础、演进、机制、能力,指出挑战与未来方向。
重磅开源!240亿参数力压Nano Banana 2
4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。