视觉空间」共找到 1095 篇相关文章

算法论文8

迎接范式革命:最新、最全的大模型Latent Space综述,NUS、复旦、清华等联合出品

大模型核心计算正从显式空间转向潜在空间,现有文献缺乏统一视角。NUS、复旦等机构的综述《The Latent Space》从五大视角构建框架,阐述潜在空间基础、演进、机制、能力,指出挑战与未来方向。

机器之心
开源动态8

重磅开源!240亿参数力压Nano Banana 2

4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。

新智元
8

李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!

全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。

新智元
新闻资讯7

CVPR 2026 Workshop征稿|第六届AdvML@CV:多模态大模型智能体安全

IEEE/CVF 计算机视觉与模式识别会议 CVPR 2026 6月3 - 7日在美国丹佛举办,期间6月3或4日将举办第六届对抗机器学习计算机视觉研讨会,聚焦视觉 - 语言智能体安全,现开启论文征稿并公布重要日期,给出投稿入口。

机器之心
算法论文8

切开Claude大脑,Anthropic称发现了一个类似人类意识的内部空间

Anthropic在Claude模型中发现J空间,其与人类大脑全局工作空间理论相似,承载特殊内容且可干预、参与多步推理等,但模型和人脑有差异,研究也有局限性。

DeepTech深科技
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位
算法论文8

清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”

清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。

深度学习自然语言处理
算法论文8

50年僵局打破!MIT最新证明:对于算法少量内存胜过大量时间

MIT理论计算机科学家Ryan Williams最新研究建立数学程序,将任意算法转化为占用空间更少的形式,证明少量计算内存比大量计算时间更有价值,打破计算机科学家近50年认知。

机器之心
开源动态7

本地无限画布,把AI创作玩出了新高度!

传统AI生图工具使用有局限,缺乏自由组织的畅快感。Infinite - Canvas是本地无限画布工具,支持多种生成后端,有普通和智能两种画布模式,具空间自由、覆盖不同用户等优势,还提供上手教程。

GitHubStore