8
李曼玲等:具身大模型评估新范式
新智元
AI 摘要
李曼玲、李飞飞、吴佳俊等团队提出具身模型空间能力评估新范式Theory of Space,已被ICLR 2026接收。研究评测多模态大模型,发现其在主动探索、模态处理等方面存在局限,为具身智能发展指明方向。
阅读原文 · 新智元
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
新闻资讯8
WAIC2026:具身智能迈入千行百业
7月17日,2026世界人工智能大会在上海开幕。与往届不同,今年大会更多展示具身智能在真实场景的应用。硬件迭代、软件与数据突破,让泛化能力和任务执行成功率显著加强。现场还呈现模型四条技术路线、数据基建等趋势。
AI科技评论
开源动态8
上海交大开源 HLL,测 Agent 验证码处理能力
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。
深度学习自然语言处理
算法论文8
Octopus:大模型持续学习新解法
上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。
量子位