视觉错觉图」共找到 898 篇相关文章

开源动态8

上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下

上海人工智能实验室联合多家单位提出通用具身智能大脑框架VeBrain,能集成视觉感知、空间推理和机器人控制能力。它统一三类任务语言建模范式,有“机器人适配器”,配套VeBrain - 600k数据集,性能测试表现出色。

量子位
产品应用8

机器人学会「眼看手摸」!FreeTacMan 实现人类指尖亲自「授课」

OpenDriveLab提出的FreeTacMan,将人类视觉、触觉和动作技能高效传输给机器,破解精细操作难题。它配备高分辨率触觉“皮肤”,实现人类“手把手”教机器人“感知”,还通过融合时间感知的触觉预训练,提升机器人策略性能。

AI科技评论
算法论文8

RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill

新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。

机器之心
新闻资讯8

两张定位全球,o3碾压T0级高手!人类「诡计」被看穿,跨模态推理爆表

OpenAI的o3在GeoGuessr游戏中与大师级玩家Sam Patterson对决,o3通过视觉与搜索推理,忽略伪造EXIF信息,最终以23179比22054获胜,展现出跨模态推理潜力,引发对AI推理能力的思考。

新智元
开源动态8

终于用上啦,3.9 万 Star archify,程序员福音!!!!

架构常与代码脱节,约3.9万Star的archify让Agent先把代码库或系统描述写成带类型的JSON,经布局、检查后交付可交互系统地,它先结构化、验证再交付,适用于特定场景。

小华同学ai
算法论文7

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。

机器之心
产品应用7

6个Claude Code神作,Anthropic亲选

Claude 官方晒出一批来自普通用户的 Claude Code 「神作」,覆盖实用工具、可视化创意和趣味应用等领域,如人脸涂鸦、医学影像查看器、代码库动态等。这些项目反映出 Claude Code 正走出传统编程场景。

机器之心
开源动态8

告别直接生成,文生进入Agent时代:港中文联合伯克利开源Gen-Searcher

过去文生多是‘直接出’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生准确性和质量。

机器之心
8

Claude能直接操控你的电脑微信了,这才是真正的上位小龙虾。

Claude新发更新,可通过Computer use纯视觉方案操控电脑,还更新了远程操控Dispatch。这俩功能组合让Claude能操控微信等本地软件,使用简单,且权限管控和防护较好,更新速度快,领先同类产品。

数字生命卡兹克
算法论文8

打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26

现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。

量子位