「视觉原语」共找到 871 篇相关文章
机器人学会「眼看手摸」!FreeTacMan 实现人类指尖亲自「授课」
OpenDriveLab提出的FreeTacMan,将人类视觉、触觉和动作技能高效传输给机器,破解精细操作难题。它配备高分辨率触觉“皮肤”,实现人类“手把手”教机器人“感知”,还通过融合时间感知的触觉预训练,提升机器人策略性能。
RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill
新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配图生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。
两张图定位全球,o3碾压T0级高手!人类「诡计」被看穿,跨模态推理爆表
OpenAI的o3在GeoGuessr游戏中与大师级玩家Sam Patterson对决,o3通过视觉与搜索推理,忽略伪造EXIF信息,最终以23179比22054获胜,展现出跨模态推理潜力,引发对AI推理能力的思考。
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。
去往 Capital One 的俞栋,曾是 Hinton 的「救命恩人」
近日原腾讯AI Lab副主任俞栋加入Capital One。此前他和邓力曾在微软为Geoffrey Hinton雪中送炭,挽救深度学习研究。如今邓力、俞栋等技术大佬纷纷投身金融公司,或是因薪资、挑战和资源等因素。
我做了个 Skill:让 AI 帮你生成 Logo 和图标
作者因用 Gemini 为 CodePilot 生成 Logo 获关注,开发了 Logo Generator Skill。该 Skill 可三步生成 Logo 与高级展示图,还介绍了不直接用 AI 画 Logo 的原因、使用场景、开源地址与安装方式。
刚刚,100 美金的 ChatGPT 来了
OpenAI 推出 $100/月 Pro 档,填补 Plus 和原 Pro 间空缺,核心是 Codex,提供 5 倍 Codex 用量及 Pro 特权。Plus 用户 Codex 配额调整,旧 Pro 仍保留。与 Claude 定价锚点一致,但打法各有侧重。
Claude能直接操控你的电脑微信了,这才是真正的上位小龙虾。
Claude新发更新,可通过Computer use纯视觉方案操控电脑,还更新了远程操控Dispatch。这俩功能组合让Claude能操控微信等本地软件,使用简单,且权限管控和防护较好,更新速度快,领先同类产品。
突发!OpenAI关停Sora
OpenAI彻底退出视频生成业务,关闭App和API,ChatGPT视频功能也没了,迪士尼10亿美元合同作废。Sora研究团队转向机器人方向。原因是Anthropic靠文字和代码实现高营收,而Sora营收不佳且消耗算力。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。