机器人RL」共找到 1156 篇相关文章

算法论文7

CVPR'26 | 以机器人为中心的ToM推理框架,从心智推理到决策行动

吉林大学、台湾大学和微软亚洲研究院联合提出MindPower Benchmark,构建以机器人为中心的ToM推理框架,统一建模环境感知、心智推理等,还构建数据集和评估指标。引入Mind - Reward强化优化,提升ToM决策与动作生成性能。

新智元
算法论文8

图片生成仿真!这个AI让3D资产「开箱即用」,直接赋能机器人训练

南洋理工大学与上海人工智能实验室团队提出PhysX - Anything,首个面向仿真、具物理属性的3D生成框架。它仅需单张图像就能生成可用于仿真的3D资产,在多项测试中表现优异,有望推动3D重建范式转变。

量子位
产品应用7

一个销售数据分析机器人的诞生:看 Dify 如何在 DMS 助力下实现自动化闭环

Dify是低代码AI应用开发平台,但在企业级落地有代码执行和自动化调度瓶颈。本文介绍用“Dify + DMS Notebook + DMS Airflow”架构,以销售数据分析机器人为例,展示构建可调度、可扩展、可运维Agent系统的方法。

阿里云开发者
算法论文8

让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器

当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。

机器之心
新闻资讯8

Karpathy 回应争议:RL 不是真的不行,Agent 还需要十年的预测其实很乐观

Andrej Karpathy 在与知名播客主持人 Dwarkesh Patel 的对谈中指出当下 LLMs 研究进展、Agents 存在的实际问题,如‘AGI 仍需十年时间’‘LLM 认知有缺陷’‘强化学习很糟糕’等。他还对关键争议点做了补充回应,包括对 AGI 时间线、强化学习局限性等的看法。

Founder Park
算法论文8

斯坦福洗碗机器人新作!灵巧手跟人学采茶做早餐,CoRL 2025提名最佳论文

斯坦福等机构提出DexUMI框架,利用人手将操作技能迁移至灵巧手。该框架通过软硬件创新缩小人手与灵巧手具身差异,在两款灵巧手硬件平台验证,平均任务成功率达86%,数据采集效率提升3.2倍,被CoRL 2025提名最佳论文。

量子位
开源动态8

字节开源终身记忆多模态智能体,长时记忆+RL,实测超Gemini‑GPT4o!

字节开源全球首个带终身记忆更新的全多模态智能体M3 - Agent,给其装上‘长期记忆’大脑。它构建实体记忆图谱解决现有Agent问题,架构含两个流程,代码实现有特色,跑分数据出色。

探索AGI
开源动态8

开启RL Scaling新纪元,siiRL开源:完全分布式强化学习框架,支持超千卡规模高效训练

传统强化学习框架在模型和集群规模达上千块GPU时,存在扩展性瓶颈和效率低下问题。上海创智学院团队推出siiRL,采用全分布式架构和多控制器范式,解决传统框架痛点,在多方面验证了其高性能。

机器之心
算法论文8

强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!

伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。

新智元
算法论文8

无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!

论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。

深度学习自然语言处理