「机器人RL」共找到 1159 篇相关文章
让GPU不再摸鱼!清华蚂蚁联合开源首个全异步RL,一夜击穿14B SOTA
清华与蚂蚁联合开源AReaL - boba²,实现全异步强化学习训练系统,解耦模型生成与训练流程,大幅提升GPU利用率。14B模型在多个代码基准测试达SOTA,性能接近235B模型。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。
矩阵乘法新突破!XX^T原来可以更快!RL助力搜索,世界纪录又被提升了5%
深圳市大数据研究院、香港中文大学(深圳)研究团队,结合强化学习与组合优化技术,发掘新算法 RXTX,让 XX^T 运算减少 5% 运算量,成果在国际引发关注,不过产业化落地仍面临挑战。
预测误差仅0.26mm,中科院自动化所×灵宝CASBOT团队让机器人提前“知道你要干嘛”
中科院自动化所与灵宝CASBOT提出DTRT方法获ICRA 2025录用。该方法利用Transformer和博弈论,将人类动态纳入长期预测,实验显示其预测精度和协作表现显著优于现有技术,有巨大应用潜力。
机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%
星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境中具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试中大幅提升任务成功率。
独家专访来福谐波创始人及投资人:一家县级市机器人零部件公司,如何走到港股上市?|甲子光年
2026年6月30日,浙江来福谐波传动股份有限公司在港股上市。「甲子光年」专访其创始人张杰和北极光创投合伙人黄河,探讨这家县级市企业如何在竞争激烈的市场中站稳脚跟、发展上市,还分享了发展历程、产品迭代等情况。
万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026
清华大学等联合提出高通量视觉高保真仿真器GS - Playground,被RSS 2026录用。它解决现有仿真器渲染开销高、资产制作依赖人工、Sim2Real迁移鸿沟大等问题,是全栈重新设计的仿真基础设施。
刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!
蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。
一个现代化AI 内容聚合平台,集成了 AI 报告生成、飞书机器人推送、多源内容聚合等高级功能
RSS - AIGC 是现代化 RSS 订阅与 AI 内容聚合平台,有智能内容聚合、AI 内容加工等核心能力。具备 RSS 订阅管理、内容聚合等功能,还介绍了环境要求、配置说明及部署指南。
协同加速,多机器人协作不再「慢半拍」!软硬一体化框架ReCA破解具身智能落地效率瓶颈
佐治亚理工学院等团队推出集成加速框架 ReCA,针对多机协作具身系统,从算法、系统、硬件跨层协同优化,经评估,实现 5 - 10 倍速度提升且成功率升 4.3%,为具身智能落地奠基。