流中强化学习」共找到 2766 篇相关文章

算法论文7

机器狗能当羽毛球搭子了!仅靠强化学习从0自学,还涌现出类人回位行为 | Science子刊

苏黎世联邦理工学院团队让机器狗靠强化学习学会打羽毛球,开发全身视觉运动控制策略,使其最高挥拍速达12米/秒,还涌现类人回位行为,研究证明足式机器人在体育场景应用可行。

量子位
算法论文7

DeepMind 提出 CaMeL,抵御 LLM 提示词注入

谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询的控制和数据阻止恶意输入,能在AgentDojo基准测试抵御67%攻击,采用传统软件安全原则。

InfoQ
算法论文8

ICLR 2026 Oral | 告别多步去噪!清华团队推出MVP,实现机器人动作单步极速生成

清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值学习问题,设计复合生成与选择机制,在多任务测试表现出色。

机器之心
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务表现良好。

机器之心
开源动态8

AI能自己打红警了!经济拉满零交战惨遭打脸,玩家笑疯

Hugging Face推出OpenRA-RL,将《红色警戒》改造成大模型的Agent训练场,50个MCP游戏工具全量暴露,25Hz实时状态推送,打通三条训练路线,原生接入OpenEnv生态。实战,Agent经济满分但战斗零分。

新智元
算法论文8

清华联手千问重塑归一化范式,让 Transformer 回归「深度」学习

Pre - Norm和Post - Norm是Transformer架构稳定信号的关键范式,但面临权衡取舍。近日,清华黄高团队联合千问团队提出SiameseNorm,构建参数共享的平行通路,实现稳定训练并提升性能。

机器之心
推荐文章7

AI优质信息源整理:高质量网站、博主与Twitter资源推荐

文章整理了AI优质信息源,介绍Twitter在AI浪潮的重要性及筛选优质信息方法,还列举知乎、B站等平台,以及资讯平台、网站、播客、博客等资源,给出挑选标准和了解领域的技巧。

AI Reading Hub
产品应用8

DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了

DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。

AIGC开放社区
算法论文7

JFM | 西北工业大学杨忠鑫、张伟伟等:数据驱动的特定且可泛化的湍封闭知识发现

本文基于高精度数据结合符号回归等方法重建混合长理论,提出解决泛化性问题的策略。通过槽道等基本动获普适公式,用于封闭求解RANS方程,在工程附着提升精度,为飞行器摩阻预测提供新工具。

力学与人工智能
产品应用8

具身智能的无本体数据,终于有了自己的「代表作」

自变量机器人发布的Demo,机器人用数百条无本体数据完成化学实验。其发布的TwinDEX系统由无本体数据采集系统和机器人末端执行器组成,能让无本体数据获接近真机数据的训练效果,重新定义数据采集逻辑。

AI科技评论