强化学习系统」共找到 2987 篇相关文章

产品应用7

真·养虾!3步让龙虾边聊边进化,不用GPU不用数据集就能强化学习

程序员给智能体套在线强化学习系统MetaClaw,把用户与AI对话变训练数据。它基于Kimi - 2.5,用SkillRL框架,不依赖本地GPU,训练交Tinker云平台,三步即可上手。

量子位
开源动态8

手把手带你入门机器人学习,HuggingFace联合牛津大学新教程开源SOTA资源库

HuggingFace与牛津大学研究者推出机器人学习教程,附带开源数据集、模型等的LeRobot库。教程从经典机器人学讲起,介绍强化、模仿学习及通用策略,还提及解决现实瓶颈的技术与前沿模型。

机器之心
推荐文章7

LLM学习笔记:最好的学习方法是带着问题去寻找答案

文章总结拓展Andrej Karpathy教学视频,分析大模型聊天流程与原理,介绍LLM训练步骤,包括预训练、后训练和强化学习,还提及主流特性应用,如文件上传、网络搜索,强调带问题学习的重要性。

腾讯技术工程
新闻资讯8

最懂英伟达的CoreWeave,为啥突然花钱买了个强化学习作坊?

算力巨头CoreWeave市值达483.9亿美元,收购专攻强化学习训练AI智能体的OpenPipe。CoreWeave想打造全能平台,此前已收购W&B,此次收购标志其涉足智能体核心训练环节。OpenPipe的ART框架有独特优势。

AIGC开放社区
算法论文8

用动作分块突破RL极限,伯克利引入模仿学习,超越离线/在线SOTA

如今强化学习在多领域成果显著,但在长跨度、稀疏奖励任务中表现欠佳。加州大学伯克利分校研究者提出Q - chunking方法,将动作分块引入基于时序差分的强化学习,解决探索效率和值传播问题,实验表现优异。

机器之心
算法论文8

SFT远不如RL?永不过时的剃刀原则打开「终身学习」大模型训练的大门

现代AI系统学习新任务时会灾难性遗忘旧知识,限制其持续学习能力。麻省理工学院研究者对比SFT和RL后发现,相同性能下RL更不易遗忘,提出遗忘定律,解释了RL优势源于其on - policy特性。

机器之心
算法论文8

Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
算法论文8

Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统

文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。

深度学习自然语言处理
算法论文7

全球强化学习+VLA范式,PI*0.6背后都有这家中国公司技术伏笔

机器之心介绍了Physical Intelligence成果π*0.6论文,指出VLA+online RL是有前景的研究方向。还分析VLA+RL重要性、应用难点,重点介绍星动纪元iRe-VLA突破困境的方案及其实验效果,揭示VLA在线强化学习前景。

机器之心
算法论文8

JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略

浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。

力学与人工智能