「RL强化学习」共找到 1606 篇相关文章
ICLR 2026 Oral | 告别多步去噪!清华团队推出MVP,实现机器人动作单步极速生成
清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值流学习问题,设计复合生成与选择机制,在多任务测试中表现出色。
Hugging Face 推出九大 AI 课程,免费、全面【收藏】
Hugging Face悄悄上线一批免费AI课程,还带认证证书。课程从大语言模型到扩散模型,从计算机视觉到游戏AI,覆盖面广。完成课程可拿证书,还能在平台分享成果,是学习AI的好机会。
手残党跪了,Pi 0.6机器人15分钟学会拧螺丝,能进厂边干边学了
具身智能领域 Physical Intelligence 公布新进展,借助「RL token」法,让机器人短时间掌握精细操作。该方法给 VLA 加「外挂」,使机器人进化快、学习效率高,在多项任务测试中表现出色。
直播预约 | 迈向用于演绎推理的诚实语言模型
本次讲座聚焦迈向用于演绎推理的诚实语言模型。当前语言模型难诚实推理,输入不足会产生无根据答案。为此制定多步骤任务,提出强化学习方法ACNCHOR,稳定学习过程、提高推理性能。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。
听说,大家都在梭后训练?最佳指南来了
大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。
Agent创业者的天塌了,OpenAI发布ChatGPT Agent
昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。
DeepSeek在Agent上做了件大事!
昨天DeepSeek发布V3.2正式版,强化Agent能力并融入思考推理,其在Agent评测达开源模型最高水平。文中分析Agent成开源‘心病’的痛点,介绍DeepSeek相关解决策略及成果,还给出使用示例。
Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证
Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。
LLM记忆管理终于不用“手把手教”了,新框架让智能体自主管理记忆系统
加州大学圣地亚哥分校和斯坦福大学研究人员提出强化学习框架Mem-α,用于训练LLM智能体自主管理记忆系统。它将记忆构建转为序列决策问题,采用多维度奖励函数,实验显示其全面超越现有方法。