强化学习范式」共找到 2260 篇相关文章

算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式

量子位
7

强化学习之父:LLM主导只是暂时,扩展计算才是正解

新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习强化学习潜力需靠扩展计算支撑。

量子位
新闻资讯7

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界

9月2日消息,前字节跳动Seed团队强化学习专家孙鹏博士加入星尘智能,负责机器人强化学习方向。星尘智能有技术、资本和商业优势,孙鹏经验丰富,此次加入将助力其强化学习后训练发展。

AI前线
新闻资讯8

强化学习之父Richard Sutton最新采访:LLM是“死路一条”

强化学习之父Richard Sutton在采访中批判当前由LLMs主导的AI发展路径,认为其是死胡同,缺乏真实世界模型与目标。他构想‘经验时代’新范式,预言权力向更高级智能转移,也指出未来面临腐败与价值观挑战。

AI寒武纪
算法论文7

强化学习全新视角的大模型对齐技术

文章从逆强化学习(IRL)视角回顾LLM对齐进展。先介绍强化学习基础及挑战,将LLM生成过程化为MDP,探讨无奖励函数的MDP,说明需神经奖励模型,还阐述通过奖励建模实现IRL及多种优化方法。

PaperAgent
算法论文8

强化学习大本营新作:如何破解「学新忘旧」困局

阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。

AI科技评论
算法论文8

AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o

斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。

量子位
新闻资讯8

人脑细胞做成芯片打Doom!20万活体神经元自己探路杀敌,学习效率碾压深度强化学习

20万人类脑细胞组成“脑PU”学会玩《毁灭战士》,代码已开源。研究将活体神经元与三大强化学习算法对比,发现生物培养物学习效率全面超越算法。实验运行在Cortical Labs的CL1生物计算机上,团队邀开发者探索更多可能。

量子位
产品应用8

打造全球首个强化学习云平台,九章云极是如何做到的?

AI正从语言模型走向智能体,强化学习成关键技术,但训练面临困难。2025年6月九章云极发布全球首个工业级强化学习云平台AgentiCTRL,实现系统级重构,其智能基础设施战略布局领先,具产业赋能优势。

机器之心
新闻资讯8

LLM将是又一个“惨痛教训”?强化学习之父Sutton再放炮:万亿美金AI泡沫可能破裂

强化学习之父Sutton在采访中认为,LLMs过度依赖人类知识,违背‘惨痛教训’原则,发展将遇瓶颈,当前投资和期望或致泡沫破裂。讨论还涉及LLM与强化学习、人类模仿方式差异及AI领域经济动态等。

AI寒武纪