「强化学习Scaling」共找到 1650 篇相关文章
通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果
阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
AgentFly:重塑Agent,无需微调LLM,如我们一样的记忆和经验持续学习
现有LLM智能体依赖静态流程或微调参数,缺乏灵活性且成本高。论文提出基于记忆的在线强化学习框架AgentFly,不更新LLM权重,在多基准测试表现出色,为构建通用智能体提供新范式。
游戏教父 John Carmack:LLM 不是游戏的未来
游戏教父 John Carmack 认为 LLM 不是游戏未来,强调交互式体验学习重要性。他倾向游戏和虚拟环境研究,分析 Atari 游戏强化学习问题,还提及离线学习、迁移学习等方面挑战。
首个为具身智能而生的大规模强化学习框架RLinf!清华、北京中关村学院、无问芯穹等重磅开源
人工智能从‘感知’迈向‘行动’,具身智能成焦点。当前强化学习框架对具身智能支持受限,清华等机构联合开源面向具身智能的框架RLinf,提出混合式执行模式,设计灵活可扩展,在多方面表现出色。
奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式
在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。
宇宙尺度压缩:Scaling Law的边界,柏拉图表征收敛于物质和信息交汇,解决P与NP问题,Simulation假说……
超对称公司在BigBang - Proton实现跨尺度跨结构科学多任务学习,提出宇宙尺度压缩构想。文章论证其科学基础、工程可行性与意义,探讨Scaling Law边界,还给出宇宙尺度压缩计划和相关假设。
OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课
全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。
伯克利神作背刺OpenAI:持续学习才是真神!
伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。