「行为校准强化学习」共找到 927 篇相关文章
算法论文8
PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃
快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。
机器之心
开源动态8
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
机器之心
算法论文7
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
量子位
算法论文8
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
深度学习自然语言处理
算法论文8
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
量子位
产品应用8
20亿美金苏度科技具身首秀即大招!0真机数据,zero-shot,跑出98%首次抓取成功率
苏度科技发布软硬件全栈自研的机器人系统R1,采用世界模型与强化学习一体化设计,在不使用真机数据的前提下,实现关键任务近100%的Zero-shot成功率。苏度团队通过重新定义数据范式,解决了具身智能发展的核心瓶颈。
量子位
9
苹果竞价搜索广告(ASM应用商店营销)到底是什么?
ASM广告位展示的产品在用户自然搜索结果的前10名位置再次出现,即使App的自然排名本不在Top10以内。这种推广方式能为App带来额外的曝光机会,同时提高下载转化率。
孔学长