RL强化学习」共找到 1606 篇相关文章

开源动态8

Agent的自演进,被刚刚开源的AReaL 2.0按下了加速键

Agent 正从「会使用工具并完成任务」向「在使用中学习并改进方法」转变,但面临自演进难题。AReaL 2.0 上线,解决 Agent 服务侧问题,给出在线学习闭环方案,其价值已在实践中得到验证。

机器之心
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元
算法论文8

Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”

来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。

量子位
开源动态8

OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课

全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。

新智元
算法论文8

用中等难度prompt做高效post training

近年来,RL后训练在LLM发展中至关重要,但传统方法效率低。本文提出PCL轻量级算法,通过动态选中等难度提示提升LLM后训练效率,经多基准实验验证其优越性,也指出方法局限与未来方向。

深度学习自然语言处理
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
新闻资讯7

Nature重磅发文:深度学习x符号学习,是AGI唯一路径!

大模型虽惊艳,但权威认为仅靠神经网络难达人类级智能。符号AI曾被边缘化,如今‘神经–符号融合’升温。神经网络与符号算法各有利弊,业界探索出不同融合路径,不过对其能否通往AGI仍存争议。

新智元
算法论文8

为什么这篇谷歌论文被称为「Attention is all you need」V2

谷歌新论文《嵌套学习:深度学习架构的幻象》引发关注,被称为「Attention is all you need」V2。它指出主流优化器是关联记忆系统,提出嵌套学习范式,构建HOPE架构,为AI设计带来新思考框架。

量子位
推荐文章7

AI时代,为什么你又焦虑又学不进去?这个人破解了专注力的秘密

文章指出AI时代人们学不进去,原因在于信息爆炸、AI工具易致分心,本质是没学会处理学习不适。介绍了Time Boxing、“10分钟法则”等应对方法,强调专注力是新学习力,要预先规划建立学习系统。

花叔
推荐文章7

别再乱学AI了!我花7天实践了张Zara的方法,从此告别焦虑

作者实践张Zara的AI学习法后告别焦虑,分享学习-实践-链接-输出的心法。包括高质量输入,如看长视频、跟随创造者、深度用产品;内化输出,如公开学习、与创造者交流、实践;还提及启动和持续输出要点及优质信息源。

AI产品黄叔