RL 配方」共找到 289 篇相关文章

开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
开源动态8

MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench

MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。

量子位
算法论文8

破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o

腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。

机器之心
8

6.2K Star!25 种风格配方让 AI 前端审美直接拉满!garden-skills把这事做彻底了。

AI 站点界面同质化严重,开发者陷入享受便利又抱怨产出同质化的矛盾。开源项目 garden - skills 由 ConardLi 开发,是面向 AI 编程代理的技能集合,解决了界面审美和流程不稳定问题,有多种亮点与安装方式。

开源星探
算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
推荐文章7

最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?

国外AI初创公司Mechanize三位创始人联合撰文称,RL或迎“GPT - 3时刻”,但需数千至上万年“模型处理任务所用时间”训练。还提出“复制训练”新范式,能磨炼模型能力,补足短板。

AI科技评论
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。

AI前线
算法论文7

R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%

DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜单展现高效率。

PaperAgent
开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
推荐文章7

5Y View|欢迎来到评测时代

强化学习推动AI突破,模型将刷爆既有评测,AI实验室面临评测饥荒。构建评测与RL环境是利用人类时间的高效方式,不同领域有不同验证方式,Mercor已率先拓展RL数据边界。

五源资本 5Y Capital