强化学习范式」共找到 2266 篇相关文章

开源动态7

量化投资和金融科技的开源利器来了!

金融强化学习 (FinRL®) 是首个面向金融强化学习的开源框架,已发展成生态系统,有三层结构。其特点包括支持多算法、多市场环境模拟等,有完整流水线,还支持多数据源。

GitHubStore
算法论文8

VDC+VBench双榜第一!强化学习打磨的国产视频大模型,超越Sora、Pika

复旦大学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。

机器之心
算法论文7

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。

机器之心
算法论文8

强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史

本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。

机器之心
算法论文8

Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化

上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。

机器之心
新闻资讯8

最懂英伟达的CoreWeave,为啥突然花钱买了个强化学习作坊?

算力巨头CoreWeave市值达483.9亿美元,收购专攻强化学习训练AI智能体的OpenPipe。CoreWeave想打造全能平台,此前已收购W&B,此次收购标志其涉足智能体核心训练环节。OpenPipe的ART框架有独特优势。

AIGC开放社区
算法论文8

6666!NuerIPS满分论文来了

NuerIPS唯一满分论文结论惊人,指出真正决定推理上限的是基座模型本身而非强化学习,且蒸馏比强化学习更有望实现大模型自我进化,这给正火热的RLVR泼了冷水。

量子位
算法论文7

「微调已死」再添筹码,谷歌扩展AI自我进化范式,成功经验与失败教训双向学习

近期,‘微调已死’言论引关注。谷歌《ReasoningBank: Scaling Agent Self - Evolving with Reasoning Memory》论文提出类似概念,可让智能体从自身成败经验学习,还引入MaTTS,实验显示其有效性和效率优于基准方法。

机器之心
推荐文章7

大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。

宝玉AI
开源动态8

说句话,造个3D世界!腾讯VibeWorlding氛围造世界

香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。

AIGC开放社区