开放域RL」共找到 857 篇相关文章

开源动态8

7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍

腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。

量子位
推荐文章7

2025小结:从RL到Agentic RL

作者回顾2025年从RL到Agentic RL的发展,指出Agentic RL存在慢、不稳定、难scale的问题,还探讨了RL与推理、CoT的关系,以及RL的泛化能力,认为RL能提升模型能力但还不稳定,期待明年研究。

深度学习自然语言处理
推荐文章7

RL Infra 行业全景:环境和 RLaaS 如何加速 RL 的 GPT-3 时刻

文章指出RL Scaling正推动AI从“人类数据时代”迈向“Agent体验时代”,RL Infra可弥合模拟与现实差距。梳理了RL环境、RLaaS、数据/评估三大模块,分析代表公司案例,探讨RL未来趋势与投资策略。

海外独角兽
推荐文章7

吴恩达来信:开放模型,开放执行框架,开放安全

吴恩达团队用闭源模型做安全审查遇阻,后改用 OpenWorker 框架结合开源权重模型 Kimi K3 和 GLM 5.2 取得进展。他认为开放模型和执行框架能带来更安全系统,开源权重模型舆论战虽胜,但立法层面未胜。

DeeplearningAI
算法论文8

Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统

文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。

深度学习自然语言处理
开源动态7

从“开放模型”到“开放生态”,AI 开源进入下半场

近期,Meta 推出开放权重模型,而开放模型商业使用收费渐成趋势。AI 开源面临成本、边界等问题,竞争从模型能力转向基础设施选择。世界人工智能开源大赛关注模型应用,凸显开源生态建设重要性。

AI前线
开源动态8

中国AI高速路,华为给出开源开放方案

上周华为全联接大会展示系列创新。超节点架构带动的开源开放意义深远,开放硬件、开源软件和灵衢组件。华为发布系列超节点新品,实现全场景覆盖,同时全面开放开源,推动产业协同与生态繁荣。

量子位
推荐文章7

GPT-5 核心成员详解 RL:Pre-training 只有和 RL 结合才能走向 AGI

本文编译 OpenAI 研究副总裁 Jerry Tworek 访谈,探讨 RL 与通向 AGI 路径。他认为 pre - training 与 RL 需结合,GPT - 5 是 o3 迭代,还谈及推理、模型发展、训练方式及 OpenAI 研究情况等。

海外独角兽
算法论文7

MoE RL 实战:统一 FP8 全流程训练

SGLang RL 团队等实现 RL 全流程 FP8 训练与采样,消除训推不一致性。介绍 FP8 硬件基础、格式等,分析训练难点,定位 KL Loss 异常源于量化原理,验证其在 MoE 模型 RL 场景优势,指出模型规模与训推不一致的关联。

GiantPandaLLM
算法论文8

2篇最新152页论文,RL+LLM被彻底讲透了!

今天分享2篇2025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成大推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。

PaperAgent
上一页1 / 86下一页