「RL token」共找到 901 篇相关文章
训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式
大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。
奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式
上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。
性能比肩DeepSeek-R1,MiniMax仅花380万训出推理大模型性价比新王|开源
MiniMax开源推理大模型MiniMax - M1,原生支持100万token输入、8万输出,性能比肩DeepSeek - R1,仅花380万训成。采用Lightning Attention机制与CISPO算法,在多领域表现出色,模型权重可在HuggingFace下载。
1.5K Star!网页提取神器 webclaw:让 AI 精准抓取网页核心内容!
webclaw是专为AI工作流打造的高性能网页提取工具,能把网页转成适合大模型的内容。它有Token优化、极速响应等亮点,支持多种安装和使用方式,解决了传统抓取工具的痛点。
ICML 2026 | Agentic强化学习训练的信息自锁问题
随着大语言模型走向真实交互,强化学习训练LLM agents时出现信息自锁问题。香港中文大学等研究者分析其原因并提出AREW方法,在多场景实验中表现稳定且具鲁棒性。
AIEC 2026:今天起,Agent开始成为企业里的「新员工」
AIEC 2026人工智能+生态大会在北京召开,聚焦AI从战略部署到产业实践。大会指出大模型发展风向已变,落地竞赛开启,未来AI将成企业员工,还探讨了Agent落地关键及人与AI关系等问题。
一个框架,重塑具身研发流程:Dexbotic走向具身PyTorch
开源具身智能原生框架 Dexbotic 宣布支持 RLinf 作分布式强化学习后端,打通 VLA 模型研发中「SFT 与 RL 割裂」问题。其 2.0 版实现模块化解耦与多源混训,构建开发闭环,孵化出 DM0 大模型。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
破解大模型「无效并行推理」:Parallel-Probe问世,并行推理效率提升35.8%
来自多所高校的研究团队提出 Parallel-Probe,通过 2D Probing 刻画并行推理动态,发现问题后提出控制算法,能降推理延迟 35.8%、总 token 成本 25.8%,还推出 SCOUT 测试床,代码和平台已开源。
Mini-sglang-01:从Client到Scheduler的消息流转之旅
文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。