「奖励函数」共找到 324 篇相关文章
GPU-MODE Leaderboards之nvfp4_gemv代码阅读
文章围绕GPU-MODE的nvfp4_gemv竞赛rank1代码展开,先介绍问题及官方baseline,后详细解读rank1代码,含数据加载、线程模型等,还剖析核心计算函数,最后总结代码在缓存控制、数据格式等方面的调优亮点。
刚刚,Thinking Machines Lab博客提出在策略蒸馏,Qwen被cue 38次
Thinking Machines Lab发布《在策略蒸馏》博客,提出在策略蒸馏可结合强化学习纠错与SFT奖励密度,成本低且能让小模型有强大性能。该成果受Qwen团队启发,大量用Qwen3模型。还对比了不同训练方法。
4000万样本炼出AI读心术,刷新七榜SOTA,最强「人类偏好感应器」开源
Skywork-Reward-V2全新发布,构建超高质量千万级人类偏好样本,刷新七大评测基准SOTA。8款模型覆盖6亿至80亿参数,小体积也能媲美大模型性能。团队引入多样大规模真实人类偏好数据,提升数据规模与质量。
Andrej Karpathy 提出判断什么工作会被 AI 替代的新标准
Andrej Karpathy 提出判断工作是否会被 AI 替代的新标准,即不看复杂度看可验证性。他在 Software 2.0 框架下解释此现象,还指出任务被 AI 自动化需满足可重置、高效、可奖励三个条件,同时提及该框架有局限性。
ENG APPL COMP FLUID | 西北工业大学赵书乐、张伟伟:欧拉方程嵌入的壁面压力和摩阻分布机器学习方法
传统气动力建模依赖大量样本、泛化能力弱。本文将欧拉方程无粘特征融入建模,配合架构与损失函数设计,让模型在复杂状态保持泛化能力,集中力误差约3%,小样本建模时样本量比传统方法降2倍以上。
突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!
近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。
MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench
MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。
RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘
近年来,基于可验证奖励的强化学习(RLVR)成为提升大语言模型推理能力的重要路径,但许多经RL微调的模型出现‘越训越单一’问题。复旦大学等团队聚焦长期被忽视的KL散度项,提出DPH - RL方法,可缓解多样性坍塌。
斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家
斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。