「结果导向强化学习」共找到 1203 篇相关文章
RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘
近年来,基于可验证奖励的强化学习(RLVR)成为提升大语言模型推理能力的重要路径,但许多经RL微调的模型出现‘越训越单一’问题。复旦大学等团队聚焦长期被忽视的KL散度项,提出DPH - RL方法,可缓解多样性坍塌。
PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃
快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
真·博士水平!GPT-5首次给出第四矩定理显式收敛率,数学教授只点拨了一下
在数学教授引导下,GPT - 5首次将定性的第四矩定理扩展为带有显式收敛率的定量形式,明确了收敛速率。研究人员还引导其将结果推广到泊松情形,作者起初想将其列为论文共同作者但被 arXiv 政策禁止。
《TAML》好文推荐 | 来自中国科学院力学研究所张磊博士 评估大语言模型在计算流体力学领域的知识利用、学习与创造
研究聚焦评估推理型(DeepSeek R1和OpenAI o3 - mini - high)与非推理型(DeepSeek V3和ChatGPT 4o)大语言模型在计算流体力学领域知识利用、学习与创造能力。通过三类基准问题评估,结果有差异。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
蚂蚁开源 x SGLang Meetup技术回放解读之基于CUTE DSL的通信计算重叠算子实践
文章是对蚂蚁开源x SGLang Meetup分享的回放解读,聚焦基于CuTe DSL的通信 - 计算重叠内核实践。探讨不同通信计算重叠方案,分析在Blackwell上做GEMM + AllReduce融合算子的优势,介绍multimem指令等,还提及接入模型执行路径和性能结果。
谢赛宁也玩MC?开源全新世界模型生成多人一致的游戏视角
电子游戏推动AI发展,谢赛宁团队探索世界模型新方向,推出多人视频世界模型Solaris。该模型能生成多人一致的第一视角,团队还搭建了多人数据采集系统SolarisEngine,构建了多人Minecraft数据集。实验结果显示,其方法在多方面表现更优。
英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核
近日,字节跳动Seed团队和清华AIR的CUDA Agent引发轰动。它能编写经优化的CUDA内核,性能超torch.compile等。研究发布CUDA - Agent - Ops - 6K数据集,介绍系统管线设计、训练流程,实验结果佳,但有未对比复杂编译器等局限。
我用Cursor测了下GPT-5.2,好像并不是那么回事儿~
GPT-5.2发布,奥特曼称其很强。作者用Cursor在真实Coding场景对GPT-5.2和Gemini 3 pro做测试,涉及烟花盛宴、5000篇Paper分析、RAG代码重构,结果显示GPT-5.2在多方面表现欠佳,写代码需慎重。