在线后训练」共找到 3819 篇相关文章

算法论文8

RL训练一层就够了!单层RL超越全参数训练,跨任务跨模型跨算法全部验证

明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。

机器之心
新闻资讯7

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型训练经验带到物理世界

9月2日消息,前字节跳动Seed团队强化学习专家孙鹏博士加入星尘智能,负责机器人强化学习方向。星尘智能有技术、资本和商业优势,孙鹏经验丰富,此次加入将助力其强化学习训练发展。

AI前线
算法论文8

Claude团队用Qwen测试全新训练方法

Anthropic最新研究提出中训练(MSM),在预训练训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。

量子位
算法论文8

别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练

CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。

新智元
算法论文8

LLM 仅靠自身就能增强推理?SePT 给出简洁在线训练范式

多数推理训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。

机器之心
算法论文8

在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。

深度学习自然语言处理
算法论文7

Meta最新大模型RL微调:在线DPO/GRPO显著优于离线DPO

Meta和NYU研究强化学习在大模型微调中的有效性,对比离线、半在线在线训练范式。半在线在线显著优于离线,多任务结合可验证与不可验证任务能提升性能,还给出不同任务的测试数据。

PaperAgent
算法论文8

10秒视频token超5万,O(n²)跑不动?用训练线性化框架实现1.71倍加速,推理成本大降|CVPR'2026

视频生成进入大规模时代,但计算成本高,自注意力复杂度O(n²)跑不动。研究团队提出LINVIDEO训练框架,无需数据和重新预训练,实现视频扩散模型线性化替换,保持生成质量,加速推理并降低成本。

量子位
产品应用7

Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍

Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。

机器之心
算法论文8

大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销

字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。

量子位