后训练策略」共找到 4309 篇相关文章

推荐文章8

真正的AI竞争力,藏在大模型“训练”这一步

当全球聚焦基座模型参数竞赛时,训练变革正悄然发生。产业共识是,大模型训练是AI落地产业必经之路。训练技术从SFT演进至强化学习范式,企业应用也有了从技术到商业价值的完整链路。

量子位
推荐文章8

吴恩达推出LLM 训练免费课程,覆盖三大调优方法:SFT、DPO、RL

吴恩达发布「Post-training of LLMs」课程,由Banghua Zhu主讲,瞄准实用技术,重点介绍SFT、DPO、RL三种训练方法,有大量动手实验,课程发布引发热烈讨论。

AGI Hunt
开源动态8

蚂蚁灵波开源LingBot-VLA训练代码!150条示教数据即可适配新机器人

蚂蚁集团旗下灵波科技全面开源具身基座模型LingBot-VLA的真机训练工具链,覆盖四个关键环节。模型基于2万小时真实机器人数据预训练,仅需150条演示数据就能迁移任务,训练效率更高。代码库已在GitHub开源。

量子位
产品应用8

跑通AI Agent「最一公里」:iMeanAI的WebAgent训练技术全解析

文章深入解析iMeanAI的WebAgent训练技术,指出当前AI Agent落地存在从‘理解’到‘执行’的困境。通过两个极限任务展示其能力,介绍核心技术架构和训练进化引擎,还提及该技术带来的自由体验,其1.0版本已公测。

AGI Hunt
产品应用8

Thinking Machines发布首个产品Tinker :大模型训练彻底变天

OpenAI前CTO Mira Murati的Thinking Machines公司发布首个产品Tinker,这是为微调大模型设计的灵活API,能简化LLM训练过程,让用户专注算法和数据,平台处理分布式训练。它有多种特性,已被顶尖机构采用。

AI寒武纪
算法论文8

稳定训练、数据高效,清华大学提出「流策略」强化学习新方法SAC Flow

本文介绍清华大学和CMU提出的SAC Flow新方案,可端到端优化流策略。它将流策略视作residual RNN,用GRU和Transformer结构稳定训练。在多环境测试中表现优,有稳定、快速、样本效率高的特点。

机器之心
开源动态7

VeRL-Omni:面向扩散和全模态生成模型的通用RL训练框架

VeRL-Omni是面向多模态生成模型的通用RL训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,续将扩展模型与算法支持。

机器之心
算法论文8

Agentic RL 训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍

大语言模型走向“完成任务”,Agentic RL 训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。

机器之心
产品应用8

RL训练步入超节点时代!华为黑科技榨干算力,一张卡干俩活

在大模型竞赛白热化当下,强化学习训练成突破LLM性能天花板核心路径,但算力浪费和集群效率低是难题。华为团队祭出两大黑科技破局,在超节点实现训推共卡,资源利用率翻倍,还提升训练速度。

新智元
新闻资讯8

剑指“美国版 DeepSeek!”Ai2 科学家 Nathan Lambert 最新访谈:剖析 RLVR、激辩智能体与训练

艾伦人工智能研究所科学家 Nathan Lambert 在访谈中剖析 RLVR、激辩智能体与训练。他所在团队用 Olmo 和 Tulu 模型揭开训练魔法,带火 RLVR 概念。他还谈到开源 AI 未来,想打造“美国版 DeepSeek”。

AI科技大本营