RL后训练」共找到 3814 篇相关文章

开源动态8

个人电脑也能进行智能体RL训练?尤佳轩团队开源OpenTinker

伊利诺伊大学厄巴纳 - 香槟分校尤佳轩团队开源OpenTinker,这是全新‘强化学习即服务’系统。它通过解耦架构和友好API,让开发者在不同算力设备启动智能体训练,解决传统RL框架难题,指明下一代智能体基建方向。

机器之心
开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
推荐文章7

RL Infra 行业全景:环境和 RLaaS 如何加速 RL 的 GPT-3 时刻

文章指出RL Scaling正推动AI从“人类数据时代”迈向“Agent体验时代”,RL Infra可弥合模拟与现实差距。梳理了RL环境、RLaaS、数据/评估三大模块,分析代表公司案例,探讨RL未来趋势与投资策略。

海外独角兽
开源动态8

智谱发布GLM 4.5,不仅开源模型还把训练框架也开源了

智谱AI发布GLM 4.5,不仅开源模型,还开源整套训练基础设施。模型规格亮眼,性能也超越qwen 235b。其开源的训练框架slime专为强化学习扩展设计,完整工具链支持多种模型。

AI工程化
开源动态8

他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力

2025年,强化学习成大模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。

量子位
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
算法论文7

英伟达发现RL Scaling!创造力暴涨,做基座模型做不了的事!

过去学界争论强化学习(RL)对语言模型的作用,此前研究认为其效果有限。本文发现问题出在训练时间短,提出ProRL,让训练突破2000步以上,结果惊人,小模型也能有出色表现。

深度学习自然语言处理
算法论文8

10步优化超越强化学习,仅需1条未标注数据!训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型训练提供了更高效简洁的新思路。

新智元
开源动态8

阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜

阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。

量子位
新闻资讯8

斯坦福教授直播训练535B大模型,模型训练的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。

机器之心