RL训练框架」共找到 3470 篇相关文章

产品应用8

小红书提出社交大模型RedOne 2.0:兼听、敏行

在SNS内容爆炸式增长的当下,传统SFT训练方法有局限。小红书NLP团队推出RedOne 2.0社交大模型,采用以RL为核心的三阶段渐进式训练方法,实验显示其性能优异,还能转化商业价值。

量子位
开源动态8

世界模型和具身大脑最新突破:90%生成数据,VLA性能暴涨300%|开源

国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。

量子位
开源动态8

机器人视觉语言导航进入R1时代!港大联合上海AI Lab提出全新具身智能框架

香港大学与上海AI Lab联合提出VLN - R1,可将自然语言指令转化为连续导航动作,打破传统链条。它有两阶段训练等创新支柱,在测试中表现出色,小模型性能佳,推动具身智能从数字向具身认知跨越。

量子位
算法论文8

只需1/4预算,性能反超基线:阿里高德提出Tree-GRPO,高效破解智能体RL难题

阿里高德提出Tree - GRPO方法解决智能体RL难题。它以智能体步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算超GRPO基线,解决了Rollout成本高和监督稀疏问题。

机器之心
算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI
推荐文章8

真正的AI竞争力,藏在大模型“后训练”这一步

当全球聚焦基座模型参数竞赛时,后训练变革正悄然发生。产业共识是,大模型后训练是AI落地产业必经之路。后训练技术从SFT演进至强化学习范式,企业应用也有了从技术到商业价值的完整链路。

量子位
开源动态8

清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练

清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。

机器之心
产品应用7

AI 应用开发的破局之路:字节跳动 Eino 框架实践

在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动沈桐介绍 Eino 框架在组件抽象和业务编排的创新实践。该框架以大模型为基础,解决应用开发中节点、信息流转和沉淀框架的问题,还给出开发实例,展望了未来重点方向。

InfoQ
开源动态8

字节Seed团队发布循环语言模型Ouro,在预训练阶段直接「思考」,Bengio署名

现代LLM依赖显式文本生成训练“思考”,未充分挖掘预训练数据潜力。字节Seed团队联合多家机构推出循环语言模型Ouro,将推理能力构建到预训练阶段,实现参数效率提升,还降低了有害性。

机器之心
推荐文章8

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

文章深入解读大模型后训练,先对比 PPO 与 GRPO,指出 GRPO 优势及成本问题。又介绍 GRPO 后续改进算法,如 DAPO 解决训练问题、GSPO 提升训练稳定性、GFPO 可优化多属性,还提及 GRPO 其他缺陷。

机器之心