「强化微调」共找到 899 篇相关文章
快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!
多模态奖励模型对提升多模态大语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。
Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」
新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。
刚刚,神话级Fable 5.1来了!
今天,Claude Fable 5.1全平台上线,Mythos 5.1专供特定团队。新模型跑分有断层式代差,还降低了算力门槛。通过重绘金星、设计蛋白等案例展示其科研能力,在编程上也表现出色,同时在安全上采取‘一松一紧’策略。
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
一个框架,重塑具身研发流程:Dexbotic走向具身PyTorch
开源具身智能原生框架 Dexbotic 宣布支持 RLinf 作分布式强化学习后端,打通 VLA 模型研发中「SFT 与 RL 割裂」问题。其 2.0 版实现模块化解耦与多源混训,构建开发闭环,孵化出 DM0 大模型。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华
随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。
致敬Kimi K2:基于slime的全流程INT4量化感知RL训练
受Kimi K2团队启发,SGLang RL团队落地INT4量化感知训练流程方案,在强化学习多方面取得进展,还在slime框架复现全流程方案,实现媲美BF16精度,提高Rollout效率,为社区提供开源参考。
模型训练篇|多阶段ToolRL打造更可靠的AI导购助手
当前,AI导购成电商与服务平台新风口,但芝麻租赁场景挑战大,存在需求难匹配等痛点。为此打造AI导购智能体“租赁小不懂”,经架构升级和算法优化,性能提升,还探索了MoE训练和推理优化。
用超图撕开知识边界:16万节点无师自通搞Agentic科研
传统知识图谱只能用三元组描述世界,难以应对真实科学场景里的多体交互。作者提出将文献里n元关系存成超图超边,让LLM在多智能体框架里‘沿着超边走路’,并构建了超图进行实验,实现可验证的科学发现。