强化学习」共找到 1482 篇相关文章

开源动态8

腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作

大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。

量子位
开源动态8

一个框架,重塑具身研发流程:Dexbotic走向具身PyTorch

开源具身智能原生框架 Dexbotic 宣布支持 RLinf 作分布式强化学习后端,打通 VLA 模型研发中「SFT 与 RL 割裂」问题。其 2.0 版实现模块化解耦与多源混训,构建开发闭环,孵化出 DM0 大模型。

机器之心
产品应用8

美团之后,京东也开始自研大模型了

京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。

AIGC开放社区
开源动态7

致敬Kimi K2:基于slime的全流程INT4量化感知RL训练

受Kimi K2团队启发,SGLang RL团队落地INT4量化感知训练流程方案,在强化学习多方面取得进展,还在slime框架复现全流程方案,实现媲美BF16精度,提高Rollout效率,为社区提供开源参考。

机器之心
算法论文8

智能体「卷王」诞生!干活自动配结项报告,1.5张截图就把事说清了

在LLM/VLM驱动的智能体强化学习研究中,验证完成度是挑战。为此提出SmartSnap方法,让智能体成“质检员”,主动留痕存证。它有三大突破,表现惊艳,简化训练准备,让AI更可靠。

量子位
推荐文章7

Codex 跟练全攻略

本文聚焦 Codex 学习,指出知名 AI 视频博主更新慢,而 B 站有全面的「Codex 跟练」专题,含快速安装、基础入门、进阶技巧、场景应用四个专区,不同阶段用户都能找到合适内容,视频跟练更高效。

AGI Hunt
算法论文8

痛点突破:YOLOv26引入AAttn区域注意力机制,精度提升1.3个百分点

文章介绍YOLOv26引入AAttn区域注意力机制,解决传统机制在复杂场景下的不足。它通过划分特征图区域学习权重,提升检测精度,且实现简单。经实验验证,精度提升显著,还给出实现细节与优化建议。

机器学习AI算法工程
新闻资讯7

The Batch: 865 | 机器人外科医生的切割与夹闭

约翰·霍普金斯大学等团队开发Hierarchical Surgical Robot Transformer(SRT - H),结合两个transformer模型,通过模仿学习训练,用达芬奇机器人完成胆囊切除关键步骤。虽在体外组织测试表现好,但应对人体手术仍有挑战。

DeeplearningAI
算法论文8

Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」

新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。

机器之心
产品应用8

模型训练篇|多阶段ToolRL打造更可靠的AI导购助手

当前,AI导购成电商与服务平台新风口,但芝麻租赁场景挑战大,存在需求难匹配等痛点。为此打造AI导购智能体“租赁小不懂”,经架构升级和算法优化,性能提升,还探索了MoE训练和推理优化。

阿里云开发者