RL训练」共找到 2217 篇相关文章

算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
新闻资讯7

Grok最新模型吃上Cursor「加餐」,马斯克:Coding实现巨大改进

马斯克在X上透露,xAI的Grok基础模型V9 - Medium(1.5T)完成训练,预计2 - 3周后发布,训练加入大量Cursor数据。同时,xAI的AI编程代理工具Grok Build进入早期Beta测试阶段。

量子位
新闻资讯7

马斯克开始疯狂剧透Grok 5了

ARC - AGI榜单官宣新SOTA,用Grok 4+程序合成技术微调,超越一众明星模型。马斯克剧透Grok 5,称其能达AGI,将几周内开始训练。投入大量训练数据和硬件资源,但成品效果仍待观察。

量子位
新闻资讯8

真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅

美国具身智能创业公司PI发布最新机器人基础模型π*0.6,新方法大幅提升具身智能成功率与处理效率。其开发的Recap方法从经验数据获训练信号,使模型能执行多项真实世界应用。

机器之心
算法论文8

零样本 Sim-to-Real !实现五指灵巧手力控抓取与手内操作

ByteDance Seed团队研究论文针对训练真实硬件控制策略难的问题,提出实用强化学习框架。该框架有完整Sim - to - Real方案,结合触觉反馈和关节力矩感知,在纯仿真环境训练策略,可零样本部署在真实五指灵巧手。

机器之心
开源动态8

3000块钱,这支中国团队把ChatGPT成功的“秘密”用在了机器人训练

国内穹明智能团队推出千元级手持采集系统 UMI ver.2 并开源。该系统精度达毫米级、能双臂协同,成本低、部署快。团队认为数据是关键,还计划搭建机器人数据 infra,预计新模型范式很快出现。

AI前线
产品应用7

Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能

OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。

CourseAI
算法论文8

ACL 2026 | 腾讯混元Agents工具学习新范式

腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。

PaperAgent
算法论文8

链式思维是幻象吗?从数据分布视角重新审视大模型推理,马斯克回复,Grok破防

亚利桑那州立大学研究发现,思维链(CoT)推理可能只是对训练数据分布内模式的复现,输入与训练数据分布有差异时,推理链条会失效。研究探究了CoT泛化性等问题,对实际应用提出警示。

机器之心
开源动态8

OpenAI 迈出关键一步:LLM 黑盒不再是盲盒

OpenAI开源新研究成果,提出全新范式,训练权重稀疏的Transformer模型以提取人类可理解的电路。该方法分三步,关键结果显示稀疏模型优势多,但也存在训练成本高、规模有限等局限,还给出两条未来路线。

PaperAgent