预训练框架」共找到 3463 篇相关文章

开源动态8

刚刚,Dexbotic开源!VLA性能+46%,机器人叠盘子100%成功,统一具身智能底座

Dexmal原力灵机开源的Dexbotic是具身智能VLA模型一站式科研服务平台,可提供基础设施。其训练模型在多仿真器中提升传统VLA策略,还推出开源硬件DOS - W1,覆盖训练需求,架构有创新。

新智元
开源动态8

Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成

当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估。

机器之心
推荐文章7

入局AI Infra:程序员必须了解的AI系统设计与挑战知识

文章分享传统后台工程师技术栈和方法论如何迁移到AI系统,系统性拆解AI Infra的硬件、软件、训练和推理挑战,如硬件从CPU到GPU、软件依赖深度学习框架,还分析训练和推理面临的问题及解决办法。

腾讯技术工程
算法论文8

2篇最新Anthropic论文,揭开LLM对齐新范式

Anthropic在5月连发两篇研究,揭示LLM对齐训练新范式。指出单纯模仿正确行为不足以保证安全,需在训练与对齐微调间插入教原理阶段。研究围绕Claude模型展开,有多项关键发现,MSM方法效果显著。

PaperAgent
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,训练小数据量也能带来增益,示机器人通用大模型或到来。

机器之心
新闻资讯8

最懂英伟达的CoreWeave,为啥突然花钱买了个强化学习作坊?

算力巨头CoreWeave市值达483.9亿美元,收购专攻强化学习训练AI智能体的OpenPipe。CoreWeave想打造全能平台,此前已收购W&B,此次收购标志其涉足智能体核心训练环节。OpenPipe的ART框架有独特优势。

AIGC开放社区
算法论文8

告别多奖励跷跷板:Flow-OPD将多教师OPD带入图像生成

中国科学技术大学等机构团队提出Flow - OPD,这是首个将OPD引入流匹配模型的统一多任务后训练框架。它解决了流匹配模型后训练对齐中多任务的梯度冲突等问题,效果良好,未来有多个拓展方向。

机器之心
算法论文8

27M参数战胜GPT-4!脑启发的分层Reasoning引擎如何重塑LLM

当前大语言模型(LLM)核心架构存在根本性缺陷,受大脑分层处理和多时间尺度启发,本文提出仅2700万参数的分层推理模型(HRM),免训练与CoT标注,单次前向传播解决复杂任务,在ARC - AGI上超越GPT - 4等LLM。

深度学习自然语言处理
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
开源动态8

补齐OpenClaw进化拼图!AReaL v1.0开源,智能体强化学习「一键接入」

2026 年 Agent 仍是热门赛道,OpenClaw 热度持续。但 Agent 强化学习训练缺乏成熟体系。蚂蚁和清华联合打造的 AReaL v1.0 开源,实现 Agent 一键接入 RL 训练,还革新了训练引擎,降低开发门槛。

机器之心