「训练方法」共找到 3276 篇相关文章
零样本 Sim-to-Real !实现五指灵巧手力控抓取与手内操作
ByteDance Seed团队研究论文针对训练真实硬件控制策略难的问题,提出实用强化学习框架。该框架有完整Sim - to - Real方案,结合触觉反馈和关节力矩感知,在纯仿真环境训练策略,可零样本部署在真实五指灵巧手。
AI能自己打红警了!经济拉满零交战惨遭打脸,玩家笑疯
Hugging Face推出OpenRA-RL,将《红色警戒》改造成大模型的Agent训练场,50个MCP游戏工具全量暴露,25Hz实时状态流推送,打通三条训练路线,原生接入OpenEnv生态。实战中,Agent经济满分但战斗零分。
3000块钱,这支中国团队把ChatGPT成功的“秘密”用在了机器人训练上
国内穹明智能团队推出千元级手持采集系统 UMI ver.2 并开源。该系统精度达毫米级、能双臂协同,成本低、部署快。团队认为数据是关键,还计划搭建机器人数据 infra,预计新模型范式很快出现。
强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!
伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。
博士答辩PPT分享 | 高雷诺数湍流场数据同化与湍流模型机器学习研究
西北工业大学孙旭翔博士的论文聚焦航空航天湍流模拟难题,结合数据驱动与同化方法,构建全流程框架,提出数据同化与模型修正方法,设计集成框架,实现高雷诺数复杂流动精确高效模拟。
Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能
OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。
X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习
年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。
关键突破:理论验证了 RL for LLM 路线的可行性
传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。
4B Qwen3逆袭671B DeepSeek!字节DAPO微调方法这么猛的吗
最新模型Jan - nano引发关注,它在智能体任务上超671B的DeepSeek - V3 0528,在SimpleQA基准获80.7分。它基于Qwen3 - 4B用字节&清华DAPO微调方法。其研发团队是Menlo Research,有开源产品和长远规划。
ACL 2026 | 腾讯混元Agents工具学习新范式
腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。