多步聚合训练」共找到 5661 篇相关文章

算法论文8

零样本 Sim-to-Real !实现五指灵巧手力控抓取与手内操作

ByteDance Seed团队研究论文针对训练真实硬件控制策略难的问题,提出实用强化学习框架。该框架有完整Sim - to - Real方案,结合触觉反馈和关节力矩感知,在纯仿真环境训练策略,可零样本部署在真实五指灵巧手。

机器之心
开源动态8

AI能自己打红警了!经济拉满零交战惨遭打脸,玩家笑疯

Hugging Face推出OpenRA-RL,将《红色警戒》改造成大模型的Agent训练场,50个MCP游戏工具全量暴露,25Hz实时状态流推送,打通三条训练路线,原生接入OpenEnv生态。实战中,Agent经济满分但战斗零分。

新智元
开源动态8

刚刚,大模型装上「鹰眼」!首创高刷视频理解,谷歌Gemini 2.5完败

面壁智能开源MiniCPM-V 4.5模态端侧模型,8B参数越级反超72B巨无霸,在领域达SOTA。它首创高刷视频理解,性能强、效率高、适合端侧部署,还实现技术创新,是开源端侧模态AI的革命。

新智元
开源动态8

揭秘开源Agentic‑Doc真能支撑120 W+ 查询?医疗/金融/法务都在用,确实是有这么 6~~~

LandingAI的Agentic Document Extraction是领先OCR且具视觉结构化能力的Python SDK,可处理复杂文档。它功能丰富,架构合理,支持格式输出。在行业有应用,性能提升显著,与同类项目相比优势明显。

小华同学ai
开源动态8

3000块钱,这支中国团队把ChatGPT成功的“秘密”用在了机器人训练

国内穹明智能团队推出千元级手持采集系统 UMI ver.2 并开源。该系统精度达毫米级、能双臂协同,成本低、部署快。团队认为数据是关键,还计划搭建机器人数据 infra,预计新模型范式很快出现。

AI前线
新闻资讯7

刚刚,国产GPU赛道又跑出一个 2700 亿估值独角兽!“中国AMD”沐曦股份完成 IPO,开盘大涨超 500%

2025年12月沐曦登陆科创板,股价达679元/股,估值破2700亿。其定位全栈GPU提供商,产品覆盖领域。2022 - 2024年营收三年复合增长率超4000%,但累计净亏损超30亿。核心团队来自AMD。

InfoQ
产品应用7

Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能

OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。

CourseAI
算法论文8

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。

机器之心
算法论文8

关键突破:理论验证了 RL for LLM 路线的可行性

传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。

深度学习自然语言处理
开源动态8

4K Star的人 Agent 协作平台 Multica!Agent即队友,可像同事一样被指派、被追踪!

当前 Agent 协同缺乏统一管理和经验沉淀,GitHub 开源的 Multica 平台解决了这一问题。它把编码 Agent 变成队友,自动化处理任务,支持 Agent 后端,有种功能特性,提供云服务和自托管两种使用方式。

开源星探