算法论文8
RM - R1:重塑奖励模型推理价值
机器之心
AI 摘要
伊利诺伊大学团队:RM - R1 将奖励建模变为推理任务,引入 CoR 机制。两阶段训练后,在多基准测试超大规模模型,证明推理能力关键,为奖励模型研究指明新方向。
阅读原文 · 机器之心
从打分器到思考者:RM-R1用推理重塑模型价值判断
伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
牛津、NUS 提出心智世界建模新方向
牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。
机器之心
新闻资讯7
DeepSeek V4 Pro 发布,撞车马斯克 Grok 4.6
周三晚间,DeepSeek 突然发布 V4 Pro 大语言模型正式版,命名为 DeepSeek - V4 - Pro - 0813,官方未调升 API 使用价格。有用户称调用的 V4 Pro 思维链风格有变,跑分显示其 Agent 评测表现可媲美顶级模型,还撞车了马斯克的 Grok 4.6。
机器之心
算法论文8
港校提出 Libra,Agentic RL 吞吐最高提 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
机器之心
算法论文8
TurboVLA:绕开LLM实现高效动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
机器之心