多步聚合训练」共找到 5661 篇相关文章

算法论文8

从打分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
新闻资讯7

新“SOTA”推理模型避战Qwen和R1?欧版OpenAI被喷麻了

“欧洲的OpenAI”Mistral AI发布首款推理模型Magistral,却再遭质疑未与最新版Qwen和DeepSeek R1对比。该模型亮点是支持语言推理,以纯RL方式训练,为LLM强化学习提供新范式。

量子位
算法论文8

首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26

STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在任务表现优,成本低且泛化能力强。

新智元
算法论文8

让LLM扔块石头,它居然造了个投石机

港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,个模型测试表现良好。

量子位
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的模态大模型

模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在评测中达SoTA,省资源且效果好。

深度学习自然语言处理
算法论文8

Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转

Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在任务上媲美或超最优算法,训练成本低、速度快,还能适配任务。

机器之心
产品应用8

基于大模型(LLM)的自选股智能分析系统,让AI帮你盯盘,每天自动推送分析报告

daily_stock_analysis是基于LLM的自选股智能分析系统,免费零成本运行,获6.3万Star。它市场覆盖、聚合源数据,自动生成决策报告并推送。有零成本运行等五大亮点,还给出上手步骤、适合人群。

机器学习AI算法工程
开源动态8

10B超越Gemini-2.5-Pro!阶跃星辰端侧模态天花板开源

阶跃星辰模态智能团队开源STEP3-VL-10B模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在任务上表现出色,为小模型发展提供新思路。

AIGC开放社区
开源动态8

横扫19项榜单!大晓机器人开源全球首创空间智能底座

大晓机器人联合机构推出通用基础模型“ACE - Brain - 0”并全行业开源。它打破本体壁垒,在24个核心benchmark中19个获SOTA成绩,应用于机器狗,还提出新训练范式,统一四大能力,重新定义通用具身智能。

AI科技评论
算法论文8

GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026

本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在基准任务上超越基线算法。

AI科技评论