两阶段训练策略」共找到 3206 篇相关文章

产品应用8

揭秘夸克首个高考志愿大模型!蒸馏数百名人类专家经验、Agent 可完整生成志愿报告

6月12日,夸克发布国内首个高考志愿大模型,上线‘高考深度搜索’等三大核心功能。其‘志愿报告’以Agent运行,能输出完整报告;模型经多阶段训练,搭载最大高考知识库,为考生提供精准志愿填报服务。

AI科技大本营
算法论文8

以星为舵:LLM的Post-Train与Rest-Time奖励学习综述

这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。

深度学习自然语言处理
算法论文8

从打分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer
算法论文8

幻觉的根源找到了:大模型说谎,是为了讨好你

清华大学OpenBMB团队研究发现,大模型胡说八道根源是想讨好用户。他们识别出负责产生幻觉的H - Neurons,占比不到0.1%,其本质是‘过度服从’,在预训练阶段形成,为构建可靠模型提供新视角。

AI工程化
产品应用8

英伟达拿出推理版VLA:Alpamayo-R1让自动驾驶AI更会动脑子

当今自动驾驶模型虽强大,但在‘长尾场景’易翻车。英伟达推出的Alpamayo - R1是带推理能力的视觉 - 语言 - 行动模型,有核心创新,实验中性能显著提升,训练分三阶段,让自动驾驶迈向可解释。

机器之心
算法论文8

突破瓶颈,嵌入式AI神经持续学习引擎—Replay4NCL

阿联酋、纽约、巴基斯坦大学研究人员推出Replay4NCL,解决嵌入式AI持续学习难题。它优化记忆重放,有创新架构和训练策略。实验显示其精度高、延迟低、省内存、能耗少,成果将在2025年DAC大会展示。

AIGC开放社区
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型

多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。

深度学习自然语言处理
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
开源动态8

小米陈龙团队首作:统一具身与自动驾驶的开源模型

小米具身智能团队发布首篇论文,提出统一具身智能与自动驾驶的新模型MiMo-Embodied。该模型在多任务中领先,其四阶段训练框架打通两领域边界,为行业提供新范式。

AI科技评论