有监督学习」共找到 7086 篇相关文章

算法论文8

刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。

机器之心
推荐文章7

AI 基础知识从-1到0.1:带你走进机器学习的世界

文章沿着AI发展脉络,从Seq2Seq到GPT模型,深入介绍关键技术原理。以简明方式梳理AI基础概念,涵盖人工智能、机器学习等定义,还介绍了各类学习方法、特征工程及向量化等内容,最后提及模型应用流程和Quick BI助力企业分析。

阿里云开发者
算法论文8

强化学习+大模型记忆:Mem-α,让智能体第一次学会“如何记忆”

在大语言模型发展中,‘记忆’是智能体具备长期智能的关键。现外部记忆系统局限,Mem-α将强化学习引入大模型记忆管理体系,解决记忆难题,在性能、泛化等多方面表现出色。

机器之心
算法论文8

用动作分块突破RL极限,伯克利引入模仿学习,超越离线/在线SOTA

如今强化学习在多领域成果显著,但在长跨度、稀疏奖励任务中表现欠佳。加州大学伯克利分校研究者提出Q - chunking方法,将动作分块引入基于时序差分的强化学习,解决探索效率和值传播问题,实验表现优异。

机器之心
推荐文章7

关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章

训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据局限。

机器之心
算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查器,但很多价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心
产品应用8

8块钱跑通一次强化学习全流程,潞晨云重塑微调赛道:1名算法工程师=1支Infra团队

大模型下半场,后训练特别是强化学习成核心战场。潞晨云微调SDK上线,它是国内首个全面开放、且兼容Tinker范式的Serverless微调平台,为强化学习提供低成本解法,在易用性和成本上优势。

量子位
开源动态8

9.1K Star 调参师集体失业!亚马逊造出机器学习“核弹”,3行代码打造高精度模型!

在机器学习普及的当下,自动化机器学习框架降低开发门槛。AutoGluon由AWS AI开发并开源,仅3行代码就能训练和部署高精度模型,支持多类型数据,诸多亮点,已获9.1K Star。

开源星探
算法论文8

ICML26 | 浙江理工大学马啸讲师和南京大学李武军教授课题组联合提出EMCES:为强化学习合成更价值的样本

强化学习获取高质量样本成本高、风险大,现基于扩散模型的样本增强方法局限。浙江理工大学马啸讲师和南京大学李武军教授课题组提出 EMCES,将情景记忆机制引入可控扩散模型,提升下游强化学习算法表现,论文已被 ICML2026 录用。

机器之心
算法论文8

AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型

文本提示图像分割技术战略意义,但基于监督式微调的方法泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。

机器之心