体验式学习」共找到 2562 篇相关文章

算法论文8

突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR

现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。

机器之心
算法论文8

大模型推理学习新范!ExGRPO框架:从盲目刷题到聪明复盘

上海人工智能实验室等团队提出经验管理和学习框架ExGRPO,能科学管理经验。与传统RLVR方法比,它在不同基准提升性能,尤其复杂推理任务,还揭示滚雪球效应,为模型推理训练提供新思路。

量子位
算法论文7

Thinking Machines曝LoRA终极指南:10倍学习率,媲美全参微调

Thinking Machines推出论文《LoRA Without Regret》,研究LoRA与FullFT达到相近表现的条件。通过实验发现,把握关键细节,LoRA可与FullFT性能相当,还探讨了关键因素、批大小效应等内容。

新智元
算法论文8

大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。

机器之心
算法论文8

Nature重磅:AI和人脑的根本区别找到了,我们对“聪明”的理解可能全错了

2025年《自然·机器智能》研究指出AI和人类在‘泛化能力’上本质不同。人类泛化靠抽象,学习高效;AI泛化靠统计,学习笨重。未来AI与人应互补协作,而非谁取代谁。

AIGC开放社区
产品应用8

真情实感体验了阿里「千问APP」后,为什么说它是「中国的ChatGPT」?

近日阿里推出面向全球的千问APP。从产品定位、模型能力、效果来看,它接近ChatGPT,是“中国的ChatGPT”。它打通Qwen模型和应用,界面极简,功能多,体验佳,有望让大家重新认识阿里大模型应用。

机器之心
产品应用8

啊?豆包居然也开始卷AI编程了?

作者体验发现豆包更新了“应用创造1.0”标识的AI编程功能。该功能不仅能生成代码,还能可视化修改网页结果,用户操作轻松,降低了AI编程门槛,体验远超其他同类产品。

数字生命卡兹克
算法论文7

函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025

中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。

量子位
新闻资讯7

RPA要没了

Codex更新Record & Replay功能,虽与RPA表面都是录制操作、重复执行,但底层逻辑不同。RPA是指令,有诸多缺陷;Codex是目标,是RPA替代品,还构建了企业自动化体系。

newtype AI
算法论文8

告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026

树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。

AI科技大本营