持续学习范式」共找到 2457 篇相关文章

新闻资讯8

强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神

2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。

AGI Hunt
新闻资讯7

Claude1.7万字系统提示词全网刷屏!Karpathy锐评:LLM训练缺乏关键范式

Claude近1.7万字系统提示词在GitHub泄露,网友称是提示技术的金矿。大神卡帕西提出系统提示学习范式,模拟人类经验积累,让LLM有‘记忆’功能,引发网友激烈讨论。

量子位
算法论文8

IEEE TPAMI 2025 | 北京大学提出分布驱动的终身学习范式,用结构建模解决灾难性遗忘

北京大学周嘉欢与彭宇新教授合作在 IEEE TPAMI 发布研究成果 DKP++,针对终身学习的灾难性遗忘问题,提出分布建模引导的框架,增强历史知识记忆与跨域学习能力,代码已开源。

机器之心
算法论文8

ICLR 2026 | 从「聚合」到「引导」:FedDRM开启客户端智能路由新范式

传统联邦学习中,统计异质性是障碍,本文提出 FedDRM,将联邦学习从「聚合范式」拓展到「路由范式」,让服务器能把问题交给最合适的客户端处理,在多数据集上提升系统准确率,为多场景提供新可能。

机器之心
新闻资讯7

Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死

AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时长下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增长曲线待发现。

新智元
算法论文8

SFT远不如RL?永不过时的剃刀原则打开「终身学习」大模型训练的大门

现代AI系统学习新任务时会灾难性遗忘旧知识,限制其持续学习能力。麻省理工学院研究者对比SFT和RL后发现,相同性能下RL更不易遗忘,提出遗忘定律,解释了RL优势源于其on - policy特性。

机器之心
开源动态8

6.6K标星!微软开源Agent自我优化框架,为智能体注入持续学习能力!

开发AI Agent常面临部署后难自动优化的问题。微软开源的Agent Lightning,加几行代码就能让Agent自动学习持续优化,有事件追踪等核心能力,安装简单,应用场景丰富。

开源星探
开源动态7

只要强化学习1/10成本!翁荔的Thinking Machines盯上了Qwen的黑科技

新智元报道,翁荔的Thinking Machines研究同策略蒸馏策略,能以1/10强化学习成本,结合同策略训练优势与密集奖励信号。该策略受DAGGER启发,扩展Qwen3团队工作,可在Tinker复现,还能用于个性化和持续学习

新智元
算法论文8

经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning

该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在多样环境中效果出色,为智能体训练提供新思路。

深度学习自然语言处理
算法论文8

从「会说」迈向「会做」,LLM下半场:Agentic强化学习范式综述

过去LLM训练多依赖PBRFT范式,但局限明显。2025年初起,Agentic RL新范式受关注。此综述论文梳理该方向,覆盖500+研究,构建理论框架,讨论未来挑战,助LLM从「会说」迈向「会做」。

机器之心