「策略判别学习」共找到 2106 篇相关文章
Claude Code 推出学习模式,比ChatGPT更激进:甚至能给你部署作业……
Anthropic为Claude Code和Claude应用推出全新学习功能,Claude Code支持切换交流风格,Learning模式像结对编程,会留作业。Claude实现方式比ChatGPT激进,开发者反响热烈,标志其向更智能教育方向发展。
经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning
该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在多样环境中效果出色,为智能体训练提供新思路。
AlphaGo之父找到创造强化学习算法新方法:让AI自己设计
谷歌DeepMind团队在Nature发表论文,探索AI自主发现强化学习算法的可能。团队负责人是“AlphaGo之父”David Silver 。方法是基于智能体经验元学习,实验显示自动发现的规则表现优异,未来强化学习算法或无需人工设计。
Yann LeCun最新纪录片首曝!传奇AI教父的双面人生,深度学习幕后40年
Yann LeCun新纪录片上线,回顾其深度学习四十年历程。他是深度学习开创者、Meta首席AI科学家,坚信机器应学会学习,认为AI竞争是开放与封闭之争,还对AI威胁论持务实乐观态度。
微软副总裁X上「开课」,连更关于RL的一切,LLM从业者必读
微软副总裁 Nando de Freitas 在 X 上「开课」,分享人工智能教育帖子,从 LLM 的强化学习讲起。内容涵盖无监督、监督、强化学习定论,分布式强化学习系统构建,RL 用于后训练 LLM 等,还介绍单步强化学习与策略梯度及相关技巧。
一篇持续强化学习技术最新综述
文章对持续强化学习(CRL)进行全面考察,关注其核心概念、挑战和方法,提出新的分类体系,从知识存储和/或转移角度将CRL方法分为四类,并分别介绍各类方法特点。
OpenAI 新的学习模式的系统提示词
本文介绍OpenAI新学习模式的系统提示词,包括严格规则,如了解用户、温故知新等,还说明了可做的事,如教授新概念、辅导作业等,强调语气方式及不要直接给答案。
人手一个顶级家教!OpenAI深夜重磅:ChatGPT「学习模式」上线
OpenAI推出ChatGPT「学习模式」,旨在支持真正的学习。该模式从答案机变导师,通过定制指令实现智能教学,有交互式提示等特性,测试反馈积极,未来还会有更多功能。
哇塞!Chrome MCP + OpenAI Whisper = 播客秒变学习笔记
作者分享Chrome MCP + OpenAI Whisper将播客秒变学习笔记的工作流。此组合成本低、无限制、学习成本低,通过实例演示音频下载、转录及划重点等步骤,适用于多种场景,性价比高。
100万美元图灵奖奖金,强化学习师徒想献给科研自由
3月5日,Andrew Barto和Richard Sutton因强化学习获图灵奖。Communications of the ACM对其采访,谈及研究经历与AI未来。100万美元奖金用途未明,Sutton或捐Openmind,Barto计划设奖学金。