体验式学习」共找到 2560 篇相关文章

算法论文8

SAPO:让强化学习告别“硬剪切”

强化学习是提升大语言模型推理能力的核心技术之一,但现有基于组的策略优化方法面临 token 级重要性比率高方差问题。GRPO 和 GSPO 采用硬剪切有学习信号丢失等缺点。为此提出 SAPO,用平滑门控函数替代硬剪切,实验效果良好。

通义千问Qwen
新闻资讯7

Gartner发布生成AI模型提供商魔力象限

Gartner发布《生成AI模型提供商创新指南》,首次对生成AI市场进行象限划分,按功能完整性和未来潜力将厂商分为新兴领导者、新兴挑战者、新兴远见者和新兴专家四个区域,还指出AI正从实验转向企业核心层。

AI工程化
产品应用8

人手一个顶级家教!OpenAI深夜重磅:ChatGPT「学习」上线

OpenAI推出ChatGPT「学习」,旨在支持真正的学习。该模从答案机变导师,通过定制指令实现智能教学,有交互提示等特性,测试反馈积极,未来还会有更多功能。

AI寒武纪
产品应用8

哇塞!Chrome MCP + OpenAI Whisper = 播客秒变学习笔记

作者分享Chrome MCP + OpenAI Whisper将播客秒变学习笔记的工作流。此组合成本低、无限制、学习成本低,通过实例演示音频下载、转录及划重点等步骤,适用于多种场景,性价比高。

AI 产品自由
新闻资讯8

100万美元图灵奖奖金,强化学习师徒想献给科研自由

3月5日,Andrew Barto和Richard Sutton因强化学习获图灵奖。Communications of the ACM对其采访,谈及研究经历与AI未来。100万美元奖金用途未明,Sutton或捐Openmind,Barto计划设奖学金。

新智元
算法论文7

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习

姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。

量子位
新闻资讯8

强化学习之父Richard Sutton最新采访:LLM是“死路一条”

强化学习之父Richard Sutton在采访中批判当前由LLMs主导的AI发展路径,认为其是死胡同,缺乏真实世界模型与目标。他构想‘经验时代’新范,预言权力向更高级智能转移,也指出未来面临腐败与价值观挑战。

AI寒武纪
新闻资讯7

LLM 语境下,「持续学习」是否是 「记忆」 问题的最优解?

本期通讯解读 3 个 AI 业内要事,包括谷歌嵌套学习引争议、AI 产品记忆方向探讨、英伟达合成数据等。谷歌 NL 范想规避遗忘问题,测试中 HOPE 表现优,但也遭质疑,当前 LLM 研究更关注改善记忆。

机器之心
推荐文章8

智能体时代的强化学习:AReaL 框架与 Agent 最佳实践

本文整理自吴翼博士在 2025 年 QCon 全球软件开发大会的分享。他介绍 AReaL 框架及 Agent 最佳实践,阐述强化学习与大模型联系,指出 Agent 是 AGI 未来 5 年关键,强化学习是 Agent 技术核心,还分享团队成果与经验。

InfoQ
开源动态8

LeRobot v0.4.0 正发布:全面提升开源机器人的学习能力

LeRobot v0.4.0 正发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。

Hugging Face