「离线强化学习」共找到 1551 篇相关文章
哇塞!Chrome MCP + OpenAI Whisper = 播客秒变学习笔记
作者分享Chrome MCP + OpenAI Whisper将播客秒变学习笔记的工作流。此组合成本低、无限制、学习成本低,通过实例演示音频下载、转录及划重点等步骤,适用于多种场景,性价比高。
姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”
姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。
多模态大模型持续学习系列研究,综述+Benchmark+方法+Codebase一网打尽!
近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、方法、Benchmark和Codebase,为相关人员提供全面支持。
LLM 语境下,「持续学习」是否是 「记忆」 问题的最优解?
本期通讯解读 3 个 AI 业内要事,包括谷歌嵌套学习范式引争议、AI 产品记忆方向探讨、英伟达合成数据等。谷歌 NL 范式想规避遗忘问题,测试中 HOPE 表现优,但也遭质疑,当前 LLM 研究更关注改善记忆。
LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力
LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。
机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习
端到端策略模型在物理世界失灵,现有在线学习路径未走通。清华 AIR 与域变换联合推出 Zetta ζ,通过三个闭环实现闭环物理智能体在线学习,实验显示其任务成功率高,还让机器人出现‘Aha Moment’。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。
刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习
腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。
谷歌让机器人「长脑子」了!首发离线具身VLA模型,断网精准操控
谷歌首发具身智离线模型Gemini Robotics On-Device,实现VLA多模态大模型在具身机器人本地离线运行,无网络也能稳定运行。谷歌还开源了SDK,具身智能迈向实用化新阶段。
ChatGPT「学习模式」火爆上线,一大波教育AI连夜被端!24小时导师免费用
OpenAI为ChatGPT上线苏格拉底「学习模式」,针对大学生,以交互式提示、分步解答等功能引导学习,可应对复杂学科难题。一经推出便受网友热捧,有人预言将端掉一波教育类AI。