算法论文8
EvolveR:让Agent从经验中长出Skill
量子位
AI 摘要
上海人工智能实验室团队提出EvolveR,让Agent从自身成败中总结经验形成“认知Skill”,经强化学习学会用经验。实验显示它在多跳问答表现优,小模型借外部教师,3B模型自总结更好。
阅读原文 · 量子位
Agent学会自己「长」Skill了!从失败里长出经验,比人类写的更好用|ICML 2026
ICML 2026接收论文提出EvolveR,让Agent从自身成败轨迹自动蒸馏“经验”,经闭环生命周期形成“认知Skill”,维护经验库,用强化学习让其学会“使用经验”,在多跳问答表现优。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
百融智能“硅基客服”跨行业上岗
今年7月,一家头部物流企业和大型综合类头部券商上线百融智能的AI客服,业务量和部署规模增长显著。百融智能正战略升级,以新一代AICC智能联络技术向多行业拓展,其创始人张韶峰分享了相关思考与技术优势。
机器之心
开源动态7
EvoMap:构建自进化 Agent 网络
当下 Work Agent 难以稳定完成复杂长程任务,且经验无法沉淀。EvoMap 提出自组织蜂群架构,通过 AutoResearch 落地验证,探索 AI4AI 方向,构建记忆和连接的三层产品结构,推动 Agent 网络自进化。
特工宇宙
推荐文章8
EvoMap团队给出RSI工程新解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。
机器之心
算法论文8
阿尔伯塔大学:FAME破解强化学习遗忘难题
阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。
AI科技评论