多阶段强化学习」共找到 2106 篇相关文章

产品应用8

借鉴人脑「海马体-皮层」机制,红熊AI重做了一个「记忆系统」

记忆成AI进化关键,Google Research新论文提出「嵌套学习」范式。红熊AI受业务难题启发,推出「记忆熊」,借鉴人脑机制重构记忆系统,在多场景应用落地,提升了服务质量和效率。

机器之心
新闻资讯8

OpenAI 直播摘要:AI 将推动科学进步,个人 AGI 即将到来,未来将非常光明

OpenAI 直播中,Sam Altman 和 Jakub Pachocki 透露重磅信息,称个人 AGI 即将到来,未来光明。公布通向超级智能时间表,对深度学习有信心,谈及基础设施扩张、公司架构变化等,还预测科学发现进程。

AGI Hunt
推荐文章7

17.6K Star跨平台逆向工程神器!免费替代IDA Pro,支持插件扩展!

在二进制文件分析或软件逆向工程中,专业工具如IDA Pro界面复杂、学习成本高。文章推荐开源跨平台逆向工程平台Cutter,它基于rizin核心引擎,功能完善,可降低使用门槛。

开源星探
算法论文8

任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B

现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。

量子位
算法论文8

大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

来自多机构的研究团队发布“可实践的机制可解释性”综述,通过 'Locate, Steer, and Improve' 三阶段范式,为大模型的对齐、能力增强和效率提升提供方法论,还梳理可解释对象体系和干预手段。

机器之心
推荐文章8

《DeepSeek掘金》背后的故事——从行业寒冬到AI春潮,用腾讯IMA知识库重构价值

本文讲述《DeepSeek掘金》成书背后的故事。从行业寒冬到AI春潮,编委们因DeepSeek迎来职业转机。面对出版市场乱象,用腾讯IMA知识库完成创作,还打造四位一体学习方案,致敬梁文锋与DeepSeek理想主义。

AIGC开放社区
算法论文8

无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%

西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。

机器之心
算法论文8

ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力

美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。

机器之心
开源动态8

字节最火的开源Agent项目,如何思考Agent的自我进化?

4月5日,LangChain创始人Harrison Chase阐述对Agent自我进化的思考,认为Agent系统可在Model、Harness、Context三层持续进化。知名开源框架DeerFlow联合作者Daniel也补充了团队思考。

Founder Park
推荐文章8

硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。

文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。

AI大模型应用实践