自我奖励」共找到 537 篇相关文章

开源动态8

6.6K标星!微软开源Agent自我优化框架,为智能体注入持续学习能力!

开发AI Agent常面临部署后难自动优化的问题。微软开源的Agent Lightning,加几行代码就能让Agent自动学习、持续优化,有事件追踪等核心能力,安装简单,应用场景丰富。

开源星探
算法论文7

「微调已死」再添筹码,谷歌扩展AI自我进化范式,成功经验与失败教训双向学习

近期,‘微调已死’言论引关注。谷歌《ReasoningBank: Scaling Agent Self - Evolving with Reasoning Memory》论文提出类似概念,可让智能体从自身成败经验学习,还引入MaTTS,实验显示其有效性和效率优于基准方法。

机器之心
算法论文8

泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法

随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。

机器之心
算法论文8

AI 终于学会 「自我坦白」!Anthropic最新论文震撼来袭,「内省适配器」让黑盒模型自己说出隐藏行为

2026年4月28日,Anthropic联合剑桥大学发布论文,提出“内省适配器”技术,可让大模型用自然语言“坦白”微调中学到的行为。该技术在AuditBench基准测试等实战中表现出色,但也存在高误报率等局限。

AI科技评论
新闻资讯7

金山、Zilliz、腾讯、灵犀量子专家齐聚,揭秘 AI 记忆、RAG 演进与自我进化的工程实践 | AICon

2025 年构建复杂 AI 系统面临记忆缺失、检索瓶颈、认知固化等系统工程挑战,Context Engineering 是关键。AICon 北京站邀金山、Zilliz、腾讯、灵犀量子专家,分享上下文工程技术实践。

InfoQ
开源动态8

Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成

当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估。

机器之心
产品应用8

打破56年数学铁律!谷歌AlphaEvolve自我进化实现算法效率狂飙,堪比AlphaGo“神之一手”

谷歌DeepMind联合顶尖科学家打造「通用科学人工智能」AlphaEvolve,打破矩阵乘法领域56年效率基准,将4x4矩阵乘法标量乘法次数从49次降至48次,还在谷歌内部加速了运算、缩短训练时间。文中介绍其原理与技术。

量子位
算法论文8

大模型也需要自我反思,上海AI Lab合成“错题本”让大模型数学成绩提升13.3%

上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让大模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。

量子位
新闻资讯7

全球人工智能创新创业大赛即将启幕!杭州拱墅全力打造AI创新高地

2025年6月,‘智汇运河·智算未来’全球人工智能创新创业大赛将启幕。大赛由杭州市拱墅区等联合主办,聚焦前沿领域,面向全球征集项目,设千万扶持奖励,助力拱墅打造AI创新应用示范区。

量子位
产品应用6

记一次cursor编程代码修复的过程

作者分享用Cursor编程时遇到代码bug的修复过程。Cursor写的代码运行报错,自我修复及借助千问、DeepSeek都无果,最后靠谷歌找到解决办法,还提醒要降低对Cursor的依赖。

Agent的潜意识