「过程奖励」共找到 536 篇相关文章
Bug变奖励:AI的小失误,揭开创造力真相!
最新研究发现,AI的「创造力」并非额外能力,而是架构副作用。扩散模型本应是复制机器,却画出奇怪图像。研究者基于规则构建数学系统,证明了这一观点,还推测人类灵感或许同理。
Agent/Skills/Teams 架构演进过程及技术选型之道
文章结合作者实践与多篇论文,梳理Agent架构从单点提示词调用到Agent Teams的演进逻辑,分析Single Agent、Multi - Agent、Agent Skills、Agent Teams的优劣,给出架构选型建议,强调架构应与问题复杂度匹配。
Meta提出StepWiser,让模型学会“反思”自己的推理过程
Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。
GAIR Live 预告|智能始于记忆,AgentMemory 的技术演化过程
在人工智能走向智能体阶段,‘记忆’成焦点。如今大模型‘记不住’上下文,‘从Human Memory到Agent Memory’跃迁是迈向具身智慧关键。GAIR Live将邀专家探讨记忆技术逻辑与路径。
告别多奖励跷跷板:Flow-OPD将多教师OPD带入图像生成
中国科学技术大学等机构团队提出Flow - OPD,这是首个将OPD引入流匹配模型的统一多任务后训练框架。它解决了流匹配模型后训练对齐中多任务的梯度冲突等问题,效果良好,未来有多个拓展方向。
告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%
美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。
模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源
阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示多个证明案例。
Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险
近年来,基于大语言模型的智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。
Anthropic祭出大模型“读脑”杀手锏:LLM决策过程全给你扒开看
Anthropic宣布开源电路追踪工具,可追踪LLM神经元,通过生成“归因图谱”揭示模型输出原因。开源了生成图谱的库和交互式前端,并提供demo notebook。可追踪电路、可视化图谱、检验假设。
谷歌给「AI解数学题」神话降温:能摘低垂果实,但过程依然痛苦
谷歌用Gemini对700个Erdős猜想做攻关实验,推进13个问题。但他们指出,这并不意味着AI能自动做数学研究,其背后核验等成本远超想象,还需警惕‘潜意识抄袭’。