可验证过程奖励」共找到 1293 篇相关文章

产品应用7

GLM-4.5 验证:智谱已完成一轮“洗牌”

2025年大模型热度下降,智谱AI关注度降低。7月28日晚其发布新一代基础模型GLM - 4.5,体现战略调整成效。该模型专为AI Agent打造,性能出色,同时智谱人事、业务、收入等方面也有“洗牌”。

AI科技评论
新闻资讯7

Bug变奖励:AI的小失误,揭开创造力真相!

最新研究发现,AI的「创造力」并非额外能力,而是架构副作用。扩散模型本应是复制机器,却画出奇怪图像。研究者基于规则构建数学系统,证明了这一观点,还推测人类灵感或许同理。

新智元
推荐文章8

Agent/Skills/Teams 架构演进过程及技术选型之道

文章结合作者实践与多篇论文,梳理Agent架构从单点提示词调用到Agent Teams的演进逻辑,分析Single Agent、Multi - Agent、Agent Skills、Agent Teams的优劣,给出架构选型建议,强调架构应与问题复杂度匹配。

阿里云开发者
算法论文8

Meta提出StepWiser,让模型学会“反思”自己的推理过程

Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。

深度学习自然语言处理
产品应用7

解密 Cursor:一位深度用户的原理探析与实验验证

文章作者作为 Cursor 付费用户,通过实验分析其与大模型通信机制和设计原理。用 OpenAI 的`gpt - 4o`模型做实验,发现它是‘基模 + 若干工具’组合,也指出在真实项目因上下文不足表现不佳。

阿里云开发者
产品应用8

不卷速度卷验证,陈天桥MiroMind精准预测15天后黄金价格

陈天桥带队的MiroMind发布新一代重型推理智能体MiroThinker-1.7和MiroThinker-H1,在基准测试中表现优异,超越众多顶尖模型。该模型不仅通用任务强,在科技金融等专业领域也表现亮眼,还能承担真实长链条智力任务。

量子位
算法论文8

从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁

多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。

机器之心
新闻资讯7

GAIR Live 预告|智能始于记忆,AgentMemory 的技术演化过程

在人工智能走向智能体阶段,‘记忆’成焦点。如今大模型‘记不住’上下文,‘从Human Memory到Agent Memory’跃迁是迈向具身智慧关键。GAIR Live将邀专家探讨记忆技术逻辑与路径。

AI科技评论
算法论文8

告别多奖励跷跷板:Flow-OPD将多教师OPD带入图像生成

中国科学技术大学等机构团队提出Flow - OPD,这是首个将OPD引入流匹配模型的统一多任务后训练框架。它解决了流匹配模型后训练对齐中多任务的梯度冲突等问题,效果良好,未来有多个拓展方向。

机器之心
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元