可验证过程奖励」共找到 1293 篇相关文章

新闻资讯7

刚刚,全球最难考试惊天大反转!黑马AI冲破36%,顶流模型集体翻车

ARC-AGI-3测试中,顶级大模型Opus 4.6仅得0.2%,人类获满分。而Symbolica公司用Agentica框架首日就取得36.08%的成绩。该框架有独特技术路径和策略,但成绩未经验证,ARC-AGI-3被视为通向AGI的‘北极星’。

新智元
产品应用7

自写驱动越狱!Gemini 3 Pro零败绩通关宝可梦:效率碾压前代8倍「Agent进化太快了」

在全自动《宝可梦 水晶版》对决中,Gemini 3 Pro击败Gemini 2.5 Pro,通关速度至少快2倍,前代或慢8倍。它还展现出诸多能力,如自写驱动绕过限制等,但也存在不验证假设等局限。

AI寒武纪
开源动态7

只要强化学习1/10成本!翁荔的Thinking Machines盯上了Qwen的黑科技

新智元报道,翁荔的Thinking Machines研究同策略蒸馏策略,能以1/10强化学习成本,结合同策略训练优势与密集奖励信号。该策略受DAGGER启发,扩展Qwen3团队工作,可在Tinker复现,还能用于个性化和持续学习。

新智元
推荐文章7

为什么我用了那么多提示词模板甚至用了 AI 帮忙还是写不好提示词?

现在很多人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整。

宝玉AI
开源动态8

ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律

openJiuwen社区的ScienceDiscovery把科研试错交给程序,通过树搜索实现科研场景产物RSI。它能在多个案例中高效产出成果,成本低、耗时短,且底座灵活,可换算法和任务,但推广需解决验证速度和可信度问题。

量子位
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
算法论文8

语言反思>强化学习:伯克利新架构碾压传统RL

大型语言模型下游任务优化依赖强化学习,但计算成本高。伯克利等机构论文提出GEPA新型优化器,将LLM执行轨迹转化为诊断信号,用语言反馈替代标量奖励,仅用传统方法1/35计算量,性能最高提升19%。

深度学习自然语言处理
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
新闻资讯8

AI「生肉证明」堆爆GitHub!陶哲轩重磅发声:只会解题没用了

陶哲轩判断数学从证明稀缺进入过剩时代,AI 使证明生成加速,出现验证和消化跟不上的‘阻抗失配’现象。如 Erdős 问题有众多待评估方案堆积,而仅1196号案例跑通‘三件套’。他还指出学术评价体系将重写。

新智元
算法论文7

科学家证实磁场真的能改变基因表达,但它的要求非常严苛

韩国东国大学 Jongpil Kim 团队研究证实磁场能改变基因表达,该团队绕开 ferritin 路线,通过全基因组筛选找到关键基因 Cyb5b,拼起磁场→基因表达分子链,并在抗衰老、阿尔茨海默病、抑郁症血清素调控方面做了活体验证

DeepTech深科技