自闭环验证」共找到 2064 篇相关文章

算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
算法论文8

超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发

斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。

量子位
推荐文章7

深度解析LLM Wiki / Obsidian-Wiki / GBrain:Agent时代知识的“组织”与“进化”

文章深度解析LLM Wiki、Obsidian - Wiki和GBrain项目,探讨Agent时代知识的“组织”与“进化”。指出传统知识管理有短板,而这些项目通过不同方式解决知识结构化、沉淀和更新问题,各有优劣。

阿里云开发者
产品应用7

Figma 研了 Redis 代理,实现六个 9 可用性

Figma发布研Redis代理服务FigCache详细实践,替换旧缓存栈。2025年下半年上线,实现六个9可用性。它基于ResPC构建,分离前后端,配置灵活,处理Redis Cluster问题,迁移策略可回退。

InfoQ
新闻资讯7

谷歌Dreamer大神离职!「辛顿门徒」曝错过Transformer

谷歌世界模型大牛Danijar Hafner宣布离任,他2016年起在谷歌相关团队工作近十年,曾获辛顿指导,主导开发Dreamer系列。他还曝曾错过Transformer,当时未在意其优势。

新智元
开源动态8

“OpenClaw 类”进化智能体代表项目介绍

文章指出传统 Agent 存在记忆短暂、能力固定的瓶颈,介绍了 OpenClaw 生态中“进化”的不同形态,还列举了 Nanobot、AutoResearchClaw 等多个代表性项目,阐述其特点和应用场景,最后抽象出进化智能体的共同要素和工程模式。

AIGC开放社区
算法论文8

一篇进化Agents技术最新综述:迈向人工超级智能

LLMs有局限性,研究者关注进化Agents系统,其范式转变为人工超级智能铺路。文章回顾进化智能体研究进展,围绕‘什么要进化’‘何时进化’‘如何进化’展开,提供理论和实践指导。

PaperAgent
开源动态7

Agent能己“复盘”和“进化”,这个开源框架牛了!

文章介绍了进化AI,其核心是执行、评估、进化的反馈循环,能动修改Prompt和工作流。还讲解了SEW、TextGrad等优化器原理,并以SEW为例展示逻辑,最后推荐开源框架EvoAgentX。

探索AGI
算法论文8

StereoAdapter:北大首提监督,适配水下双目深度估计

水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合单双目视觉,以监督学习适配视觉基础模型到水下域,设计双阶段结构、监督训练策略等,实验效果好,未来还将多方面改进。

新智元
产品应用8

构建知识闭环:用CodeBuddy打造我进化的数据分析体系

腾讯团队为解决数据分析痛点,构建知识闭环体系,利用CodeBuddy设计开发规范、动生成SQL,将编码从小时级降至分钟级。体系含沉淀、传递、生成、信赖、闭环五环,提升团队效率与协作。

腾讯技术工程