可验证过程奖励」共找到 1288 篇相关文章

算法论文7

从 RLVR 到 RLSVR:开放式任务如何获得可核验奖励

COLM 2026 论文提出 RLSVR 及 SpyRL,把摘要等开放任务变成“谁是卧底”游戏,用投票生成可核验奖励,在多任务有提升,但也暴露代理目标与质量关系、成本等问题。

深度学习自然语言处理
算法论文7

Talking-Critic奖励模型带来更自然的音频驱动肖像

近期音频驱动肖像动画技术发展快,但现有方法存在嘴型声音不对、动作不自然等问题。阿里提出Talking - Critic奖励模型,构建Talking - NSQ数据集,还提出TLPO优化框架,提升多维度表现,实验超现有SOTA方法。

带你学AI
算法论文8

拒绝「降智、减配、乱收费」:面向LLM API的可信验证框架

大语言模型成AI应用基础设施,黑盒服务模式引发信任危机。研究者提出IMMACULATE审计框架,能在不暴露模型信息、仅1%额外开销下,验证黑盒LLM API执行完整性,检测违规行为,相关论文与代码已公开。

机器之心
新闻资讯8

刚刚,谷歌重大突破!量子计算首次可验证,登《Nature》封面

谷歌宣布重大成果,全新量子回声算法在 Willow 芯片运行,解决原子相互作用问题比传统超级计算机快 13000 倍,结果可验证,相关研究登《Nature》封面,朝量子计算实用迈进一大步。

机器之心
算法论文8

大模型「越用越快」!SpeedupLLM首次验证,大降56%推理预算

Emory大学研究者提出SpeedupLLM框架,利用动态计算资源分配和记忆机制,使LLM处理相似任务时推理成本降56%、准确率提升,论文系统性验证了LLM“越用越快”,为AI模型发展提供新思路。

新智元
产品应用7

当AI让答案唾手可得,学而思想把学习过程找回来

AI让答案不再稀缺,学生面临新挑战。7月3日学而思发布2026旗舰新品,提出学习机应陪孩子理解、练习、进步,将诊断、学习等环节连成路径,强调不替孩子学,保护学习过程

机器之心
算法论文8

经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning

该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在多样环境中效果出色,为智能体训练提供新思路。

深度学习自然语言处理
开源动态8

GPT-4o连验证码都解不了??SOTA模型成功率仅40%

MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。

量子位
产品应用8

Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力

Anthropic发布Claude Opus 4.7模型,相比4.6版处理长任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。

AI工程化
开源动态8

如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证

大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证

深度学习自然语言处理