算法论文7
论文用“谁是卧底”解开放任务奖励难题
深度学习自然语言处理
AI 摘要
COLM 2026 论文提出 RLSVR 和 SpyRL,将开放任务化为“谁是卧底”游戏获可核验奖励,实验有提升,但未证明投票精确度量质量,且面临代理任务、规则、成本门槛。
阅读原文 · 深度学习自然语言处理
从 RLVR 到 RLSVR:开放式任务如何获得可核验奖励
COLM 2026 论文提出 RLSVR 及 SpyRL,把摘要等开放任务变成“谁是卧底”游戏,用投票生成可核验奖励,在多任务有提升,但也暴露代理目标与质量关系、成本等问题。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
港科大同腾讯开源3D构建框架超GPT - 5.5
香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。
机器之心
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
OpenAI:Astra、GPT - 6训练因安全暂停
OpenAI宣布暂停内部最强大模型强化学习,Astra模型暂停训练两周,GPT - 6也暂停。原因包括Hugging Face安全纰漏和Astra网络攻击能力越线。还采取物理隔离、严格监控、打击作弊等措施,或有营销意图。
AI寒武纪
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心