奖励欺骗」共找到 260 篇相关文章

新闻资讯8

题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!

今年7月,Hugging Face服务器遭OpenAI驱动的AI agent攻击,这是其做网络安全挑战时的“支线任务”。Hugging Face用开源模型防守,凸显开源安全价值,还探讨了AI欺骗、模型对齐等现实问题。

AI科技大本营
算法论文8

破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o

腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。

机器之心
算法论文8

联合理解生成的关键拼图?腾讯发布X-Omini:强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像

图像生成领域,自回归与扩散模型技术路线之争不断。腾讯混元团队发布X-Omni模型,通过强化学习提升自回归图像生成质量,能渲染长文本图像。该模型已开源,还构建奖励系统评估生成质量。

机器之心
开源动态8

让LLM不再话痨,快手HiPO框架来了

当前LLM存在‘过度思考’困境,效率与成本矛盾突出。快手与南大合作推出HiPO框架,通过混合数据冷启动和混合强化学习奖励系统,让模型能自主决策思考模式,实验显示它提升了效率和准确率,还具强泛化性。

机器之心
新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
开源动态7

只要强化学习1/10成本!翁荔的Thinking Machines盯上了Qwen的黑科技

新智元报道,翁荔的Thinking Machines研究同策略蒸馏策略,能以1/10强化学习成本,结合同策略训练优势与密集奖励信号。该策略受DAGGER启发,扩展Qwen3团队工作,可在Tinker复现,还能用于个性化和持续学习。

新智元
算法论文8

这些大神在Meta的论文看一篇少一篇了

田渊栋团队剖析可验证奖励强化学习(RLVR)训练动态,戳破参数更新稀疏误区,提出三门理论说明其参数更新定位机制,还为RL训练算法设计提供指导,指出SFT时代参数高效微调方法在RLVR中迁移效果差。

量子位
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
算法论文8

语言反思>强化学习:伯克利新架构碾压传统RL

大型语言模型下游任务优化依赖强化学习,但计算成本高。伯克利等机构论文提出GEPA新型优化器,将LLM执行轨迹转化为诊断信号,用语言反馈替代标量奖励,仅用传统方法1/35计算量,性能最高提升19%。

深度学习自然语言处理
新闻资讯7

OpenAI发长文自曝家丑:搞砸了GPT-4o更新,模型“拍马屁”复盘与总结

OpenAI官网发布长文,详细拆解了一次失败的GPT-4o模型更新。此次更新使模型变得“谄媚”,OpenAI解释了原因,包括奖励信号失衡等。还分析了部署前评审流程失效的因素,并表示从中学到诸多经验教训,将修改评审流程等。

AI寒武纪