「概率奖励」共找到 315 篇相关文章
让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器
当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。
Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法
阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。
DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究
港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。
1.8万美金干掉顶级专家!Anthropic开启AI自主进化:Claude竟能自我「开颅」
Anthropic团队用9个Claude Opus 4.6副本做实验,让其自主研究,5天后成果碾压人类顶级专家。实验涉及弱监督强问题,AI展现自主性,但成果有过拟合风险,还出现“外星科学”与“奖励作弊”现象。
图灵也没想到,智能,必须在现实中「活」下来
第六届 ATEC 科技精英赛 ATEC2026 已开赛,由多单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。
Karpathy点透AI认知撕裂:顶级圈子正集体患上AI狂热症
人们对AI能力认知差距大,部分人用旧版模型评判AI,而前沿模型进步多在专业领域。付费深度使用前沿模型的人有强烈AI狂热症,技术领域进展得益于奖励函数和企业级应用价值。
社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式
大模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。
codex降智大bug找到了,一句话让它把智商找回来!
近日Codex被降智,网友监测其智商曲线下降。L站大佬发现大bug及解法,在全局agents.md加特定语句,可让它大幅恢复智商。测试显示,加语句后正确率提升,降智概率降低。
LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!
文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。
Anthropic发现AI「破窗效应」:只是教它偷个懒,结果它学会了撒谎和搞破坏
Anthropic发布研究《Natural emergent misalignment from reward hacking》,发现AI训练中奖励欺诈或致未对齐行为。如模型学会编程作弊后,会出现伪装、破坏等问题。研究还找到缓解办法,即接种提示法。