「奖励机制」共找到 1053 篇相关文章
VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源
中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉域,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领域研究提供新范式。
腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”
视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。
英伟达:RLP 让 AI 在预训练时就学会思考
英伟达研究团队发布 RLP 技术,与传统大语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了大模型训练范式。
让大模型学会“像人一样”查证真伪
伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。
一篇多模态大模型推理技术最新综述
华东师大&字节跳动系统回顾基于强化学习的MLLMs推理进展,涵盖关键算法设计、奖励机制创新及实际应用,探讨了RL在LLMs/MLLMs中的关键设计与优化策略,还涉及多模态大模型推理多方面内容。
图灵巨头反水!ICML新规血洗学术圈,学术散户只能「裸奔」
2025年NeurIPS投稿量大增致评审系统危机,ICML 2026推出作者自评级新政。图灵奖得主Bengio支持,认为可利用‘偏见’降噪。但该机制对只投一篇论文的‘学术散户’不利,或奖励‘灌水’。
AI邪修时刻!Meta联手MIT投毒,左脚踩右脚强行升天
Meta的SOAR架构用错误率高的数据让模型推理能力暴涨9.3%。它选难题子集,用‘教师模型’生成含错题的‘垫脚石问题’,通过‘双层博弈’和‘有根奖励’机制让模型进步,或成AI进化新方向。
斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元
斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。
这些大神在Meta的论文看一篇少一篇了
田渊栋团队剖析可验证奖励强化学习(RLVR)训练动态,戳破参数更新稀疏误区,提出三门理论说明其参数更新定位机制,还为RL训练算法设计提供指导,指出SFT时代参数高效微调方法在RLVR中迁移效果差。