「最大似然强化学习」共找到 903 篇相关文章
大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲
Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
思维链之父跳槽Meta,不只因为1亿美元!离开OpenAI前泄天机
硅谷人才争夺战升级,Meta砸钱抢人,思维链之父Jason Wei从OpenAI跳槽到Meta。他离职前发博客,谈及从强化学习获得的人生启示,还阐述AI领域验证非对称性概念及重要性。
国内PCB迈入高端时代,竞争与筛选开始逐力
自2006年起,中国大陆成全球第一大PCB生产地,长期贸易顺差。但高端领域曾被美日韩台掌控,如今5G与AI推动变革,国内企业正以技术为矛,在高端领域发起集群冲锋,市场规模持续增长。
感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义
伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。
关键突破:理论验证了 RL for LLM 路线的可行性
传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。
最强AI编程工具Claude Code,五个使用Tips
作者认为Claude Code是最强AI编程工具,因Anthropic对其针对性强化训练且不计上下文消耗。国内介绍少因自媒体水平差。作者分享五个使用Tips,如/init初始化、Plan Mode规划等。
Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证
Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
四面楚歌,奥特曼妥协了!OpenAI公布重大公司调整,放弃成为营利性公司
OpenAI宣布放弃营利性转型,回归非营利初心。未来公司结构有四大特点,CEO Sam Altman想打造「全球大脑」,让AGI惠及全人类。但微软作为最大投资方持保留意见,其批准是关键。