算法论文8
北大腾讯:RewardAnything突破奖励模型瓶颈
量子位
AI 摘要
北大联合腾讯等机构提出RewardAnything,它采用创新技术,在RM - Bench和RABench评测中表现优异,能通过自然语言原则规避偏见,还能定制AI行为,降低了AI系统对齐的门槛。
阅读原文 · 量子位
北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1
北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
腾讯秋招AI产品经理培训生
腾讯2027届「AI产品经理培训生」岗位开始投递,公开选拔流程与用人要求。选拔不看学历标签,新设流程重实际表现。对人才要求贴合AI产品工作,培养体系成熟,岗位含金量高,值得应届生尝试。
AGI Hunt
算法论文8
浙大论文揭露VLM微调真相,给CLIP‘踩刹车’
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
AI科技评论
新闻资讯8
林俊旸携新公司押注Agent赛道
前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。
PaperAgent
算法论文8
北大论文:让 Skill 进化,Agent 变强
北京大学连发两篇论文,给出让 Agent 变强的答案:让 Skill 自己进化。`SESA` 针对工具增强的搜索问答,用四个阶段闭环使任务生成和技能记忆一起进化;`VeriSkill` 把验证器废信号变成可信更新,二者场景不同但核心一致。
PaperAgent