算法论文8
V-Rubrics细化多模态强化学习奖励
机器之心
AI 摘要
南洋理工等机构团队提出V-Rubrics,拆分多模态回答为三类细粒度评分准则,解决奖励信用分配问题,相比答案级GRPO提升多模态推理性能,论文已收录EMNLP 2026,代码数据开源。
阅读原文 · 机器之心
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励
本文介绍南洋理工大学等机构研究团队提出的V-Rubrics方法,解决多模态推理中结果正确但推理错误的奖励分配误区,通过35万条细粒度准则拆分奖励计算,有效提升模型性能,论文已被EMNLP 2026主会接收,代码与数据已开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
平均6天一个新旗舰 大模型卷疯了
本文梳理全球大模型厂商的旗舰发布节奏,统计显示当前平均每6天就诞生一个新旗舰,AI辅助研发加速迭代,带来开发者适配难、评测体系跟不上等问题。
新智元
新闻资讯9
Claude刷新物理学九圈计算世界纪录
本文报道Anthropic的Claude攻克理论物理前沿难题,成功算出平面N=4超杨-米尔斯理论六粒子振幅的九圈结果,打破人类此前保持的八圈纪录,计算成本仅几千美元,展示了大模型在科研领域的突破性能力。
新智元
开源动态8
港科大微软联合开源AI情商教练SocialCoach
香港科技大学(广州)与微软亚洲研究院联合开源基于大语言模型的AI情商教练SocialCoach,支持用户在低风险模拟环境练习社交对话,练后提供逐字点评,可在线体验或本地部署,采用Apache 2.0协议可完全商用。
开源星探
推荐文章9
Anthropic靠Claude把产品提速3倍
本文是花叔对Anthropic工程师Claude提速复盘的深度拆解,公开了Anthropic用AI辅助做产品性能优化的完整方法,花叔还实战验证了这套方法,整理出可复用的「闪电.skill」工具开源放出。
花叔