返回首页
算法论文8

EASE:给多模态RLVR装「视线校正器」

机器之心
AI 摘要

哈工大等团队:视觉语言模型RLVR中答案奖励有盲区,EASE利用证据标注框,在训练时监督注意力,教模型‘看对地方’,推理无需标注,多模态RLVR奖励正迈向过程监督。

阅读原文 · 机器之心
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

相关文章