行业新闻

EASE 提出空间注意力监督,修正多模态 RLVR 的感知盲区

多模态 RLVR 只奖励答对,EASE 额外监督模型注意力看对证据区域,让答对基于真看图而非语言猜测。

强化学习与可验证奖励(RLVR)只用最终答案是否正确来训练视觉语言模型,却不管模型是否真的看了图中证据。哈工大等机构提出 EASE,在训练时把标注的证据区域转化为注意力监督信号,引导模型关注正确位置。在 Qwen2.5-VL-7B 等基座上,相比仅用结果奖励的基线,平均提升约 2.5 到 3.1 个百分点,推理时无需额外标注。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/3aec04f8-a2fa-4f25-9c68-655e68831c57/04(2).jpg) ![图片](/r/blog/23ce1eefe1f8702ec8f0bce134e0ba8e467eb4a5c129a3df35d8bfdc2e2b97dd.webp) 强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在: 最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。 答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。 来自哈工大、中关村学院等机构的研究团队提出 EASE(Evidence-Anchored Spatial Attention),把标注的证据区域转化为视觉 token 上的平滑目标分布,在 RL 训练过程中直接监督「回答 token 看向图像哪里」的空间注意力,且推理阶段无需任何额外标注。在 Qwen2.5-VL-7B、Qwen3-VL-4B、Qwen3-VL-8B 三个基座上,EASE 相比最强 outcome-only 基线 DAPO,平均分分别提升 2.9、3.1、2.5 个百分点。 一句话总结 EASE 的理念:不只教模型「答什么」,更教模型「看哪里」。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-03原文

相关内容