VQA 基准或存记忆捷径,ReKey 局部更新关键线索降低虚高分数
视觉问答基准存在记忆污染风险,ReKey通过只替换关键视觉线索自动生成新题,让评测更可靠。
视觉问答模型的高分可能来自记住训练数据,而非真正看图。浙江大学等团队提出 ReKey,只更新图中决定答案的一小块区域,并自动生成对应问题。每次评测都使用全新组合,避免模型靠记忆作答。测试中 8 个模型平均准确率下降 9.9 个百分点,证明原有高分部分源于记忆。
正文摘录
 导读 :视觉问答模型的准确率不断提高,但 高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。 一次人工标注之后,系统可在每轮评测中随机生成新的视觉关键线索,并自动构造对应的问题与答案 —— 不重新生成整张图,也不重建整套基准。  - 论文:REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation - 论文链接:https://arxiv.org/abs/2606.20736 - 项目主页:https://xxxxxsun.github.io/rekey-vstar/ - 作者:Tengjie Lin、Yutao Sun、Jingwei Ni、Shuhan Ge、Hao-Xua…