V-Rubrics 用 35 万条准则细化多模态强化学习奖励
V-Rubrics 把多模态回答拆成视觉事实、推理一致性、指令遵循三类准则逐项打分,避免只看最终答案而奖励了错误的推理过程。
多模态模型(能同时处理图像和文字的模型)即使答案碰巧正确,过程也可能读错图表数字,或凭空写入画面里没有的物体。V-Rubrics 把 5 万余个视觉样本拆成 35 万条可逐项核查的准则,让图像事实、推理步骤与任务要求分别计分,再用于 GRPO 强化学习;同一 SFT 起点下,通用与知识评测 Overall Avg. 达 68.04。
正文摘录
答案正确,推理就可靠吗?V-Rubrics 用 35 万条细粒度准则细化多模态强化学习奖励 .jpg)  核心结论:V-Rubrics 将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让图像中的事实、推理步骤和任务要求分别参与奖励计算。基于同一 SFT 起点和同一批 RL 数据,rubric GRPO 在通用与知识评测中的 Overall Avg. 达到 68.04。 多模态模型给出的推理过程即使连贯,也可能读错图表数字,或写入画面中不存在的物体。如果最后的答案恰好正确,按结果评分的训练方式就可能把这些“看似结果正确”但“实际推理错误”的情况也一并奖励。 反过来,最终答案错了,也不意味着此前的观察都错了。那些有依据的正确观察,仍然是有价值的训练信号:保留并强化这些观察,可以帮助模型在此基础上修正后续推断。但这也引出了一个关键问题: 当正确的观察与错误的推断交织在同一段回答中,reward 应当如何分配,才能鼓励做对的部分,并引导模型纠正出错的环节?