V-Rubrics: 基于Rubric的强化学习实现视觉忠实性
视觉语言模型能够生成流畅的答案,但往往缺乏充分的视觉依据:一个不支持的物体、图表值或中间推理,都可能破坏原本合理的回答。作者认为,这是多模态后训练中的信用分配失败——标量结果奖励只能判断答案是否可接受,却无法指明哪些视觉事实有依据、哪些推理步骤有效、哪些指令约束被遗漏。 为此,论文提出 基于视觉Rubric的强化学习(Visual Rubrics-Based Reinforcement Learning)。该方法将参考回答分解为原子命题,并沿 视觉忠实性(VF)、推理一致性(RC) 与 指令遵循(IF) 三个维度对生成答案评分。Rubric条目提供结构化的部分信用,在支持性证据片段可用时实现局部化的信用分配。 作者先在公开的 OpenMMReasoner-SFT-874K 语料上微调 Qwen3-VL-8B-Instruct 得到 SFT 检查点;随后构建 V-Rubrics 50K(50,248 个示例,来自 17 个视觉来源),经规则过滤与拒绝采样难度筛选,并用 Gemini-3-Pro 统一标注。训练采用组件式、前缀局部化的 Rubric 信用。实验表明,基于 Rubric 的 GRPO 显著优于共享 SFT 基线和仅答案 GRPO,在知识导向与视觉基础推理基准上提升最大,证明 Rubric 是一种有效的奖励抽象。
论文精读
TL;DR V-Rubrics 将视觉忠实度、推理一致性与指令遵循分解为可评分的 rubric 条目,在 GRPO 中提供**局部信用**,解决多模态后训练只给整体奖励导致的**视觉依据不足**问题,显著提升 VLMs 的 grounded reasoning。
问题
问题背景
视觉语言模型(VLM)后训练正从单纯“答案正确”转向看得到、推得对:RLVR 与长链视觉推理兴起,但视觉忠实性(visual faithfulness)仍是短板。
现有方法局限
主流的标量结果奖励 outcome reward 只对最终答案整体打分,无法分解为:
- 视觉依据是否充分:Visual Faithfulness(VF)
- 推理链是否连贯:Reasoning Consistency(RC)
- 指令约束是否遵守:Instruction Following(IF)
这造成信用分配失败:模型可依赖语言先验或模板生成流畅回答,但某个对象、图表数值或中间推理可能缺乏视觉证据。回答级奖励无法定位错误 span,也不会对部分正确给予结构化反馈,导致 RL 优化只能粗粒度拉扯策略,难以针对性修正 grounding 错误。
为什么这个问题难/重要
多模态任务中视觉事实、文本推理与指令约束高度耦合,细粒度信用需要把参考回答分解为原子命题并为每个命题提供证据定位(evidence spans),标注成本高且 schema 难以统一。工业场景对 VLM 幻觉高度敏感——医疗影像、文档解析、自动驾驶等领域,单点视觉错误都可能带来高风险,仅靠 final answer 奖励无法满足可靠性要求。
行业类比
类似自动驾驶若只奖励“到达终点”,模型可能学会危险变道;需要按“遵守车道、识别标志、预判行人”等 rubric 分项打分,视觉助手同样需要结构化反馈才能减少“流畅但瞎编”。
核心洞察
- 将视觉 grounding 的 credit assignment 从标量结果奖励重构为结构化 rubric 奖励。标量奖励仅判断答案整体是否可接受,无法定位错误出在视觉事实、推理步骤还是指令遵循。V-Rubrics 将参考答案分解为原子命题,按 Visual Faithfulness、Reasoning Consistency、Instruction Following 三个维度打分,提供 component-wise 的部分信用,使 GRPO 的 advantage 计算能精细到前缀位置。相比 answer-only GRPO,该方法在知识导向和视觉推理基准上提升最显著,证明 rubric 作为奖励抽象能有效缓解视觉后训练中的 grounding 不足。
- V-Rubrics 50K 的数据构造结合多源规则过滤与拒绝采样难度分层,形成有针对性的训练分布。从 17 个视觉 grounding 数据集出发,先用规则过滤低质量样本,再基于 rejection-sampling 得分划分难度,随后用 Gemini-3-Pro 按统一 prompt 标注 rubric。这种设计不是简单混合现有数据,而是显式控制样本难度和错误类型,使训练集覆盖模型容易失真的视觉细节和中间推理。相比直接使用单一数据集或仅做 SFT,rubric 标注和难度组成让 RL 训练能更稳定地学习到 evidence-grounded 的生成策略。
方法
方法路径
输入:多模态问答样本 (image, question, reference answer)。先对 Qwen3-VL-8B-Instruct 在 OpenMMReasoner-SFT-874K 上做 SFT,得到初始化策略。
关键模块
- V-Rubrics 50K 构建:从 17 个视觉 grounding 数据源筛选 50,248 条样本;先规则过滤,再通过 rejection-sampling 分数确定难度,最后用 Gemini-3-Pro 按统一协议标注 rubric。
- Rubric 拆解与打分:将参考回答分解为原子命题,分别按 Visual Faithfulness (VF)、Reasoning Consistency (RC)、Instruction Following (IF) 给生成答案打结构化部分分。
- Prefix-localized Rubric Credit:当支持证据 span 存在时,把 rubric 得分定位到对应前缀片段,实现 component-wise credit assignment,而不是整句标量奖励。
- Rubrics-Guided GRPO:在 GRPO 中使用 rubric-based reward 计算优势,更新策略。
输出
输出为经过 RL 微调的多模态策略,在知识型与视觉 grounding 推理 benchmark 上比共享 SFT 基线与 answer-only GRPO 取得更大提升。
跟同类方法的差异点:相比只给最终答案好坏标量奖励的 RLVR,V-Rubrics 通过原子命题级 rubric 与 prefix-localized credit 显式把梯度信号分配到具体视觉事实与推理步骤。
实验
实验设计
论文先基于 OpenMMReasoner-SFT-874K 语料对 Qwen3-VL-8B-Instruct 进行 SFT,得到共享的初始化 checkpoint。随后构建 V-Rubrics 50K:从 17 个视觉来源收集样本,通过规则过滤和难度采样,用 Gemini-3-Pro 按照统一协议标注每个样本的原子命题与三项评分维度——Visual Faithfulness (VF)、Reasoning Consistency (RC)、Instruction Following (IF)。训练阶段使用 component-wise, prefix-localized rubric credit 的 GRPO,对比共享 SFT 基线与仅使用答案级奖励的 GRPO。
关键发现
Rubric-based GRPO 在知识导向和视觉 grounding 相关的推理基准上取得了最大提升,优于共享 SFT 基线和 answer-only GRPO。这表明将奖励从标量结果分数升级为结构化部分信用,能有效缓解多模态后训练中的信用分配失败问题。
与基线对比解读
标量 outcome reward 只给出整体可行性判断,无法指出哪些视觉事实被正确 grounding、哪些推理步骤有效或哪些指令约束遗漏。Answer-only GRPO 依然受限于此。而 rubric 将每个维度拆解为原子命题评分,并在支持证据 span 可用时将 credit 定位到前缀,实现了更细粒度的反馈信号。从工程角度看,这类似于将奖励模型从“黑盒打分”变为“检查清单式评估”,让策略模型更精确地学习到哪些生成片段值得保留或修正,尤其适合需要长链路视觉推理的任务。
行业影响
落地场景
V-Rubrics 适用于任何需要视觉事实核查的 VLM 应用。典型场景包括:
- 电商商品问答:用户询问“是否含侧兜”,模型必须基于商品图回答,无依据的肯定将被 Visual Faithfulness (VF) 惩罚。
- 金融图表解读:自动生成财报摘要时,数值与趋势必须与图表一致,Reasoning Consistency (RC) 约束推导链条。
- 医疗影像报告辅助:生成放射学描述时,减少凭空添加病灶。
商业价值
核心价值在于 降低幻觉风险,而非直接增收。通过 rubrics 提供细粒度局部 credit,模型会优先学习“有证据才说”,从而:
- 减少人工审核成本:幻觉输出被拦截,无需逐条复核。
- 提升用户信任:回答可追溯至图像区域或推理步骤,增强产品可靠性。
- 支持合规与风控:在金融、医疗等强监管领域,可审计的视觉依据是刚需。
与现有工作流接口
方法基于 GRPO,可嵌入现有 RLHF 流程:
- 将 rubric 奖励作为 reward model 的补充信号,与 scalar outcome reward 并联。
- 训练数据 V-Rubrics 50K 可复用其标注协议,快速生成领域内 rubric 数据。
- 代码开源 (GitHub),支持直接加载 Qwen3-VL-8B-Instruct 权重作为起点。
关键差异:相比 answer-only reward,rubric credit 定位到原子命题,让模型知道具体哪里出错,更适合长尾、需要多步推理的视觉任务。
局限
- **Judge-Model Bias**:论文明确使用 Gemini-3-Pro 进行 rubric 标注与奖励生成,该模型的视觉理解与推理偏好会系统性地注入训练信号。不同 judge model(如 GPT-4V、Claude)之间的一致性未做量化消融,可能导致训练出的模型在脱离 Gemini 评估时性能回退。此外,judge 自身对细粒度视觉事实(如小物体、图表数值)的错误判断会直接误导信用分配,放大幻觉而非消除。工程实践中需引入多模型投票或人工校准环节来缓解该风险。
- **基座与任务泛化有限**:实验仅基于 Qwen3-VL-8B-Instruct 单一基座,未验证 Rubric 奖励在其他 MLLM 架构(如 LLaVA、InternVL)或不同规模上的迁移性。评测基准集中在静态图像问答和视觉推理,对视频、多图关联、交互式场景等未覆盖,实际部署于复杂 Agent 环境时可能出现分布外性能下降。此外,50K 训练集相对 SFT 语料规模较小,模型对长尾视觉事实的覆盖可能不充分。
- **数据构建与扩展成本高**:V-Rubrics 50K 的构建依赖规则过滤、难度采样与 Gemini 逐条标注,流程较重,扩展至新领域或持续更新需大量算力与 API 成本。与 OpenMMReasoner 的 874K SFT 数据相比,RL 阶段数据量占比低,可能影响训练的稳定性和收敛效果。该工作未开源 judge 标注管线或提供低成本替代方案,业界复现门槛较高。