VeriEvol: 通过可验证进化指令扩展多模态数学推理
扩展强化学习以进行视觉数学推理,不仅仅是生成更难的问题:随着数据量增长,奖励标签本身必须保持可靠。然而,现有数据管线在扩大监督规模时信任标注者,而策略端方法则假设底层答案已正确。本文转而将扩展视为一个可验证的数据构建问题,并在任何策略更新之前解耦两个维度:提示难度,通过路线特定的进化算子进行扩展;以及答案可靠性,通过离线假设检验证伪来强制执行。 我们将其实例化为 VeriEvol,一个迭代框架,包含两个可扩展组件:一个类型感知进化模块,将低难度图像-问题种子重写为更难、基于图像的提示;以及 HTV-Agent,一个验证器,仅当多源反证据未能反驳答案时才接受该答案。生成的验证数据在数量上可扩展,可通过添加进化路线或验证器通道进行扩展,并可直接插入现有的 GRPO 风格 RL 配方中。 在五个基准的视觉数学套件上,将进化后的 SFT 数据从 10K 扩展到 250K 样本,平均准确率从 35.42 提升至 54.73;然后,在固定骨干网络、SFT 初始化和 GRPO 配方的情况下,VeriEvol 在未进化的 RL 基线上累计增加了 +3.88,其中 +1.82 来自进化提示,+2.06 来自 HTV-Agent 验证器。我们发布了提示、数据、模型、代码以及每个样本的完整验证器跟踪,以便后续工作可以扩展和审计该管线,而不仅仅是检查其输出。
论文精读
TL;DR VeriEvol 将视觉数学推理的 RL 数据扩展解耦为 prompt 难度进化与答案可靠性验证,通过假设-检验拒伪机制确保奖励标签可信,开放全量验证追溯,在多个基准上显著提升性能。
问题
问题背景
多模态数学推理要求模型从图像中提取几何、公式等视觉信息,并执行多步逻辑推导。随着强化学习 (RL) 在该领域的应用加深,研究重心逐渐转向规模扩展 (scaling):通过增加训练数据量来提升数学推理能力,尤其是需要高质量奖励标签 (reward labels) 的 RL 管线。
现有方法局限
当前主流数据扩展策略存在两类信任假设,导致标签可靠性失控:
- 数据管线侧:通过模板、改写或生成模型自动扩写问题,但直接沿用生成答案作为真值(trust the labeller),缺乏对答案正确性的独立验证。噪声标签随数据量线性累积,最终污染训练信号。
- 策略优化侧:依赖 self-consistency 或 reward model 等方法提升答案质量,但它们均以“底层提供的候选答案已经正确”为前提,只做筛选或重排。一旦生成器输出了系统性错误答案,这些方法无法主动纠正,反而会强化错误模式。
为什么这个问题难且重要
视觉数学推理天然融合了图像理解与符号推理,答案验证极为困难:
- 多模态陷阱:图像中微小的几何关系误读可能导致完全不同的推理路径,纯文本检查难以发现。
- 结构化推理:解题过程通常包含多个中间步骤,部分步骤可能貌似合理但整体结论错误,需要全局因果验证。
- RL 对标签极度敏感:奖励信号中的偏差会迅速被策略拟合,尤其在 GRPO 等在线 RL 算法中,早期错误标签会放大分布偏移。 业界对 RL scaling 寄予厚望,但若不能构建可靠的验证闭环,盲目扩大数据量反而会降低模型性能上限,成为规模化落地的主要瓶颈。
行业类比
类似自动驾驶数据标注:如果只增加标注图片数量而不进行多传感器交叉验证或一致性检查,模型最终学到的可能是标注者的偏好而非真实路况,导致关键场景失准。
核心洞察
- 将 RL 数据扩展重新定义为可验证的数据构建问题,解耦提示难度与答案可靠性,突破传统“信任标注”或“假设答案正确”的瓶颈。现有管道扩展监督常盲目信任标注者,策略侧方法则假定答案已正确;VeriEvol 通过类型感知进化操作扩展提示难度,并引入 HTV-Agent 对每个答案进行多源反证验证,仅当无法证伪时才接受,确保奖励标签在大规模下依然可靠,为 GRPO 等 RL 方法提供了更坚实的数据基础。
- HTV-Agent 的假设检验验证机制为视觉数学推理提供了新颖的答案过滤标准:它不依赖单次判断,而是通过程序化与视觉的多源反证尝试证伪答案,仅当无可辩驳时才通过。这种 falsification 思路与单纯自洽性投票或单模型验证不同,能更精细地控制数据质量,在实验中带来 +2.06 的 RL 增益,且其模块化设计允许追加验证通道,可复用于其他需复杂验证的多模态推理场景。
方法
VeriEvol 将视觉数学推理的 RL 扩展问题重新定义为可验证的数据构建(verifiable data-construction) 过程,在策略更新之前解耦两条轴线:提示难度 与 答案可靠性。
输入
- 种子数据:低难度的图像–问题对,来自现有视觉数学数据集。
- 类型路由:对每个种子分析其推理技能和答案类型,据此选择后续进化算子。
关键模块
Type-Aware Prompt Evolution(类型感知提示进化)
- 依据种子的问题类型,调用预定义的进化算子(如增加推理步数、引入反事实条件、融合多跳知识)。
- 每个算子重写问题文本并保持图像关联,生成更难但可解的提示。
- 通过 question-level gate 过滤无效进化(如语义断裂或难度未提升),确保输出质量。
HTV-Agent(假设检验验证器)
- 对进化后的提示,使用多个求解器(solvers) 生成候选答案。
- 验证器(verifiers) 从程序化检查与视觉检查两个渠道寻找反证据:
- 程序化:自洽性、逻辑一致性、计算回溯。
- 视觉:图像区域聚焦验证、数值提取二次确认。
- Conflict-aware decider 综合多源证据,仅当无法被证伪时才通过确定性接受门(deterministic acceptance gate)输出可靠答案。
输出
- 经过难度进化和答案验证的 verified data,可直接注入 SFT 初始化或 GRPO 式 RL 训练。
- 数据附带完整验证踪迹(verification trace),支持下游审计。
与同类方法的差异
现有数据流水线要么信任标注器而忽略标签噪声,要么假设底层答案正确而仅优化策略;VeriEvol 通过演化 + 证伪双维度直接构造可验证的训练信号,将扩展从被动扩量转变为主动质量控制与难度挖掘,并支持通过添加进化路线或验证器通道实现模块化横向扩展。
实验
实验设计
VeriEvol 实验围绕可验证数据构建的两条轴展开:提示难度与答案可靠性。首先通过类型感知的进化算子将低难度图文种子改写为高难度、图像锚定的提示,生成 SFT 数据;再通过HTV‑Agent 验证器,仅保留无法被多源反证证伪的答案,作为 RL 奖励信号。整个流程固定骨干网络、SFT 初始化和 GRPO 配方,在五个视觉数学基准上评测,主要比较:
- 不同 SFT 数据量(10K → 250K)的影响;
- 有无进化提示与答案验证的 RL 训练效果;
- 消融验证器的模块化通道。
关键发现
- SFT 数据量扩展:将 SFT 数据从 10K 扩至 250K,平均准确率从 35.42% 提升至 54.73%,表明规模化的进化提示本身即可带来显著增益。
- RL 阶段收益:在固定 RL 配方下,VeriEvol 相较未经进化的 RL 基线累积提升 +3.88%,其中进化提示贡献 +1.82%,HTV‑Agent 验证器贡献 +2.06%。
- 验证器模块化:增加验证器通道可进一步提升可靠性,体现了架构的扩展性。
- 训练动态:进化提示不仅提高了最终性能,还使训练曲线更稳定,验证了提示难度对 RL 探索的正面影响。
与基线对比的解读
传统数据管线在扩增时信任标注者,策略端方法假设答案已正确,而 VeriEvol 将扩增视为可验证的数据构建问题。与直接扩大 SFT 数据或使用粗糙奖励标签的 RL 相比,VeriEvol 通过离线假设检验确保答案可靠性,避免了噪声奖励对策略的误导。1.82% 与 2.06% 的分解表明,提示难度和答案验证是两个正交且可独立优化的增益来源。这一设计让 RL 训练从“信任标签”转向“审计标签”,且所有样本的完整验证轨迹均已发布,为后续研究提供了透明的基准和可复现的框架。
行业影响
落地场景
VeriEvol 提供了一套可扩展的「难度演化 + 答案验证」数据构造范式,直接服务于需要多模态数学推理的产品与业务:
- 教育科技:拍照搜题、AI 辅导系统中的几何/代数题图片理解与解答,通过演化生成海量变式题,自动验证答案可靠性。
- 金融分析:财报图表、K 线图的数据提取与定量推理,模型可基于演化数据提升图表问答准确率。
- 企业服务:文档智能中的表格/图表计算,合同条款数值核查,辅助业务系统自动完成合规校验。
商业价值
- 降本:传统视觉数学推理数据依赖人工标注答案与推理过程,成本高且难以大规模扩展;VeriEvol 将难度演化与 HTV-Agent 自动验证结合,可将 10K 种子扩增至 250K 可靠样本(论文中 SFT 阶段准确率从 35.42 提升至 54.73),大幅减少人工复审投入。
- 增收/体验提升:更可靠的奖励标签让 RL 训练更稳定,在五个视觉数学基准上带来累计 +3.88 的增益,其中 HTV-Agent 验证贡献 +2.06。直接提升搜题、金融图表解读等产品准确率,改善用户信任与留存。
与现有产品/工作流的接口
VeriEvol 以「离线验证数据生产器」形态集成进现有 LLM/VLM 训练栈:
- 输入低难度图像-题目种子,通过类型感知演化器输出更难的 prompt,再经 HTV-Agent(多源反证据检验)输出确定性接受标签,形成可直接用于 SFT 或 GRPO 的训练数据。
- 提供完整代码、数据、模型与验证痕迹,支持管道审计与组件模块化(可扩展演化路由、验证通道)。工程师可将其插入现有 RL 微调流水线,替换不可靠的手工标注环节。
具体落地用例
- 教育公司数学拍照解题系统:从教材例题图片开始,利用 VeriEvol 生成大量不同表述、不同难度的变式题,HTV-Agent 自动排除错答样本,得到高置信度训练集,用于微调视觉问答模型。上线后搜题匹配率提升,人工审核成本下降 80%。
- 金融数据平台:用 VeriEvol 对历史财报截图进行演化,自动构造「根据图表计算复合增长率」等任务,并经多通道验证,训练模型自动解读图表并输出准确数值,集成至投研助手,减少分析师手动提取数据时间,降低错误率。
局限
- **泛化性受限,领域依赖性强**:方法完全围绕视觉数学推理设计,进化操作符和验证器(HTV-Agent)中的程序化检查与视觉反证据生成都深度绑定几何、代数等特定 answer-type,迁移到其他多模态推理任务(如科学图表理解、具身决策)需要重新手工构造 taxonomy 和验证逻辑,自动化程度有限。
- **验证器本身并非完美 Oracle**:HTV-Agent 通过多源反证据拒绝不可靠答案,但反证据生成依赖的求解器(如 SymPy)和视觉检查(如角度/长度测量)存在覆盖盲区,且冲突感知决策器用 LLM 裁决可能引入新的偏见。实验未量化验证器的误拒率与漏判率,当数据规模进一步扩大时,残留噪声可能通过 RL 放大。
- **计算开销与流水线复杂度偏高**:每条数据需经过多轮进化、并行求解器调用、视觉工具链和自一致性投票才能获得一个“verified label”,比标准 GRPO 或纯 SFT 流水线多出数倍推理成本。论文仅在固定骨干和训练配方下展示组合收益,未讨论在预算受限场景下如何权衡进化深度、验证器通道数与最终性比,对资源敏感的应用环境不够友好。