论文

Trace: 一个基于分类学引导的多领域视觉推理环境

Trace: 一个基于分类学引导的多领域视觉推理环境

强化学习与可验证奖励(RLVR)已显著提升语言模型推理能力,但其在视觉-语言模型上的扩展受限于缺乏同时具备广泛性、精确可验证性和可复现性的训练数据。我们提出 Trace,一个基于分类学引导的多领域视觉推理环境。 Trace 将任务构建分解为 场景语法 和 可执行任务程序,实现视觉实现与答案计算的分离。共享的语义状态决定渲染图像、提示、类型化答案、验证器状态和可重放实例轨迹。该环境包含 1,000 个任务,涵盖 277 个场景语法和 11 个视觉领域,具有受控的语义和视觉变化。 在 64,000 个 Trace 实例上进行 RLVR 训练后,Qwen2.5-VL-3B 在 24 个外部基准测试上的宏观平均提升 3.51 个百分点,Qwen2.5-VL-7B 提升 4.06 个百分点,证明了广泛的过程性训练可以迁移到生成任务分布之外。项目页面:https://maveryn.github.io/trace/。

论文精读

TL;DR Trace 通过场景语法与可执行任务程序将多域视觉推理任务生成程序化,提供可验证、可复现的 RLVR 训练环境,在外部基准上实现显著迁移。

问题

多模态推理 正成为视觉语言模型(VLMs)的核心能力,而 RLVR(带可验证奖励的强化学习)已在数学和代码推理中证明了其有效性,因此业界高度关注如何将 RLVR 扩展到视觉推理任务上。

现有方法的主要局限在于缺乏 同时满足广泛性、精确可验证性和可重复性 的训练数据:

  • 静态视觉问答数据集覆盖面窄,且答案形式不统一,难以设计通用验证器
  • 合成数据生成常将视觉内容与任务逻辑强耦合,修改图像则需重写整个生成流程,导致 领域扩展性差
  • 多数生成环境无法提供可复现的实例 trace,阻碍细粒度诊断与迭代

这一问题重要且困难,因为视觉推理的本质要求模型在多样化场景中进行 精确的语义理解可验证的符号输出(如计数、排序、物理状态判断),而手工创建此类任务不仅成本极高,还难以系统控制变量(如物体数量、空间关系)以分析模型行为。RLVR 的优势又恰恰依赖高质量、类型化答案的批量生成,两者之间的鸿沟构成了核心挑战。

类似地,在 自动驾驶感知 中,模拟器需要生成无限多样的交通场景并附带可验证的真值(如车辆位置、信号灯状态),这与 Trace 为多领域视觉推理构建可控、可复现训练环境的思路高度一致。

核心洞察

  • 通过将视觉任务分解为**场景语法** 与**可执行任务程序**,Trace 实现了视觉感知与逻辑推理的彻底解耦。这一设计使得答案计算(逻辑)完全独立于渲染(视觉),从而能够提供精确的、自动化的可验证奖励信号,同时保证每个训练实例的完全可复现性。与以往依赖模糊匹配或人工评判的视觉 RLVR 方法不同,Trace 的 `verifier` 可以直接从语义状态中获取 ground-truth,无需启发式后处理,这是将 RLVR 可靠扩展到视觉-语言模型的关键。
  • Trace 引入了一个**分类法驱动(taxonomy-guided)的多域任务生成框架**,覆盖 11 个视觉域、277 种场景语法和 1000 个任务。这种系统化的覆盖并非简单的数据扩增,而是通过定义清晰的语义基元与组合规则,确保训练数据既具有足够的多样性(避免过拟合到特定模式),又能通过共享语义状态控制难度和变化维度。实验表明,在此环境中进行 RLVR 训练后,模型在 24 个外部基准上的表现全面提升,证明了这种‘合成到真实’的迁移并非侥幸,而是源于对视觉推理核心能力的广泛锻炼。

方法

任务因子化与程序化生成

Trace 将多领域视觉推理任务解耦为两个正交组件:

  • 场景语法 (scene grammar):定义视觉域的参数空间,如几何图形的位置、颜色、尺寸,或图表的坐标轴范围、数据点分布。它控制所有可变化的语义与视觉属性,但独立于具体问题。
  • 可执行任务程序 (executable task program):一个确定性的程序,接收场景语法的实例化参数,生成自然语言 提示 (prompt)、计算 类型化答案 (typed answer),并输出 验证器状态 (verifier state)。程序本身不含渲染逻辑,仅操作符号化的语义状态。

共享语义状态与实例生成

每个 Trace 实例由一个 共享语义状态 驱动,该状态由场景语法采样得到。任务程序根据该状态生成问题与答案;渲染器则将其转换为对应 图像 (image),并通过显式标记保证与问题视图的一致性(例如,渲染时标注要计数的对象)。最终输出为一个完整的可训练实例:(image, prompt, answer, verifier_state),并附有可复现的完整轨迹。

RLVR 训练流程

RLVR 训练中,VL 模型接收图像和提示,生成自由文本或结构化答案。验证器根据 verifier_state 和正确答案,对模型输出进行精确比对(支持数值、集合、坐标等多种类型),返回 0/1 奖励。该奖励直接作为强化学习的信号,无需人工反馈或奖励模型。Trace 生成的 64,000 个实例涵盖 11 个视觉域、277 个场景语法,确保训练数据既多样又完全可验证。

与同类方法的差异

不同于依赖静态数据集或仅提供弱验证信号(如 BLEU/ROUGE)的工作,Trace 通过程序化精确验证可控场景生成,首次在多领域视觉推理中实现完全可复现、大规模、确定性奖励的 RLVR 训练,其数据生成方式天然支持对难度、分布偏移等因素的系统化研究。

实验

实验设计

Trace 通过场景语法与可执行任务程序将视觉实现与答案计算解耦,生成 64,000 个覆盖 11 个视觉领域的训练实例。每个实例提供语义状态、渲染图像、自然语言提示、类型化答案及可验证奖励。模型采用 Qwen2.5-VL 的 3B 和 7B 版本,使用 RLVR(基于规则的可验证奖励的强化学习)进行微调,优化目标为最大化正确答案的奖励。

关键发现

  • 24 个外部视觉推理基准 上,RLVR 训练后的模型宏平均准确率平均提升 3.51 pp(3B)和 4.06 pp(7B),显示合成数据训练的强泛化能力。
  • 训练动态表明,模型在 Trace 生成的分布内任务上快速收敛,同时外部基准性能持续增长,未出现严重过拟合。
  • 多样化的情景语法和可控的语义/视觉变化是迁移成功的关键因素,单纯增加数据量不如结构化的领域覆盖有效。

与基线对比的深度解读

基线为未经 RLVR 训练的 Qwen2.5-VL 基础模型。与仅使用语言推理 RL 数据的方法不同,Trace 提供的视觉-语言联合训练信号带来了显著提升,证明精确可验证的视觉推理环境能有效激发 VLM 的推理能力。值得注意的是,提升并非仅来自模型尺度扩大,3B 模型也获得了可观增益,表明 训练数据构造范式的改进 比简单堆砌参数更具成本效益。同时,Trace 的实例可复现性与完整执行追踪为后续分析和迭代提供了坚实工程基础,这对工业级应用尤为重要。

行业影响

落地场景

Trace 生成的多域视觉任务可直接用于提升视觉语言模型(VLM)的通用推理能力,适合集成到以下产品线:

  • 电商与内容平台:商品图像问答(材质识别、尺寸估算)、用户生成内容审核中的场景理解。
  • 企业服务与自动化:复杂图表理解(财报、流程图)、PDF 文档信息提取、UI 自动化测试中的视觉断言。
  • 教育与知识服务:理科题目图文推理、交互式教具中的物体关系识别。
  • 自动驾驶与机器人:交通标志识别、三维场景空间关系问答、操作指令跟从。

商业价值

  • 降本:Trace 的语法化任务构造无需人工标注,可无限生成多样且可验证的样本,大幅降低数据获取成本。
  • 增收:在视觉问答、以图搜图等核心体验上提升准确率,提高用户留存与交易转化(如电商平台中减少错误回复导致的订单流失)。
  • 体验提升:模型在 24 个外部基准的宏平均提升 3.51–4.06 个百分点,意味着更少的 “我不懂” 式回复,增强用户信任。

与现有工作流集成

Trace 以可执行任务程序语义状态为核心,与现有 ML 栈契合度高:

  • 数据管线:将 Trace 作为合成数据源,通过 scene grammar 和随机种子持续产出训练实例,注入现有 VLM 的 SFT 或 RLHF 流程。
  • 强化学习框架:其 verifiable reward 原生支持与 TRLDeepSpeed-Chat 等 RL 库对接,实现自动化的在线策略训练。
  • 评估系统:内部实例可复制,便于回归测试,确保模型迭代不退化。

具体 use case

  1. 电商以图搜商品问答:用户上传衣物图片问 “什么材质?”,模型需读取图像纹理并推理。用 Trace 的 Icons、Illustrations 域数据增强后,模型能更细粒度区分棉、麻等材质,减少 “无法识别” 比例。
  2. 金融 PDF 数据提取:从财报扫描件中自动解析柱状图、饼图的数值。Trace 的 Charts 域生成大量带标注的图表,训练模型直接输出结构化 JSON,替代现有 OCR + 规则后处理的脆弱方案,降低人工复核成本。

局限

  • **任务领域有限**:Trace 目前涵盖 11 个视觉领域和 1000 个任务,主要聚焦于结构化场景(如图表、游戏、几何等),可能无法覆盖开放域视觉推理(如自然图像问答、视频理解)。任务的可验证性要求答案必须精确可计算,这排除了许多需要常识或主观判断的任务。
  • **合成数据与现实差距**:虽然场景语法支持视觉变化控制,但生成的图像基于程序化渲染,与真实世界的复杂纹理、光照、遮挡等差异较大。这可能导致模型在 Trace 上训练后,迁移到自然图像基准时存在系统性偏差,尤其是在需要细粒度视觉理解的任务上。
  • **可扩展性与计算成本**:构建新任务需要领域专家设计场景语法和任务程序,扩展至新领域时的人力成本较高。此外,RLVR 训练需要生成大量实例(本文使用 64k 实例),且每步验证涉及渲染和程序执行,计算开销可能限制更大规模或在线训练的应用。
论文Md Tanvirul Alam2026-07-22原文

相关内容