CoVA-SFT: 大规模视觉抽象链数据集
思维链(CoT)推理通过将问题分解为中间步骤,显著提升了大型语言模型(LLMs)。尽管 CoT 在语言任务中广泛有效,纯文本 CoT 迫使模型将视觉问题序列化为笨拙的散文。虽然存在处理视觉输入的架构方案,但社区缺乏一个大规模、多步骤、自校正的数据集,来教导模型在解决纯文本推理问题时构建并维护内部视觉工作空间。 为解决这一局限,我们引入了 CoVA-SFT,一个高度结构化的语料库,包含 51.9K 个样本,涵盖 222K 多模态推理步骤,跨越 5 种不同布局族和 17 种复杂任务;以及 CoVA-Bench,一个配套基准,包含 1,700 个保留测试样本,覆盖相同任务,用于可复现评估。通过提供明确的推理公式、智能体渲染(agentic renderings)和验证循环(verification loops),CoVA-SFT 教导多模态语言模型将文本与视觉抽象交错结合。 我们验证了该数据集:在 CoVA-Bench 上,基于 CoVA-SFT 微调的模型平均性能超过所有交错 CoT 基线 2倍以上,但仍不及纯文本 CoT 强基线,这突出了未来工作面临的开放挑战。
论文精读
TL;DR CoVA-SFT 数据集含 51.9K 样本、222K 多模态推理步骤,教模型在纯文本推理中交叉生成视觉抽象(图表/布局)并自我校验;微调后在 CoVA-Bench 上平均比交织 CoT 基线高 2 倍以上。
问题
问题背景
Chain-of-thought (CoT) 推理已成为提升 large language models (LLMs) 复杂任务表现的核心手段,多模态社区也在探索如何让模型在视觉与文本之间建立中间推理状态。
现有方法局限
Text-only CoT 在处理视觉问题时强制将图表、几何或空间布局序列化为纯文本描述,导致信息丢失与推理步骤冗长。已有的 multimodal CoT 方法多依赖单步视觉问答数据,或缺乏自纠正机制和可验证的中间渲染,模型难以学会维护内部视觉工作区。此外,现有数据集规模小、任务覆盖窄,无法支撑稳定的指令微调。
为什么这个问题难/重要
构建一个能教模型交错生成文本与视觉抽象的数据集,需要同时设计:
- 多步 rationale 的显式标注;
- agentic renderings 保证中间视觉状态可执行、可验证;
- verification loops 引入错误恢复信号。
这比单纯收集图像-文本对困难得多,且对模型的结构化输出、空间推理和长程一致性提出更高要求。业界对多模态 agent 和可解释推理的需求持续上升,但缺乏标准化评测与大规模训练数据。
行业类比
类似 自动驾驶 中需要中间 BEV 表示 来融合多源信息并预测轨迹,多模态推理模型也需要一个“内部草稿纸”来逐步绘制和修正视觉抽象,而非在最终答案前只做黑盒映射。
核心洞察
- CoVA-SFT 首次将视觉工作空间作为可训练的多模态思维链组件,通过显式 rationale、代理渲染和验证循环,系统化地教会模型在纯文本推理中生成并维护内部视觉抽象。与既有工作相比,它不依赖特定任务架构或仅提供多模态输入,而是提供 51.9K 样本、5 类布局、17 个任务的大规模结构化数据,覆盖 222K 多模态步骤;同时配套 CoVA-Bench 基准。实验结果(微调后平均超过交织 CoT 基线 2 倍以上)验证了数据驱动方法的可行性,但模型仍落后于强文本 CoT 基线,表明视觉工作空间尚不能完全替代成熟的文本推理链,揭示了融合两者的挑战。
- 验证循环(verification loops)作为数据集的核心机制,显式地训练模型对生成的视觉表示进行自我检查和修正,模拟人类画图推理中的迭代过程。这一设计比简单的多模态输入-文本输出更进一步,将自我校正从文本域扩展到视觉域,使模型能够识别并修复中间视觉抽象的误差。相比同类多模态 CoT 数据集(如仅提供图像描述或静态图文对),CoVA-SFT 的代理渲染和验证循环构成闭环训练信号,为提升复杂空间推理的可靠性提供了新路径。然而实验显示该机制尚未完全弥合与强文本 CoT 的差距,提示后续工作需进一步强化验证深度或结合符号推理。
方法
输入
CoVA-SFT 针对 纯文本推理问题,训练 多模态语言模型 在推理过程中生成并维护 视觉抽象。每个样本的输入是文本问题,监督信号为显式的 推理链 及其对应的 视觉渲染。
关键模块
数据构建包含三类互补组件:
- Rationale Formulations:给出分步文本推理路径,明确每步应产生的中间结论与下一步需要可视化的抽象。
- Agentic Renderings:为推理步骤生成结构化视觉表示,覆盖 5 种布局族(如树形、表格、坐标图等),共计 222K 个多模态步骤。
- Verification Loops:对渲染结果进行校验与修正,形成自纠错轨迹,教会模型判断视觉工作空间的正确性并回溯更新。
训练采用 监督微调,模型在下游任务上学习交错生成文本 tokens 与视觉 tokens。数据集含 51.9K 样本、17 类任务;评测使用 CoVA-Bench 包含 1,700 条留出样本,复现同一任务分布。
输出
推理时模型从文本问题出发,逐步输出 文本推理 与 视觉抽象,并在必要时触发验证循环修正中间表示,最终给出答案。
差异点:相比以往仅加入单步图像或多模态输入的 interleaved CoT 方法,CoVA-SFT 的 agentic renderings + verification loops 显式建模了视觉工作空间的构建与自校正过程,使模型能主动维护内部可视化状态。
实验
实验设计
- 数据集: CoVA-SFT 包含 51.9K 样本、222K 多模态推理步骤,覆盖 5 种布局家族、17 个任务;CoVA-Bench 为 1,700 个留出测试样本,用于可复现评估。
- 训练目标: 通过显式 rationale 构造、agentic rendering 与 verification loops 教会模型交错生成文本与视觉抽象。
- 基线: 与 interleaved CoT 基线以及强 text-only CoT 基线对比。
关键发现
- 在 CoVA-Bench 上,CoVA-SFT 微调模型平均性能超过所有 interleaved CoT 基线 2 倍以上。
- 但仍未达到强 text-only CoT 基线的水平,表明视觉工作空间的内部构建还存在开放挑战。
- 数据集提供了结构化、可自校正的多步推理信号,证明了多模态交错推理的潜力。
与基线的深度解读
- 相对 interleaved 基线的大幅提升说明显式视觉抽象步骤对复杂推理有益。
- 落后于 text-only CoT 基线可能源于多模态模型在纯文本推理中引入视觉噪声,或视觉编码与语言解码的协同尚未优化。
- 后续工作需关注视觉表示与语言推理的高效融合,避免额外模态成为负担。
行业影响
落地场景
CoVA-SFT 训练的多模态模型可落地于需要视觉推理辅助的教育解题、数据分析助手、设计自动化等场景。例如教育平台中,模型分步生成几何图形或函数图像并伴随推理文字,替代纯文本讲解;企业 BI 工具中,用户上传图表,模型自动在内部生成数据可视化中间步骤以推导结论。这类应用直接受益于模型在 5 类布局家族 和 17 种任务 上的能力覆盖。
商业价值
该数据集/基准可降低多模态推理模型的开发成本:通过 SFT 数据授权或自用,企业能跳过昂贵的人工标注和推理链路设计。对于模型服务商,基于 CoVA-SFT 微调的模型有望在专业可视化推理场景中提升准确率,减少因推理错误导致的用户流失或售后成本;基准 CoVA-Bench 可作为产品迭代的验收工具,加速模型选型。
与现有产品/工作流的集成
集成路径较直接:将 CoVA-SFT 混入现有 SFT 数据管道,使用支持图像输入的模型(如 LLaVA、GPT-4V 等)进行微调,并在部署端增加一个中间渲染服务(如 Python matplotlib、SVG 生成器)来输出视觉工作区。开发团队可在 CI 中引入 CoVA-Bench 作为回归测试,确保模型升级不破坏交错推理能力。教育解题 App 可在前端展示模型生成的分步视觉化推理;数据分析平台可将模型用作插件,在 SQL 查询和图表之间增加推理层。
局限
- 该工作明确指出,尽管在 CoVA-SFT 上微调的模型显著优于 interleaved CoT 基线(平均超过 2 倍),但仍明显落后于 strong text-only CoT 基线。这表明引入视觉抽象尚未能带来全面的性能提升,模型在有效建立和利用 internal visual workspace 方面仍存在明显不足。这一差距也间接说明 CoVA-SFT 当前的数据规模和任务设计可能不足以充分训练模型掌握视觉抽象的优势,未来需要结合更强的架构或训练策略来缩小该 gap。
- CoVA-SFT 的构建依赖预定义的布局家族(5 种)和任务模板(17 个),其中的视觉抽象步骤是在数据生成过程中精心设计的。这种监督式构造可能过度指定了推理路径,导致模型在开放域问题中难以自主决定何时以及如何生成视觉表示。在真实推理场景中,模型需要具备自主发起视觉抽象的能力,而本数据集未能提供充分的自由探索空间,泛化性存疑。
- 与现有多模态推理数据集(如 MMCoT、ScienceQA 等)相比,CoVA-SFT 的 51.9K 样本规模仍然偏小,尤其考虑到多模态任务的数据饥饿特性。同时,其任务类型集中于几何、空间推理等特定领域,覆盖范围有限,对更广泛的语言推理任务(如常识推理、复杂数学文字题)的适用性未知。此外,CoVA-Bench 仅包含 1,700 个测试样本,可能不足以提供稳健的评估结论,尤其在衡量细粒度能力时可能产生较高方差。