论文

CURV: 通过课程式视觉接地推理增强图表理解

CURV: 通过课程式视觉接地推理增强图表理解

图表问答(CQA)要求多模态大语言模型(MLLMs)整合视觉理解与逻辑推理,然而现有模型在精确视觉接地和连贯推理链方面仍有不足。尽管外部思维链提示和视觉线索能显著提升性能,但当前MLLMs缺乏内在的视觉接地推理能力,导致感知不准确且推理与视觉证据脱节。 为解决这些问题,我们提出 CURV,一种课程学习框架,通过将CQA重构为多步视觉接地推理来发展内在视觉推理能力,其中每一步通过空间注意力集中协调逻辑推理与动态视觉接地。为辅助模型学习,我们进一步引入 CCQA,一个三级课程数据集,涵盖多样图表类型和推理模式的可扩展合成生成。我们的课程系统性地从基础单步操作推理推进到复杂多图表组合任务。 实验表明,CURV 相较于基线实现了最高 ↑20.50% 的提升,并可泛化至真实世界基准(最高 ↑12.30% )和跨领域多模态推理任务(最高 ↑10.20% ),验证了通过动态接地内化视觉推理对增强图表理解能力的有效性。代码已开源:https://xhguo7.github.io/CURV/。

论文精读

TL;DR CURV 通过课程学习与动态视觉基础,将图表问答转化为多步可解释的视觉推理,内部化推理能力,在多个基准上大幅超越现有方法。

问题

问题背景

图表问答(Chart Question Answering, CQA)要求多模态大语言模型(MLLMs)融合视觉感知与逻辑推理,从柱状图、折线图等结构化图表中提取信息并回答复杂问题。这一领域近期聚焦于提升模型对图表元素的精确定位与推理链的连贯性,以实现可信的自动化数据洞察。

现有方法局限

当前 MLLMs 主要依赖外部链式思维提示(extrinsic chain-of-thought)或视觉提示(visual cues, 如边界框)来引导推理,但存在两点根本性缺陷:

  • 内在视觉接地能力缺失:模型缺乏将推理步骤动态地与图表特定区域对齐的机制,导致推理时常脱离实际视觉证据,产生幻觉。
  • 感知与推理割裂:视觉编码器与语言解码器独立运作,多步推理过程中无法根据逻辑需要重新聚焦视觉注意力,限制了处理多步、多图表组合任务的灵活性。

技术挑战与重要性

图表中数据点、轴标签、图例等元素的空间关系复杂,且问题往往需要多步聚合、过滤、比较才能回答。动态视觉接地 需要在每一步推理中精确定位相关视觉区域,这对模型的跨模态对齐能力提出极高要求。同时,标注此类推理过程数据成本高昂,缺乏高质量训练资源。 业界对自动化报表解读、商业智能问答等应用需求强烈,因此建立具备内在视觉推理能力的 MLLM 成为关键瓶颈。

行业类比

该挑战类似代码生成中让模型逐步跟踪变量状态(如执行跟踪),每一步推理必须基于当前上下文动态聚焦于相关代码片段,而非仅凭整体理解一次性生成答案。

核心洞察

  • 将依靠外部视觉提示的 **显式 grounding** 转化为模型内生能力:CURV 通过课程训练,让 MLLM 在多步推理中自主生成动态空间注意力,每一步逻辑推导都精准对齐图表对应区域。与现有方法(如 TAP、VoT)依赖额外视觉锚定或思维链提示不同,CURV 实现了 **内在视觉 grounded 推理**,使得推理链条始终扎根于视觉证据,显著减少幻觉,并泛化至非图表多模态任务。
  • 构建 **三级课程合成数据集 CCQA**,从单步操作到跨图组合,系统破解复杂图表推理的训练数据瓶颈。现有图表问答数据集(ChartQA、PlotQA)多聚焦单图单步,缺乏渐进式难度与多样组合。CCQA 通过可扩展合成管线,生成涵盖多种图表类型和推理模式的数据,配合课程学习策略,先强化基础操作,再渐进至多步复合推理,训练出的模型不仅图表理解提升 20%+,更在域外多模态推理任务中展现 10%+ 的迁移增益,证明了结构化课程的有效性。

方法

方法概述

CURV 将图表问答(CQA)重新定义为 多步视觉根基推理(multi-step visual grounded reasoning),通过 课程学习(curriculum learning) 框架让 MLLM 内部掌握动态空间注意力与逻辑推理的协同能力。整体流程遵循“输入 → 关键模块 → 输出”线索:

  • 输入:图表图像 + 自然语言问题
  • 关键模块:
    1. 多步推理链生成:模型在每一步输出一个子问题、对应的视觉根基区域(通过空间注意力集中实现),以及基于该区域的中间结论,逐步逼近最终答案。
    2. 动态视觉根基(dynamic visual grounding):每一步推理均动态定位图像中与当前子问题最相关的空间区域,注意力集中策略使模型学会从视觉证据出发进行推理,而非仅依赖语言先验。
    3. 三级课程 CCQA 数据集:自行构建的可扩展合成数据集,涵盖单操作推理、多操作链式推理、跨多图表的组合推理三个难度层次,覆盖多种图表类型与推理模式。训练时由易到难逐步提升任务复杂性,确保模型稳步内化视觉推理能力。
  • 输出:最终答案及完整的视觉根基推理链

与同类方法的差异

与依赖外部 Chain-of-Thought 提示 或额外视觉线索(如边界框标注)的现有方法不同,CURV 在不改变底层 MLLM 架构的前提下,通过课程学习让模型自发产生内在的视觉根基推理行为,从而避免感知错误与推理过程脱离视觉证据的问题。这使得 CURV 在真实世界基准(+12.30%)和跨域多模态推理任务(+10.20%)上均表现出显著泛化性。

实验

实验设计

CURV 在自建的三级课程数据集 CCQA 上训练,该数据集通过可扩展的合成生成,涵盖多种图表类型和推理模式。课程从基础单步操作推理逐步过渡到复杂的多图表组合任务。模型将图表问答(CQA)重新定义为多步视觉接地推理,每步结合逻辑推理与通过空间注意力集中实现的动态视觉接地。评估在CCQA 测试集、多个真实世界图表问答基准(如 ChartQA、PlotQA)以及域外多模态推理任务上进行,以检验模型的内化视觉推理能力和泛化性。

关键发现

CURV 在所有评估中均表现出显著提升:相比基线方法,整体性能最大提升 20.50%;在真实世界基准上最大提升 12.30%;在域外任务上最大提升 10.20%。这些结果证明了将视觉推理内化到模型能力中的有效性。动态空间注意力集中机制使得推理步骤始终锚定在视觉证据上,减少了幻觉和不准确的感知,并产生了更连贯、可解释的推理链。此外,课程学习策略确保了模型逐步构建稳健的推理技能。

与基线对比

基线 MLLMs 依赖外部思维链提示或视觉线索,缺乏内化的视觉接地能力,导致推理与视觉证据脱节,尤其在需要精确定位图表元素的场景下表现不佳。CURV 通过课程学习强制模型学习逐步视觉推理,将接地过程融入推理链内部,无需外部提示即可进行视觉锚定推理。与使用人工标注提示的通用视觉推理方法相比,CURV 展现更强的泛化性,在多个分布外任务上仍保持优势,表明该方法习得了可迁移的视觉推理能力。

行业影响

落地场景

CURV 通过多步视觉接地推理 (visual grounded reasoning) 增强了图表问答能力,可嵌入需要从数据可视化中提取洞察的产品:

  • 商业智能 (BI) 仪表盘:用户用自然语言提问,直接得到基于图表的精确答案,例如“Q3 销售额最高的区域是哪个?”
  • 自动化报告生成:金融、咨询机构可将图表批量转换为文字摘要,减少分析师手工解读时间。
  • 教育科技:智能辅导系统自动解答数学/科学图表题,提供分步推理过程。
  • 金融数据服务终端:分析师通过聊天界面查询 K 线图、股票趋势图,模型输出具备视觉证据支撑的结论。

商业价值

  • 降本:替代大量初级图表解读人力,尤其在批量报告生成场景。CCQA 数据集提供了可扩展的合成数据生成方式,降低了模型定制成本。
  • 增收:提升 BI、金融终端等产品的差异化功能,使数据查询更直观,减少用户学习曲线,从而提高订阅率或客户粘性。
  • 体验提升:相比传统抽取式 QA,CURV 的动态空间注意力集中机制让模型输出附带可解释的视觉依据,增强用户信任。

与现有产品/工作流的接口

该框架可作为插件集成到现有的多模态大模型 (MLLM) 推理管线:

  1. 模型接收图表图像与问题,CURV 将问题分解为多步推理,每步动态定位关键视觉区域。
  2. 输出答案同时可返回空间注意力热图,供前端高亮图表相应部分,实现可解释交互。
  3. 与主流 MLLM (如 LLaVA, CogVLM) 兼容,可微调后以 API 形式部署,与 BI 工具 (Tableau, PowerBI) 或聊天机器人框架 (Rasa, LangChain) 串联。

具体用例:

  • 电商运营看板:运营人员上传销售趋势图并输入“找出周末转化率下降的原因”,系统依据图例和坐标轴视觉接地,生成带引用标注的分析。
  • 投研报告解读:用户上传包含多子图的行业研报,模型通过多图表组合推理对比不同指标,输出结构化摘要,并标注关键异常点。

局限

  • **合成数据的覆盖局限**:论文提出的 **CCQA** 数据集基于模板和自动生成,虽然覆盖了柱状图、折线图、饼图等常见图表类型,但对散点图、雷达图、桑基图等复杂或特殊图表类型的支持有限。合成的推理链(如 `select`, `filter`, `compute`)可能不能完全模拟真实场景中的隐式推理路径,且数据分布与真实用户提问的多样性仍有差距,可能限制模型在开放域图表问答中的表现。
  • **多步推理的错误累积**:**CURV** 将推理分解为多步视觉基础操作,步骤间依赖空间注意力的动态调整。一旦中间步骤的视觉基础出现偏差(如定位错误的数据标记、坐标轴刻度误读),误差会向后传播,导致最终答案错误。训练时虽通过课程学习逐步增加复杂度,但推理链长度增加时,模型的长距离依赖和纠错能力仍面临挑战,论文未提供针对错误恢复或不确定性校准的机制。
  • **与外部知识增强方法的对比缺失**:许多现有图表问答工作利用外部工具(如数据表提取、OCR、代码生成)或检索增强来提升推理可靠性,**CURV** 强调内在视觉基础能力,未与这些显式知识注入方法进行直接对比,因此尚不清楚在纯视觉推理能力之外,实际部署时是否需要额外模块来弥补不足。
论文Xuehang Guo2026-08-03原文

相关内容