论文

ChartArena: 跨语言、场景和格式的图表解析基准评测

ChartArena: 跨语言、场景和格式的图表解析基准评测

图表是传达定量和关系信息的主要媒介,但系统性地评估图表解析模型仍然困难。现有基准聚焦于狭窄的图表类型,未涵盖流程图和思维导图等图表结构,且模型输出格式不兼容,数据集很少包含实践中遇到的打印或手绘图像。为解决这些问题,我们提出 ChartArena,一个全面的双语基准,涵盖八个图表家族,包括数值图表和图表结构,每个家族在三种视觉场景下评估:数字渲染、打印照片和手绘照片。数据集通过人机协作标注流水线构建,包含多阶段人工验证以确保标注可靠性。 为促进公平的跨模型比较,我们进一步设计了格式无关的评估协议,将异构输出映射到两个规范语义空间:归一化三元组视图和有向图视图,并使用结构感知指标评分。通过对26个主流MLLM的广泛评估,我们观察到三个一致发现:(i) 前沿专有模型如 Gemini 3.1 Pro 整体领先,但最强开源系统正在迅速缩小差距;(ii) 文档解析模型在数值图表上表现合理,但在图表结构上严重落后;(iii) 专业图表解析器仍局限于狭窄的图表家族。所有模型中,雷达图和手绘场景尤为困难。这些发现表明 ChartArena 暴露了明确的能力差距,并为未来进展提供了统一基础。ChartArena 公开于 https://github.com/pspdada/ChartArena。

论文精读

TL;DR ChartArena 构建了覆盖 8 类图表、3 种视觉场景的双语基准,并通过格式无关的语义空间映射与结构感知评分,首次公平比较了 26 个 MLLM 的图表解析能力,揭示前沿模型在图表结构与手绘场景下的显著差距。

问题

问题背景
图表是传递定量信息与关系逻辑的核心视觉媒介。随着多模态大模型(MLLMs)快速演进,业界迫切需要一套能覆盖真实多样场景、支持公平对比的图表解析评测体系,以衡量模型在文档理解、自动化数据分析等下游任务中的实际能力。

现有方法局限
当前基准存在三个关键不足:

  • 类型覆盖窄:主流基准(如 ChartQA、PlotQA)仅聚焦柱状图、折线图等数值图表,几乎不涉及流程图、思维导图等图示化结构。
  • 格式不兼容:模型输出格式各异(JSON、CSV、树结构等),缺乏统一的格式无关评估协议,导致跨模型对比不可靠。
  • 场景单一:数据集多为干净数字渲染图,忽略打印拍照、手绘草图等实际部署中常见的视觉场景,且标注流程缺少多阶段人工验证,可靠性存疑。

为何该问题既难又重要
技术挑战源于需同时解决多语言(中英双语)、多场景(数字/打印/手绘)和多结构(数值图表与图示结构)的联合评估,并设计能归一化异构输出到统一语义空间(如三元组视图、有向图视图)的结构感知指标。业界高度关注的原因在于:文档智能、RAG、自动化报告生成等生产系统严重依赖图表解析模块,而模型在复杂视觉变异下的精度是否可靠仍属未知,一个全面的基准可明确能力边界并推动模型改进。

行业类比
正如结构化信息提取(从发票、表单中抽取键值对)依赖覆盖多种布局与噪声的标准化基准来检验鲁棒性,ChartArena 为图表解析提供了一个类似的通用评测框架,让模型在统一尺度下竞争,定位长尾能力的真实短板。

核心洞察

  • - 格式无关评估协议:ChartArena 将不同模型的异构输出统一归一化到三元组与带属性图两种规范语义空间,解决了输出格式不兼容导致跨模型比较失真的难题。与强制固定输出格式的以往基准不同,该协议先接受各模型的原始输出,再通过结构感知的映射与评分实现公平对比,既能容纳未来输出的多样性,又避免了因格式约束掩盖真实解析能力,为图表解析评估提供了可扩展且公正的通用框架。
  • - 示意图结构解析成为关键瓶颈:在涵盖流程图、思维导图等八类图表的全面测试中,主流多模态大模型对示意图结构的解析能力显著低于数值图表,即使前沿专有模型也大幅落后于文档解析模型,暴露了通用视觉语言模型在关系性、层次性结构理解上的普遍短板。这一发现突破了传统基准仅关注柱状图、折线图等标准数值图表的局限,指明训练数据分布与模型架构需更重视抽象拓扑关系,为破解图表理解中的长尾难题提供了明确方向。

方法

输入与数据构造

ChartArena 构建了首个双语、多场景、多图表族的图表解析基准,输入覆盖 8 个图表族 (数值图表 如柱状图、折线图、雷达图等,图形结构 如流程图、思维导图、网络图) 以及 3 种视觉场景:数字渲染、打印照片、手绘草图。数据来源广泛,标注采用 人机协作管道:先由 LLM 生成初步结构化标注,再经 多阶段人工校验,确保标注可靠;最终形成稠密的三元组或图结构 ground truth。

核心评估协议

面对不同模型输出格式的异构性 (JSON、表格、自然语言等),ChartArena 设计了 格式无关评估协议,包含两大模块:

  1. 格式归一化 (Format-Agnostic Normalization):根据图表类型,将任意模型的输出映射到两个规范语义空间——
    • 规范化三元组视图:用于数值型图表,将数据点抽象为 (主语, 谓词, 宾语) 三元组,提取量化关系;
    • 有向图视图:用于图形结构图表,将元素转化为节点、连接转化为有向边,捕捉拓扑信息。
  2. 结构感知评分 (Structure-Aware Scoring):在归一化后的空间上计算 精确匹配率 (Exact Match)平均精度均值 (mAP) 等指标。例如对三元组采用集合匹配,对图结构采用边匹配算法,兼顾内容准确性与结构完整性,避免单一字符相似度带来的偏差。

实验与输出

协议应用于 26 个主流 MLLM (包括 Gemini 3.1 Pro、GPT-4V、开源模型) 的评估,输出分图表族、分视觉场景的细粒度得分。该设计使得即使模型输出格式截然不同也能公平对比,暴露出前沿模型在雷达图、手绘场景上的普遍短板。

关键差异

相较于传统图表基准 (如 ChartQA 仅限数字图表、固定输出格式),ChartArena 首次以语义空间归一化实现跨模型、跨格式的统一评估,同时将图形结构图表纳入标准测试集,填补了流程解析等领域的评估空白。

实验

实验设计

ChartArena 是一个双语、多场景的图表解析基准,覆盖 8 大类图表(含数值图表与图示结构),每种图表均包含 3 种视觉场景:数字渲染、打印照片和手绘照片。数据构建采用 人机协同标注流水线,并经过多阶段人工验证。评估引入了 格式无关评估协议,将异构模型输出归一化到 规范三元组视图有向图视图,并用 结构感知指标 进行评分。实验选取 26 个主流多模态大模型(MLLM),涵盖闭源与开源系统,统一对比图表解析能力。

关键发现

  • 闭源模型 Gemini 3.1 Pro 综合领先,但最强开源模型正在快速追赶。
  • 文档解析专用模型 在数值图表上表现尚可,面对图示结构(流程图、思维导图)时性能锐降。
  • 专家级图表解析器 仍局限于特定图表类型,泛化性不足。
  • 雷达图手绘场景 对所有模型均为难点,准确率显著偏低。

与基线的深度对比

现有基准多聚焦少数图表类型,忽略图示结构,且输出格式不统一,无法公平比较;真实场景下的打印/手绘图像也鲜有涉及。ChartArena 通过 多元图表覆盖真实视觉退化,大幅提升了评估的信度。其格式无关评估将模型从专属输出范式中解耦,使得跨架构对比成为可能。结果揭示出:通用 MLLM 虽能处理简单图表,但结构化理解仍弱;专用模型在窄域突出,却缺乏鲁棒性。基准暴露的短板为后续研究指明了方向,同时也为构建更鲁棒的图表理解系统提供了标准化测试床。

行业影响

落地场景

ChartArena 基准覆盖的 8 类图表(柱状图、雷达图、流程图、思维导图等)与 3 种视觉场景(数字渲染、打印、手绘),直接对应实际应用中的复杂输入。典型的落地产品包括:

  • 智能文档处理平台:自动提取财报、学术论文、产品说明中的图表数据,输出结构化表格。
  • 多模态 RAG 系统:将图表纳入知识库,提升问答系统对量化关系的理解。
  • 教育辅助工具:对手写笔记、打印习题中的图表进行解析,支持交互式答疑。
  • 企业流程图自动化:从手绘或拍照的流程图、思维导图中抽取节点与关系,辅助流程挖掘。

商业价值

  • 降本:替代人工转录图表数据,减少 80% 以上的重复录入工作;ChartArena 的格式无关评测协议可标准化输出,减少后处理开发成本。
  • 增收:在电商平台中,自动提取商品详情图(如尺寸对照表、性能对比图)的结构化信息,丰富搜索与推荐特征,提升转化率。
  • 体验提升:在金融分析类 SaaS 中,将图表解析为可交互数字,用户无需手动对照截图与原始数据,分析速度提升数倍;同时,结构感知指标(triple view/graph view 的 mAP/EM)直接转化为产品中的可解释性评分,让用户感知解析可信度。

与现有产品/工作流的接口

  • 模型评估与选型ChartArena 可作为 MLLM Pipeline 中的自动化评测组件,通过统一路由适配不同模型的输出格式(JSON、Markdown、自然语言),输出 Exact MatchmAP 分数,与 CI/CD 集成实现持续性能监控。
  • 标准化输出层:其定义的 normalized triple view(数值图表)和 directed graph view(图示结构)可作为 API 规范,连接下游数据分析、BI 工具或数据库,无需为每个模型定制适配器。

具体用例

  1. 电商内容审核与增强:商品详情页的“尺寸指南”通常为图片,使用 ChartArena 中表现最佳的模型(如 Gemini 3.1 Pro 或追赶中的开源模型)自动抽取表格数据,直接写入商品数据库,改善移动端浏览体验和搜索可发现性。
  2. 金融研报自动化:基金公司每周处理大量包含图表(K 线图、资产配置饼图、雷达图)的 PDF,集成 ChartArena 评估筛选出的模型可将图表数据实时推送到内部 Excel 模型,消除人工截图再录入的延迟,交易策略回测效率大幅提高。

局限

  • **数据集构建依赖人机协作标注流程**,虽然多阶段人工验证保障了可靠性,但手绘照片和印刷拍照场景的标注一致性可能受噪声和主观判断影响,且未公开标注者间一致性指标,可能引入系统性偏差。
  • **格式无关评估协议**将异构输出统一映射到规范语义空间,虽实现了公平比较,但归一化过程可能丢失输出格式特有的细粒度信息(如布局、样式),对部分图表类型(如雷达图、复杂流程图)的结构评分可能不足以反映语义完整性,且未充分验证评分指标与人类判断的相关性。
论文Shangpin Peng2026-05-31原文

相关内容