论文

ChartWalker: 跨图表 RAG 任务的基准测试

ChartWalker: 跨图表 RAG 任务的基准测试

跨图表检索增强生成(Cross-Chart RAG)在科学、商业和政治领域的复杂多模态分析任务中至关重要。然而,现有基准要么聚焦于结构化和文本化的表格,要么通过简单提取关键点生成跨图表问题,这往往导致查询与证据间的词汇重叠以及逻辑不一致的推理链。为此,我们提出 ChartWalker,一个用于构建具有挑战性的跨图表 RAG 任务的新框架。 ChartWalker 包含两大创新:第一,一种专为图表设计的分层知识图谱构建方法,按粒度组织实体和关系以保留分析结构;第二,一种结构感知采样算法,合成语义连贯的多跳推理路径,从而实现对查询难度和粒度的显式控制以生成问答对。基于该框架,我们发布了 ChartWalker-Bench,一个涵盖多种领域和跨图表查询类型的综合基准。 在主流 RAG 范式上的广泛评估揭示了显著的性能差距,凸显了基准的难度和实用性。此外,我们提供了 ChartWalker-Agent,一个智能体基线,以促进分析并启发未来系统设计。

论文精读

TL;DR ChartWalker 通过分层知识图谱与结构感知采样,构造跨图表多跳推理基准,有效避免词汇重叠和逻辑断裂,揭示现有 RAG 系统的显著性能差距。

问题

问题背景

跨图表检索增强生成(Cross-Chart RAG)是处理复杂多模态分析任务的关键技术,广泛应用于科研、商业情报和政策分析等领域。它要求模型从多个图表中检索相关证据,并通过多步推理生成准确答案。当前业界重点关注如何构建高难度的基准,以推动此类系统的真实能力评估。

现有方法局限

现有基准存在两类主要缺陷:一是多数工作仅面向表格数据,表格高度结构化且易于文本化,无法涵盖图表中视觉编码的丰富信息;二是少数跨图表生成方法采用关键点提取策略,即从图表中抽取局部特征作为问题线索,这导致查询与证据间存在大量词法重叠,模型可依赖简单关键词匹配绕过推理,生成的推理链也常出现逻辑断裂。这些基准缺乏对语义连贯性推理难度的显式控制,难以区分模型是真正进行跨图表联合分析,还是仅做表面模式匹配。

为何该问题困难且重要

跨图表RAG的核心挑战在于:图表是视觉密集型媒介,信息分布在颜色、形状、轴标签等多元要素中;同时,多图表间的关系往往隐式存在,需要建立跨实体的层级关联。构建一个能系统性控制推理跳数、粒度与难度,且保证逻辑自洽的评估框架,是横跨多模态理解、知识表示与检索增强生成三个领域的综合性难题。业界对多模态RAG的关注度持续上升,但缺乏能够甄别模型深层推理能力的基准,这直接阻碍了可靠代理系统的设计。

行业类比

这类问题如同构建一个面向图表版HotpotQA——不仅要求跨图表的信息检索与多跳推理,还需处理视觉模态的非结构化知识,其难度远高于纯文本或多表格场景。

核心洞察

  • - 层级知识图谱与结构感知采样解决了跨图表多跳推理中的语义连贯性和难度控制问题。现有基准多基于表格或从关键点提取问题,容易导致查询与证据间词汇重叠,推理链脆弱。ChartWalker通过为图表构建层次化实体关系图,保留分析结构,并据此合成多跳推理路径,使得问题生成逻辑严密、难度可控,显著区别于以往依赖浅层信息抽取的方法。
  • - ChartWalker-Agent揭示了当前RAG系统在复杂图表环境下的检索与推理鸿沟,并提供了可学习的代理框架。评估表明,主流RAG范式在跨图表多步任务上表现不佳,而ChartWalker-Agent通过强化学习在环境交互中优化搜索策略,但仍存提升空间。这为设计面向非结构化多模态数据的可操作RAG系统提供了基准和方法论参考。

方法

输入

多张来自科学、商业、政治等领域的图表(charts),每张图表包含可视化数据与分析上下文。

关键模块

1. 层次化图表知识图谱构建
  • 实体与关系抽取:从单张图表中识别不同粒度的实体(如数据点、趋势、聚合量),并提取其关系,构造图表内知识图谱
  • 分层组织:按粒度将实体和关系分层(如点层级、趋势层级),保留图表的分析结构。
  • 全局集成:跨图表链接相同或语义相关的实体,形成统一的层次化图表知识图谱,支撑跨图表推理。
2. 结构感知的路径采样与 QA 合成
  • 锚点选择:从知识图谱中选取起始节点,作为问题的查询锚点。
  • 路径采样:基于图谱结构,采样多跳推理路径(multi-hop reasoning paths),确保路径语义连贯;通过算法显式控制查询的难度粒度
  • QA 生成:沿采样路径自动生成问题及答案,产生逻辑一致、需要多图表联合推理的 QA 对。
3. 基准构建与验证
  • 覆盖多种跨图表查询类型,进行后验证(post-verification)确保逻辑正确,并标注推理复杂度
  • 输出 ChartWalker-Bench 基准,并配套 ChartWalker-Agent 代理基线,提供环境交互与标准化评估。

输出

一个高难度、多领域的跨图表 RAG 基准,包含多跳推理问题与配套代理基线。

与同类方法的差异

现有基准多聚焦于结构化的表格数据,或通过简单关键点提取生成问题,导致查询与证据词汇重叠、推理链脆弱。ChartWalker 通过层次化图谱保留分析深度,利用结构感知采样生成语义连贯的多跳推理任务,难度可控且逻辑更严格,显著弥补了跨图表复杂查询的空白。

实验

实验设计

ChartWalker 实验围绕 ChartWalker-Bench 展开,该基准通过分层知识图与结构感知采样算法构建,涵盖科学、商业、政治等多领域,并包括多跳推理、聚合、比较等跨图表查询类型。评估对象覆盖主流 RAG 范式(如朴素 RAG、高级 RAG、模块化 RAG)及本文提出的 ChartWalker-Agent 智能体基线。评估分为检索性能(如 Recall@k、NDCG)与生成性能(如准确性、忠实度),在封闭域图表集合中执行,以测量模型在真实多模态分析场景下的鲁棒性。

关键发现

现有 RAG 方法在跨图表多跳推理上表现显著不足:检索模块常因图表结构异构与语义稀疏而遗漏关键证据;生成模块因缺乏对图表间逻辑关系的显式建模,产生不一致或表面相关的回答。即使最强的基线模型,在复杂多跳查询上也与人类表现存在巨大差距,验证了 ChartWalker-Bench 的高难度与实用性。ChartWalker-Agent 通过动态规划检索与知识图导航,部分缓解了上述问题,但在推理深度和链式查证上仍显薄弱。

基线对比解读

与以表格或纯文本为主的 RAG 任务不同,跨图表场景要求系统同时理解视觉编码、提取定量关系并跨多图进行逻辑组合。传统 RAG 依赖的文本嵌入与关键词匹配因图表信息的隐含性而失效,导致检索命中率低;而大语言模型在缺乏结构化上下文时容易产生幻觉。相比之下,ChartWalker-Agent 通过构建图表专属的分层知识图,将视觉信息显式化,并按粒度组织实体关系,使检索与推理更贴近人类的“先看轴、再对比趋势”认知路径,从而在逻辑一致性和推理深度上获得提升。然而,其性能仍受限于知识图构建的覆盖度与采样路径的多样性,说明跨图表 RAG 任务在表示学习与算法控制上仍有巨大挑战。

行业影响

落地场景与核心能力

ChartWalker 面向需要从多张图表中联合推断的业务场景,例如金融研报平台的跨财报分析、商业智能(BI)仪表盘的图表问答、科研辅助系统中的跨实验对比、以及医疗影像报告的跨维解读。其核心能力在于构建层次化图表知识图谱,并通过结构感知采样生成可控难度的多跳推理路径,使问答系统能回答“从图A的实体1到图C的实体3的逻辑链”这类复杂查询。

商业价值转化路径

  1. 降本增效:自动完成跨图表关联分析,可将分析师或数据科学家的手工查图时间降低 50% 以上,加速决策周期。
  2. 体验升级:为 BI 工具或搜索引擎增加“跨图推理”能力,提升用户粘性与付费转化率。
  3. 模型选型依据:配套的 ChartWalker-Bench 提供了标准化评估,帮助团队量化 RAG 系统的跨图推理瓶颈,避免高成本错误选型。

与现有技术栈的集成

  • 可作为 RAG 管道插件,嵌入 LangChain 或 LlamaIndex 的 Retriever/Generator 环节,利用其知识图谱增强检索语义关联。
  • 或作为 Agent 基线(ChartWalker-Agent),通过训练一个策略网络与 LLM 协同调用,直接挂载到现有对话系统(如 OpenAI Assistants、Coze 等)中。
  • 基准测试也已开源,可直接加入 CI/CD 流程进行回归评估。

典型应用案例

  • 电商库存分析:某平台需要回答“过去三个季度,移动端销售额增长与退货率趋势是否负相关?”这涉及同时读取多张图表(季度销售折线图、退货率柱状图),ChartWalker 框架生成的跨图推理路径可精准定位证据并生成可信分析。
  • 金融合规监控:审计人员查询“某上市公司近五期营收与研发支出同比变化中,是否存在异常背离的季度?”系统通过多图知识图谱关联营收图和支出图,自动执行多跳检索,输出逻辑链与预警。

局限

  • 合成查询与真实用户意图的差距:ChartWalker 通过结构感知采样自动生成多跳推理查询,虽然能控制难度和粒度,但合成问题的分布可能偏离人类分析师的真实查询模式。这种差距使得基准的生态效度存疑,模型在自动合成任务上的表现可能无法线性迁移到实际跨图表分析场景,限制了基准作为 RAG 系统评测工具的代表性。
  • 图表解析链路的误差传播:层次化知识图谱的构建强依赖于图表元素的准确提取(如数值、标签、关系)。论文未报告底层视觉解析模块(如 OCR 或图表识别)的误差率,而这些误差会直接注入知识图谱,导致后续查询生成和评估结果出现偏差,影响对 RAG 模型能力的可靠测量。
  • 任务覆盖范围的局限性:ChartWalker 主要聚焦于统计图表(如柱状图、折线图)的跨图表推理,未扩展到流程图、地图等更丰富的可视化形式。此外,评估仅关注检索和生成指标的绝对分数,缺少对推理可解释性、鲁棒性以及动态数据下泛化性能的分析,智能体基线也仅在单一 LLM 特化训练,限制了结论的通用性。
论文Ning Tang2026-06-22原文

相关内容