论文

E2A-Bench:金融图表推理中证据到行动可靠性的基准评测

E2A-Bench:金融图表推理中证据到行动可靠性的基准评测

金融视觉语言模型(VLMs)能否把图表证据转化为可靠的行动建议?现有的幻觉评测大多以陈述为中心:它们评估生成的陈述是否有依据,却不评估证据在推理依据、置信度与最终行动之间是否保持可追溯。我们提出 E2A-Bench,一个包含 969 条查询的金融图表推理基准,基于 323 只 HS300 成分股、三种输入模态构建,并配有确定性的 OHLCV 派生证据锚点。 E2A-Bench 通过 UCR、RCI、ECI 与 NDR 四项指标,分别评测依据性、推理-行动一致性、证据-置信度校准与方向覆盖,其中 NDR 衡量的是覆盖感知的证据到行动可靠性,而非实际交易表现。 对 20 个 VLMs 的评测揭示了三种被标量幻觉分数掩盖的失败模式: 1. UCR 最低的模型因方向覆盖率仅 6.4%,在 NDR 上接近垫底; 2. oracle 辅助验证能减少无依据陈述,却可能使覆盖率崩塌; 3. 金融微调在严格的基础-微调模型对上,将 BUY:SELL 比例放大约 4.21 至 4.68 倍。 这些结果表明,金融 VLM 评测应追踪完整的证据到行动链条,而非依赖单一幻觉分数。代码与数据: https://github.com/wanng-ide/E2A-Bench

论文精读

TL;DR E2A-Bench 用 969 个金融图表查询,沿“证据→推理→置信度→行动”全链路评估 VLM,揭示单一幻觉分数掩盖的方向覆盖崩塌、微调风险放大等三类隐性失败。

问题

问题背景

金融视觉语言模型(VLMs)正被用于从图表证据生成交易建议,但幻觉评估仍以声明为中心。

现有方法局限

现有评估大多只检查生成文本是否被图表支持,即 claim-centric 事实性,忽略了 证据可追溯性:模型给出的理由、置信度与最终行动之间是否逻辑一致、是否覆盖足够的方向分布。这种标量幻觉分数无法暴露三个实际问题:

  1. 低 grounding(UCR)模型可能仍因方向覆盖极窄而排名虚高;
  2. oracle 辅助验证能减少无支持声明却可能坍缩方向覆盖;
  3. 金融微调会系统性放大 BUY:SELL 比例(4.21–4.68 倍),导致分布偏移。

为什么难 / 重要

金融决策错误代价高,模型输出需要 端到端可验证:证据锚点必须确定性地从 OHLCV 数据派生,且 rationale-confidence-action 链条要能自动打分。但现有基准缺少覆盖感知的可靠性指标,无法回答“模型是否只在极少数方向上自信”这一问题。业界对金融 AI 的关注正从生成质量转向决策可靠性,因此证据到行动的基准成为刚需。

行业类比

类似自动驾驶中,仅看感知 mAP 无法保证规划安全,必须验证从检测框到控制指令的全链路一致性。

核心洞察

  • E2A-Bench 将金融图表推理的评估从“陈述是否被支持”扩展到“证据能否通过推理、置信度和最终行动完整追溯”。与现有 claim-centric 幻觉基准仅检查生成句子是否有依据不同,它引入 UCR、RCI、ECI、NDR 四个指标,覆盖 grounding、推理-行动一致性、证据-置信度校准和方向覆盖,能揭示单一幻觉分数掩盖的失败模式,例如最低 UCR 模型因方向覆盖仅 6.4% 而在 NDR 接近底部。
  • 金融微调会系统性放大模型的买入/卖出方向偏差,BUY:SELL 比率在严格基座-微调对中放大 4.21 至 4.68 倍。这一发现与一般微调改善任务性能的认知相悖,说明在金融决策场景中,微调可能引入过度自信或类别不平衡,而非真正提升证据到行动可靠性,提示从业者需对微调后的方向分布进行校准和监控。
  • Oracle 辅助验证虽然减少无支持的声称,但可能导致方向覆盖崩溃,表明事实性与决策覆盖存在冲突。传统评估往往追求高事实性(如高 UCR),但 E2A-Bench 的 NDR 是覆盖感知的可靠性指标,揭示出仅优化事实性可能牺牲模型给出可操作建议的能力,因此评估和优化必须在覆盖与可靠性之间权衡,而非单一追求无幻觉。

方法

输入与任务形式

E2A-Bench 以 金融图表 为输入,覆盖三种模态(图像、OHLCV 序列、图文混合)。模型需针对每个查询输出四元组:证据陈述、推理依据、置信度、交易动作(BUY / SELL / HOLD)。

关键模块

  • 证据锚点构造:从 OHLCV 数据中确定性派生技术信号(如均线交叉、超买超卖),形成可验证的 ground-truth 锚点,避免人工标注的主观性。
  • 评估协议:四个指标分别度量不同环节:
    • UCR(无支撑主张率):生成陈述与证据锚点的对齐程度。
    • RCI(推理-动作一致性):推理方向与最终动作是否逻辑一致。
    • ECI(证据-置信度校准):置信度是否与证据强度成正比。
    • NDR(归一化方向可靠性):在方向覆盖前提下度量证据到动作的整体可靠性,强调覆盖率而非单纯准确率。

输出与差异点

模型最终得到多维诊断剖面,而非单一幻觉分数。相比传统 claim-centric 评估只追问“陈述是否有据可依”,E2A-Bench 追踪 证据 → 推理 → 置信度 → 动作 全链路,能暴露低覆盖、高自信等隐藏缺陷。

实验

实验设计

E2A-Bench 从 323 个 HS300 成分股构造 969 个查询,覆盖三种输入模态,使用确定性 OHLCV 衍生证据锚点。评估 20 个金融 VLM 在 grounding (UCR)、reasoning-action consistency (RCI)、evidence-confidence calibration (ECI) 和 directional coverage (NDR) 上的表现。NDR 是覆盖感知的证据到行动可靠性指标,而非实际交易表现。

关键点:评价全证据链而非单一幻觉分数。

关键发现

  • 最低 UCR 模型因仅 6.4% 方向覆盖率,NDR 排名接近垫底,表明即使 grounding 表现好,方向覆盖差也会损害最终可靠性。
  • Oracle 辅助验证能减少 unsupported claims,但可能坍缩 coverage,显示验证与覆盖存在 trade-off。
  • 金融微调将 BUY:SELL 比例 放大 4.21 到 4.68 倍(strict base-fine-tuned pairs),引入显著偏置。

与基线对比解读

与 claim-centric 幻觉评估相比,E2A-Bench 强调证据可追溯性。传统标量幻觉分数无法捕捉 reasoning-action 不一致和 confidence 失准。Oracle 验证虽然降低错误声明,但若牺牲方向覆盖,最终 NDR 并未提升。微调放大偏置提示部署金融 VLM 时需监控决策分布,而非仅看准确率。

行业影响

落地场景

金融投研助手、智能研报生成、交易信号辅助决策。例如:券商/基金用多模态 VLM 解读 K 线、财报图表并输出买卖建议。保险核保、供应链金融中涉及图表证据的自动审核也可复用。

商业价值

E2A-Bench 推动从“幻觉率”到“行动可靠性”的评估范式转变,降低错误投资建议带来的合规与声誉风险。自动生成确定性锚点测试集,减少人工标注成本,加速模型迭代。通过 NDR 等指标,可筛选出方向覆盖率和一致性俱佳的模型,提升决策质量,间接增收。

与现有工作流接口

作为模型上线前的质量关卡,集成进 CI/CD 或 LLMOps 流水线。与 RAGAS、LangSmith 等评估工具互补,增加证据链追踪。将 E2A-Bench 评分作为金融 VLM 微调后的回归测试,确保微调不破坏证据-行动对齐。使用 OHLCV 数据自动构造查询,可周期性运行,监测模型漂移。

具体 use case

  • 智能投研助手:某资管平台部署图表问答机器人,用户上传个股走势图问“现在可以买入吗?”,模型需给出证据、置信度和行动。E2A-Bench 的 UCR、RCI、ECI 可联合判断模型是否信口开河,避免误导客户。
  • 量化交易信号生成:对冲基金用 VLM 自动解读技术图表并产生多空信号,NDR 指标确保模型不仅答对方向,还在各种市场条件下保持证据覆盖,防止只在少数模式上高置信度输出。

局限

  • **资产与图表覆盖有限**:E2A-Bench 仅基于 HS300 成分股(323 只)的 OHLCV 数据构建证据锚,缺少技术指标叠加、新闻事件、非股票资产(如加密货币、外汇、债券)或多图表组合场景。这让基准在金融领域内的泛化性受限,模型在更复杂或低流动性的金融图表上的证据到行动可靠性可能未被充分评估。
  • **评估指标与实际决策存在差距**:核心指标 **NDR** 明确衡量 *coverage-aware evidence-to-action reliability*,而非 realized trading performance。它关注的是方向覆盖下的可靠性,但不直接反映实际盈亏、风险调整后收益或执行成本。因此,即便模型在 NDR 上表现良好,也不保证能转化为有效的交易策略。
  • **自动评分器对开放式生成鲁棒性有限**:UCR、RCI 等指标依赖预定义的确定性证据锚和输出解析规则,虽然论文进行了人工验证,但解析错误和边界情况仍可能影响结果。此外,论文诊断出金融微调放大 BUY:SELL 比例的现象,但未提出缓解策略,仅停留在问题揭示层面。
论文Xiaoya Wang2026-09-13原文

相关内容