论文

AUDITFLOW: 可执行符号环境用于结构化财务报告验证

AUDITFLOW: 可执行符号环境用于结构化财务报告验证

结构化财务审计验证对于语言模型智能体而言具有挑战性,因为正确性取决于结构化证据而非仅文本。模型必须将报告事实与分类法概念关联,遍历计算或维度关系,并在应用审计规则前重新计算预期值。 我们提出 AuditFlow,一个基于图的多智能体框架,将自适应搜索与确定性验证分离。AuditFlow 从静态 US-GAAP 分类图与动态 XBRL 归档图构建符号环境,并通过类型化工具暴露事实检索、分类法遍历、数值检查与规则评估。两名初级审计员从监管与证据视角检查每个案例,高级审计员解决分歧并可请求进一步调查。最终报告通过证据聚合融合,产生审计裁决、预期值、证据链与可信度评分。 在 FinAuditing 派生的 FinMR 样本上,AuditFlow 在 GPT-5.5 下达到 82.09% 的联合审计准确率,超过最强基线 14.93 个百分点。移除确定性检查后准确率降至 17.91%,表明符号环境执行了模型无法可靠替代的验证步骤。

论文精读

TL;DR AuditFlow 构建 XBRL 与 US-GAAP 双图符号环境,用多智能体结合确定性检查器,将财务审计验证准确率从最强基线提升至 82.09%,证明结构化验证无法被纯模型取代。

问题

问题背景

财务审计自动化是金融 NLP 的关键方向,核心挑战在于验证结构化报告中的事实是否符合美国 GAAP 等会计准则的复杂语义与计算约束。纯文本模型难以直接处理分类体系层次、维度关系与跨报告数值一致性。

现有方法局限

现有 LLM 审计代理多依赖文本生成直接判断,但面临三类典型失败: (1) 事实链接错误,无法将报告中的数值字段可靠映射到分类体系概念(如 us-gaap:Revenue),导致错误归因; (2) 计算关系不可信,即使模型生成正确公式,算术结果常不可靠,而审计中哪怕一个小数点错误也会导致误判; (3) 规则评估幻觉,在无精确工具的情况下,模型会编造非存在的合规要求或忽略维度聚合逻辑。ReAct 等通用框架在需要确定性数值推理时,无法保证每次输出的正确性,且缺乏可审查的证据轨迹。

为什么这个问题难/重要

结构化审计本质是符号约束下的精确验证,而非开放域推理。技术挑战在于: (1) 分类体系图(如 US-GAAP 计算关系)与动态申报图(公司实际填写的数据)必须对齐,否则计算关系链断裂; (2) 审计规则同时依赖法规语义(如 SEC 合规阈值)与数值条件(如 Assets = Liabilities + Equity),纯神经网络难以同时处理; (3) 业界监管要求可解释的证据链,而现有代理输出常为黑盒。该任务直接影响财务报告质量、投资者信任与合规成本,是 AI 落地金融的核心障碍。

行业类比

类似代码生成中编译器与类型检查器的角色: 编译器执行确定性规则(语法/类型),大模型负责意图生成; AuditFlow 用符号环境充当审计的"编译器",让 LLM 代理专注策略决策而非数值计算。

核心洞察

  • **符号验证与 LLM 推理的解耦**:AuditFlow 的核心设计是将自适应搜索(LLM 驱动)与确定性验证(符号环境提供)完全分离。与其让 LLM 直接处理数值计算或审计规则匹配,框架通过类型化工具暴露分类法遍历、数值检查和规则评估等能力,LLM 仅负责探索与假设生成。这从根本上规避了 LLM 在精确计算上的不可靠问题——消融实验显示,移除确定性检查后准确率从 82.09% 暴跌至 17.91%,证明符号环境承担了模型无法可靠替代的验证职责,为高精度财务审计场景提供了可落地的工程范式。
  • **图基环境实现结构化证据的闭环**:AuditFlow 构建了由静态 US-GAAP 分类图谱和动态 XBRL 申报图谱组成的可执行符号环境,将审计任务从自由文本理解转向基于关系网络的证据链接。LLM 代理必须通过工具访问事实、遍历维度或计算关系,从而强制生成可追溯的证据链。这一设计区别于仅依赖文本上下文的基线方法,解决了结构化财务报告审计中“证据锚定”这一根本难题,使得整个判定过程可解释、可复现,并能够输出预期值、证据轨迹和可信度评分,为构建可靠审计 AI 提供了可扩展的工程基础。

方法

输入与任务形式

AuditFlow 接收结构化财务归档文件(XBRL 实例)及对应的监管知识(US-GAAP 分类体系),任务是将报告事实关联至分类概念、遍历计算与维度关系、重算期望值,并对每条审计规则给出判定。

关键模块

1. 双重图审计环境

  • 静态监管图:编码 US-GAAP 分类中的概念层级、计算弧、维度关系等先验约束。
  • 动态归档图:从被审 XBRL 文件中即时提取的事实、上下文、计量单元等,形成可查询的图结构。

2. 类型化工具接口 环境将图操作封装为确定性工具,供智能体调用:

  • fact_retrieval:按概念、期间、维度检索已报告事实。
  • taxonomy_traversal:沿计算或维度弧查找父/子概念。
  • numerical_check:执行符号计算(如求和、加减)以验证报告值与期望是否一致。
  • rule_evaluation:根据审计规则(如阈值、相关性)对验证结果打分。

3. 三智能体审计协议

  • 两个初级审计员:分别从监管视角(规则合规)和证据视角(数据支撑)独立探查环境,生成初步报告。过程中必须通过强制工具关卡required-tool gate),确保每个断言都有直接工具调用支撑,防止凭空想象。
  • 高级审计员:比对两份报告的分歧点,可命令重新调查或调用额外工具,产出融合结论。

4. 证据聚合与边界精炼

  • 证据聚合:将两路证据链合成统一的审计裁决(合规/违规)、期望值(重算结果)、证据轨迹(调用记录+快照)和可信度分数
  • 有界精炼:允许在有限轮次内对存疑点进行复核,平衡效率与严谨性。

输出

最终输出包含:审计决议期望数值可追溯的证据链置信度评分,满足可解释性和可复现性要求。

与同类方法的差异

不同于让 LLM 端到端“阅读并判断”的智能体方案,AuditFlow 将搜索(自适应探索)与验证(确定性符号运算)解耦:模型负责导航决策,而环境内置的计算器、规则引擎等工具保证数值与关系推理的精确性——移除这些工具后准确率从 82% 暴跌至 17.91%,直接证明了结构化符号环境是审计验证不可替代的基石

实验

实验设计

实验基于从 FinAuditing 派生的 FinMR 数据集,涵盖 US-GAAP 分类法下的结构化财务报告审计任务。AuditFlow 构建 双图审计环境——静态监管图(分类法本体)与动态 XBRL 申报图,为智能体提供 事实检索、分类法遍历、数值校验、规则评估 四类工具。采用三智能体协议:两名初级审计员分别从 监管视角证据视角 检查案例,高级审计员仲裁分歧并决定是否深入调查,最终通过 证据聚合 融合报告,输出审计结论、期望值、证据链与可信度评分。

关键发现

GPT-5.5 下,AuditFlow 取得 82.09% 联合审计准确率,大幅领先最强基线 +14.93 个百分点。消融实验显示,移除确定性检查模块后准确率骤降至 17.91%,清晰表明符号环境承担了模型自身无法可靠替代的验证任务,而适应性搜索(LLM 推理)与确定性验证的解耦是性能提升的核心。

与基线对比

相比纯大模型方案(如直接提示、ReAct 式单智能体),AuditFlow 的 图接地多智能体协作 有效解决了财务审计中结构化证据依赖难题。传统方法常在计算关系或维度遍历中出错,而 AuditFlow 通过将数值校验与规则评估 外部化为确定性的工具调用,避免了幻觉累积。此外,初级-高级审计员架构 模拟了真实审计流程,显著减少了假阳性和假阴性,体现了多视角交叉验证在复杂结构化任务中的价值。

行业影响

落地场景

AuditFlow 可直接嵌入金融审计、合规审查与财务报告验证等核心业务流程。具体产品形态可包括:

  • 审计辅助系统:为审计师提供自动化底稿生成、异常检测与证据追溯,加速季度/年度审计周期。
  • 监管科技(RegTech)平台:用于实时检查上市公司 XBRL 申报是否符合 US-GAAP 分类法,自动标记计算与维度不一致问题。
  • 企业内部财务自动复核:CFO 团队在提交报告前,用 AuditFlow 进行多规则联合校验,降低错报风险。

商业价值

  1. 降本增效:通过确定性符号引擎替代低级人工核对,大幅减少耗时的人力审查(例如 rule-based 的数值加总与层级遍历)。模型仅负责搜索与推理,避免纯 LLM 的幻觉引入误报,误报率控制直接降低回查成本。
  2. 提升审计质量:多智能体协作与证据聚合机制提供可解释的审计证据轨迹与可信度分数,使审计结论可追溯、可辩护。与仅输出黑盒判定的基线相比,AuditFlow 在保持高准确率的同时具备更强的合规说服力。
  3. 扩展收入:审计软件厂商可将该框架包装为VIP 合规校验服务或 SaaS 订阅模块,按申报数量或规则复杂度计费,开辟新营收线。

与现有工作流/产品的集成接口

AuditFlow 设计为工具型多智能体框架,可通过标准化 API 与现有审计技术栈对接:

  • 数据层:接收标准 XBRL 实例文档及 US-GAAP 分类法链接库,与现有 ERP、披露管理系统(如 Workiva、Certent)直接对接。
  • 执行层:Python 实现的符号环境与工具接口可封装为微服务,通过 REST/gRPC 与现有审计工作台(如 CaseWare、TeamMate)集成,在审计程序的“分析性复核”阶段自动被调用。
  • 人机协同:高级审计师的“分歧裁决”与“请求进一步调查”接口可映射为工单系统通知,保持现有审核流程不变,仅增加 AI 驱动的建议层。

典型用例

  • 全球性会计师事务所的审计自动化:某事务所在审计跨国集团合并报表时,使用 AuditFlow 自动遍历多个子公司的 XBRL 申报,检查跨实体计算关系与维度一致性,将原本需要 3 天的 manual tie-out 压缩至数小时,同时标记出 2 处人工未发现的标签误用。
  • 金融数据平台的投资组合合规筛选:一家金融数据终端(如 Bloomberg、FactSet)将 AuditFlow 集成到其基本面分析模块,帮助机构投资者实时筛查财务报告可信度,把审计问题企业按可信度分数排序,辅助投前风控决策。

局限

  • **依赖结构化数据格式**: AuditFlow 的符号环境需基于 XBRL 实例文档和 US-GAAP 分类法图构建,但大量企业仍以 PDF 或非标准 Excel 报表提交财务数据。即使可转换为 XBRL,不同司法辖区的分类法差异(如 IFRS)可能使静态图需要额外适配,未在实验中验证跨准则迁移能力。这限制了框架在真实多元审计场景下的直接部署,除非配套强健的数据提取与标准化流水线。
  • **多代理推理成本与交互可靠性**: 三位代理(两名初级审计员加一名高级审计员)协同需要多次 LLM 调用,且高级审计员可能触发“进一步调查”循环,引入不可忽视的延迟和 token 消耗。虽然实验通过 bounded refinement 控制回合数,但在处理大量审计案例时的平均成本和高 concurrency 下的吞吐量未量化。此外,代理间异议的消解依赖结构化争执协议,如果 LLM 产生幻觉或理解偏差,证据聚合阶段的规则引擎可能无法完全纠正,导致错误传递。
  • **数据集局限与泛化性**: 实验基于从 FinAuditing 衍生的 FinMR 样本,论文未披露该数据集的完整统计分布(如行业覆盖、错误类型比例),且仅使用 GPT-5.5 作为骨干模型。虽然做了部分开源模型测试,但仅在骨干变更时评估,可能低估了不同模型在审计复杂推理上的差异。对比基线中的 ReAct 或纯 LLM 方法缺少在非结构化报告上的对比,导致难以判断性能提升多大程度上来自 XBRL 结构化信息的介入,而非代理协作本身。
论文Yan Wang2026-06-02原文

相关内容