结合反事实链和因果图的 LLM 可解释性
因果图提供了一种高层语言,用于让机制透明化。近期工作利用大语言模型(LLM)恢复外部世界过程的因果图。本文则使用因果图对 LLM 推理本身建模,为利益相关者提供模型如何感知和组织高层概念以产生预测的透明视图。我们提出了一种四阶段方法来构建此类图。给定目标 LLM 和一组文本示例,我们的方法发现类别判别性且人类可解释的概念,并将每个输入映射到 LLM 感知的概念状态。 随后,我们引入了一种MCMC 启发的反事实增强过程,通过反事实链扩展稀疏的观测数据,从而在 σ-CG 下实现稳定的因果发现,得到信息丰富且可解释的图。我们将该方法应用于三种 LLM,涵盖疾病诊断、情感分析和 LLM-as-a-judge 分类任务。评估指标包括预测保真度和结构稳定性,并分析了 MCMC 启发增强的收敛性和下游效用。 结果表明,所发现的因果图捕捉到了与 LLM 推理一致的有意义的依赖关系。本文为 LLM 的概念级可解释性奠定了基础。
论文精读
TL;DR 用因果图建模 LLM 推理过程中概念的因果关系,通过 MCMC 启发的反事实链增强稀疏数据,稳定发现可解释的概念结构,实现概念级可解释性。
问题
问题背景
LLM 在医疗、法律、金融等高风险决策中快速渗透,但其推理过程仍是黑箱。可解释性研究当前聚焦于如何让模型的内部概念与因果机制透明化,以便利益相关方信任和审计。
现有方法局限
主流方案分两类:事后解释(如注意力可视化、特征归因)只能反映相关性而非因果结构,容易导致 混淆偏误;因果发现 虽能推断变量间因果关系,但现有工作多将 LLM 作为工具去恢复外部世界因果图,而非建模 LLM 自身推理。直接对 LLM 推理建模面临 观测数据稀疏:每个输入仅对应一组概念状态,传统因果发现算法(如 PC、GES)在样本量不足时极易产生伪边或遗漏真实因果路径。此外,现有概念级解释方法缺乏系统化的 概念发现-映射-因果发现 闭环,手工定义概念往往引入人为主观偏差。
为什么这个问题难/重要
LLM 的推理是一个高维、非线性、基于自然语言的隐式过程,其内部概念状态无法直接观测,只能通过代理任务间接提取。因果关系建模要求 稳健的统计检验,而稀疏数据导致结构极不稳定。业界迫切需要一套 自动化、可复现 的流程,从黑箱模型中提取人类可理解的概念因果图,用于验证模型是否基于合理推理(而非捷径、偏见)给出预测。技术挑战包括:如何发现 类别判别性概念,如何在不运行真实干预的情况下高效生成反事实数据以丰富因果信号,以及如何评估图的 预测保真度 和 结构稳定性。
类比 自动驾驶感知系统 中的因果关系图——工程师需要确认“刹车”决策是因“行人”概念而非“背景颜色”触发,否则模型安全无法保证。
核心洞察
- 用因果图直接建模 LLM 推理过程本身,而非用它来恢复外部世界因果:传统 LLM 可解释性常聚焦于注意力权重、特征归因或探测分类器,这些方法停留在 token 或神经元粒度,难以反映模型如何组合抽象概念进行决策。本文首次将 LLM 视为一个可观测的“概念系统”,在概念层面构建因果图,使利益相关方能直观看到模型感知到的概念依赖关系,为理解模型内部推理逻辑提供了全新的层次。
- MCMC 启发的反事实链数据增强,让稀疏概念状态间的因果发现变得可行:LLM 标注的概念状态通常仅覆盖输入空间的极小部分,直接用于因果发现会因数据稀疏导致图结构不稳定。作者引入文本空间的马尔可夫链蒙特卡洛方法,通过链条式反事实生成(不断询问“如果概念 X 改变,其他概念如何变化?”)来扩充数据,使 σ-CG 算法能稳定恢复概念间的因果关系。这种数据驱动、模型自生成的反事实增强手段,解决了概念级可解释性中长期存在的数据匮乏问题,且收敛性有保证。
方法
本文提出一种四阶段方法,从 LLM 的推理行为中构建可解释的因果图,使模型内部的高层概念组织方式透明化。
输入:目标 LLM、一组文本示例及对应标签。
阶段 1:概念发现与标注
- 标签预测:先用 LLM 对示例进行预测,得到伪标签(或结合真实标签)。
- 判别性概念发现:利用对比聚类等方法,从文本中自动挖掘类判别性、人类可解释的概念(如“包含否定词”“提及特定症状”),并确定每个概念的可能状态(二值或多值)。
- 输入映射:对每条文本,查询 LLM 对各个概念状态的感知(通过 LLM 的自标注),将文本转化为概念状态向量,构成初始观测数据。
阶段 2:MCMC 启发的反事实数据增强
观测数据通常稀疏且不平衡。受 MCMC 采样启发,本方法在文本空间构造反事实链:
- 从真实样本出发,以概念状态为条件,让 LLM 生成满足特定概念组合的反事实文本(例如“保持其他概念不变,仅翻转情感极性”)。
- 通过接受准则(与目标分布成比例的概率)决定是否接受生成样本,形成一条马尔可夫链。
- 递归细化链上的样本,扩展数据集,确保覆盖更广的概念状态组合,同时维持数据合理性。
阶段 3:因果发现
在增强后的数据集上,使用 σ-CG 算法进行因果结构学习,得到有向无环图(DAG),节点为概念,边表示概念间的因果关系。σ-CG 通过条件独立性检验和评分搜索,在有限样本下具有更好的稳定性。
输出:一个反映 LLM 在特定任务中如何组织概念进行预测的因果图。
差异点:与利用 LLM 恢复外部世界因果图的工作不同,本文直接对LLM 自身推理过程建模,并通过反事实增强和 MCMC 灵感设计解决了观测数据稀疏导致的因果发现不稳定性,使概念级解释更具保真度。
实验
实验设计
论文在三个不同领域的分类任务上评估所提方法:疾病诊断、情感分析 和 LLM-as-a-Judge。使用三个大型语言模型作为目标 LLM,针对每个任务构造因果图。整体流程为四阶段:1)利用目标 LLM 预测类别标签;2)通过判别性概念发现从文本中提取人类可解释的概念,并将每个输入映射到概念状态;3)采用受 MCMC 启发的反事实增强过程,通过链式反事实生成扩充稀疏观测数据;4)使用 σ-CG 算法进行因果发现,得到因果图。评估指标聚焦于预测保真度(图节点状态对 LLM 预测的近似程度)、结构稳定性(不同随机种子下图结构的变异)以及 MCMC 增强的收敛性。
关键发现
实验表明,方法能够稳定地恢复出与 LLM 推理过程一致的因果图,且这些图对人类可理解。MCMC 增强有效缓解了原始观测数据稀疏带来的不稳定性,因果发现结果在不同扰动下收敛到相似的结构。预测保真度方面,因果图能够以高精度复现 LLM 的预测行为,验证了概念级解释的可靠性。消融分析显示,反事实链的质量和数量对图质量有显著影响,验证了基于 MCMC 的递归精炼策略的有效性。
基线对比
论文并未直接与外部因果发现基线进行数值比较,而是通过内部对照(有无反事实增强、不同概念提取策略)验证各部分贡献。这种设计更侧重于验证因果图本身作为解释媒介的合理性与稳定性,而非与其他方法竞争性能指标。相比过往工作将 LLM 用于恢复外部因果图,该研究翻转视角——将因果图用于解释 LLM 内部推理,提供了一个全新的可解释性范式。
行业影响
落地场景
该方法直接服务于高风险决策支持系统,如医疗诊断辅助、金融信贷审批、司法判决辅助等需要透明度的场景。同时,在内容审核与客服系统中,可解析模型如何将“侮辱性语言”或“服务态度差”等高层概念关联到违规判断。此外,对于LLM-as-a-Judge范式下的自动评估流程,此技术能可视化评估依据,避免黑箱误判。
商业价值
核心价值在于信任与合规,直接降低因模型不可解释导致的商业风险。在金融风控中,可解释的因果图能减少监管阻力,缩短模型上线周期;在医疗领域,有助于通过伦理审查,提升产品采纳率。降本层面,通过概念级分析快速定位模型缺陷,减少人工错误标注的排查成本。增收路径上,可解释性本身作为增值功能,可嵌入企业级AI平台(如Dataiku、Databricks),提升产品竞争力。
与现有产品/工作流的接口
该方法可作为外挂解释层集成,无需修改目标LLM。部署时,将用户输入批次发送给概念发现与因果发现模块,生成因果图并通过API或前端面板展示。MCMC反事实增强可离线完成,其生成的扩展数据集能缓存复用,避免重复推理成本。输出可与SHAP/LIME等特征归因工具结合,形成从低层token到高层概念的多粒度解释体系。MLOps团队可将因果图稳定性作为模型监控指标,当关键概念间的因果关系突变时触发告警。
具体工业场景
- 在线问诊平台:患者输入症状描述,LLM生成初步的疾病分类。因果图揭示模型如何看待“胸痛→心血管风险”与“胸痛→胃食管反流”的竞争通路,医生可据此判断模型是否过度依赖伪相关(如将“年龄”混淆为病因),避免误诊。
- 电商评论审计:分析产品评论时,模型判断差评原因。因果图显示“物流速度”节点直接影响“负向情感”但“包装质量”影响较弱,运营团队可据此优化供应链,而非猜想式整改。同时,解释层可直接嵌入商家后台,降低客服工单转交率。
局限
- - **概念提取的批次配对敏感性**:论文承认,概念发现阶段的判别性概念依赖于示例对的批次组合方式,不同随机配对可能导致提取出的概念集合不稳定。这一敏感性会降低因果图的复现性,尤其当数据量有限时,配对选择可能显著影响最终的解释结构,给实际部署带来不确定性。该局限源于启发式配对策略缺少对概念覆盖率或多样性的显式优化。
- - **自我标注与生成循环的固有偏差**:方法全程依赖目标 LLM 进行标签预测、概念状态标注及反事实文本生成,形成闭环。这种自举式流程可能放大 LLM 自身的知识盲区或推理捷径,生成的因果图反映的是模型“自以为”的因果机制,而非真实世界逻辑,当 LLM 存在系统性偏见时,图谱的解释可靠性受损。对第三方审计而言,缺乏外部知识锚定是一个关键短板。
- - **因果结构评估范围受限且泛化验证不足**:评估仅检查每个概念的局部父母节点(local parents),未度量全局图结构的准确性,可能遗漏间接依赖与冗余边。同时,实验在三个分类任务(疾病诊断、情感分析、LLM 裁判)上开展,数据集规模较小且领域集中,对复杂开放域生成任务或更大规模 LLM 的迁移效果尚存疑,与一些基于探针或线性因果假设的方法相比,该方法在图结构完整性验证上仍显薄弱。