Agent时代的因果发现
近期尝试将大语言模型(LLMs)与因果发现结合的工作,要求模型推断成对方向、提出图结构,或注入语言模型输出作为先验和约束。这些方法虽承诺更快的分析,却模糊了因果证据究竟是来自数据和假设,还是来自文本关联、提示伪影和幻觉机制。 文章主张Agent在因果发现中扮演不同角色:应检查数据、检索上下文、解释方法假设、澄清图输出,但不应提供边、方向、先验、约束或因果结论。核心原则是:Agent辅助工作流,而因果主张仍应基于数据、明确假设、形式化算法、诊断以及用户或领域专家的决策。 作者在causal-learn+平台实例化该原则。该平台围绕causal-learn算法生态,协调数据分析、预处理、方法推荐、专家知识整合、形式化发现和解释。基于大五人格数据的案例研究表明,Agent辅助管道可在不将语言模型不可靠性转化为因果证据的前提下,完成因果发现。平台地址:causallearn.com。
论文精读
TL;DR 本文主张 LLM 智能体在因果发现中只应辅助工作流(数据检查、方法解释),而非直接生成因果边或结论,确保因果声明扎根于数据与形式算法;并推出平台 causal-learn+ 实例化该原则。
问题
问题背景
因果发现(causal discovery)旨在从观测数据中学习变量间的因果关系,是科学发现与可信 AI 的核心任务。近年来,大型语言模型(LLM)被尝试引入该流程,以期加速因果图构建。
现有方法局限
当前利用 LLM 辅助因果发现的主流做法,是直接让模型推断成对因果方向、提出图结构或将语言模型输出作为先验和约束注入形式化算法。但这些做法存在根本性技术缺陷:
- 文本关联代替因果证据:LLM 的预测基于训练语料中的统计共现,而非数据本身的因果信号。模型可能输出看似合理的因果边,实际却源于命名惯例、常见短语或 prompt 工程 artifact,而非真正的因果机制。
- 幻觉与不可验证性:LLM 极易生成虚构的因果链路,且缺乏统计假设(如因果充分性、忠实性)与诊断检查,使结论无法被严格检验。
- 混淆不确定性来源:将语言模型输出与数据驱动算法混合时,无法区分因果证据是来自数据、显式假设,还是模型的黑箱推理,严重削弱了结论的可信度。
难题根源与重要性
因果发现本身高度依赖形式化假设、条件独立性检验以及面向数据的评分与搜索,任何松散的代理输出都可能引入不可控偏差。在高风险领域(如药物研发、流行病学、基因组学),错误的因果推断可能导致严重后果。业界对可信 AI和可解释机器学习的需求日益迫切,而因果发现正是实现这些目标的基础能力。因此,如何在不牺牲因果推断严谨性的前提下,合理利用 agent 的检索、解释与流程协调能力,成为一个横向影响多个应用领域的关键技术挑战。
行业类比
如同在自动驾驶感知系统中,AI 负责环境建模和目标检测,但路径规划与安全决策必须由确定性算法或人类接管,因果发现 agent 也应严格限定于辅助角色(检查数据、解释假设、澄清输出),而将因果声明交给数据、形式化算法与领域专家。
核心洞察
- LLM 在因果发现中的角色应从“因果推断者”转变为“工作流协调者”。 现有工作常让 LLM 直接推断因果方向、图结构或提供先验,模糊了数据支持与文本关联的界限。本文严格区分:因果声明必须由数据和形式算法支撑,智能体仅负责检查数据、解释方法,不输出因果结论。这为因果发现划定了安全边界,避免文本关联冒充因果证据。
- 构建一个以形式化算法为基座、智能体为交互界面的信任平台,而非依赖黑箱因果推断。 causal-learn+ 平台将数据预处理、方法推荐、专家知识融合、因果发现和解释性分析整合成完整管道,所有因果运算均由验证过的算法执行,智能体只做流程引导和结果解读。这保证了结论的可追溯、可复现与可诊断性,解决了直接使用 LLM 做因果推理时不可信且不可复现的工程痛点。
方法
输入
- 观测数据(表格数据,允许缺失值、混杂变量)
- 用户可选的领域知识(已知因果约束或部分图结构)
关键模块
causal-learn+ 以 LLM 驱动的 agent 作为工作流协调者,但严格限定其角色为辅助工具,禁止直接生成边、方向或因果结论。核心处理流程如下:
数据探查与预处理
agent 自动检查数据分布、缺失模式与可疑异常,建议预处理策略(如归一化、填补、变量变换),并解释选择依据。方法推荐
根据数据特征(样本量、线性/非线性、高斯/非高斯)和假设条件,agent 从 causal-learn 的算法生态(PC、FCI、GES、LiNGAM 等)中推荐最适方法,引用形式理论支撑,避免盲目尝试。专家知识嵌入
agent 辅助将领域知识转化为算法可读的先验(如禁止边、强制方向),确保知识形式化无误,但知识内容完全来自人工输入。形式发现与诊断
执行选定算法,产出因果图。agent 不修改图结构,只负责解释统计检验结果(如条件独立性检验)、模型假设以及图的不确定性,帮助用户判断证据强弱。结果解释与交互验证
agent 提供图的语义解读、可能的混淆情形和敏感性分析建议,引导用户进行诊断;但所有因果声明均溯源至“数据+假设+形式算法”三角,最终决策权归属用户或领域专家。
输出
- 一份因果图(有向无环图或部分祖先图),附 agent 生成的可读摘要,不含任何 agent 自行推断的因果主张。
与同类方法的差异:现有 LLM 结合因果发现方法常让模型直接推断因果边或方向,易受提示伪影和幻觉干扰;causal-learn+ 通过严格分离“辅助”与“决策”,将语言模型限定为工作流助理,确保因果结论仅来自数据与形式算法,从而避免将不可靠的语言关联误作因果证据。
实验
实验设计
展示 causal-learn+ 平台如何处理完整因果发现流程:上传 Big Five 人格数据 → 代理自动进行数据检查 与预处理建议 → 用户选择或干预 → 基于 causal-learn 算法库执行形式化因果发现 → 代理解释输出图 并提供假设依据,同时允许专家知识注入 以指导搜索方向。关键点是,代理不提供边方向、先验或因果结论,仅辅助工作流。
关键发现
平台成功分离了代理辅助与因果推理:所有因果声明均严格基于数据、显式假设和形式化算法(如 PC / GES),并由用户或领域专家最终确认。代理的帮助体现在降低认知负担和避免操作错误,而非生成不可靠的因果臆测。案例中,代理识别出数据分布特点,推荐了合适的因果发现方法,并以自然语言解释输出图中的关键路径,使非专业人员也能理解分析过程。
基线对比解读
若将 LLM 直接输出因果边 或作为强先验的方法作为基线,causal-learn+ 的优势在于因果证据的可溯源性与健壮性。直接使用 LLM 会引入文本关联、提示词伪影和幻觉带来的虚假因果联系;而本平台通过形式化算法与数据支撑,确保每个边都经过统计检验或评分优化。代理的“辅助但不决策”原则,使得系统兼具 LLM 的交互便利与因果发现的科学严谨性,避免了用语言模型可靠性换速度的陷阱。
行业影响
落地场景
causal-learn+ 提倡的智能体辅助因果发现模式,适用于所有依赖可解释因果推理的行业:
- 医疗与制药:利用观察性临床数据挖掘疾病诱因、药物副作用,智能体辅助医生审查方法假设而非直接生成关系,降低误判风险。
- 金融风控:从交易网络中发现风险传导路径,智能体负责解释模型输出与假设,风控专家保留最终裁决权。
- 电商与内容平台:归因分析(如促销活动→转化率、推荐策略→用户留存),平台运营者可借助智能体解读混杂因子与工具变量选择,确保结论立于数据而非模型幻觉。
- 企业决策支持(HR 绩效归因、供应链根因分析):智能体协调数据预处理、方法推荐与结果解释,让业务专家在可视化界面下完成可靠的因果假设验证。
商业价值
- 降本:自动化数据探索、方法推荐与诊断报告生成,将原本需要专业因果推断团队数周的工作缩短至小时级,减少人力依赖。
- 增收与风险控制:避免因 LLM 直接生成虚假因果结论导致错误决策带来的损失(如无效营销预算、错误用药)。通过数据与算法锚定因果主张,提升决策质量,间接优化转化率、患者预后等核心指标。
- 信任与合规:在金融、医疗等强监管领域,每一次因果推断均可回溯到形式化算法与人工确认节点,满足审计与解释性要求,加速产品落地。
与现有产品/工作流的接口
- 数据分析平台集成:causal-learn+ 可嵌入 Jupyter/DataBricks 等 notebook 环境,或通过 REST API 对接现有 BI 工具(Tableau、PowerBI),将智能体提供的解释与图表注入报告。
- MLOps 管道:作为模型可解释性模块的一环,在特征工程后、模型训练前执行因果特征选择;智能体自动生成数据假设、协变量调整建议,结果以结构化 JSON 输出,供下游模型消费。
- 低代码决策工场:为非专业用户提供网页交互界面(playground 模式),上传 CSV → 智能体引导分析路径 → 专家确认约束 → 执行算法 → 返回图形报告,无缝融入商业分析师日常工作流。
具体落地 Use Case
- 电商促销效果归因:运营团队上传电商促销日志与销量时序数据。智能体检查季节性、处理缺失值,推荐使用 FCI 算法处理潜在隐混杂,并以自然语言解释“为什么不能用 Granger 检验直接推断因果关系”。最终输出剔除混淆后的促销→销量因果效应图,专家签字后用于预算分配。全程因果主张由算法与数据支撑,智能体仅负责引导与解读。
- 金融信用风险因子发现:银行信审团队希望从贷款历史数据中识别导致违约的核心因子。智能体解析数据字典,整合领域知识(如“收入负债比”不可作为碰撞节点),调用PC 算法并生成诊断报告。信审经理依据报告调整风控规则,而非依赖“大模型说A导致B”,满足监管对模型可解释性的硬性要求。
局限
- 论文提倡的“代理仅辅助”原则虽合理,但缺乏与现有LLM直接参与因果发现方法的系统定量比较。仅通过Big Five案例研究难以证明该平台在因果发现准确率、效率或鲁棒性上优于或劣于让LLM推断边的方案,使得方法优势停留在哲学主张层面,缺少说服力。
- causal-learn+平台的代理辅助功能本质上依赖LLM进行上下文检索、解释和推荐,而LLM本身的幻觉、提示敏感性及知识截止问题未被充分讨论。代理可能导致错误的方法推荐或误导性解释,论文未给出错误监控、纠正机制或可靠性评估,可能将LLM风险引入辅助环节。
- 案例研究仅使用单一心理学数据集,该领域因果结构高度争议,潜变量和测量误差普遍存在,但论文未探讨在这些挑战下平台输出的可信度。此外,缺乏用户研究或领域专家反馈,无法评估代理辅助在实际分析中是否真正降低认知负担或提升决策质量。