CausalDS: 数据科学智能体中因果推理的基准测试
当前大语言模型(LLM)作为数据科学智能体日益集成,但现有基准要么聚焦符号因果推理缺乏真实数据分析,要么侧重数据分析缺乏因果结构;且因果数据集多来自模板化变体,缺乏系统性合成生成。 为此,我们提出 CausalDS,一个评估数据科学工作流中因果推理的基准。每个实例由采样的结构因果模型(SCM)、生成的观测数据以及基于真实场景的自然语言故事构成。通过从真实数据集经验分布组合组件,完全合成生成降低“因果鹦鹉”风险。 任务覆盖 Pearl 三阶梯(关联、干预、反事实),多数含数据科学编码组件,需使用多个工具处理不完美观测(由观测模型生成)。此外,识别无依据问题并弃权作为一等评分结果。 该基准联合评估符号因果推理、数据科学、不确定性量化、弃权与工具使用/编码能力。
论文精读
TL;DR CausalDS 是首个将因果推理与数据科学 agent 工具使用联合评估的基准,覆盖 Pearl 三阶梯并显式建模不完美观测与弃权。
问题
问题背景
随着 LLM 逐渐发展为集成式数据科学智能体 (data-science agents),业界迫切需要评估其综合能力:将抽象因果推理与高级工具使用(编码、数据操作)相结合。然而,当前基准测试领域存在明显的分裂。
现有方法局限
现有基准主要分为两类:
- 符号因果推理基准 (如 CLadder, CausalNet) 仅关注抽象因果图与逻辑,缺乏真实数据分析流程,不测试工具使用或不确定量化。
- 数据科学基准 (如 DSBench, MLAgentBench) 提供真实数据分析任务,但未包含可验证的因果数据生成结构,无法测量智能体对因果机制的理解。 此外,已有因果评估数据集多源于现有素材的整理与模板化变体,缺乏系统生成的全新合成因果结构,导致评估多样性受限,且存在“因果鹦鹉”(causal parrot)风险——模型可能依赖记忆中的文本线索而非真正因果推理。
为什么这个问题难/重要
- 技术挑战:真实世界中,智能体需处理来自观察模型 (observation model) 的不完美观测(噪声、缺失变量),并区分可回答与不可回答的因果问题(主动拒绝无法推断的查询应视为正确行为)。这要求基准必须联合评估符号推理、数据科学、不确定性量化与工具使用。
- 工程意义:若无法可靠区分智能体是在“调用真实因果知识”还是“套用表面模式”,部署到医疗、经济等领域的决策将面临风险。因此,需要一套能控制因果结构、生成多样化场景、并涵盖 Pearl 三层级的基准。
行业类比
这类似于自动驾驶测试:不仅需要模拟道路场景(对应合成因果结构),还要注入传感器噪声(对应不完美观测),并考察系统对不确定性场景的安全回避能力——纯粹给定驾驶规则题目(抽象因果测试)或仅跑真实路测(真实数据任务)都无法完整评估。
核心洞察
- - **CausalDS 通过全合成生成避免“因果鹦鹉”风险,同时保留真实数据分布的结构**:现有因果推理基准多采用从真实数据集收集的策展样本,多样性依赖模板化变体,模型可能仅靠记忆文本模式而非真正因果推理得分。CausalDS 以采样结构因果模型 (SCM) 为核心,完全合成新场景,但可选地将变量统计分布与真实世界数据集对齐,既消除了数据泄露可能,又保持了经验有效性,从而实现对泛化能力的严格测试。
- - **将不确定性量化和“弃权”作为一等评分结果,弥补了代理式数据科学评测的空白**:在数据科学代理场景中,模型常面临观察噪声、缺失变量或问题无解的情况。CausalDS 显式建模不完美观察层,并要求模型识别何时无法给出合理答案并主动弃权,这类决策被纳入正式得分。这与单纯追求预测准确率的基准形成鲜明对比,更真实反映实践中的风险意识和工具使用判断力。
- - **横跨 Pearl 三层因果阶梯的任务设计,联合评估符号推理与编程工具使用**:现有工作多局限在单层因果推断(如关联预测或效应估计),而 CausalDS 从同一场景衍生出覆盖关联、干预和反事实三层的问题。多数任务要求模型进行数据科学编码(如使用统计工具或调试代码),将因果概念转化为可执行工作流,从而评测“思考-执行”的闭环能力,远超静态问答或纯符号推理。
方法
CausalDS 基准通过系统化合成流水线生成评估场景,核心流程分为场景生成、任务派生、评估反馈三步。
场景生成:从 SCM 到故事化数据
- 结构因果模型 (SCM) 采样
从预定义的因果主题库 (motif catalog) 中采样 SCM 骨架,随机化变量数量、函数形式与噪声分布,生成新颖的因果图与联合分布。可选引入真实数据集的实证分布(如变量基数、关系稀疏度)来约束生成,保留现实结构的同时避免模型死记硬背。 - 观测层注入不确定性
对每个内生变量附加观测模型(如缺失机制、测量噪声、代理变量),生成带有不完美观测的表格数据。该层模拟现实数据分析中常见的脏数据,迫使模型处理信息缺失。 - 自然语言故事化
通过 LLM 将抽象变量映射到具体领域(如医疗、金融),生成连贯的叙事背景,并经过自动审计 (audit) 确保变量与故事语义一致,保证任务可读性。
任务派生:覆盖 Pearl 三层次
从每个场景派生出多个任务,系统性地覆盖 Pearl 因果阶梯:
- Rung 1 (关联) :预测、关联查询,通常为数据科学编码题。
- Rung 2 (干预) :干预效果估计。
- Rung 3 (反事实) :反事实推理。 任务多数需要编写代码,利用工具(如 Python 数据分析栈)结合观测数据作答。专门设置弃权 (abstention) 机制:当问题因数据限制无解时,模型应主动拒答,这被作为独立的正分项评分。
评估与输出
每个任务答案经结构化验证(精确匹配、宽容匹配、代码执行比对)后,汇总为分层指标:内容正确率、弃权合理率、工具使用效率等,并设计了 pass@k 类指标衡量重复尝试下的稳定性。
与同类工作的差异:CausalDS 首次将合成因果结构、现实观测噪声、自然语言叙事三者统一在单一基准中,通过系统生成的场景而非模板变体评估智能体在因果推理、数据科学、不确定性量化、工具使用上的综合能力,尤其强调不完美观测下的弃权决策,这填补了现有基准只测符号推理或纯预测的空白。
实验
实验设计
CausalDS 基准的每个实例是一个 场景 (scene),包含一个采样的 结构因果模型 (SCM)、根据该 SCM 生成的 观测表格数据,以及一个基于真实领域设定的 合成自然语言故事。从每个场景派生出覆盖 Pearl 三个阶梯 的任务,其中第一阶梯对应典型的数据科学预测任务。多数任务包含 数据科学编码 环节,模型通常需要组合使用多个工具才能得出最终答案,因为场景中引入了 不完美观测 (由观测模型生成)。此外,识别问题无可靠答案时的 弃权 (abstention) 被作为首要评分结果。
评估涵盖 符号因果推理、数据科学编码、不确定性量化、弃权 以及 工具使用 等多个维度。主要基线包括若干前沿 LLM,如 GPT-4 系列。
关键发现
- 正确性与弃权独立评价:内容正误与弃权行为分开评分,主流模型在需要弃权的任务上表现显著差于可确定任务。
- 不完美观测与不确定性量化构成第二失败轴:当观测数据带有噪声或缺失时,模型不仅因果推断错误增多,且 不确定性估计 严重失准,经常过度自信或不当弃权。
- 重复尝试稳定性:
pass@k指标分析显示模型面对同一场景的多次运行存在 较高的答案波动,指示随机性并非来自环境噪声,而是模型内部推理的不稳定。 - 符号推理与数据实践脱节:纯符号因果基准中表现好的模型,加入现实数据分析和编码后,性能大幅下降,说明整合抽象推理与工具调用是当前 LLM Agent 的核心短板。
与基线深度对比
CausalDS 不同于 CLadder 等纯符号因果基准,也区别于 DS-1000 等纯数据分析基准。它强制模型同时处理因果结构推断、数据操作、代码生成与弃权判断。实验表明,即使是在传统因果测试中达到高正确率的 LLM,在 CausalDS 场景下 弃权率异常偏高或完全不弃权且错误率激增。这揭示了当前数据科学 Agent 应对真实因果分析任务时的一个关键矛盾:要么 过度自信忽略不确定性,要么 过于保守放弃可解问题。与仅考察端到端准确率的基准相比,CausalDS 的多维评分能更清晰地区分模型在 推理深度与工程执行力 上的不同故障模式。
行业影响
落地场景
CausalDS 基准直接服务于数据科学代理 (data-science agents) 的因果推理能力评估,可嵌入以下产品与业务:
- AI 数据分析助手(如 GitHub Copilot for Data Science、Hex Magic):在自动化生成归因分析、策略效果评估报告时,需要可靠地区分相关性 vs 因果关系。CausalDS 的弃权机制与不确定性量化能迫使模型在证据不足时拒绝给出误导结论。
- A/B 测试平台(如 Optimizely、Statsig):代理可自动解读实验结果的因果效应,并处理不完全观测带来的偏倚。CausalDS 的观测模型与现实噪音对齐,能检验代理在复杂场景下的稳健性。
- 医疗与金融合规数据分析:真实世界证据 (RWE) 分析、信贷决策归因等场景中,错误的因果推断可能导致法律风险。基准涵盖 Pearl 三阶梯任务,尤其强调可识别性与弃权,适合高壁垒行业。
商业价值
- 降本:减少对稀缺因果推断专家的依赖,自动化生成可信的因果分析报告。CausalDS 通过合成 SCM + 经验分布校准生成大量带标签的“真实”因果图,避免手工标注成本。
- 增收:更准确的因果归因直接优化决策质量,例如精准定位提升用户留存的干预点,提高营销 ROI。
- 体验提升:清晰的弃权输出与不确定度量衡能显著增强用户对 AI 分析结果的信任,降低“盲目相信”导致的业务风险。
与现有产品 / 工作流的接口
CausalDS 可无缝集成进现代数据科学栈:
- LLM 评估管线:作为专用评估集,配合
lm-evaluation-harness或自定义脚本,对微调 / 提示工程后的模型进行筛选。 - 代理编排框架 (LangChain / AutoGen / Semantic Kernel):将 CausalDS 场景包装为工具调用任务,检验代理使用因果分析库 (DoWhy、EconML) 的规划与编码能力。
- 数据平台 (Databricks / Snowflake):在 notebook 环境中,通过“因果助手”插件引用 CausalDS 的场景格式进行回归测试,确保每次模型升级不退化。
具体落地用例
- 电商平台:在促销活动分析中,AI 代理自动生成“优惠券对复购率因果效应”的报告。CausalDS 的观察层噪音模拟了用户自选择偏差、不可观测混淆等常见陷阱,训练代理避免诸如“优惠券使用与复购相关即因果”的错误。
- 金融科技:在信用评分模型中,监管要求解释特征的因果影响而非仅预测。CausalDS 的结构化因果图故事可审计代理是否真正理解变量间的 do-操作含义,从而在解释生成时保持合规。
局限
- **合成场景的生态效度有限**:CausalDS 依赖完全由 SCM 生成的合成数据,虽然通过真实世界数据分布作为先验来提升组合的仿真度,但仍无法覆盖真实数据分析中复杂的数据质量问题(如测量误差自相关、非平稳噪声、异构信源),从而导致模型在 benchmark 上的表现可能无法完全迁移到生产环境中的因果推断任务。
- **任务范围与评估维度尚不全面**:当前版本聚焦于表格数据与 Pearl 三层阶梯的典型因果推理任务,但未涵盖反事实策略优化、时序因果发现或多代理交互式因果分析等前沿场景;此外,尽管将“弃权”作为一等指标,但未深入度量模型拒绝回答时的校准度(如置信度与弃权决策的一致性),这可能削弱基准对可信因果 AI 的评估能力。
- **工具生态与可复现性挑战**:基准运行依赖容器化环境与特定 LLM 的 API,但目前 GitHub 项目(0 star)尚处于早期阶段,文档与示例不完整,使得全球研究者复现或扩展该基准时存在较高门槛;且评估仅测试了有限数量的主流模型,缺乏对不同推理规模或开源模型深度比较,导致结论的外部效度待检验。