论文

DSWorld: 用于高效自主智能体的数据科学世界模型

DSWorld: 用于高效自主智能体的数据科学世界模型

尽管自主数据科学智能体在数据理解和决策方面能力强大,但它们仍严重依赖于涉及昂贵计算的试错工作流。这一瓶颈促使我们思考:能否在实际执行之前,预测数据科学操作的效果?本文引入数据科学世界模型概念,通过基于当前工作流状态和候选操作预测环境状态转换,来建模数据科学执行环境。 我们进一步提出DSWorld框架,结合结构化状态构建、成本感知路由、轻量级实际执行以及基于LLM的昂贵操作模拟器。为支持训练,我们构建了8K规模转换轨迹数据集,并引入反思式世界模型优化,一种针对转换预测的错误感知强化学习策略。 实验表明,DSWorld将基于强化学习的智能体训练加速约14倍,基于搜索的推理加速约3-6倍,同时保持有竞争力的性能;在转换预测任务上比最强LLM基线提高35.6%。代码已开源。

论文精读

TL;DR 提出 **DSWorld**,一个数据科学世界模型,通过预测操作的环境状态转换来替代高昂的试错执行,结合成本感知路由和反思式强化学习优化,可将基于 RL 的 agent 训练加速约 14 倍,搜索式推理加速 3-6 倍,并显著提升转换预测准确性。

问题

领域现状

自主数据科学代理(Autonomous Data Science Agents)正推动端到端自动化分析——从探索性数据洞察到预测建模,其核心在于高效搜索操作序列(如特征工程、模型选择)。

现有方法局限

当前代理普遍采用试错式工作流:真实执行代码、观测结果并调整下一步。该范式暴露两大瓶颈:

  • 计算浪费:每次尝试需运行实际数据处理或模型训练,成本高且不可重用,形成交互瓶颈。
  • 决策滞后:代理仅在执行后评估效用,无法提前对比候选操作,导致长序列探索中错误累积,严重拖累搜索与强化学习训练效率。

问题难度与重要性

构建数据科学世界模型(Data Science World Model)面临独特挑战:

  • 状态表征复杂:环境状态融合数据集、历史操作、中间结果等多源信息,需设计结构化压缩方案。
  • 转移不确定性:操作效果受随机性(如模型初始化)影响,且真实转移数据采集代价极高。
  • 加速价值显著:可靠的世界模型可将代理探索从昂贵真实环境剥离,使策略训练与推理搜索在模拟器中低成本展开,对工业级 AutoML 与科研自动化迭代至关重要。

行业类比

如同自动驾驶仿真中用世界模型预测未来场景以替代实车路测,数据科学世界模型意图“模拟数据实验”,让代理在虚拟执行中快速迭代,而后仅验证最优路径,显著降低试错开销。

核心洞察

  • 用世界模型替代试错执行:数据科学代理的常规流程需要反复运行真实代码来获取反馈,计算开销大且耗时。DSWorld 将环境建模为状态转移预测器,代理在采取操作前即可预估结果,从而绕过大量昂贵运行。它并非简单替换所有操作,而是通过成本感知路由决定哪些操作由轻量引擎真实执行,哪些交由 LLM 仿真,兼顾预测精度与效率。这一设计将世界模型从游戏/控制领域拓展到数据科学任务,为自动化数据分析提供了一种可落地的计算加速范式。
  • 反射式世界模型优化利用错误反馈强化学习:传统世界模型多通过监督学习拟合转移数据,但容易在长期序列中出现复合误差。DSWorld 提出 Reflective World Model Optimization,将预测误差作为奖励信号进行强化学习微调,使模型能从犯错中迭代改进,尤其关注对后续决策影响大的关键转移。这一机制让世界模型不再只是历史数据的“复读机”,而具备对执行结果的反思能力,在保持高预测准确率的同时显著提升下游策略训练与搜索效率。

方法

输入与状态表示

DSWorld 将数据科学工作流环境建模为世界模型,其输入包含两部分:

  • 当前工作流状态:通过结构化状态构建模块,将数据集统计摘要、列类型、变量空间、执行历史等环境信息转化为统一的结构化表示。
  • 候选操作:以自然语言或结构化动作描述给出,如“对某列做对数变换”、“训练随机森林模型”。

核心模块:成本感知路由与混合执行

DSWorld 的关键创新在于根据操作开销动态选择执行后端:

  • 成本感知路由:预估每个操作的真实执行开销,将其分为轻量级(如列选择、简单聚合)和昂贵(如模型训练、超参数搜索)。
  • 混合执行:轻量级操作直接在真实环境中执行并获取准确状态转移;昂贵操作则触发LLM 模拟器,由大语言模型根据当前状态和操作描述预测下一状态(如数据分布变化、新变量的统计属性)。这种设计在保证关键步骤准确性的同时,大幅减少昂贵的真实计算。

世界模型优化策略

训练 LLM 模拟器采用两阶段方法:

  1. SFT 预热:在 8K 规模的转移轨迹数据集上进行监督微调,提供基本的状态转移预测能力。
  2. Reflective World Model Optimization:一种错误感知的强化学习策略。模型对预测错误进行反思(分析失败原因),并生成修正样本用于在线强化学习,从而针对复杂操作持续提升预测精度。

输出与应用

世界模型预测的状态转移可直接替代真实执行,为下游 agent 提供“想象”环境:

  • 输出包括预测后的数据摘要、新变量类型、执行结果标签等。
  • 在 RL-based agent 训练中,用预测转移替代真实交互,实现约 14 倍加速;在搜索式推理中,加速约 3–6 倍,且最终任务性能保持竞争水平。

与同类方法的差异:相比 AutoML 或数据科学 agent 依赖完整真实执行进行试错,DSWorld 首次将世界模型与成本感知路由结合,用轻量执行保真、LLM 模拟器替换昂贵操作,并通过 error-aware RL 持续优化预测,在效率与准确性之间建立新的平衡点。

实验

实验设计

DSWorld 实验围绕三个层面展开:转移预测准确性训练加速推理加速。首先构建了一个包含 8K 条状态转移轨迹的数据集,覆盖真实数据科学工作流中的典型操作。世界模型基于结构化状态表示,采用成本感知路由,结合轻量级真实执行与昂贵的 LLM 模拟器,并通过 Reflective World Model Optimization(一种错误感知的强化学习策略)进行优化。转移预测任务直接评估模型对操作后果的预判能力;训练加速实验对比在真实环境与 DSWorld 模拟环境中训练 RL 代理的效率;推理加速则考察搜索式代理在 DSWorld 辅助下的决策速度。

关键发现

  • 转移预测:DSWorld 在预测工作流状态变化上显著优于最强 LLM 基线,相对性能提升 35.6%
  • 训练加速:作为虚拟训练环境,DSWorld 将 RL 代理训练速度提升约 14 倍
  • 推理加速:在搜索式推理中,代理决策速度提高 3–6 倍,同时保持任务性能的竞争力。
  • 成本与性能平衡:轻量级路由机制在模拟精度与计算开销之间取得有效折中。

基线对比深度解读

与纯 LLM 试错模式相比,DSWorld 的世界模型能够提前模拟操作效果,这是性能优势的根源。传统 LLM 代理缺乏对执行环境的内部预测,导致大量无效试错;DSWorld 则通过结构化状态与成本感知路由,在昂贵操作上调用高精度 LLM 模拟,在简单操作上采用轻量方法,既保证了预测质量又控制了成本。在训练环境中,14 倍的加速意味着原本需要数天的 RL 训练可压缩到数小时内,极大降低了迭代门槛。搜索推理加速 3–6 倍也直接提升了交互式数据科学场景的可用性。该工作表明,构建专用世界模型是提升数据科学代理效率的有效路径,并为后续将世界模型扩展到更复杂的分析环境提供了实践范本。

行业影响

落地场景

DSWorld 作为数据科学环境的世界模型,核心价值在于 用低成本模拟替代昂贵真实执行,适用场景包括:

  • 自动化 MLOps 平台:在特征工程、模型选择、超参搜索等阶段预测操作效果,避免无效的试错训练。
  • 自主数据科学代理服务:为面向非技术用户的 AutoML 工具提供“预演”能力,让代理在模拟环境中快速规划 Pipeline,而非在真实集群上反复提交任务。
  • 智能数据治理与 EDA:在数据清洗、转换步骤中预测中间数据集状态,减少对大数据引擎的重复查询。

商业价值

  • 直接降本:论文显示 RL 代理训练加速 约 14 倍,搜索式推理加速 3–6 倍,意味着 GPU/CPU 机时成本大幅缩减,尤其适合按需付费的云上 AI 工作负载。
  • 提升迭代效率:分析师或算法工程师能在秒级内评估数百种数据操作组合,将模型上线周期从天缩短到小时级,从而更快响应业务需求变化。
  • 拓宽用户基础:低代码/无代码数据科学平台集成 DSWorld 后,即使缺乏计算资源的小团队也能享受高效自动化建模。

与现有产品/工作流的接口

DSWorld 可作为 轻量中间服务 嵌入现有数据管线:

  1. 与 Workflow 引擎集成:通过 REST/gRPC 接收当前状态(DataFrame 元信息、Pipeline 步骤)与候选操作,返回预测的状态转移,辅助调度器跳过劣势分支。
  2. 与强化训练框架对接:替代真实环境向 RL 代理提供即时反馈,可直接适配 Ray Tune、Kubeflow 等分布式调参工具。
  3. 仿真器路由:实际部署时可采用 成本感知路由——便宜操作仍真实执行,昂贵操作(如大数据集聚合)交由 DSWorld 模拟,平衡保真度与开销。

具体落地 Use Case

  • 电商推荐系统:当需要更新召回、排序模型时,数据科学家可在 notebook 中通过 DSWorld 快速验证哪种特征工程组合能提升 AUC,无需等待完整重训练。某跨国电商的推荐团队可将此集成到内部 mlflow 实验中,让“候选操作评估”从 30 分钟缩短到 2 分钟。
  • 金融风控模型运维:反欺诈模型需频繁适配新欺诈模式,利用 DSWorld 模拟不同样本重采样策略对 KS 指标的影响,避免在敏感数据上反复跑全量 Pipeline,同时满足合规审计对可复现性的要求。

局限

  • **场景泛化受限**:DSWorld 仅在 MLAgentBench、DSBench、DS-Agent 三个相对封闭的数据科学 benchmark 上验证,这些任务空间有限且模式固定。世界模型预测的状态转移依赖于训练时见过的操作组合与工作流分布,在更开放、长尾或跨领域的数据科学任务(如复杂特征工程、多模态数据融合)上可能出现严重性能退化,缺少对 Zero-shot 或 Few-shot 泛化能力的严格评估。
  • **模拟误差累积**:框架依赖 LLM 对昂贵操作(如模型训练、超参数搜索)进行模拟以预测环境状态,但 LLM 的生成结果存在随机性和幻觉风险,可能导致状态预测偏差。反射性优化(Reflective World Model Optimization)能部分利用真实执行纠正错误,但长序列规划时误差仍可能累积,从而影响基于该世界模型训练的 agent 的策略质量,且未讨论模拟误差对最终任务指标的可控性。
  • **成本收益分析不充分**:虽然实验展示了训练和推理速度的倍率提升,但未量化构建 DSWorld 本身的一次性成本(包括 8K 轨迹数据集收集、LLM 调用、模型训练),也未对比在低算力或简单任务场景下直接执行 trial-and-error 是否更经济。成本感知路由的门控超参数需人工设定,跨任务的自适应能力未验证,实际落地时可能面临总资源消耗反而增大的风险。
论文Zherui Yang2026-07-17原文

相关内容