论文

Spreadsheet-RL: 通过强化学习提升大型语言模型代理在真实电子表格任务上的表现

Spreadsheet-RL: 通过强化学习提升大型语言模型代理在真实电子表格任务上的表现

电子表格系统(如 Microsoft Excel、Google Sheets)在现代数据驱动工作流中扮演核心角色。随着 AI 代理日益能够自动化复杂任务(如控制计算机和生成演示文稿),构建 AI 驱动的电子表格代理成为一个有前景的研究方向。现有电子表格代理大多依赖对通用大型语言模型的专门提示,这种方法在简单操作上可行,但在处理现实应用中典型的复杂多步工作流时力不从心。 我们提出 Spreadsheet-RL,一个强化学习微调框架,旨在真实 Microsoft Excel 环境中训练专用电子表格代理。Spreadsheet-RL 包含自动管道,可从在线论坛规模化收集配对的起始-目标电子表格,并构建领域特定评估任务(如金融、供应链管理),整合为新基准数据集 Domain-Spreadsheet。此外,它提供 Spreadsheet Gym 环境用于多轮强化学习:通过 Python 沙箱暴露 Excel 的丰富功能,并配备包含全面工具集和精心设计的工具路由规则的 harness。 全面实验表明,Spreadsheet-RL 在通用和领域特定电子表格任务上均显著提升 AI 代理性能:它使 Qwen3-4B-Thinking-2507 在 SpreadsheetBench 上的 Pass@1 从 12.0% 提升至 23.4%,在我们整理的 Domain-Spreadsheet 数据集上从 8.4% 提升至 17.2%。这些结果凸显了 Spreadsheet-RL 在电子表格自动化中的强泛化潜力和实际应用价值,并广泛推动基于 LLM 的日常数据交互。

论文精读

TL;DR Spreadsheet-RL 通过强化学习在真实 Excel 环境中训练专用电子表格代理,实现了 Pass@1 近乎翻倍的性能提升,并构建了自动化数据管线与多轮 RL 框架。

问题

问题背景

电子表格(如 Microsoft Excel)是现代数据驱动工作流的核心工具,AI 代理自动化电子表格任务已成为 LLM Agent 研究的重要方向。现有工作多基于通用大模型的提示工程,虽能处理简单操作,但对真实场景中复杂、多步协作的工作流支持不足。

现有方法局限

主流方案依赖 精心设计的提示,引导 LLM 逐步解析任务并调用预定义工具。然而,这些方法存在明显局限:

  • 上下文长度瓶颈:复杂任务(如财务建模)需处理大量单元格和公式,长上下文导致推理质量下降。
  • 错误累积:顺序执行中,早期步骤的微小误差(如错误引用单元格)会级联放大,缺乏自我修正机制。
  • 静态知识:提示工程无法利用任务执行反馈优化策略,泛化能力受限。
  • 工具设计粗放:通用工具集难以覆盖 Excel 丰富的原生功能(如动态数组、条件格式),导致动作空间不匹配。

为什么这个问题难且重要

电子表格任务兼具 结构性(单元格依赖图、公式语义)与 交互动态性(实时计算、用户修改),构建有效 Agent 面临三重挑战:

  1. 环境复杂性:高维状态(万级单元格)和稀疏奖励,传统监督学习难以获取标注的端到端路径。
  2. 策略学习:需平衡探索(尝试新操作序列)与利用(复用已知模式),RL 训练的样本效率与稳定性是关键。
  3. 评估基准:缺乏涵盖真实领域(如供应链、金融)的标准化测试集,难以衡量真实泛化能力。 业界对电子表格自动化需求迫切:Gartner 预测到 2025 年,超 70% 的企业数据分析将通过增强型分析工具完成,高效的电子表格 Agent 可大幅降低人工重复操作,释放数据分析师的生产力。

行业类比

类似于 自动驾驶 从规则系统转向基于强化学习的端到端控制,电子表格 Agent 也需从硬编码的提示流程进化为能从交互反馈中持续优化的 RL 智能体,以应对开放域的真实业务场景。

核心洞察

  • **RL 微调在真实电子表格环境中的试错学习显著提升了智能体处理复杂、多步工作流的能力。** 现有方法主要依赖专用提示工程,难以泛化到真实场景中需要动态组合多种操作的任务。Spreadsheet-RL 将任务建模为多轮交互,利用 GRPO 与基于结果的奖励,让模型在 Spreadsheet Gym 中通过环境反馈持续优化动作序列。这种 end-to-end 的 RL 训练将 Pass@1 指标在通用基准上从 12.0% 提升至 23.4%,在领域特定基准上从 8.4% 提升至 17.2%,证明试错学习对提升长序列操作规划的鲁棒性至关重要。
  • **从在线论坛自动挖掘起始-目标电子表格对的流水线为可扩展的 RL 训练数据生成提供了新范式。** 不同于手工构建的有限基准,Spreadsheet-RL 利用元数据收集和甲骨文编码智能体,将论坛中的真实问题转化为带参考解的配对数据。这一自动化流程不仅能产生大规模多样化训练样本,还催生了覆盖金融、供应链等领域的 Domain-Spreadsheet 基准,使 RL 微调后的智能体在未见过的专业任务上展现出更强的泛化能力,为领域自适应数据生成提供了工程参考。
  • **精心设计的工具接口和工具路由规则是 RL 训练在电子表格环境中成功落地的关键工程因素。** Spreadsheet-RL 构建的 Spreadsheet-Native Tool Harness 将 Excel 功能封装为 Python 沙箱中的结构化工具,并引入检查-修改-验证循环与回退机制,既保证了与 RL 训练管线的兼容性,又通过规则化路由降低了无效动作空间。消融实验表明,预训练工具接口的失败模式(如参数格式混乱)在 RL 后得到纠正,凸显出工具设计对 RL 收敛速度和最终性能的直接影响。

方法

任务建模与训练框架

Spreadsheet-RL 将电子表格任务形式化为 多轮决策过程:给定初始表格,智能体通过一系列工具调用逐步将其转换为目标表格。核心流程分为 数据生成、环境交互、RL 微调 三个阶段。

  1. 自动数据管道:从在线论坛收集真实的起始-目标表格对,通过编码智能体构建 Oracle 轨迹,确保每个任务都有可执行的解决方案。这一过程无需人工标注,可扩展至大规模训练集。
  2. Spreadsheet Gym 环境:基于 Microsoft Excel 与 Python 沙箱构建,暴露完整的电子表格功能(如公式计算、格式化、图表),同时提供 工具复用规则(tool-routing)来约束动作空间,避免无效探索。该环境支持多轮交互与状态隔离,天然适配 RL 训练。
  3. RL 训练:采用 GRPO(Group Relative Policy Optimization) 算法,奖励由 最终表格的单元级一致性 决定:仅当智能体生成的表格与目标完全相同(逐单元格比较)时才获得正向奖励。训练通过异步奖励 API 解耦推理与验证,提升吞吐。

关键差异

不同于以往依赖 提示工程 的电子表格智能体(如 SheetAgent 使用静态提示),Spreadsheet-RL 通过 RL 微调 直接优化策略网络,使模型自身习得何时检查、修改、验证表格,从而在复杂多步任务上显著提升泛化能力。

实验

实验设计

实验基于 Qwen3-4B-Thinking-2507 基座模型,通过 强化学习(GRPO) 进行微调。训练数据来自自动化流水线,从在线论坛抓取并合成 配对的 start-goal 电子表格,覆盖多种操作场景。环境依托 Spreadsheet Gym,集成 Microsoft Excel 的 Python 沙盒,提供丰富的工具接口与工具路由规则,支持多轮交互。评估在两类数据集上进行:

  • SpreadsheetBench: 通用表格操作任务集
  • Domain-Spreadsheet: 本工作新构建的领域专用基准,涵盖金融、供应链等实际业务场景

主要指标为 Pass@1,即首次尝试即完全完成任务的通过率。同时分析了 RL 训练动态预训练工具接口消融

关键发现

RL 微调带来显著提升:

  • SpreadsheetBench 的 Pass@1 从 12.0% 提升至 23.4% (+11.4% 绝对值)
  • Domain-Spreadsheet 从 8.4% 提升至 17.2% (+8.8% 绝对值)

这表明 RL 训练有效增强了模型的工具使用与多步规划能力,尤其在需复杂推理的领域任务中。训练曲线显示性能持续上升,未出现显著过拟合。消融实验证实,仅依赖提示而不做 RL 微调接口 的性能远低于本方法,验证了 RL 的作用。

与基线对比的深度解读

现有表格代理大多基于通用大模型的 提示工程(prompt engineering),在简单操作上尚可,但对 多步工作流、跨工作表引用、条件格式化等复杂任务 表现乏力。本工作直接从基座模型出发,通过 RL 让模型从数据中学习最优策略,摆脱了手工模板的局限。对比提示基线,Spreadsheet-RL 展现出了明显的泛化优势: 不仅在通用场景上超越,更在未见过的领域任务上取得成倍增长(Domain-Spreadsheet 相对提升超 100%)。这证明了 RL 微调路线在表格自动化领域的可行性与潜力,为后续研究提供了一条清晰的演进路径。

行业影响

落地场景

Spreadsheet-RL 为高度依赖电子表格的行业带来了自动化代理的可能,可直接应用于以下场景:

  • 财务与会计:自动生成多期财务报表、合并数据、执行公式审计,减少人工核对工作。
  • 供应链与库存管理:根据历史销量与库存数据自动更新预测模型,触发补货提醒。
  • 人力资源:批量处理员工考勤、薪酬计算,或根据绩效数据生成分析看板。
  • 企业数据分析:处理从数据库导出的复杂 Excel 报表,自动完成数据清洗、透视表创建与图表生成。

商业价值

  • 降本:将重复性电子表格操作从数小时压缩至分钟级,释放分析师与行政人员产能。据论文数据,在通用基准 SpreadsheetBench 上 Pass@1 从 12.0% 提升至 23.4%,领域任务集 Domain-Spreadsheet 从 8.4% 提升至 17.2%,这意味着可自动化处理的工单比例显著上升,减少外包或加班成本。
  • 增效:通过 RL 微调,代理能自主规划多步骤工具调用(如公式写入、条件格式、数据验证),避免人工操作失误,缩短从数据到决策的链路。
  • 体验提升:非技术用户可用自然语言与电子表格交互,系统解析意图并操控 Excel,降低学习门槛。

与现有产品/工作流的接口

框架设计充分考虑了与现有办公套件的集成:

  • 微软 Excel 环境原生对接Spreadsheet Gym 通过 Python 沙箱暴露 Excel 功能,可封装为 Office 插件或 Power Automate 连接器,在企业已部署的 M365 生态中直接调用。
  • 标准化工具路由规则:定义的 Spreadsheet-Native Tool Harness 可作为 API 中间层,与 RPA 平台(如 UiPath、Automation Anywhere)或云函数(AWS Lambda)集成,以无头模式处理上传的 .xlsx 文件。
  • 异步 RL 训练管线:支持持续从社区论坛(如 Stack Overflow)抓取新的任务对,实现代理能力的持续进化,可融入企业内部的 LLMOps 流程。

具体落地用例

用例一:全球电商平台的供应链周报自动化 某电商平台每周需汇总各区域仓储、物流、销量数据生成 Excel 看板,涉及跨工作表引用、VLOOKUP 匹配、条件高亮异常值等繁琐步骤。部署 Spreadsheet-RL 代理后,运营人员仅需在对话窗口输入“生成本周北美区库存健康度报告”,代理即可自动从共享文件夹读取源文件,执行计算,输出格式化报表并邮件分发,单次操作从约 3 小时降至 5 分钟。

用例二:金融科技企业的投资组合再平衡 资产管理团队在 Excel 中维护包含多资产类别的投资组合模型,需根据市场变动重新计算权重并生成调整建议。代理接收截断时间点的价格数据文件,调用 Excel 规划求解与数据模拟工具,自动产出再平衡方案,并标注关键风险指标,帮助分析师聚焦决策而非手工调表。

以上用例体现 Spreadsheet-RL 从单步操作到多步工作流的自动化跨越,为办公场景的智能化升级提供了可复现的强化学习范式。

局限

  • 性能瓶颈与部署可行性:尽管 RL 微调使 Pass@1 提升近一倍(SpreadsheetBench 12.0%→23.4%,Domain-Spreadsheet 8.4%→17.2%),但绝对成功率仍偏低,离工业级可靠代理差距明显。论文未对错误模式进行细致分析,也未提供边界案例的失败分布,导致难以评估在安全或合规敏感场景下的风险。此外,仅测试了 4B 大小的 Qwen 模型,更大模型可能突破性能上限,但资源开销与收益权衡尚不明确。
  • 环境依赖性及扩展成本:框架深度绑定 Microsoft Excel 真实环境,通过 Python 沙箱与 Excel 自动化接口交互。这保证了操作准确性,但也引入了单 Windows 实例并发、Excel 重计算与 COM 调用的固有开销。文中提及异步奖励 API 和回滚机制,但未给出大规模 RL 训练的吞吐量、延迟与资源利用率数据,掩盖了可能成为瓶颈的运行时成本。
  • 领域泛化与奖励设计:Domain-Spreadsheet 基准仅覆盖财务、供应链等少量领域,且数据来源为论坛帖子,可能存在选题偏差。对于新领域的零样本迁移,需重新设计验证器与奖励函数,泛化能力未经检验。奖励基于最终单元格值(outcome-based)的精确匹配,忽略中间步骤的效率或策略优劣,可能导致过拟合于特定奖励信号,进而影响代理的鲁棒性。
论文Banghao Chi2026-05-21原文

相关内容