A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets
预测性代码补全能极大提升开发者的工作效率。然而,在电子表格中,尽管使用更为普遍,此类自动补全功能却几乎不存在。为填补这一空白,我们引入了一个基准测试,用于评估那些观察电子表格中用户操作序列并预测未来操作的系统。 面临两大挑战:(1) 公开电子表格语料库缺少编辑历史;(2) 电子表格操作的复杂空间(包括空间、时间和复合操作)。为解决第一个问题,我们手动整理了52个操作序列(共约12K个操作),通过参数化启发式算法和LLM精炼,从公共语料库中重构电子表格。为解决第二个问题,我们提出一种在线评估方法:在每次用户操作后做出预测,接受或拒绝该预测,若接受则更新未来操作,并重复此过程直至获得目标电子表格。我们使用多种基线预测器(包括零样本LLM、微调SLM和经典模型),并分析了该基准测试揭示的不同特性,包括但不限于:保存操作与误报的特性、效率、用户画像的影响、触发机制的影响以及上下文的影响。
论文精读
TL;DR 首个电子表格操作预测基准,通过手动构建编辑序列与在线评估框架,填补自动补全空白,并系统分析预测器行为。
问题
问题背景
电子表格是全球最普遍的生产力工具,但自动化水平严重滞后于代码编辑器。代码自动补全(如 GitHub Copilot)已大幅提升开发效率,而电子表格中的预测性操作建议几乎空白,用户仍需手工执行重复的格式设置、公式填充与数据整理。
现有方法局限
现有电子表格自动化方案主要依赖宏录制或基于示例的合成。宏录制要求用户预先定义固定序列,缺乏适应性;示例合成(如 Flash Fill)仅限于单步模式转换,无法建模包含空间选择、时序依赖与复合命令的完整操作流。更关键的是,公开电子表格语料缺乏编辑历史数据,使监督学习难以开展。以往评估也多采用离线模式,即给定固定前缀预测后续动作,忽略了交互中预测被接受/拒绝对后续状态与动作分布的影响,导致评估结果与真实使用场景严重脱节。
为什么这个问题难/重要
核心挑战在于电子表格操作空间的极高复杂度:动作可以是空间相关的(单元格/区域定位)、时序相关的(历史顺序决定后续操作)以及复合的(单一用户动作可能由多个底层命令组合而成)。实时预测还需处理冷启动(新表格无历史)和动态变化的用户意图。若成功实现,下一个动作预测将惠及全球数十亿非专业程序员用户,其影响力可能超越代码补全,因为电子表格使用者更依赖直观引导。业界正加速布局:Excel、Google Sheets 等已引入推荐图表、数据洞察等初步智能功能,但真正的预测式操作建议产品化仍远未成熟,建立统一基准对推动技术发展至关重要。
行业类比
如同 IDE 中的代码行补全从简单记号补全演进为上下文感知的整行生成,电子表格的下一步动作预测有望成为“表格的 Copilot”,让用户仅需确认建议即可完成复杂任务,大幅降低使用门槛与时间成本。
核心洞察
- **在线交互式评估框架**重新定义了电子表格动作预测的评测方式。与传统离线静态指标不同,该框架模拟真实交互:每次用户动作后提供预测,预测被接受则更新未来动作序列,循环直至生成目标表格。这种方式直接衡量系统在实际辅助中的节省动作数和效率,揭示了接受率、误报与最终效用间的权衡,为自回归式智能补全系统提供了更贴近部署场景的在线指标设计思路。
- **通过混合人工与 LLM 的精炼轨迹生成**解决了电子表格编辑历史稀缺的瓶颈。该方法用参数化启发式生成种子轨迹,再用 LLM 重构动作序列,最后人工精修,产出的 52 条序列、1.2 万动作构成了可靠基准。这为缺乏交互日志的垂直领域(如办公软件、设计工具)构建行为预测数据集提供了可复制范式:利用 LLM 作为“动作合成器”结合人工审核,能高效获得高质量训练与评测资源,降低对真实用户日志的依赖。
方法
数据集构建
针对公共电子表格语料库中缺失编辑历史的问题,本工作提出了一个参数化启发式 + LLM 精炼 + 人工标注的流水线,生成 52 条包含 12K 动作的重建轨迹。
- 冷启动启发式轨迹生成:定义一组涵盖空间选择、公式填充、格式化等操作的参数化启发式规则,为每个目标电子表格随机采样参数,生成初步的动作序列。
- LLM 精炼:将启发式生成的序列与目标表格结构输入 zero-shot LLM,要求模型以更符合人类操作习惯的方式重排或修改动作,提升轨迹的真实性。
- 人工标注:标注员审核并修正 LLM 精炼后的序列,确保每一步动作的合理性,最终形成高质量的标准轨迹。
在线评估框架
为了模拟交互式自动补全的真实场景,框架采用逐步预测与接受/拒绝的在线评估协议:
- 在每一步用户动作后,预测器基于当前上下文给出下一个动作预测(或一组候选)。
- 评估器根据预设的接受启发式规则(如精确匹配目标动作)决定接受或拒绝该预测。
- 若接受,则将预测动作视为已发生,更新上下文,并预测后续动作;若拒绝,则回退到真实动作,继续下一轮预测。
- 循环直至达到目标电子表格。
评估指标分为三个层次:
| 指标层次 | 关注内容 | 示例度量 |
|---|---|---|
| 操作/属性级 | 单个动作属性的预测准确性 | 动作类型、参数的精确率 |
| 预测级 | 整个动作序列的预测质量 | 接受率、虚警率 |
| 仿真级 | 完成任务的全局效率 | 节约的动作步数、完成时间 |
基线预测器
评估框架支持三类预测器作为基线:
- Zero-shot LLM:直接使用大型语言模型(如 GPT-4)根据表格状态和操作历史预测下一步,通过精心设计的 prompt 触发推理。
- Fine-tuned SLM:在本文构建的数据集上微调小型语言模型(如 CodeBERT),使其适应电子表格操作预测。
- 经典 ML 模型:包括在线 n-gram、LSTM/GRU、XGBoost 等,利用手工设计的特征(如单元格坐标、公式模式)进行预测。
与同类方法的差异点
不同于常见的代码补全基准(如静态 top-k 准确率),本工作首次针对 电子表格操作空间的空间、时间及复合特性 设计在线评估,更真实地衡量预测器在交互式环境中的实用性。
实验
实验设计
在线评估框架模拟用户逐步接受预测:每次用户动作后,预测器给出下一动作建议,系统根据接受启发式(如置信度阈值)决定接受或拒绝,若接受则更新未来动作序列。评估涵盖多动作预测与单动作重预测两种设置,基线包括零样本 LLM、微调小模型(SLM)及经典模型(n‑gram、LSTM/GRU、XGBoost)。
关键发现
任务可学习,弃权机制对减少错误至关重要;廉价预测或事件触发可提升效率,但并不存在普适最优策略。动作难度差异明显,“公式输入”类动作更易预测。保守接受策略不总是更好,精度单独不能保证实用性——过高的拒绝率会抵消收益。上下文长度与预测长度需平衡,过短丢失信息,过长引入噪声。随着轨迹推进,预测接受率自然上升,表明模型从累积上下文中受益。
基线对比深度解读
零样本 LLM 在未见过的表格上泛化能力强,但因其通用性易产生过度预测;微调 SLM 更专注领域,效率更高,但需针对不同用户画像单独微调。经典模型如 n‑gram 在局部模式上仍有竞争力,且计算开销极低。各模型对上下文长度的敏感度不同:LLM 偏好更长上下文,n‑gram 仅在短窗口有效。整体来看,结合弃权与自适应触发的混合方案有望在电子表格自动补全中达到工程可用水平。
行业影响
落地场景
电子表格(如 Microsoft Excel, Google Sheets)是办公自动化的核心工具,但智能自动补全仍远落后于代码编辑器。该论文提出的下一动作预测 (Next Action Prediction) 框架可直接嵌入主流电子表格产品,为用户实时推荐后续操作(如填充公式、格式化区域、复制模式)。典型场景包括:商业数据分析师构造季度报表时,系统预测并批量完成重复的数据清洗与透视表构建;供应链分析师调整库存模型时,自动补全复杂的多表引用与条件格式。
商业价值
- 降本:通过预测式自动补全,减少分析师重复手工操作,将报表构建时间缩短 30%–50%,降低人力成本。
- 增收:智能辅助功能可成为企业版电子表格的溢价模块,提升 ARPU;自由的个人用户则因效率提升而增强粘性,带动订阅转化。
- 体验提升:实时建议与一键接受机制降低认知负荷,新手也能快速完成高级操作,扩大潜在用户群。
与现有工作流的集成
该框架以 在线评估 (Online Evaluation) 为核心,每步用户操作后实时生成预测,与现有电子表格事件流自然契合。集成路径如下:
- 将预测模型封装为本地或云端推理服务,通过插件或内置 API 接入 Excel/Sheets。
- 利用
Acceptance Heuristics控制建议频率,避免干扰,可与现有「快速填充」「推荐图表」功能并列在工具栏或浮层。 - 模型可基于用户历史操作微调(fine-tuned SLMs),实现个性化,无需改变现有文档存储格式。
具体用例
- 电商运营报表:某电商平台的运营人员在 Sheets 中整理每周 SKU 销售数据,系统学习其「先按类目排序→插入小计行→应用条件格式」的固定模式,在第二步时即弹出后续序列,一键完成整个模板。
- 金融建模:投行分析师在 Excel 中搭建 DCF 模型,系统根据已输入的
Free Cash Flow行,自动预测下一行为Terminal Value计算及折现公式,并智能调整跨表引用,减少人工错误。
这些场景表明,该研究可加速电子表格从 passive canvas 向 active assistant 进化,补齐低代码/无代码工具链中缺失的一环。
局限
- **数据集规模与真实性有限**:基准基于人工策划的52个序列、12K操作,远小于真实用户编辑历史规模。通过参数化启发式和LLM精炼生成的轨迹,缺少真实用户行为的多样性和错误修正模式,可能无法完全捕捉电子表格操作的复杂性,限制了模型在实用场景中的泛化能力。
- **在线评估方法引入偏差**:评估依赖固定的接受启发式(如基于Levenshtein距离)来模拟用户接受或拒绝预测,这种简化可能偏离真实用户的交互逻辑。真实场景中用户可能部分采纳预测或基于习惯调整,而评估中的全量接受/拒绝机制可能导致效率指标(如节省的操作数)高估或低估实际效用。
- **预测能力与可解释性不足**:实验显示模型对复合操作、空间操作等动作类别预测精度较低,且保守接受策略并非严格有利,表明当前方法对电子表格的深层语义理解有限。同时,模型预测缺乏可解释性,用户难以信任黑箱建议,未来需结合电子表格结构知识或引入更强大的基础模型来提升可靠性与透明度。