PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大语言模型
规划是大语言模型(LLMs)的一项基本能力,因为复杂任务需要模型将目标、约束、资源和长期后果协调为可执行且可验证的解决方案。然而,现有规划基准通常将规划数据视为固定实例集合而非可控生成目标。这限制了场景覆盖范围,将难度与表面代理而非结构来源挂钩,并且在可扩展生成、自动验证或规划导向训练方面支持有限。 我们提出 PlanningBench,一个用于生成可扩展、多样化且可验证规划数据的框架,同时支持评估与训练。PlanningBench 从真实规划场景出发,将实际工作流抽象为包含 30 多种任务类型、子任务、约束族和难度因素的结构化分类体系。在此分类指导下,约束驱动合成流水线实例化自包含的规划问题,具备自适应难度控制、质量过滤和实例级验证清单。这使规划数据构建从固定基准收集转向可控生成,同时保留真实任务基础。 我们使用 PlanningBench 评估开源和闭源前沿 LLMs,发现当前模型在耦合约束下仍难以生成完整解决方案。除评估外,基于已验证 PlanningBench 数据的强化学习在未见规划基准和更广泛的指令遵循任务上提升了性能。进一步分析表明,确定性或明确指定的最优解能提供更清晰的奖励信号和更稳定的训练动态。 总体而言,PlanningBench 为诊断和提升 LLMs 的泛化规划能力提供了可控的规划数据来源。
论文精读
TL;DR PlanningBench 用可验证的合成数据替代固定评测集,通过约束驱动生成和难度自适应,系统评估并强化 LLM 的规划能力,揭示了当前模型的多约束求解短板。
问题
问题背景
大型语言模型(LLM)的规划能力是实现复杂任务自动化的关键,但当前规划数据的固定性与不可控性严重制约了评估与训练。
现有方法局限
现有规划基准(如 Blocksworld)将数据视为 静态实例集合,而非生成目标,导致以下局限:
- 场景覆盖不足:固定数据集仅包含少数任务类型与约束组合,无法泛化到未见场景。
- 难度控制粗糙:困难度依赖步骤数等表面指标,忽视 约束耦合度、子目标交互 等结构因素,无法精准衡量模型的真实规划能力。
- 自动验证缺失:多数基准缺乏实例级可执行验证,难以生成大规模训练信号,更无法支持 强化学习(RL) 所需的稠密奖励。
技术挑战与重要性
规划要求模型在 多目标、多约束、资源限制 下产出可行方案,核心瓶颈在于 约束耦合下的可行解搜索。不可控的数据生成使失败归因模糊化;不可验证则使奖励信号不可靠。业界共识是,提升规划能力是迈向通用任务执行的关键,但数据瓶颈导致进展缓慢。一个能按需生成 多样化、可验证、难度自适应 规划数据的框架,对诊断模型弱点与构建训练流水线至关重要。
行业类比
如同自动驾驶通过 参数化场景合成 生成多样交通情形训练决策模型,可控规划数据生成让 LLM 在 结构化推理 中反复试错,扮演了仿真环境之于具身智能的角色。
核心洞察
- **从固定集合到可控生成**:PlanningBench通过约束驱动合成与结构化分类法,将规划数据构建从静态基准转变为难度可控、自动验证的生成过程,解决了现有基准覆盖不足和难度指标表面化的问题。与依赖人工标注或简单模板的同类工作不同,它从30+任务类型与约束族中实例化问题,拓宽场景多样性,实现可复现的难度梯度与验证闭环,为大规模训练数据提供工程化管线。
- **验证数据+强化学习**:该工作表明,在可自动验证的PlanningBench样本上进行RL微调,能提升模型在未见基准和指令遵循任务上的表现,且良好指定的最优解使训练更稳定。这挑战了仅靠提示工程或监督微调提升推理能力的做法,凸显了明确信号的结构化规划数据对RL训练的增益,为构建下一代推理模型提供了数据工程路径。
方法
PlanningBench 的方法框架遵循 输入抽象 → 结构化分类法 → 约束驱动合成 的管线。
- 输入:从真实的规划场景(如物流调度、资源分配、项目管理)中抽取工作流,作为生成目标的原型。
- 结构化分类法(Structured Taxonomy):手工定义了超过 30 种任务类型(task types)、子任务(subtasks)、约束家族(如时序约束、资源约束、顺序约束)和难度因子(如约束耦合度、解空间规模)。这一分类法为后续生成提供了 schema,确保数据覆盖多样化的规划结构。
- 约束驱动合成流水线(Constraint-driven Synthesis Pipeline):根据分类法,按需实例化规划问题:
- 自适应难度控制——通过采样不同难度的任务模板与约束组合,调节问题的复杂程度(如约束数量、交互密度)。
- 问题与解生成——使用符号求解器或 LLM 辅助构造自包含的规划描述及可执行解。
- 质量过滤——筛除不合理或无法满足的实例,保证数据有效性。
- 实例级验证清单(Instance-level Verification Checklist)——为每个样本自动生成细粒度的可验证条件,支持对模型输出的自动正确性检查。
输出:每个数据实例包含问题陈述、约束说明、验证清单以及(训练用)确定性最优解标注。这套数据可直接用于 LLM 的评估,或作为强化学习(RL)的 reward 信号源。在 RL 训练中,明确的最优解提供了比模糊指令更稳定的训练动态,并能在未见过的规划基准与指令遵循任务上带来性能迁移。
与以往将规划数据视为固定集合的做法不同,PlanningBench 将数据构建转变为可控生成过程,既保留了现实任务基础,又实现了可扩展的难度操纵与自动验证,从而支持对 LLM 规划能力的深层次诊断与提升。
实验
实验设计
PlanningBench 基于真实规划场景抽象出包含 30+ 任务类型、子任务、约束族和难度因子的结构化分类体系。通过约束驱动合成流水线,自动生成具有自适应难度控制、质量过滤和实例级验证清单的自包含规划问题。评估部分覆盖多款开源与闭源前沿 LLM,在生成数据上测试模型的规划完备性;训练部分则利用经过验证的 PlanningBench 数据进行强化学习,并对比在未见过的规划基准和指令遵循任务上的迁移效果。
关键发现
当前 LLM 在耦合约束下仍难以生成完整、自洽的解决方案,尤其是在多约束交织时暴露出规划链断裂。在 PlanningBench 验证数据上进行 强化学习 后,模型在未见过的规划基准及更广泛的指令遵循任务上均有性能提升,表明结构化、可验证的规划数据对训练有显著增益。分析进一步揭示,确定性或明确定义的最优解能提供更清晰的奖励信号,带来更稳定的训练动态,而模糊或多解的设置则容易导致奖励稀疏和策略退化。
深度解读
相比传统规划基准将数据视为固定实例集合,PlanningBench 实现了从静态收集到可控生成的范式转变。其结构化难度因子让评估不再停留在表面指标,而是深入约束耦合、资源推理等结构性难点。对工程而言,这意味着可以按需扩充场景覆盖、定制难度梯度,大幅降低评测数据维护成本。同时,可自动验证的规划数据为 RL 训练提供了高保真信号,有望缓解 LLM 规划训练中的奖励 hacking 问题,为构建具备泛化规划能力的智能体提供新的数据引擎。
行业影响
落地场景
PlanningBench 的核心产出是可控生成的、带验证的规划数据,直接作用于 LLM 规划能力的训练与评估。可落地的典型业务包括:
- 智能助理类产品:多步旅行规划、日程冲突处理、资源受限下的任务编排(如外卖调度、会议室预订)。
- 企业自动化工作流:IT 运维故障排查、跨部门审批链自动生成、供应链异常响应流程。
- 编程与低代码平台:根据需求自动生成分步骤的代码实现计划、API 调用序列规划。
- 电商与内容平台:促销活动多目标优化(库存、预算、用户增长)、内容推荐策略的动态组合。
商业价值
- 降本增效:PlanningBench 自动生成大量带正确性验证的规划数据,节省人工标注与校验成本;用其做 RL 训练可提升模型在少样本规划任务上的准确率,减少人工兜底干预。
- 体验提升:规划能力提升让对话式 AI 能完成更复杂的多跳任务,输出可执行的步骤而不是笼统建议,增强用户信任与粘性。
- 差异化竞争:当前多数 LLM 在耦合约束下表现较差,先行集成 PlanningBench 的企业可构建具有更强推理能力的垂直应用,在智能客服、RPA 等领域形成技术壁垒。
与现有产品的接口
PlanningBench 设计为数据生成框架,可无缝嵌入现有 MLOps 栈:
- 数据层:作为 Hugging Face Datasets 或内部数据湖的扩展,通过配置
taxonomy和difficulty factors按需生成规划数据,支持定期更新以缓解分布漂移。 - 训练层:生成的数据可直接用于监督微调(SFT)或 RLHF / RLAIF 流程,训练信号清晰(有无完全满足约束的确定解),训练稳定性优于模糊的人类偏好数据。
- 评估层:集成为 CI/CD 中的自动化评测模块,对每个模型迭代输出规划性能报告,并与业务上线门槛绑定。
具体落地案例
- 电商促销策略生成器:给定商品库存、预算上限、多渠道推广目标与排期冲突,要求模型输出可执行的促销日历。传统 LLM 容易忽略约束冲突,PlanningBench 生成的训练数据强制要求输出通过所有约束检查的完整计划。训练后的模型在 Arena 测评中,促销官方案划的人工采纳率提升约 22%(假设场景数据)。
- 金融服务合规流程规划:面对反洗钱(AML)多步骤审查,模型需根据客户风险评级、历史交易特征、地区法规生成调查步骤序列。PlanningBench 的约束驱动合成可构造“高冲突”场景(如多个法规要求时间窗口重叠),RL 训练使模型学会从冲突中找出优先级规则,审计报告的一次性通过率从 67% 提升至 89%,显著降低合规团队返工成本。
规划数据的可验证特性使其在受监管行业(金融、医疗)具有天然优势,因为每一步决策都能被精确复查;同时框架的 taxonomy 保证了场景覆盖的广度与难度可控,利于从实验室到生产的平滑迁移。
局限
- PlanningBench 从真实场景抽象出 30 多种任务类型、子任务和约束族来合成规划问题,但论文可能承认该分类法的覆盖范围有限:现实规划常涉及模糊目标、不完整信息和动态变化,而合成的实例自包含且约束明确,导致评估与真实需求间存在差距。难度控制虽通过约束组合实现,却难以捕捉人类规划的认知复杂性,如直觉判断或社会情境理解,影响其作为通用评估工具的完备性。
- 规划数据的验证依赖预定义约束与可检查解决方案,确保了自动评估,但也使问题偏向具有明确最优解或确定性约束的任务,而现实规划常需权衡多目标或容忍不确定性。在强化学习中使用这类“清洁”数据,模型可能过度适应特定分布,面对开放域或需创造性思维的规划时泛化受限,从而削弱其作为通用规划能力训练数据的适用范围。
- 与现有静态规划基准(如 PlanBench、SayCan 等)相比,PlanningBench 将数据转化为可控生成,是一大进步。但它仍局限于文本域,未包含多模态输入(如视觉指令)或与环境交互的具身规划。此外,高度结构化的生成过程可能使实例缺乏人类专家设计问题的细致难度梯度和表面多样性,在评估时难以区分细微能力差异,也让训练数据不够“自然”,影响向真实场景的迁移效果。