论文

AdaPlanBench:在世界与用户约束下评估大语言模型代理的自适应规划能力

AdaPlanBench:在世界与用户约束下评估大语言模型代理的自适应规划能力

现实世界中的规划问题通常同时涉及世界约束和用户约束,且这些约束可能不会事先完全明确,而是在交互过程中逐步披露。然而,现有基准对在逐步揭示的双重约束下进行自适应规划的探索仍不足。为此,我们提出 AdaPlanBench,一个动态交互基准,用于评估 大语言模型(LLM)代理 是否能够在逐步揭示的世界和用户约束下自适应地规划和重新规划。 AdaPlanBench 基于 307 个家庭任务构建,并配备可扩展的约束生成管线,为每个任务附加双重约束。在运行时,代理通过多轮协议与环境交互:只有当代理提出的计划违反隐藏约束时,该约束才会被揭示,从而要求代理在累积反馈下迭代修订计划。这种设计使得规划具有挑战性,因为代理必须从反馈中推断和跟踪约束,同时有效重新规划。 我们在十个主流 LLM 上进行的实验表明,双重约束下的自适应规划仍具挑战性,最佳模型仅达到 67.75% 的准确率。进一步观察发现,性能随着约束积累而下降,其中用户约束带来的挑战尤为突出,失败往往源于更弱的物理基础推理和降低的有效性。 这些结果确立了 AdaPlanBench 作为双重约束交互规划的测试平台,并突显了 LLM 代理在动态揭示约束下实现可靠适应的挑战。

论文精读

TL;DR AdaPlanBench 引入动态交互式基准,在逐步揭示世界与用户双重约束下评估 LLM 代理的规划适应能力,揭示最佳模型准确率仅 67.75%,其中用户约束构成主要挑战。

问题

问题背景

LLM 智能体在现实任务规划中需同时遵循 世界约束(物理/环境限制)和 用户约束(偏好/需求),且这些约束往往并非一次性给定,而是在多轮交互中逐步揭露。当前领域正从静态规划基准向动态、交互式评估演进,但专门针对 双重约束逐步揭示 下的自适应重规划能力仍缺乏系统衡量。

现有方法局限

多数现有基准假设所有约束预先已知,或仅模拟单一类型约束(如仅物理约束),忽略了真实场景中 用户偏好与环境限制同步涌现 的叠加效应。这种简化导致:

  • 无法评估智能体从规划失败反馈中 推断隐藏约束 的能力;
  • 缺少对 迭代修订计划 时积累约束跟踪的度量;
  • 回避了用户约束(如“避免使用洗碗机”)与物理约束(如“刀具不可用”)在复杂交互中的耦合难题。 由此,现有模型即使生成合规计划,也未必能应对动态揭示的双重约束,导致任务最终成功率偏低。

挑战与重要性

该问题的核心挑战在于 渐进式约束推断与重规划:智能体在每次违反约束后才获得反馈,需在累积约束条件下持续调整方案,这要求同时具备 物理常识推演用户意图建模。实验表明,随着约束数量增加,规划质量显著下降;用户约束因主观性强,带来的性能损失远超物理约束,暴露出 LLM 在物理接地和偏好整合上的薄弱。业界对可靠自主智能体的诉求日益增强(如机器人服务、对话式任务助手),因此构建此类动态双重约束交互基准是推动 LLM 代理走向实用 的关键一环。

行业类比

就像智能家居助手在用户逐步说出“不要用厨房水槽”和发现“洗碗机故障”的过程中,必须实时重编清洁任务序列——动态约束下的自适应规划能力 正是这类应用可靠性的基石。

核心洞察

  • 逐步揭示的双重约束是构建真实世界规划智能体的核心缺口,而 AdaPlanBench 首创性地通过多轮交互模拟这一机制。与大多只提供静态一次性约束的基准不同,该基准在运行过程中根据代理提出的计划动态释放隐藏约束,迫使模型不仅在“已知”下规划,更要在“部分已知且动态变化”下进行迭代修订,暴露了当前 LLM 在适应累积反馈方面的脆弱性,尤其是用户约束引发的性能塌陷,凸显单独追求计划有效性无法取代真正的约束推理与追踪能力。
  • 实验揭示了一个反直觉发现:高有效计划率并不转化为高任务成功率,且简单的约束追踪模块仅能提升有效性而不能恢复准确性。这突破了业界“更强的模型就一定有更好的自适应规划”的假设,表明 LLM 在物理接地上的本质缺陷——即使记住了约束,也缺乏将其转化为可执行步骤的推理链。该洞察将研究焦点从单次规划准确性转向持续交互下的约束内化与再规划连贯性,为提升智能体可靠性提供了更关键的评测维度。

方法

AdaPlanBench 的构建与评估遵循 任务-约束-交互 的流水线,旨在测量 LLM 代理在渐进揭示的双重约束下的自适应规划能力。

输入: 家庭任务与约束空间

基准以 307 个日常家庭任务(如烹饪、清洁)为基础,通过 约束构建管道 生成两类隐藏约束:

  • 世界约束:环境物理限制,如资源可用性、工具兼容性;
  • 用户约束:偏好或个性化需求,如时间窗口、口味禁忌。 约束通过 查询重写与过滤 从常识知识库中提取,再经 迭代约束抽样 进行规划者维度上的累积与轮次层面上的聚合验证,确保每个任务携带可分步揭示的约束集合。

关键模块: 多轮交互与逐步揭示

运行时采用 Agent-User-World 三方交互协议

  1. 代理根据当前已知信息生成一个文本计划;
  2. 环境(User 与 World)检查计划是否违反任何尚未揭示的约束;
  3. 若违反,则将该约束反馈给代理,包含违规类型与具体描述;
  4. 代理在累积反馈下修订计划,开始新轮次,直至计划满足所有约束或达到最大轮次上限。 此过程强制代理具备 约束推断(从部分反馈中猜测整体限制)与 迭代重规划(在新增约束下调整原计划)能力。

输出: 多维评估指标

每个交互轨迹输出以下指标:

  • Acc(成功率):最终计划是否满足所有约束;
  • VPR(有效计划率):提出计划中无违规的比例;
  • Avg Turns(平均轮数):反映自适应效率;
  • AWRV/AURV(世界/用户重复违规):衡量从反馈中学习的能力;
  • ATWC/ATUC(触发约束数):揭示的约束总量,体现问题难度。

与同类方法的差异

不同于现有基准假设约束一次性全部给定或环境被动执行,AdaPlanBench 将 约束逐步揭示 作为核心挑战,要求代理在互动中主动推断并适应双重限制,更贴近现实规划场景。

实验

实验设计

AdaPlanBench 基于 307 个家庭任务构建,通过约束构造管线为每个任务生成世界约束用户约束 ,形成双约束交互环境。评估中,LLM 代理在多轮对话里逐步探索,隐藏约束仅在代理计划违反时才被揭示,迫使代理从反馈中推断并追踪约束,迭代重规划。选用 10 个主流 LLM(含 GPT-4、Claude-3.5 等),指标包括准确率 (Acc)、有效计划率 (VPR)、平均轮次 (Avg Turns) 及重复违规次数。

关键发现

  • 最佳模型准确率仅为 67.75%,且高有效计划率并不保证任务成功:代理常生成看似合理的计划,却未能满足全部隐藏约束。
  • 性能随累积约束增加持续下降,用户约束带来的挑战尤甚;失败常源于物理基础薄弱 和重规划有效性降低。
  • 常规更强的模型并不必然具备更强的自适应规划能力,说明动态约束下的重规划需额外能力。

与基线对比

无先验基准对标,论文内部对比揭示:即时约束跟踪模块可提升有效性但无法恢复准确率;评分表反馈收益有限且可能破坏计划稳定性。这些分析定量刻画了当前 LLM 在动态约束推理迭代重规划 上的短板,为后续研究提供测试平台。

行业影响

落地场景

AdaPlanBench 所评估的动态双约束下自适应规划能力,直接映射到需要处理逐步披露的环境限制与用户偏好的交互式 AI 系统。典型场景包括:

  • 对话式任务助手:如旅行规划、搬家服务预约,用户需求(预算、时间、偏好)与服务能力(可用时段、地理位置)在对话中逐步明确
  • 智能客服机器人:处理退换货、保险理赔等流程,需协调用户柔性要求(取件时间、理赔方式)与系统刚性规则(退货窗口、赔付上限)
  • 企业流程自动化:在招聘、采购审批等场景中,系统需在人力政策、预算约束下动态调整方案,并通过多次询问澄清需求
  • 智能家居控制:用户语音指令与设备状态、节能策略等环境约束交互,需渐进式确认意图并修正执行计划

商业价值

该基准揭示的 LLM 规划短板,为优化此类系统提供了直接参考,商业价值体现在:

  • 减少人工干预:提升自主解决复杂任务的比率,降低客服或运营人力成本
  • 提升用户体验:避免因忽略隐性约束导致计划失败,减少反复澄清带来的摩擦,提高任务完成率与满意度
  • 加速产品迭代:通过可量化的规划成功率、约束违反率等指标,指导模型选型与工程优化,缩短开发周期

与现有产品/工作流的接口

集成方式可参考:

  • 在现有对话 AI 平台(如 Rasa、Dialogflow)的编排层引入自适应规划模块,利用 LLM 生成候选计划,并根据用户/系统反馈触发重规划
  • 通过约束跟踪模块记录已暴露的约束,作为 prompt 上下文,提升后续规划一致性(论文中约束跟踪实验已证明有效性)
  • 对接业务规则引擎,将静态规则动态注入对话状态,使规划始终在有效边界内

具体 Use Case

  1. 电商售后客服:某全球电商平台部署退货助手,用户要求“明天上门取件”,助手初步计划调派物流,但触发系统约束“该区域次日达不可用”,并收到用户新约束“希望下午 3 点后”,助手自适应调整为“后天上午取件,或今天自寄”,经两轮交互达成方案,降低客诉转人工率。
  2. 医疗预约系统:在线诊所的预约助手需同时满足患者偏好(特定医生、时间段)与诊疗规则(医生专科匹配、检查设备排期),在交互中逐步排除不可行建议,最终给出可行方案,减少无效预约,提升资源利用率。

局限

  • **领域覆盖有限且评估偏差**:论文承认任务领域限于 307 项家庭事务(household tasks),约束类型主要围绕世界常识与用户偏好,无法覆盖更开放、多变的规划场景。此外,使用 LLM 作为评判器(judge)自动化评估规划质量,存在内生偏差与评分不一致风险,且文本交互无法捕获真实世界的物理信号(如视觉、力学约束),降低了外部效度。
  • **渐进揭示机制下的探索深度不足**:当前交互协议仅在 Agent 提出违反约束的规划时才反馈约束,导致 Agent 只能被动接收信息,缺乏主动探测未知约束的机制。实验虽分析了约束追踪模块的效果,但未深入探讨不同探索策略(如主动询问、假设测试)对自适应规划的影响,这限制了基准对 Agent 推理能力的全面诊断。
  • **约束建模与动态性的简化**:基准中的约束是静态预定义的离散规则,不随时间或上下文动态演化,也未涉及连续值约束(如资源消耗速率)或概率性约束。与真实动态环境(如供应链、人机协作)相比,这种建模仍较理想化,难以充分检验 LLM Agent 在实际部署中应对复杂约束网络和不确定性的能力。
论文Jiayu Liu2026-06-04原文

相关内容