面向广义任务与运动规划问题的编码智能体
任务与运动规划 (TAMP) 问题即便在完全可观测、以物体为中心的状态下依然困难,因为离散决策与几何、运动学及动力学约束紧密耦合。广义 TAMP 借助跨实例的规律性降低新实例的规划开销,但现有方法需要大量专属工程。 本文探究编码智能体 能否通过合成可跨实例泛化的程序来自动化这一过程。给定任务描述与模拟器访问权限,每个智能体在固定的合成预算内自行决定如何与环境交互,随后程序被冻结,并在未见过的实例上评估。 我们在 KinDER 与 PDDLStream 的 28 个模拟环境中评估 Claude Code (Opus 5) 与 Codex (GPT-5.6 Sol、GPT-6 Astra),物体数量超出原 benchmark 的评估范围:对所有程序合成方法共评估 980 个生成程序,每个在 100 个留出实例上运行,总计 98,000 个评估回合。 结果表明编码智能体 在广义 TAMP 上出奇有效:三种配置的平均成功率均优于手工规划器、一次性生成与基于 LLM 的广义规划基线(在有规划器可用的 16 个环境中为 56%–95%,规划器仅 47%);物体数量增长时其成功率保持更高,平均每实例计算量低一个数量级。日志显示智能体利用交互校准物理模型、测试边界情况并改进策略。我们开源了全部代码与完整 prompt,表明编码智能体是广义 TAMP 的强基线。
论文精读
TL;DR 本文验证编码智能体(Claude Code、Codex)可自动合成广义任务与运动规划(TAMP)程序,在 28 个环境中成功率 56%-95%,超越手工规划器与基线,推理成本低一个数量级。
问题
问题背景
任务与运动规划(TAMP) 在机器人操作中需要同时处理离散动作选择和连续运动约束。即使具备完全可观测、物体中心化状态,离散决策与几何、运动学、动力学约束的耦合仍使规划问题高度困难。
现有方法局限
- 传统 TAMP 规划器 依赖手工设计的符号域、采样器和参数调整;当物体数量、几何布局或任务变体变化时,需要大量重新工程。
- 学习型广义规划(如 LLM-based)通常仅处理离散符号层,或需要显式注入 TAMP 领域知识,难以自适应底层连续约束。
- 一次性代码生成(one-shot)无法利用仿真交互来校准物理参数、测试边界案例,生成的程序对未见实例泛化脆弱。
为什么难/重要
离散与连续耦合导致解空间规模巨大,而编码代理必须在固定的合成预算内(有限仿真查询次数)完成策略探索与程序生成。广义 TAMP 要求程序从少量实例中提取跨实例规律,并在物体数量增长时保持高成功率和低计算开销。
业界关注的是:能否用自动化方法替代手工领域工程,降低机器人多任务部署的调参成本。若编码代理能可靠合成可泛化规划程序,将显著改变机器人编程范式。
行业类比
类似 AutoML 用自动搜索替代手工特征工程,本文用编码代理的交互式合成替代手工 TAMP 领域工程,探索“编程即规划”的自动化路径。
核心洞察
- **编码代理将广义 TAMP 的自动化程度从手工工程提升到程序合成,并借助模拟器交互实现跨实例泛化。** 传统方法中,手工规划器需要大量 TAMP 专家知识,一次性生成和 LLM 广义规划基线则缺乏与环境交互的迭代改进能力。本研究中的编码代理在固定合成预算内自主选择探索方式与编程策略,生成可冻结的程序,在 28 个模拟环境上平均成功率 56%–95%,显著超过手工规划器的 47%。这证明 LLM 代理的交互式软件工程能力可以替代专门化的 TAMP 工程,为复杂机器人规划问题提供了新的自动化范式。
- **代理在合成过程中主动校准物理模型与测试边缘案例,是其泛化成功并保持高效的关键。** 日志分析显示,代理不仅编写代码,还利用与模拟器的交互来验证物理参数、探测边界条件,从而生成更鲁棒的程序。与一次性生成或纯 LLM 规划相比,这种交互式合成策略使代理程序在物体数量增加时仍保持较高成功率,且单实例计算量比手工规划器少一个数量级。该结果表明,将代码生成与主动环境探索相结合,能够在规划效率和跨实例泛化之间取得更优平衡,对实际机器人系统中降低部署成本具有重要启发。
方法
方法概览
研究将 广义任务与运动规划(Generalized TAMP)问题转化为编程智能体的程序自动合成任务。给定任务描述与模拟器访问权限,编码智能体在固定合成预算内自主开发一个可跨问题实例泛化的程序,而不是为单个实例求解具体计划。
输入 → 关键模块 → 输出
- 输入:任务描述(自然语言或结构化目标)和交互式模拟器接口。模拟器允许智能体执行动作、观察状态并获取几何/运动学反馈。
- 关键模块:
- 环境交互循环:智能体通过反复运行候选程序来探索环境,观察执行成败、物理状态变化及约束违反情况。日志显示智能体会主动校准物理模型、测试边界条件并调整策略。
- 程序生成与调试:智能体使用编码能力(如 Claude Code (Opus 5)、Codex (GPT-5.6 Sol / GPT-6 Astra))编写控制逻辑,根据交互反馈迭代修改代码,逐步收敛到能处理多样场景的泛化策略。
- 合成预算控制:固定步数或计算量限制,迫使智能体优先学习可迁移模式而非过拟合单个实例。
- 输出:冻结的泛化规划程序。该程序在随后 100 个未见实例上评估,不再修改。
工程启示
这个方法将传统 TAMP 中大量手工特征工程和领域特定搜索策略替换为智能体自主探索与代码迭代。相比一次性生成(one-shot)或 LLM 泛化规划基线,交互式调试能显著提升成功率(56%–95% vs 47%),且随对象数量增加,智能体程序保持更高成功率,平均计算量降低一个数量级。
与同类方法的差异:不同于依赖专家设计的规划器或仅单次生成的 LLM 方法,编码智能体通过闭环交互和代码迭代实现泛化,无需 TAMP 特定工程。
实验
实验设计
- 数据集:28 个仿真环境来自 KinDER 与 PDDLStream,物体数量超出原始基准。
- 代理配置:Claude Code (Opus 5)、Codex (GPT-5.6 Sol 和 GPT-6 Astra);基线包括手工设计规划器、单次生成与 LLM 广义规划。
- 合成与评测:每个代理在固定合成预算内开发程序,程序冻结后在 100 个未见实例上评测;共 980 个程序、98,000 个评测回合。
关键发现
- 三个代理配置平均成功率 56%–95%,在 16 个有规划器可用的环境中,手工规划器仅为 47%;代理显著领先。
- 物体数量增长时,代理程序保持更高成功率,且每实例计算量平均低一个数量级。
- 日志显示代理通过交互校准物理模型、测试边界情况并迭代策略,而非仅凭提示生成静态代码。
基线对比
与手工规划器相比,代理自动完成 TAMP 特定工程,减少人工设计;相比单次生成,代理通过交互获取环境反馈修正程序;LLM 广义规划基线缺乏程序化抽象与交互式调试,成功率较低。这表明编码代理是广义 TAMP 的强基线。
工程启示:可复用的程序化策略比端到端规划更易泛化与部署,但需固定评测协议避免数据泄漏。
行业影响
落地场景
- 仓储机器人:电商履约中心中,拣选、分拣、码垛等任务需要频繁调整布局与 SKU。coding agents 可合成泛化策略,快速适配新货架和物品。
- 自动驾驶仿真:生成复杂场景下的运动规划代码,应对新道路拓扑与障碍物。
- 柔性制造:小批量多品种的机械臂编程,减少人工示教。
论文表明所有 agent 配置在 16 个有 planner 的环境上平均成功率 56%–95%,高于手工 planner 的 47%,且实例计算量降低一个数量级。
商业价值
- 降本:省去大量 TAMP 专家手工工程,新环境部署周期从数周缩短至数天;实例级计算成本降低,云端推理与边缘部署更经济。
- 增收:机器人产品线可快速扩展到更多垂直场景(医疗物流、零售补货),提高市场覆盖速度。
- 体验提升:策略对物体数量增加更鲁棒,减少现场故障与人工干预。
与现有工作流接口
- 编码代理输出标准 Python 程序,可直接对接 ROS 2、Isaac Sim、Gazebo 等生态。
- 通过 API 调用基础模型(如 Claude、GPT),在仿真预算内迭代,冻结后部署,易于纳入 MLOps / CI-CD 流水线。
- 模型无关,可替换底层 LLM,降低供应商锁定风险。
具体落地 use case:电商仓储中,新开设仓库时,利用 coding agents 在数字孪生中合成拣选策略,然后零修改迁移到真实机器人,节省现场调试成本。
局限
- - **仿真到现实差距显著**:所有实验均在 KinDER 和 PDDLStream 的模拟环境中完成,且假设全观测、物体中心状态。生成的程序依赖模拟器提供的几何、运动学和动力学 API,其物理模型经过简化,无法保证迁移到真实机器人或存在传感器噪声、部分可观测的场景。论文未讨论 sim-to-real 或对感知误差的鲁棒性。
- - **合成阶段成本与模型封闭性**:coding agent 在程序合成阶段需要大量环境交互和推理 token,且基于闭源商业模型(Claude Code、Codex),复现和部署门槛较高。虽然单实例评估计算量小一个数量级,但合成成本未被系统性量化,也未与手工设计规划器的一次性工程成本做公平比较。
- - **基准对比不完整与泛化边界模糊**:28 个环境中只有 16 个有手工规划器基线,其余 12 个仅与 one-shot 生成和 LLM 广义规划对比,可能高估 agents 的优势。对象数量增多时的成功保持需要进一步验证是否源于任务退化或更易的实例分布,且 agent 交互策略受 prompt 影响较大,缺乏消融。