论文

具身图灵机:面向机器人递归自我改进的有状态代码

具身图灵机:面向机器人递归自我改进的有状态代码

大多数机器人策略都在控制回路中保留模型:VLA 将观测映射为动作,Agent Harness(如 Agent-as-Policy 或 Harness VLA)则在运行时查询 VLM 做决策。我们提出另一种视角——具身世界是一台 Embodied Turing Machine,纸带是机器人与环境状态,规则即策略。 若状态可被精确表示,决策就能完全写成代码。我们由此提出 Code-Only-as-Policy(COAP):代码从相机图像与本体感受中测量并跟踪机器人、环境与任务状态,并据此完成全部决策;同一代码跨 episode 复用,不同任务共享一个库,回路中不含 VLM 或 VLA。 相比 VLA 与 Agent Harness,COAP 有三点优势: 1. 显式状态:状态可存入代码; 2. 执行:决策可控、可灵活从失败中恢复,在线运行快速廉价; 3. 可扩展性:新任务复用、继承或扩展共享库,能力跨任务累积。 这些优势使 COAP 适合递归自我改进(RSI):coding agent 闭环开发该库,每次改动都显式可控。在 RoboDojo 的 42 项双臂任务上,所得库在测试时无模型即达 70.24% 成功率。COAP 的上限取决于状态表示的精度与代码逻辑的鲁棒性。我们因此将其视为具身任务的新范式,也可作为 VLA 与 Agent Harness 的高效数据引擎。

论文精读

TL;DR 本文提出 **COAP**:将机器人策略完全写成代码,把世界视为 **Embodied Turing Machine**,不依赖 VLM/VLA 即可决策;在 RoboDojo 42 个双手任务上无模型达到 70.24% 成功率,代码可积累、可解释,适合递归自我改进。

问题

问题背景

当前具身智能领域围绕 VLA 模型 与 Agent Harness 展开,追求以数据驱动方式让机器人具备通用操作能力,但部署时模型常驻推理链路,导致成本与延迟偏高。

现有方法局限

  • VLA 模型需要在线运行,每个动作依赖神经网络前向计算,计算量大、延迟高,且决策过程缺乏可解释性,难以定位失败原因。
  • Agent Harness 在运行时反复查询 VLM,增加了 token 成本与推理延迟,对实时性要求高的操作任务不够可靠。
  • 两类方法均缺少跨任务的能力沉淀:每个新任务往往需要重新训练或重新设计提示,难以像软件库一样复用、继承或扩展。

为什么这个问题难且重要

将决策完全写为代码,要求精确表示机器人、环境和任务状态,并保证代码逻辑对传感器噪声与场景变化鲁棒。这在技术上挑战极大,因为物理世界的状态空间复杂、感知不完美。然而,一旦实现,系统可提供显式状态、可控执行与快速低成本在线运行,并支持 递归自我改进(RSI),即编码代理在闭环中持续迭代代码库。业界正迫切寻求可解释、低成本、可自进化的机器人策略方案,以突破数据驱动方法的边际效益瓶颈。

行业类比

类似于将 LLM Agent 工作流从 prompt 动态生成转向可版本化、可测试的代码库,如把 ReAct 推理循环固化为结构化工具调用逻辑,从而获得更好的可控性与复用性。

核心洞察

  • 提出将具身世界视为 Embodied Turing Machine,以环境与机器人状态为“磁带”、策略为代码规则,实现 Code-Only-as-Policy(COAP)。与 VLA 端到端映射和 Agent Harness 的 VLM 在线查询不同,COAP 的决策完全由显式状态和手写/生成代码决定,测试时无模型推理。这种显式状态表示让系统完全可控、可调试,执行零模型调用,显著降低延迟与算力成本;代码跨 episode 复用,状态逻辑可被精准追踪与回溯,为可靠部署提供新范式。
  • COAP 以共享代码库支持跨任务继承与扩展,使能力可累积,成为递归自我改进的天然载体。与 VLA 需为每个任务收集数据训练、Agent Harness 受限于固定 VLM 能力不同,COAP 允许编码代理在闭环中增量修改库,每次代码变更显式、可验证、可回滚。在 RoboDojo 42 个任务上达到 70.24% 成功率,同时其离线执行特性可高效合成轨迹,作为 VLA 与 Agent Harness 的数据引擎,形成互补三角。

方法

方法概述

COAP 将具身决策过程视为 Embodied Turing Machine:机器人及环境状态对应图灵机纸带,策略对应规则;若状态可被精确表示,决策即可完全由代码完成。核心在于在线推理阶段移除 VLM/VLA 模型。

输入:单目/双目 RGB 图像与本体感知(关节角度、末端位姿等)。

关键模块:

  1. 显式状态读取与写入:代码从观测中测量并跟踪机器人、环境和任务状态,将其存储为程序变量(如 grasp_status、object_pose),供后续逻辑分支直接使用。
  2. 共享代码库:不同任务复用、继承或扩展同一函数库,函数按相同状态语义组织,避免重复建模;新增任务无需重新训练模型。
  3. 失败回溯改进:当任务失败时,将失败归因到具体状态表示误差或逻辑分支缺陷,迭代修改代码,而非重新采集数据或微调模型。
  4. 递归自我改进闭环:编码智能体在开发循环中构建代码库,每次修改显式且可控,支持递归自我改进(RSI)。

输出:由代码逻辑产生的动作指令,可跨 episode 复用,且无在线推理延迟与模型调用成本。

在 RoboDojo 的 42 个双手操作任务上,代码库在无模型测试时达到 70.24% 成功率。

与 Agent Harness 同类方法相比,COAP 将“状态-决策”从隐式 VLM 推理转为显式代码执行,显著提升可控性、复用性与扩展性,但其上限受状态表示精度和代码逻辑鲁棒性约束。

实验

实验设计

COAP 在 RoboDojo 的 42 个双手操作任务上评估。方法完全基于代码:从相机图像与本体感觉中测量并跟踪机器人、环境与任务状态,并依据状态做出所有决策。同一份代码跨 episodes 复用,不同任务共享一个代码库,测试时无 VLM 或 VLA 参与。对比基线包括 VLA 与 Agent Harness(如 Agent-as-Policy、Harness VLA)。

关键发现

  • COAP 在 42 个任务上达到 70.24% 成功率,且测试时无需任何模型。
  • 三大优势:显式状态(状态可直接存储在代码中)、执行可控(决策可控、失败恢复灵活、在线运行快速且廉价)、可扩展性(新任务复用、继承或扩展共享库,能力跨任务累积)。
  • 这些特性使 COAP 适合 递归自我改进 (RSI):编码智能体在闭环中开发库,每次修改显式可控。

与基线对比

VLA 与 Agent Harness 均保留模型在控制环中,前者映射观测到动作,后者运行时查询 VLM 决策。COAP 彻底移除运行时模型,带来显著推理速度与成本优势,同时提供可解释性与失败回溯能力。然而其上限受限于状态表示准确性与代码鲁棒性。此外,COAP 可作为高效数据引擎,为 VLA 与 Agent Harness 生成训练数据。

行业影响

落地场景

COAP 适合状态可测量、任务重复性高的机器人操作场景。例如电商仓储中的包裹分拣与码垛:物体位姿与机械臂状态可由视觉和本体感觉准确捕获,代码逻辑可覆盖大多数路径规划与抓取策略。再如精密制造产线的柔性装配,不同 SKU 共享底层操作库,切换任务只需扩展或继承代码模块,无需重新训练模型。

商业价值

  • 降本:移除在线 VLM/VLA 推理,边缘 CPU 即可运行,大幅降低 GPU 成本和能耗,适合大规模部署。
  • 增收:代码决策延迟低、确定性高,机器人作业节拍更稳定,单位时间产出提升。
  • 体验提升:显式状态与代码逻辑使故障可回溯、可审计,在医疗机器人或工业安全场景中更容易通过合规审查。

与现有工作流接口

COAP 可作为低层决策层直接接入 ROS 2 等机器人中间件,以节点形式运行,替换现有的 Agent Harness 或 VLA 模型调用。同时,它也是一个高效的数据引擎:在仿真或真机中运行 COAP,自动记录状态-动作对,用于训练或微调 VLA 模型,降低数据采集成本。在动态、长尾任务中,可混合使用 COAP 处理常规子任务,复杂情况 fallback 到 VLM,实现成本与泛化性的平衡。

具体 use case:电商仓库中,COAP 控制机械臂完成 90% 的标准抓取,仅当物体识别置信度低时才调用 VLM;制造产线中,COAP 库通过递归自我改进(RSI)不断沉淀新任务代码,形成组织级资产。

局限

  • **状态表示依赖手工感知代码,扩展性受限**:COAP 需要从相机图像和 proprioception 中手工编写状态估计代码(如检测物体位姿、接触等),这在非结构化环境或复杂视觉场景中会面临巨大挑战。与 VLA 直接从原始像素学习隐式状态不同,COAP 的状态表示是显式且由代码定义,当任务涉及细粒度操作、形变物体或遮挡时,手工特征可能无法准确捕获关键状态,导致决策失败。作者也指出 COAP 的上限在于状态表示准确性和代码鲁棒性。
  • **代码逻辑覆盖有限,难以处理长尾异常**:COAP 的决策完全由 if-else/规则逻辑构成,对于环境中的意外变化、传感器噪声或从未遇到的情况,代码可能缺乏相应的分支而导致失败。相比之下,学习型策略能够在一定程度上泛化到相似场景。虽然作者提到回溯失败到状态并改进代码的 RSI 循环,但该循环目前依赖 coding agent 的自主性,可能引入不可控变更,且需要大量迭代。实验仅在 RoboDojo 模拟基准上验证,未展示真实世界或更复杂的开放世界任务上的可靠性。
  • **开发成本与迁移成本较高**:虽然共享库可以跨任务复用,但初始构建一个足够通用的状态测量和决策库需要大量工程努力,特别是对于视觉感知部分。与端到端 VLA 只需收集演示数据训练相比,COAP 要求专家或 coding agent 针对每个新任务编写和调试代码。此外,代码对硬件平台和传感器配置有一定耦合,当机器人或相机设置变化时,感知代码可能需要重新校准或重写,而 VLA 可以相对容易地在不同 embodiment 间迁移(通过微调)。这限制了 COAP 在不同机器人平台上的快速部署。
论文Kairui Hu2026-10-08原文

相关内容