论文

τ0-VLA: 一个具有世界模型引导测试时计算的层次化机器人基础模型

τ0-VLA: 一个具有世界模型引导测试时计算的层次化机器人基础模型

长程机器人操控要求机器人既能可靠执行单个技能,也能在扩展任务中连贯地编排它们。大多数层次化视觉-语言-动作 (VLA) 模型每次决策只通过一次前向传播,没有机制为困难或关键选择分配额外计算。 我们提出 τ0-VLA,一个层次化机器人基础模型,通过世界模型引导的测试时计算,将高层子任务生成形式化为一个计算可扩展的推理问题。在每个推理步骤中,高层策略利用执行记忆 生成子任务,并在需要时通过搜索备选方案再确定输出。随后,低层策略在多种机器人实体上执行生成的子任务。 该策略在 40,115 小时 的异构真实世界数据上进行多模态协同训练。在分布内和分布偏移设置下,分配额外测试时计算显著提高了下一子任务预测准确率,这些提升转化为长程机器人操控任务中更高的闭环成功率。

论文精读

TL;DR τ_0-VLA 通过世界模型引导的测试时搜索,让分层机器人策略在高层次子任务决策上动态分配计算,显著提升长程操作成功率。

问题

问题背景

长程机器人操作要求机器人既能可靠执行单个技能,又能在跨越多个子任务的流程中保持连贯决策。当前该领域聚焦于如何让基础模型同时具备低层控制与高层任务规划能力,从而在真实环境中完成复杂时序任务。

现有方法局限

大多数层级 VLA 模型在生成高层子任务时仅使用单次前向传播,没有为困难或高风险的子任务分配额外推理的计算机制。具体而言:

  • 单次决策:高层策略一次性输出下一个子任务,无法根据当前执行记忆搜索备选方案。
  • 错误累积:一旦子任务预测偏差,后续子任务会沿着错误轨迹延续,导致长程任务整体失败。
  • 缺乏权衡:系统无法判断哪些步骤需要更深入的世界模型评估,计算资源被平均分配到每一步。

这些限制使得模型在分布偏移或需要精细顺序推理的场景下表现不稳定。

为什么这个问题难且重要

在机器人操作中引入 世界模型引导的测试时计算 面临多个技术挑战:

  1. 执行记忆建模:需要从既往动作和观测中提取有效上下文,指导搜索方向。
  2. 搜索策略设计:如何在高维动作空间中高效搜索候选子任务,同时控制推理延迟。
  3. 跨 embodiment 泛化:低层策略需适配多种机器人本体,高层决策不能依赖特定形态。

业界对该方向高度关注,因为测试时计算扩展是提升机器人基础模型推理能力的潜在路径,与语言模型中的推理时缩放趋势一致。论文利用 40,115 小时异构真实数据和多模态协同训练,验证了额外测试时计算能显著提升子任务预测精度并转化为闭环成功率。

行业类比

类似于大语言模型通过 思维链 或 best-of-n 采样 增强复杂推理质量,机器人策略同样可以通过测试时搜索来提升长程任务决策的可靠性,将计算资源动态分配到最有价值的高层选择上。

核心洞察

  • τ_0-VLA 将测试时计算引入层级 VLA 的高层决策,通过世界模型引导搜索实现算力动态分配。与现有层级 VLA 每步仅做单次前向、无困难样本额外算力的机制不同,它把子任务生成形式化为可扩展推理问题,允许在关键决策点搜索多个候选并选择更优方案。这一设计类似 LLM 中的思维链与树搜索,但针对机器人操作闭环,将额外算力直接转化为下一子任务预测准确率和长程任务成功率的提升。
  • 高层策略利用执行记忆生成子任务,使决策依赖历史执行上下文而非仅当前观察,这是对传统层级 VLA 忽略任务进度与失败历史的改进。该记忆机制配合世界模型评估候选子任务,使得搜索过程能显式考虑动作后果,而非仅靠语言先验。在 40k 小时异构真实数据上的多模态协同训练进一步解耦高层与低层策略,低层可跨多机器人执行,突显了架构的可扩展性与跨 embodiment 泛化潜力。

方法

输入与状态表示

τ_0-VLA 接收 多模态输入:当前视觉观测、语言指令以及 执行内存(execution memory,记录已完成子任务与中间状态)。高层策略在这些上下文基础上生成子任务描述。

高层策略:可扩展推理

  • 高层策略基于 VLA 骨干,利用 执行内存 生成候选子任务。
  • 引入 世界模型引导的测试时计算:当决策困难或后果重大时,不直接输出,而是对候选子任务进行搜索,由世界模型评估每个候选的后续状态或成功率,选择最优者提交。
  • 计算量可动态分配:简单步骤单次前向,困难步骤多次搜索,实现 test-time compute 可伸缩。

低层策略:跨本体执行

低层策略接收高层输出的子任务和当前观测,生成底层动作(关节角度或末端位姿)。通过 统一状态与动作表示,同一低层策略可在多个机器人本体上执行,无需针对每个本体重新训练。

训练

  • 使用 40,115 小时异构真实世界数据 进行 多模态协同训练。
  • 低层策略单独训练,高层策略基于标注的子任务序列和世界模型预测进行训练。

核心思想:将高层决策从固定前向扩展为可伸缩推理,使模型在困难决策上分配更多计算。

与同类方法的差异:不同于 π0 等单次前向分层 VLA,τ_0-VLA 首次将世界模型与测试时搜索结合用于高层子任务决策,实现计算自适应与决策质量提升。

实验

实验设计

τ_0-VLA 在跨域和分布偏移场景下评估,覆盖长程机器人操作任务。评价指标包括下一子任务预测准确率与闭环成功率。核心对比为单次前向决策与通过世界模型引导的测试时搜索分配额外计算。低层策略部署在多种机器人形态上,训练数据为 40,115 小时异构真实世界数据,采用多模态协同训练。

关键发现

  1. 增加测试时计算可显著提升下一子任务预测准确率,并转化为更高的闭环成功率。
  2. 世界模型引导的搜索能有效评估候选子任务,在高不确定性或后果严重时分配更多算力。
  3. 执行记忆机制帮助高层策略利用历史上下文生成更连贯的子任务序列。

与基线对比深度解读

大多数层级 VLA 模型在高层决策时仅做单次前向传播,计算预算固定。τ_0-VLA 将高层子任务生成显式建模为计算可扩展的推理问题:在推理阶段按需搜索替代方案,而不是一味增加模型规模或训练数据。这种设计在分布偏移场景下优势更明显,因为单次前向决策容易在长程任务中出现错误累积。对工程实践的启示是:在机器人基础模型中,可以通过测试时计算动态调解精度与延迟,尤其适合需要权衡安全性与实时性的部署环境。相关代码与项目页:GitHub、项目主页。

行业影响

落地场景

τ_0-VLA 适用于需要长程任务规划与可靠执行的机器人操作场景,典型产品包括电商仓库的 拣选与打包、制造业的 柔性装配线、服务机器人的 多步骤家务。这些场景中,任务由多个子任务串行组成,环境动态变化,单次推理难以处理所有不确定性。

商业价值

模型通过 world-model-guided test-time computation 在关键决策点动态分配算力,直接提升 长程任务成功率。对于物流仓储,可减少人工干预和错误率,降低每单履约成本;对于制造,可减少产线停机与返工,提高设备利用率。同时,分层架构允许低层策略复用,减少重复训练投入。

与现有产品/工作流的接口

模型可作为 高层规划器 嵌入现有机器人软件栈,与 ROS 2 等中间件对接,输出子任务指令给已有低层控制器(如阻抗控制或经训练的 VLA 策略)。论文提供的异步双系统服务可在边缘 GPU 上部署,与实时控制循环解耦,便于集成到现有自动化系统中。

具体落地 use case

  • 电商仓储拣选:在大型仓库中,机器人根据订单从多个货架取不同物品并放入周转箱。τ_0-VLA 高层策略根据订单和库存状态生成子任务序列(如“移动至 A3 货架”“抓取红色包装盒”),遇到遮挡或空位时进行搜索选择替代路径。低层策略执行抓取与放置。该方案可直接集成到 WMS(仓储管理系统)中,通过 API 接收订单,输出动作指令。
  • 汽车零部件装配:在柔性装配线上,不同车型需要不同装配顺序。τ_0-VLA 作为动态工艺规划器,根据当前工位状态和零件库存生成下一步装配子任务,并利用 world model 预测执行结果,在多个可行方案中选择成功率最高的。与 MES(制造执行系统)对接,减少人工重编程。

局限

  • **测试时计算开销** 未量化:高层策略在推理时通过世界模型搜索候选子任务,会引入显著额外计算与延迟。虽然高层决策频率低于低层,但在真实机器人闭环控制中,搜索过程的耗时可能影响任务执行的连续性与响应速度。论文未给出与单次前向推理相比的延迟增加量、能耗开销,也未讨论自适应路由在何种条件下跳过搜索,导致难以评估在资源受限平台上的实际部署可行性。
  • **世界模型精度依赖** 未充分分析:搜索质量高度依赖世界模型对状态转移与子任务结果的预测准确性。在长程任务或分布偏移场景下,世界模型误差可能逐层累积,使得高价值候选被错误剪枝,或错误候选被冗余保留,反而降低成功率。论文缺少对世界模型失效模式的系统评估,也未说明如何在线校准或更新世界模型以缓解预测漂移。
  • **评估范围与低层策略未覆盖**:虽然训练数据规模达 **40,115 小时** 并跨多种机器人,但实验部分可能只在有限任务集上验证,分布偏移设置的具体难度与广度未完全披露。此外,测试时计算仅作用于高层子任务生成,低层策略仍为单次前向执行,未探讨低层遇到困难或意外状态时是否也能受益于计算扩展。LLM-as-Judge 协议可能引入主观偏差,闭环成功率指标的定义与统计显著性有待进一步说明。
论文Xiaowei Cai2026-08-17原文

相关内容