论文

RoboTTT: 机器人策略的上下文缩放

RoboTTT: 机器人策略的上下文缩放

现有机器人基础模型通常仅使用单步或短历史视觉运动上下文。本文提出 RoboTTT(Test-Time-Training Robot Policies),一种机器模型与训练方案,可将视觉运动上下文扩展到 8K 时间步,比现有最优策略提升三个数量级,且不增加推理延迟。在该上下文长度下,我们解锁了新能力: - 一次性上下文模仿:从人类视频演示中直接模仿; - 即时策略改进:在线优化行为; - 鲁棒性:应对扰动; - 多阶段长周期任务:性能更强。 我们还首次观察到,随着预训练上下文长度增加,闭环性能稳步提升。核心上,RoboTTT 将 测试时训练 集成到机器人基础模型(如视觉-语言-动作策略)中,得到一种序列模型,其循环状态由 快速权重 组成——这些参数在训练和推理期间通过梯度下降更新,将历史压缩为权重空间并检索上下文信息以进行长上下文条件化。为扩展训练上下文长度,方案结合了 序列动作强制 与 截断时域反向传播。 在挑战性的真实机器人操作任务上,RoboTTT 相比单步上下文基线将整体性能提升 87%,并完整完成一项五分钟、十阶段的组装任务(基线从未完成)。使用 8K 时间步 上下文训练的 RoboTTT 比同模型使用 1K 时间步 预训练的性能高出 62%,表明上下文长度可作为机器人基础模型的新缩放轴。视频见 https://research.nvidia.com/labs/gear/robottt/

论文精读

TL;DR RoboTTT 将测试时训练融入机器人基础模型,把视觉运动上下文扩展至 8000 步(提升千倍),首次展示上下文长度的 scaling 收益,大幅提升长程任务性能且不增加推理延迟。

问题

问题背景

机器人基础模型正逐步从单步反应式控制走向具备长程记忆的自主操控,但上下文长度的扩展仍处于早期探索阶段。当前业界焦点在于构建能够整合多模态历史信息的策略,以应对真实世界中复杂的多阶段任务。

现有方法局限

主流机器人策略(如扩散策略、Transformer 策略)仅使用单步或极短历史(通常 < 100 步)的视觉运动上下文进行决策。这导致两大技术缺陷:

  • 信息遗忘:无法保留与当前操作相关的远距离事件(例如若干步前的物体移动轨迹),在需要回溯的纠错或重试场景中表现脆弱。
  • 被动适应:无法从上下文中自发展地模仿或修正行为,缺乏 few-shot 学习能力。

即使部分工作引入长序列建模,也因推理延迟与训练复杂度而难以实用化。例如,直接堆叠历史帧会线性增加计算量,破坏实时控制需求。

为什么这个问题难/重要

将上下文从 10 步扩展到 10K 步,面临计算与记忆的根本矛盾

  • 在线推理要求低延迟,但长上下文通常意味着巨大的 KV 缓存或状态膨胀。
  • 长序列中的梯度传播、记忆压缩与稳定性都是开放挑战。

然而,解决该问题能赋予机器人前所未有的能力:

  • 一次性上下文模仿:从单个人类演示视频中即时学习新技能。
  • 在线策略改进:根据近期失败自动调整动作。
  • 长周期任务完成:多阶段装配等任务需要持续的上下文关联。

这类似于大语言模型中上下文长度扩展带来的 emergent abilities,将其引入机器人领域有望成为新的 scaling axis,因而受到产学研广泛关注。

行业类比

如同语言模型通过扩展上下文窗口实现 in-context learning 与长文档理解,机器人策略的上下文扩展有望将操作能力从简单抓取提升到具有记忆与适应性的长程任务执行。

核心洞察

  • 上下文长度成为机器人基础模型性能的新扩展轴。RoboTTT 首次证明,将 visuomotor 上下文从单步或短历史扩展到 8K timesteps,不仅解锁了 one-shot in-context 模仿等新兴能力,而且闭环性能随预训练上下文长度单调提升,8K 上下文模型比 1K 高 62%。这与以往仅关注模型参数量或数据规模的扩展范式不同,揭示了类似 LLM 的 scaling law,为机器人预训练提供了新方向。
  • Test-Time Training 的快速权重实现无损长上下文条件化。RoboTTT 将历史观测和动作压缩为梯度更新的快速权重,作为序列模型的递归状态,从而在恒定推理延迟和内存下检索 8K 上下文信息。这突破了 Transformer 注意力机制随序列长度二次增长的计算瓶颈,以及传统 RNN 的记忆衰减问题,使得长期依赖学习不再以牺牲实时性为代价。

方法

输入与输出

RoboTTT 的输入是长序列视觉运动上下文(最长 8K 时间步),每个时间步包含多视角图像与末端执行器状态;输出为当前动作预测,推理延迟不随上下文长度增长。

核心模块:TTT 层与快速权重

模型基于 Vision-Language-Action (VLA) 架构,关键创新是集成 Test-Time Training (TTT) 层。

  • TTT 层将上下文历史压缩为一组快速权重 (fast weights),作为序列模型的循环状态。
  • 快速权重在训练和推理时均通过梯度下降在线更新,本质上是将过去的观测-动作映射关系编码到权重空间,形成可检索的上下文记忆。
  • 这种设计避免了显式存储所有历史帧,实现固定大小的循环状态,从而在 8K 时间步下不增加推理计算量。

训练策略:扩展上下文长度

为高效训练极长序列,RoboTTT 采用两项训练技巧:

  • 序列动作强制 (sequence action forcing):训练时强制模型基于当前历史预测下一步动作,强化时间因果性,使梯度信号更集中地流向与动作相关的上下文。
  • 截断的时间反向传播 (truncated BPTT):将梯度传播限制在固定窗口内,显著降低长序列训练的内存与计算开销,使 8K 上下文的端到端训练成为可能。

上下文利用与能力涌现

长上下文使模型能够执行单步人类视频模仿:从一段人类演示中立即提取任务逻辑,无需微调;同时支持在线策略改进——边执行边根据近期失败调整行为,以及对扰动的鲁棒性和多阶段长周期任务的全完成。实验表明,随预训练上下文长度增加,闭环性能持续提升,上下文长度成为机器人基础模型的新缩放轴

与同类方法的差异

与固定窗口历史或 Transformer 注意力机制的策略不同,RoboTTT 通过可学习的快速权重压缩任意长度历史,上下文扩展三个数量级而不牺牲推理速度,首次在真实机器人上验证了 8K 时间步上下文带来的质变能力。

实验

实验设计

本文在 真实机器人 多阶段、长周期操作任务上评估 RoboTTT,重点关注上下文长度缩放的影响。基线包括:

  • 单步上下文策略:只使用当前观察进行动作预测。
  • 短上下文策略:使用 1K 时间步的上下文预训练。 主要测试场景涵盖扰动鲁棒性、人类视频一次性上下文模仿以及长达十分钟的十阶段装配任务。

关键发现

  • 上下文缩放带来持续收益:首次观察到,随着预训练上下文长度从 1K 扩展至 8K,闭环性能持续提升。8K 上下文模型 比同结构的 1K 模型性能高出 62%
  • 新能力解锁:RoboTTT 能够从单次人类演示视频中 进行上下文模仿,并在推理时 即时改善策略
  • 长周期任务突破:在十分钟、十阶段装配任务上,RoboTTT 完全成功执行,而所有基线均未能完成。

与基线对比

单步上下文基线无法利用历史信息,在需要长期一致性和错误恢复的任务中表现差。1K 上下文模型虽优于单步,但仍不足以处理更长的依赖。RoboTTT 通过 测试时训练(TTT) 将历史压缩为 快速权重,在保持推理延迟不变的前提下,将有效上下文扩展至 8K 时间步,从而在整体性能上实现 87% 提升。这表明 上下文长度 可作为机器人基础模型的新缩放轴,与模型大小、数据量并列。

行业影响

落地场景

RoboTTT 将机器人策略的上下文窗口扩展至 8K 时间步,显著提升了长周期、多阶段操作任务的性能。在仓储物流中,适用于货品拣选、打包、装箱等流程,机器人需长时间连续工作并应对物品摆放变化;在精密装配中,可处理多达十阶段的复杂组装,如电子设备或机械部件装配,容忍操作中的意外扰动并即时调整。此外,服务机器人在执行递送、清洁等长任务时,能从一段人类演示视频中一次性学习新技能,无需重新收集大量示教数据。

商业价值

RoboTTT 的核心价值在于大幅缩短机器人部署周期,降低对大规模标注示教数据的依赖,从而减少编程与调试成本。其从人类视频中一次性模仿学习的能力,使非专家用户也能快速教导机器人,拓宽了自动化应用的客户群。更长的上下文记忆和在线策略改进能力,让机器人在面对动态变化时保持鲁棒,减少人工介入和停机时间,直接提升运营效率和设备利用率。在竞争激烈的自动化市场中,这为机器人即服务(RaaS)或设备销售提供了更高的可靠性和更快的投资回报。

与现有产品/工作流的接口

RoboTTT 作为策略模型,可嵌入现有的机器人软件栈。在感知层面,它接收多模态视觉输入,可与主流视觉编码器(如 ViT)无缝对接;在规划层面,其输出的动作指令可直接驱动机械臂,兼容 ROS 等中间件。由于推理时仅需单步前向传播(快速权重已压缩历史),延迟并未增加,便于部署在边缘设备(如 NVIDIA Jetson)上,与现有基于 Transformer 或扩散策略的抓取系统共存。模型权重可以通过标准 ONNX 或 TensorRT 优化,集成到现有 MLOps 流程中。

具体落地场景举例

  • 电商仓储:面对每天变动的商品 SKU,部署 RoboTTT 的拣选机器人仅需操作员提供一次完整操作演示,即可掌握新商品的抓取与包装策略,无需工程师反复调参。在订单高峰期,机器人能自主应对包装材料撕扯或物品滑落等扰动,保持连续作业,将平均任务完成率从基线提升 87%。
  • 3C 电子装配:某工厂需装配包含 10 个步骤的电路板组件。RoboTTT 策略能记住整个装配序列,并在零件定位偏差或操作失误时,利用在线更新快速恢复,将首次成功完成长周期的任务变为常态,突破以往基线均无法完成的瓶颈。

局限

  • **计算与存储开销**:RoboTTT 在推理时需通过梯度下降更新快速权重(fast weights),虽未大幅增加单步延迟,但其内部需维护优化器状态与历史梯度信息,对内存和并行计算的效率提出更高要求。在边缘或低功耗机器人平台上,这种持续的内循环更新可能成为部署瓶颈。相较于基于 Transformer 的序列模型(如 RDT、ACT)仅需前向传播,RoboTTT 的计算图动态性更强,不利于硬件加速。
  • **泛化与任务边界**:论文主要展示了在固定任务序列上的长程表现,但在分布外场景(如未见物体、光线变化)下的鲁棒性尚未充分验证。TTT 的上下文压缩本质上是将历史数据编码进权重,若训练数据覆盖不足,模型可能过拟合特定轨迹模式,导致在新环境中策略退化。此外,8K 上下文的缩放效果是否在所有长时任务上均呈单调增益,还是对某些任务饱和甚至负优化,缺乏消融分析。
  • **与强化学习范式的兼容性**:RoboTTT 基于行为克隆和监督学习设计序列动作强迫(sequence action forcing),其上下文学习能力依赖于高质量离线演示数据。在需要在线探索或奖励稀疏的任务中,该方法难以直接嫁接强化学习算法。相比其他 foundation model(如 GATO、RoboCat)试图统一多模态任务,RoboTTT 对演示数据的依赖限制了其自主能力提升的上限。
论文Yunfan Jiang2026-07-16原文

相关内容