论文

像世界模型一样思考,像 VLA 一样行动:把世界模型表征蒸馏进紧凑机器人策略

像世界模型一样思考,像 VLA 一样行动:把世界模型表征蒸馏进紧凑机器人策略

Vision-Language-Action (VLA) 模型将观测直接映射为动作,目标函数并不建模世界如何响应,鲁棒性因此主要受数据覆盖范围限制。世界模型 恰好携带这一缺失的目标,grounding 更强,但逐步推演未来需要每次决策数秒,无法进入控制回路。 两者其实可以分离:世界模型对物理场景的认知存在于其内部特征中,生成未来只是产出这些特征的目标,因此可以继承 grounding 而丢弃生成机制。方法是在普通 VLA 训练中加入一个 特征对齐 项:冻结的世界模型在训练帧上运行一次并缓存,学生模型学习与该缓存保持一致。训练时无需加载教师,投影器用完即弃,部署的策略与未蒸馏基线完全一致,在消费级 RTX 5090 上以 32 ms、1.86 GB 运行。 实验方面:0.8B 学生模型在 LIBERO 上达到 97.9%,RoboCasa-GR1 人形操作从 48.2% 提升到 50.5%,同一目标也迁移到真机,覆盖单臂与双臂平台。 该增益在学生规模、backbone、对齐层与教师模型变化下均能保持,说明这是一种广泛的表征先验,而非两个特定网络之间的脆弱对齐。

论文精读

TL;DR 把世界模型的场景理解蒸馏进 VLA 表征:训练时对齐冻结世界模型的特征缓存,部署时不增加任何计算,让学生策略获得物理一致性先验,在 LIBERO 等基准上显著提升鲁棒性。

问题

问题背景

机器人操作领域正从Vision-Language-Action (VLA) 模型直接映射观测到动作,向利用世界模型理解物理动态演进。当前关注点是如何在不牺牲实时性的前提下,让策略具备对场景响应的内在理解。

现有方法局限

主流 VLA 训练目标仅最小化动作预测误差,完全忽略动作执行后环境将如何变化。这导致两个具体缺陷:

  • 数据覆盖依赖严重:模型只能从见过的轨迹中插值,遇到分布外状态(如物体滑动、光照变化)时缺乏物理先验,动作可能不符合真实动力学约束。
  • 世界模型无法闭环:直接在世界模型中滚动未来虽然能提供grounding,但单次决策成本高达数秒,且需额外 GPU 算力,在 30–60 Hz 控制回路中完全不可行。

同时,现有World Action Model 或测试时规划方法要么增加推理延迟,要么需要在线访问教师网络,部署沉重。

技术挑战与重要性

核心难点在于:世界模型内部特征包含场景几何、物体关系、动力学先验,但这些知识隐含在生成式训练目标中,难以直接迁移到判别式策略;并且跨架构(如 Transformer 与 CNN backbone)表示对齐容易出现特征坍缩或过拟合特定教师。

该问题对行业价值显著:机器人基础模型若要走出实验室,必须同时满足低延迟、轻量部署、物理鲁棒性三项约束。本文提出的离线蒸馏方案首次证明可以将世界模型表示压缩进 0.8B 参数策略,且不改变推理结构,直接适用于真实单臂与双臂平台。

行业类比

类似自动驾驶中利用离线 4D 占用网络蒸馏出轻量实时检测头:用昂贵的生成式先验一次性训练,部署时只保留判别式学生,既获得语义/物理一致性,又不增加边缘设备算力。

核心洞察

  • 世界模型的物理先验可以与其生成机制解耦,通过特征对齐蒸馏注入 VLA 策略,在不增加推理开销的前提下提升鲁棒性。与 `World Action Models` 在线生成未来(秒级延迟)不同,该方法只运行一次冻结世界模型并缓存特征,训练时用单一特征对齐项蒸馏,部署模型与 baseline 完全一致(32 ms、1.86 GB),增益源于表征先验而非额外容量或测试时计算。
  • 通过 cached 特征对齐实现表征级知识迁移,而非改变动作分布或网络结构,因此跨学生规模、backbone、alignment layer 和教师均有效。相比让大模型教师参与推理或依赖生成结果,这种训练期一次性蒸馏是低成本领域自适应:教师只在训练前运行一次,训练中无需加载教师,最终策略与 baseline 结构相同,增益完全归因于学到的世界模型表征,适合消费级硬件上的机器人策略增强。

方法

方法核心:分离“世界知识表示”与“未来生成”

输入为机器人观察(RGB 图像)与语言指令,输出为动作指令。学生 VLA 模型(如 0.8B 参数)在常规行为克隆目标之外,增加一项表示对齐损失。

  1. 教师特征预计算与缓存
    使用冻结的世界模型 Cosmos3-Nano,对训练集中的每一帧只运行一次前向,提取其内部中间层特征并缓存到磁盘。教师不参与梯度更新,训练时也无需重新加载。

  2. 学生投影与对齐
    在学生 VLA 的视觉编码器之后插入一个轻量 投影头(MLP),将学生特征映射到与缓存特征相同的维度。对齐损失采用回归形式(如均方误差或余弦相似度),强制学生中间表示逼近世界模型对物理场景的隐式编码。该投影头仅在训练阶段存在。

  3. 训练与部署解耦
    训练完成后,丢弃投影头,学生 VLA 恢复为原始架构。部署时推理路径与未蒸馏基线完全一致,不存在额外延迟或显存占用。论文报告在消费级 RTX 5090 上运行 32 ms、占用 1.86 GB。

该方法继承了世界模型的物理接地性(对物体、接触、因果的隐式理解),却无需在控制回路中展开未来预测。与直接使用世界模型做动作选择(如 World Action Model)相比,THAW 只蒸馏表示、不蒸馏生成器,因此保持实时性;与教师-学生策略蒸馏相比,它对齐的是世界模型特征而非教师动作分布,提供更通用的先验。

实验

实验设计

论文在三个层面验证 THAW-VLA:LIBERO 基准、RoboCasa-GR1 人形操作、以及真实机器人单臂和双臂平台。学生模型为 0.8B VLA,训练时用冻结的 Cosmos3-Nano 对训练帧预计算表征并缓存,然后仅增加特征对齐项。部署时丢弃投影器,保持与 undistilled baseline 完全相同的推理开销。

关键发现

在 LIBERO 上达到 97.9% 成功率;RoboCasa-GR1 从 baseline 的 48.2% 提升到 50.5%。真实硬件上单臂和双臂任务均有效。增益对 student scale、backbone、alignment layer、teacher 的变化保持稳健,说明是广泛适用的表征先验。推理延迟 32 ms、显存 1.86 GB,在消费级 RTX 5090 上运行,所有增益均归因于表征改善,而非额外容量或测试时计算。

与基线的深度对比

相比在线使用 world model 进行规划的方法,THAW-VLA 将 world model 的物理 grounding 蒸馏进策略表征,避免逐决策生成未来,因此部署成本与普通 VLA 相同。这一设计验证了表征蒸馏在机器人策略中的实用价值:不需要牺牲实时性即可获得更强的场景理解。

行业影响

落地场景

该方法可直接用于机器人操作与自动驾驶等具身智能产品。例如电商仓储分拣中,物流机器人需在动态环境中稳定抓取,THAW-VLA 能在不增加推理延迟的前提下提升对物理扰动的鲁棒性;服务机器人(清洁、配送)也能受益于更好的场景理解,减少误操作。

商业价值

核心降本路径是减少数据采集与标注:世界模型表征提供了对物理规律的先验,使策略在有限演示数据下仍能泛化,降低研发阶段的数据成本。同时部署成本不变——推理仍为 32 ms / 1.86 GB 量级,可直接运行在消费级 GPU,无需为鲁棒性升级硬件。对于需要快速迭代的机器人产品,训练时只需额外缓存教师特征,不引入运行时开销,商业上可缩短上市周期且避免算力支出膨胀。

与现有工作流的接口

集成方式极简:在现有 VLA 训练损失中加入一个特征对齐项,训练前用冻结世界模型(如 Cosmos3-Nano)对训练帧提取一次特征并缓存,训练时加载缓存即可,推理阶段完全丢弃投影层。这一设计使得该技术可作为即插即用的插件嵌入现有 VLA 训练管线(如基于 OpenVLA、RT-2 的框架),无需修改部署推理代码或模型架构。实际工程中,团队可先将该方法作为正则项加入已有策略微调,在 LIBERO 等基准上验证增益后再迁移到真实硬件,风险极低。

具体 use case:1)电商仓储机器人在货架密集场景中抓取商品,利用表征对齐减少对复杂物理交互(如推挤、滑动)的误判;2)自动驾驶末端规划中,低速园区配送车可基于该策略处理行人突然闯入等事件,保持实时响应。

局限

  • 对世界模型的质量高度依赖:方法收益取决于所蒸馏世界模型(Cosmos3-Nano)的表征是否真正编码了物理规律和场景理解,但世界模型自身存在偏差或盲区时,对齐可能继承错误先验;且论文未探索多 teacher 或更大规模世界模型的影响,也未讨论如何选择或验证 teacher 表征的有效性。
  • 实验范围有限:主要基准为 LIBERO 和 RoboCasa-GR1 仿真任务,真实机器人仅验证了单臂和双臂平台,但任务数量少、操作类型简单;尚未在更复杂的长程操作、移动操作或非刚性物体任务上验证,泛化性存疑;另外,性能提升幅度不大(RoboCasa 仅提升 2.3 个百分点),在实际应用中可能有限。
  • 静态表征对齐可能丢失时序动态信息:仅对齐当前帧的特征,没有利用世界模型对未来状态的预测能力,可能遗漏了与动作后果相关的动态先验,限制了策略对长期因果关系的把握;且对齐层在训练后丢弃,部署模型与基线相同,无法在推理时利用额外时序信息。
论文Trung Dao2026-09-21原文

相关内容