VisualPatchWorld: Code World Models as Latent Structured Representations for Planning
不同研究线路对“世界模型”的定义各异,但共同目标是以支持感知、模拟和规划的形式捕捉世界在动作下的演化。两种典型实现是神经预测器(在连续向量空间中学习动力学)和手工物理引擎(暴露显式状态与物理定律)。前者从数据中可扩展但动力学形式隐式;后者可检查可编辑但难以大规模构建。 本文提出 VisualPatchWorld (VPW),将世界动力学表示为代码。首先通过短主动探测选择定性动力学形式,然后从记录的状态-动作轨迹中通过最小化多步预测误差拟合该形式的自由参数。生成的程序可像模拟器一样前滚、以源代码形式检查,并用于模型预测控制 (MPC);图像派生的场景图可在重规划时提供实时状态。 与先前基于代码的世界模型相比,VPW 平均规划成功率达 69.0%,超过最强代码基线 23.5 个百分点。最大增益出现在需要正确选择定性动力学的场景。在相同规划器下,诱导模型在导航和抓取丰富控制中接近真实引擎成功率;在接触丰富的推动任务中仍存在残余差距,但检查引擎中的候选计划可填补大部分差距。 实验结果确立了自动构建对规划有用的代码世界模型的实用途径。代码开源于 https://github.com/HKBU-KnowComp/VisualPatchWorld/。
论文精读
TL;DR VisualPatchWorld 将世界模型编译为可执行代码,通过主动探测自动选择动力学结构并拟合参数,实现可解释、可编辑的规划模型,在规划成功率上大幅领先现有代码世界模型。
问题
问题背景
世界模型是机器人规划与决策的核心,它捕捉环境动态随动作的演化方式。当前主流路线分为神经隐式动态模型和手工物理引擎,二者在可扩展性与可解释性之间难以兼顾。
现有方法局限
神经预测器(如 DreamerV3, TD-MPC)能从大量数据中泛化,但其动态表示以隐式向量形式存在,无法进行符号级调试、修改或注入先验知识。手工引擎(如 MuJoCo, Bullet)虽可解释,但构建和校准需专业领域知识,且难以自动适配新场景。基于代码的世界模型(如 WorldCoder, POMDP-Coder)尝试从轨迹中诱导可执行程序,但存在两大瓶颈:
- 结构选择依赖手绘草图:需要人工提供定性动态形式(如接触模式、运动学链),无法自动发现正确的物理抽象。
- 参数拟合不稳定:单步预测优化易导致长期 rollout 误差累积,且对接触丰富任务(如推动)缺乏鲁棒性。
挑战与重要性
将世界动态表示成代码本质是一个离散结构搜索与连续参数优化的联合问题。结构空间组合爆炸,主动探测以区分不同物理假设(如静止 vs. 滑动摩擦)需要智能探索;参数拟合必须考虑多步预测误差,对非光滑接触等动力学尤为敏感。突破这一问题,将催生可审计、可编辑、可迁移的世界模型,对安全关键型机器人及 sim-to-real 迁移具有重大价值。业界正寻求“像写代码一样构建物理直觉”的途径。
行业类比
如同自动驾驶从纯端到端黑盒逐步引入可解释规划模块(行为树、规则引擎),VisualPatchWorld 将物理常识编译为可执行代码,兼顾数据驱动效率与工程师友好性。
核心洞察
- 代码世界模型将动力学表示为可执行程序,提供显式结构化表示,使规划器能直接利用符号动力学进行推理,这与隐式神经潜变量形成根本差异。VPW 生成的代码程序可像模拟器一样前向滚动,支持模型预测控制,且源代码可检查、可编辑,提升了可解释性与可靠性。相比神经预测器将动力学子以黑盒形式隐含在连续向量中,VPW 在规划时能更高效地利用环境结构,尤其在需要正确定性动力学的任务中优势显著。
- 主动探测驱动的结构选择是 VPW 超越先前代码基线的关键突破,它解决了从数据中自动推断正确定性动力学形式的难题。以往方法如 WorldCoder 常依赖预先定义的完整结构或启发式,导致动力学模型类别与实际环境不匹配时性能大幅下降。VPW 通过短主动探测验证候选动力学形式,再拟合连续参数,有效减少了结构错配。论文显示,在 Reacher 和 PushT 等任务中,该机制使规划成功率提升 23.5 个百分点,接近真实物理引擎水平,证明了结构化归纳对接触丰富操控任务的核心价值。
方法
输入与整体流程
VPW 以像素级视觉观测与动作序列作为输入,目标是自动构建一个可执行的代码世界模型,用于后续的模型预测控制 (MPC)。整个过程分为四个阶段:视觉抽象、轨迹导出、两级程序归纳与规划协议。
关键模块:从感知到可执行代码
Stage 1:视觉抽象
从原始图像中提取结构化的场景图(scene graph),包含物体、属性、关系等符号化表示。这一步将连续视觉信号转化为离散、可解释的状态描述,为后续代码生成提供稳定的符号基础。
Stage 2:轨迹导出
基于交互数据记录的状态-动作序列,将场景图随时间的变化整理为轨迹数据集,供动力学学习使用。
Stage 3:两级程序归纳
VPW 的核心是将世界动力学表示为 Python 代码片段(称为 sketch)。该阶段包含两个子层:
- Level 1:主动探测与草图选择
通过短时主动探测动作(active probing),系统试探环境并选择一个定性正确的动力学代码模板(例如区分是“导航动力学”还是“带接触的推动动力学”)。模板决定了状态演化的函数形式,但包含待定的自由参数。 - Level 2:参数辨识
在选定草图后,利用记录的完整轨迹数据,以多步预测误差最小化为目标,拟合模板中的自由参数(如摩擦系数、几何尺寸等)。这种优化方式使得生成代码在长时序推演中更准确。
可选的采集环(acquisition loop)允许在参数辨识后评估模型质量,若不足可追加主动探测并重新选择草图。
Stage 4:规划协议
最终产出的代码模型可以像物理引擎一样前向推演,支持在源码层面检查和编辑。规划阶段使用交叉熵方法(CEM)等优化器,在模型内部进行 rollout 搜索,并将图像实时输入的场景图作为重规划时的状态观测。
输出与应用
VPW 输出的是一个可执行、可审阅、可编辑的 Python 程序,该程序完整描述了环境的动力学。相比纯神经预测器,其行为逻辑透明;相比手工物理引擎,它从数据中自动构建,无需人工设计。在导航、灵巧操控等任务中,该代码模型可通过同一 MPC 框架直接用于规划决策。
与同类方法的差异点
VPW 首次将“定性结构选择”(通过主动探测获取类别级动力学模板)与“定量参数拟合”有机结合,解决了纯神经模型隐式不可解释、纯符号方法手工建模成本高的矛盾,实现了规划性能与可解释性的统一。
实验
实验设计
VPW 在Reacher、PushT、Cube 和Navigation 四个环境上评估。所有环境提供少量演示轨迹(状态-动作序列),不依赖深度强化学习预训练。方法分四阶段:1) 从图像提取场景图,2) 从轨迹导出结构化数据,3) 通过主动探测选择定性动力学骨架,再以多步误差最小化拟合参数,4) 用诱导的代码世界模型进行模型预测控制 (MPC)。基线包括PatchWorld、WorldCoder、POMDP-Coder、PoE-World 等代码世界模型,以及神经网络预测器和离线 RL。
关键发现
VPW 在四种环境下平均规划成功率达 69.0%,比最强代码基线高23.5 个百分点。提升主要来自正确的定性结构选择:当任务需要明确的接触或运动学类别时,VPW 的主动探测能准确识别,而固定骨架的基线严重失败。在导航和抓取为主的Cube 上,诱导模型性能已逼近真实物理引擎;在接触丰富的PushT 上,单纯 MPC 仍有残余差距,但通过混合评分(引擎验证少量候选计划)可将大部分差距闭合。
基线对比解读
VPW 与基线的最本质区别是将结构选择显式化:基线如 WorldCoder 试图直接学习神经-符号混合程序,但定性形式固定或搜索受限,导致在错误结构下优化参数无效。VPW 用短时主动交互快速锁定正确骨架,而后参数识别仅需少量轨迹。这解释了为何在Reacher(运动学歧义)和PushT(接触模式)上 VPW 大幅度领先。剩余差距主要出现在需要精细接触推理的场景,表明单纯代码级抽象仍难以完全替代物理引擎的连续碰撞检测,但作为自动构建的符号规划前端已显示出实用前景。
行业影响
落地场景
VisualPatchWorld (VPW) 通过从视觉观测中自动归纳可执行的代码世界模型,为机器人操作、自动驾驶仿真、仓库自动化等需要环境动力学预测与规划的产品提供直接支持。其方法不依赖手工构建的物理引擎,而是从数据中学习结构化程序,特别适合以下业务:
- 机器人抓取与灵巧操作:在物流分拣、装配线上,VPW 可基于视觉场景图在线重建物体动力学模型,用于模型预测控制 (MPC),提高对新物体的适应能力。
- 具身智能仿真器:为视频游戏 NPC、虚拟训练环境自动生成可解释的物理规则,替代部分手工编码的物理引擎。
- 自动驾驶交通 Agent 建模:从感知轨迹中归纳他车行为代码,用于运动规划与交互仿真。
商业价值
VPW 围绕 降本增效 提供清晰的价值路径:
- 降低模型构建门槛:传统仿真器需要领域专家数月开发,VPW 从交互数据中小时级自动产生可运行、可编辑的动力学代码,极大缩短部署周期。
- 提升规划成功率:在 5 个视觉操控任务上,VPW 较同期的代码世界模型基线平均高出 23.5 个百分点规划成功率(69.0% 均值),接近真值引擎水平,减少反复实体试错的硬件损耗与时间成本。
- 可解释性带来的信任与维护:生成的代码模型可被工程师直接审查、调试,降低黑盒风险,对安全关键应用(如协作机器人)尤为重要。
与现有产品栈的集成
VPW 可作为模块插入现有的 感知–规划–控制 管道:
- 感知层:接入已有视觉检测/分割模型(如 YOLO、Mask R-CNN)输出的场景图,或直接使用 VLM 产生的 scene graph。
- 世界模型层:VPW 替代传统物理引擎或神经网络预测器,为上层规划器提供
step(state, action) → next_state的代码级接口。 - 规划层:与常用的交叉熵方法 (CEM)、MCTS 等模型预测控制算法兼容,可直接嵌入。
- 部署:形成感知→代码世界模型→MPC 的轻量闭环,支持在线重规划,适合边缘设备部署。
具体案例:
- 物流仓库中的自适应拣选:货物种类频繁变化,传统方法需重新标定动力学参数。VPW 可根据几次随机探针动作在线归纳物体推动或抓取行为的代码模型,结合 RGB 相机重建场景图,立即用于 CEM 规划,显著减少每类 SKU 的定制工作。
- 自动驾驶仿真中的交互 Agent 生成:在主车轨迹规划时,需要大量具有真实行为多样性的背景车辆。VPW 从真实驾驶数据中自动归纳变道、跟车等行为的结构化代码,避免手工编写规则,加速仿真场景构建,提升感知-规划算法的测试覆盖率。
局限
- **动力学草图家族依赖**: VPW 通过主动探测从预定义的草图家族中选择定性动力学形式,这意味着模型只能拟合库中已有的结构,无法发现全新的物理规律或未建模的接触模式。当环境动力学超出预设模板时(如特殊摩擦、弹性形变),程序归纳会失败,这限制了其在开放世界中的泛化能力。
- **接触丰富任务的预测间隙**: 在推物体等接触丰富的控制任务上,VPW 诱导的模型与真实物理引擎之间仍存在不可忽略的误差。虽然混合评分能在引擎中重排候选计划,但本质上要求能访问 oracle 引擎,削弱了从数据自动构建模拟器的优势,且规划成功率受限于评分函数的准确性。
- **主动探测的实际开销**: VPW 的草图选择依赖短交互式探测来获取定性信号,这在某些实际系统中可能代价高昂或不允许(如安全关键系统、真实机器人硬件磨损)。即使探测序列很短,大规模部署时累积的数据收集与评估成本仍可能显著,且离线静态数据集无法直接利用这一机制。