论文

代码即世界:面向物理推理的可执行世界表征的智能体发现

代码即世界:面向物理推理的可执行世界表征的智能体发现

物理理解与推理依赖于对世界形成紧凑且可泛化的表征。尽管现代视觉语言模型能够识别和解释多样的物理事件,但它们往往缺乏对底层机制的显式表征(如物体状态、物理参数及控制动力学),因而难以可靠地推理世界如何演化及对干预如何响应。 为此,我们提出 Code-as-World 范式,通过 可执行世界表征 来刻画物理世界。它将物理组成、动态演化与视觉外观表达为可执行代码,提供紧凑、定量且可控的物理世界抽象。为从多模态观测(如自然语言描述或真实视频)中构建此类表征,我们受溯因推理启发,开发了 智能体发现循环:智能体持续提出、执行、渲染、验证并迭代精炼可执行世界假设。 作为具体应用,我们利用验证过的可执行世界为视觉语言模型提供可扩展的物理监督,以训练其进行定量物理推理。实验表明,Code-as-World-VL 在 QuantiPhy 基准上达到最先进性能,并超越领先的专有模型,凸显了可执行世界表征作为物理智能可扩展基础的潜力。

论文精读

TL;DR Code-as-World 将物理世界表示为可执行代码,通过 agentic 发现循环构建可验证的世界表示,为 VLM 提供可扩展的物理监督,在 QuantiPhy 上取得 SOTA。

问题

问题背景

物理理解和推理依赖紧凑、可泛化的世界表征。当前视觉语言模型(VLM)虽能识别和解释物理事件,但缺乏对底层机制——对象状态、物理参数、动力学——的显式表征,难以可靠推理世界演化与干预响应。

现有方法局限

主流世界表征形式存在明显短板:

  • 像素级表征:不可执行,难以解耦物理变量,无法进行定量推演;
  • 3D 表征:侧重几何结构,忽略动力学与因果关系;
  • 自然语言描述:语义粗糙,无法支撑精确的物理计算。

因此模型常出现“能描述但不能计算”的问题,例如无法准确回答碰撞后速度、物体稳定条件等定量问题。

为什么这个问题难/重要

构建可执行且可控的世界表征需同时满足紧凑性、定量准确性与泛化性,并需从多模态观测(文本/视频)中自动发现。执行、渲染、验证、迭代的闭环涉及视觉、物理引擎与符号推理多系统协同,技术挑战大。随着具身智能和机器人仿真需求增长,可执行世界模型成为规模化物理监督的重要途径,业界关注度持续上升。

行业类比

类似自动驾驶中需要高保真仿真环境生成训练数据,Code-as-World 通过可执行代码表征物理世界,为 VLM 提供可验证的物理监督与定量推理能力。

核心洞察

  • 可执行世界表示将物理场景编码为代码,使对象状态、物理参数与动力学显式化,弥补了像素或语言表示与物理机制之间的鸿沟。与传统视觉语言模型直接映射输入到答案不同,Code-as-World 提供可解释、可干预、可验证的中间抽象,能支持定量推理与反事实干预评估,这是现有 end-to-end 方法无法直接实现的。
  • Agentic discovery loop 采用溯因推理,通过提出、执行、渲染、验证、迭代细化来构建世界代码,从自然语言描述或视频中自动发现物理规则与参数。相比依赖人工标注或静态合成数据的范式,该闭环机制能够在交互中修正假设,显著降低精确物理监督的获取成本,并提升表示与真实世界的保真度。
  • 利用验证后的可执行世界生成大规模物理监督,用于训练视觉语言模型进行定量物理推理,绕过了人工标注瓶颈。与现有视频-文本预训练数据不同,这些监督信号源于可执行引擎的精确仿真,具备物理一致性,使 Code-as-World-VL 在 QuantiPhy 上超越专有模型,展示了可执行世界作为物理智能可扩展基础的能力。

方法

输入与表示构建

Code-as-World 的多模态输入包括自然语言描述或真实视频。核心是把物理世界编码为三段式可执行代码:物理组成(对象、状态、参数)、动态演化(物理引擎/运动方程)、视觉外观(渲染配置)。这些代码片段组合成一个可执行世界模拟。

关键模块:Agentic Discovery Loop

发现过程采用基于溯因推理的智能体循环,包含以下步骤:

  1. 提出假设:智能体根据输入生成候选世界代码。
  2. 执行与渲染:运行代码得到模拟轨迹与图像。
  3. 验证:将渲染结果与原始观测(文本描述或视频帧)对齐,计算一致性。
  4. 细化:根据反馈迭代修改代码,直至满足保真度指标。

该循环可自动从 文本驱动世界构建 或 视频驱动世界抽象 中提取紧凑世界表示,并输出经过验证的可执行世界。

输出与应用

输出为可直接运行的世界代码,不仅作为可解释的物理抽象,还用于生成规模化物理监督:将验证过的世界与图像空间测量对齐,校准世界空间物理参数,进而训练视觉语言模型在定量物理推理任务(如 QuantiPhy)上达到 SOTA。

与同类工作的差异:不同于基于像素、3D 点云或自然语言的隐式/静态表示,Code-as-World 用可执行代码提供显式、定量、可控的世界抽象,并借助自举式发现循环持续扩展监督来源。

实验

实验设计

论文围绕 Code-as-World 范式展开,核心实验分为两阶段:agentic discovery loop 构建可执行世界表示,以及利用这些表示训练 Code-as-World-VL 进行定量物理推理。在构建阶段,从自然语言描述和真实视频两条路径生成世界假设,通过执行、渲染和验证循环迭代优化。评估可执行世界保真度时,采用 视觉对齐、对象 IoU、轨迹保真度 等指标。下游任务在 QuantiPhy 基准上评测定量物理推理能力,该基准包含多种运动学类别。训练流程包括图像空间测量接地和世界空间物理校准,以生成可扩展的物理监督信号。

关键发现

实验结果证明 Code-as-World-VL 在 QuantiPhy 上达到 state-of-the-art,并超越多个领先专有模型。这表明可执行代码表示能够为物理推理提供精确的定量监督,弥补纯视觉语言模型在物理机制理解上的不足。Agentic discovery loop 生成的 world hypotheses 经渲染验证后,可作为高质量物理模拟数据来源,支持 VLM 在推理时捕捉对象状态、物理参数和动力学演化。该方法还展示了从真实视频中抽象出可执行世界的能力,增强了模型的泛化性。

与基线对比解读

与直接使用视觉语言模型或专有 API 的基线相比,Code-as-World-VL 的优势在于显式建模物理机制:代码表示不仅描述视觉外观,还编码了对象构成与动态规律。这种结构化表示使模型在 QuantiPhy 等定量基准上更可靠,避免了传统模型只能做定性判断的缺陷。虽然摘要未提供具体数值提升,但 surpassing leading proprietary models 的结论提示该范式在物理智能方向上具备 scalable 潜力。后续若公开算力与数据规模,可进一步验证其边际收益。

行业影响

落地场景

Code-as-World 可落地于需要物理合理性推理与可执行仿真的产品:

  • AR/VR 电商:家具摆放、服装试穿时评估物理交互(碰撞、重力、遮挡)。
  • 自动驾驶仿真:从真实视频抽象出可执行世界模型,生成 corner case 训练数据。
  • 机器人操作:将操作场景表示为可执行代码,用于策略预训练或 sim-to-real 迁移。
  • 内容平台:为视频生成模型提供物理一致性监督,减少“反物理”错误。

商业价值

  • 降本:替代人工标注物理事件(如碰撞、倾倒),用代码渲染自动生成无限带标签数据。
  • 增收/体验:提升模型物理推理能力,直接改善电商 AR 试用转化率、自动驾驶安全测试覆盖率。
  • 加速迭代:agentic discovery loop 自动化构建世界表示,缩短仿真环境搭建周期。

与现有工作流集成

  • 作为 数据合成引擎:将 Code-as-World 生成的 image-space 标注与 world-space 物理参数,接入现有 VLM 微调 pipeline(如 LoRA 或 full fine-tuning)。
  • 作为 推理模块:在 MLLM agent 中加入可执行代码验证环节,对物理问题输出定量答案前先运行仿真校验。
  • 与 仿真器(如 MuJoCo、Bullet)互补:Code-as-World 提供高层抽象,仿真器负责精确动力学。

具体 use case

  1. 电商虚拟家居:用户上传房间照片,系统用 Code-as-World 从照片和文本描述中抽象出可执行世界表示,实时模拟家具摆放后的稳定性、空间冲突与光照,提升购买转化。
  2. 自动驾驶数据闭环:从真实路测视频中提取可执行世界代码,对场景参数(速度、距离、遮挡)进行扰动,生成大量边缘案例用于训练端到端模型,降低实车采集成本。

局限

  • **可表示物理范围有限**:当前 `Code-as-World` 的可执行世界主要基于刚体动力学和简单几何体,对流体、软体、颗粒物质、断裂等复杂物理现象难以编码;即使使用抽象代码,底层物理引擎(如 PyBullet)通常只支持有限的物理材质和交互类型。这导致从真实视频或文本构建的世界表示偏向于理想化场景,无法覆盖开放世界中的多样物理行为。原文 7.1 节也承认需扩展至更广泛的物理现象,因此当前方法在通用物理智能上的泛化能力受限。
  • **依赖模拟引擎的准确性与 sim-to-real gap**:代码世界需要底层物理引擎执行仿真,引擎的数值精度、碰撞处理、参数标定直接影响生成数据的质量。尽管作者在 B.1 节做了视觉对齐和轨迹保真度评估,但模拟环境与真实物理之间仍存在系统性偏差,例如摩擦系数、恢复系数等难以从图像中精确估计。因此,用仿真数据训练 VLM 定量推理时,模型可能学到引擎特有的偏差,在真实世界数据上性能下降。该局限未被完全解决,仅通过 sim-to-real evaluation 部分缓解。
  • **Agentic discovery 的计算开销与可扩展性**:agentic 循环需要多次迭代:生成代码、执行渲染、视觉验证、物理校准,每一步都需调用大语言模型或视觉模型以及渲染引擎,计算成本高。论文未详细给出单次构建所需的 GPU 时或 token 消耗,但视频驱动的抽象尤其昂贵。此外,验证环节依赖 VLM 或检测器的判断,可能引入错误反馈,导致循环不稳定或收敛慢。这限制了该框架在大规模、低成本构建物理监督数据方面的实际可扩展性,与作者宣称的可扩展监督存在差距。
论文Hanyang Wang2026-08-27原文

相关内容