Recursive Code World Models:通过 Recursive Scene Programs 构建复杂世界
Code world models 将世界表示为可执行程序,但仅靠这一表示并不能决定如何构建复杂世界。为此,我们提出 Recursive Code World Models (RCWM),一个从单张参考图像出发、以代码形式重建复杂 3D 世界的框架。 RCWM 将 Recursive Scene Program (RSP) 表示与一个会递归调用自身的构建求解器耦合。RSP 把可执行世界表示为可组合的场景代码,而每次求解器调用都遵循同一套完整流程: 1. 建立整体; 2. 递归重建尚未解析的部分; 3. 回到整体,精修它们的组合方式。 这种 全局—局部—全局 递归让精细尺度结构拥有自己的感知与编辑循环,同时保持全场景的几何与关系。参考对齐视图在层级之间传播共享的相机投影,而父级回访则处理局部精修后浮现的边界、空间关系与共享误差。一个 vision-language coding agent 直接比较参考图像与场景渲染结果,以指导精修、递归下降与返回。 在复杂场景上,RCWM 优于此前基于代码的图像到场景重建方法。消融研究进一步支持递归构建带来的收益,并表明更深的调用可改善更细尺度的重建。RCWM 为从视觉证据构建复杂可执行世界提供了递归构建原则。
论文精读
TL;DR RCWM 用递归场景程序从单张参考图重建复杂 3D 世界为可执行代码,全局-局部-全局递归让细粒度结构获得独立感知与编辑循环,重建质量超越现有代码式方法。
问题
问题背景:当前 3D 场景重建领域正从传统几何重建转向可编辑、可执行的世界表示,例如将场景编码为代码程序,以便后续修改、组合与渲染。
现有方法局限:Code World Models 将世界表示为可执行程序,但构建过程本身缺乏对复杂多尺度结构的系统组织策略。此前基于代码的单图重建方法通常一次性生成完整场景代码,或采用单层全局优化,难以同时保证全局几何一致性与局部细节精细度。对于包含多个物体、遮挡和丰富纹理的场景,这些方法容易在局部区域丢失结构,或在全局组合时出现空间关系错误、边界不自然等问题。
为什么这个问题难/重要:复杂 3D 世界由不同尺度的成分组成,从整体布局到微小附件,单一视角信息有限,需要推断未观测结构,并要求所有尺度都保持正确空间关系。递归构建要求每个子任务共享相机投影、在局部细化后重新审视全局,处理边界和共享误差,这对感知、编码和编辑循环提出较高技术要求。业界对可编辑、可组合的 3D 资产需求持续增长,用于仿真、游戏、数字孪生和具身智能训练环境,因此提升从单张图像构建复杂可执行世界的能力具有实际价值。
行业类比:这一递归构建思想类似于软件工程中从单体架构向模块化递归组件的演进——每个组件独立开发、测试和集成,既保证内部质量,又维持整体系统一致性。
核心洞察
- RCWM 的核心创新在于将复杂 3D 世界建模为 Recursive Scene Program (RSP),并采用递归求解器,每个递归调用都执行完整的“建立整体—重建局部—回到整体精修”循环。这种 global-local-global 递归与现有 code-based 图像到场景重建方法形成根本差异:后者通常采用单次前向生成或简单的分层组合,缺乏对局部细节的独立感知与编辑回路。RCWM 让每个未解析的局部结构拥有自己的 perception-and-editing loop,同时保留全局几何与空间关系,有效缓解了细粒度重建与场景级一致性之间的矛盾。
- RCWM 利用参考对齐视图跨层级传播共享的 camera projection,使得递归子问题中的局部观察与父级场景保持一致的投影关系。这与以往递归或分层重建工作中各层级使用独立相机假设的做法不同,避免了局部重建完成后与全局场景之间出现几何错位。父级在子级返回后重新审视图像与渲染的差异,可专门处理边界、空间关系和共享误差,从而在不牺牲局部精度的前提下保持场景整体的一致性。这一机制为基于视觉证据构建复杂可执行世界提供了可扩展的递归构造原则。
方法
输入与输出
RCWM 的输入为单张参考图像,输出为可执行的 Recursive Scene Program (RSP),即一个组合式场景代码,能够渲染出复杂 3D 世界。
关键模块
- RSP 表示:将场景建模为可执行的组合代码,每个部分可单独解析并组合,支持递归结构。
- 递归构造求解器:核心递归循环,每个调用遵循统一流程:
- 建立整体:在当前层级观察参考图像和已有渲染,生成或细化整体场景模型,上下文由父程序提供。
- 准备并递归构造未解析部分:识别场景中细节不足的子区域,匹配参考视图和相机裁剪,将子区域裁剪图像作为子调用输入,递归执行同一求解器。
- 组合、细化并返回:将子调用返回的程序组合回当前场景,联合视觉细化处理边界、空间关系及局部细化后出现的共享误差,然后继续处理其他部分或返回父级。
- 视觉-语言编码代理:作为决策核心,直接比较参考图像与当前渲染,判断需要递归下降或细化,生成代码修改。
- 共享相机投影:参考对齐视图在不同层级传播相同相机投影,保证全局几何一致性。
差异点
相比传统 code-based 图像到场景重建方法仅使用代码表示但缺乏复杂场景构建策略,RCWM 通过递归全局-局部-全局循环同时保留场景级几何关系和细粒度结构,实现了从单图重建复杂可执行世界的递归构建原则。
实验
实验设计
- 从单张参考图像重建复杂 3D 场景,评估 参考视图保真度、整体场景与局部细节、额外视图合成与构造轨迹。
- 对比方法为先前基于代码的图像到场景重建方法;消融研究考察递归构造组织及递归深度的影响。
关键发现
- RCWM 在复杂场景上优于基线,尤其在局部细节与全局几何关系一致性上。
- 递归构造允许细尺度结构拥有独立的感知-编辑循环,同时保持场景级几何。
- 消融表明更深递归调用可改善更细粒度重建,验证了递归构造的必要性。
与基线对比解读
- 传统代码世界模型将世界表示为可执行程序,但缺乏复杂世界的构造策略;RCWM 引入 递归场景程序(RSP) 和递归求解器,通过全局-局部-全局循环协调局部与全局。
- 共享相机投影跨层级对齐参考视图,父级重访解决局部细化后出现的边界、空间关系和共享误差,这是基线未显式处理的。
- 视觉-语言编码代理直接比较参考图像与渲染结果,指导细化、递归下降和返回,提升了基于视觉证据的构造可靠性。
行业影响
落地场景
RCWM 从单张图像重建可执行的 3D 场景代码,适用于需要快速生成可编辑 3D 资产的场景。
- 电商 3D 商品展示:商家上传一张产品照片,系统自动生成可交互的 3D 模型,用于在线 360° 查看和 AR 试摆,降低传统 3D 建模门槛。
- 游戏/影视概念预可视化:美术团队提供概念图,RCWM 生成结构化场景程序,可进一步编辑光照、布局和物体属性,加速原型迭代。
商业价值
- 降本:替代大量重复性人工建模,缩短 3D 资产生产周期(从数天降至小时级)。
- 增收/体验提升:电商场景中的 AR 试穿、动态展示可提高用户停留时长与转化率;内容平台可提供“一键 3D 化”增值服务。
- 新服务模式:向中小商家或独立开发者提供按需 3D 场景生成 API,按调用量计费。
与现有工作流集成
RCWM 输出为可执行代码(Python 场景程序),可直接嵌入 Blender、Unreal Engine 等工具链,或通过脚本接口调用。与视觉语言模型(VLM)代理结合后,支持人机协同迭代——用户可对渲染结果提出修改指令,系统自动调整场景代码。场景程序可使用 Git 进行版本管理,便于团队协作和资产复用。
具体 use case:
- 电商平台:家具品牌上传单人沙发照片,RCWM 生成带材质和结构的可编辑 3D 模型,嵌入商品详情页,用户可拖拽旋转、更换颜色,退货率下降预期明显。
- 内容平台:教育科技公司提供历史建筑图片,RCWM 自动生成可探索的 3D 场景,用于虚拟课堂,节省外部建模外包成本。
局限
- - **单视图输入固有歧义**:RCWM 从单张参考图像重建整个 3D 世界,未观测区域的几何和外观必须依赖生成式补全。虽然递归构造中的视觉判断和父级回访可以缓解不一致,但本质仍是基于先验的猜测;在多视角证据缺失时,重建结果可能与真实场景存在系统性偏差。对工程落地而言,该局限意味着需要额外的验证手段(如用户交互或深度传感器)来约束未观测结构。
- - **递归调用带来的计算开销与延迟**:每个 solver call 都要经历 establish–recurse–refine 的完整循环,并多次渲染场景与参考图像对比以驱动 VLM 编码代理。这种设计虽然提升了局部细节的重建质量,但会产生大量 token 消耗和串行等待,难以满足实时或近实时的应用需求。此外,VLM 本身对复杂几何和光照的理解能力有限,递归深度增加后错误可能跨层级累积,父级回访能否完全修正仍需更系统的验证。
- - **代码表示缺乏可微优化与几何精度保证**:与 NeRF 或 3DGS 等显式/隐式表示不同,RCWM 将世界表示为程序代码,无法通过梯度下降对几何做连续优化。对于需要高精度度量或物理仿真的场景,程序化表示的误差可能难以控制。同时,论文实验主要评估参考视图保真度和局部细节,对多视图一致性和可编辑性的量化不足,这限制了该方法在工业级数字孪生或机器人仿真中的直接适用性。