论文

Lucida: 可组合真实到仿真场景建模的解析、生成与放置

Lucida: 可组合真实到仿真场景建模的解析、生成与放置

可组合场景建模旨在将真实室内场景恢复为完整的、可编辑的对象资产,并按观测排列,为机器人仿真和具身智能提供就绪的仿真副本,且每个对象可单独操控。现有流水线将任务分解为三步——解析 观测为实例、为每个实例生成资产、再将资产放置回原位——但每一步都预设了杂乱捕获难以提供的输入:精确的实例几何、无遮挡视图,以及与观测精确匹配的资产。 我们提出 Lucida,它保持上述顺序但重新分配需求,使每一步只依赖真实捕获可靠提供的信息,精度在流水线末端达成而非在起点苛求。Lucida 将视频解析为场景图,节点携带逐实例多视图证据;从证据为每个实例生成完整资产;并用 GizmoAct 完成放置——这是一种 VLM 策略,将放置视为多轮 GUI 交互,在闭环中操控对象的 gizmo,并自行判断何时对齐。 在场景级 3D 对象检测、对象姿态估计和场景重建上,Lucida 在 R2S-Scene 上将 mAP 较 Boxer 提升 69%,在 CA-1M 上将 ADD-SB@0.05 从 57.8% 提升至 83.4%,并将场景 F-Score 从 SAM3D 的 0.794 提升至 0.924。

论文精读

TL;DR Lucida 从杂乱真实视频中解析多视图证据场景图,生成完整资产并用 VLM 驱动的 GizmoAct 多轮 GUI 放置,实现高保真可编辑场景重建,检测 mAP 提升 69%,ADD-SB 达 83.4%。

问题

问题背景

真实室内场景的可组合建模是机器人仿真与 embodied AI 的基础能力,目标是从真实视频中恢复完整、可编辑的对象资产并还原其布局,形成可交互的数字孪生。

现有方法局限

主流 pipeline 将任务拆为三步:解析实例、生成资产、放回场景。

  • 解析阶段 假设能获得准确的实例几何,但杂乱场景中遮挡严重,实例分割常不完整或有噪声。
  • 生成阶段 要求无遮挡视图,但真实捕获中目标物体可能被部分遮挡,导致生成的资产缺面或纹理错误。
  • 放置阶段 依赖资产与观测的精确匹配,但上游误差使资产与真实物体存在偏差,直接放置难以对齐。

三步串行导致误差累积,最终场景重建质量差,无法用于物理交互仿真。

为什么这个问题难且重要

真实室内数据包含大量遮挡、杂乱和视角变化,将多视图证据关联到同一实例本身困难。同时,仿真系统对资产几何完整性与位姿精度要求高,任何误差都可能导致机器人训练中的碰撞检测错误或抓取失败。因此,业界对从真实视频自动构建仿真场景的需求迫切,但现有方法鲁棒性不足。

行业类比

类似于自动驾驶中从真实传感器数据构建可编辑的静态场景仿真库,需要对象级语义与精确位姿,直接影响下游策略训练的效率与安全性。

核心洞察

  • Lucida 的核心创新在于将可组合场景建模从“输入即精确”转变为“输出即精确”,通过重新分配流水线各步骤的需求,使解析、生成、放置各自只消耗真实捕获中可靠可得的信号。传统流程假设实例几何准确、视图无遮挡、资产完全匹配观测,但杂乱室内视频极少满足这些条件;Lucida 在解析阶段保留多视图证据而非强制单一几何,生成阶段从证据合成完整资产,放置阶段由 VLM 闭环对齐,从而把精度压力从源头转移到末端。
  • GizmoAct 将 3D 对象放置重新定义为多轮 GUI 交互策略,利用视觉语言模型(VLM)在闭环中操纵对象的 gizmo 并自主判断对齐是否完成,而不是依赖固定迭代次数或单次回归预测。与经典的位姿估计或基于优化的 ICP 类方法不同,该策略能够利用遮挡线索、多视角观察和任务驱动的停止条件,在初始位姿噪声较大时保持鲁棒性,并通过 SFT 与 RL 联合训练获得误差注入下的恢复能力。
  • Lucida 的场景解析采用对象为中心的多视图证据整合与关系感知细化,生成节点级证据而非直接输出实例几何,为后续无模态资产生成和放置提供了更可靠的中间表示。相较于 Boxer 等仅依赖单帧或局部聚合的检测方法,该设计在场景级 3D 检测上取得 69% 的 mAP 提升,并在 CA-1M 上将 ADD-SB@0.05 从 57.8% 提升至 83.4%,证明了以证据驱动替代强制几何对齐的有效性。

方法

方法详解

输入:室内场景的 RGB 视频(通常带有遮挡、杂乱)。

关键模块:

  • 多视角物体中心场景解析(Multi-View Object-Centric Scene Parsing) 首先进行几何感知的关键帧选择与物体发现,构建场景图。每个节点代表一个实例,并整合来自全序列的多视角证据,最后通过关系感知的场景细化修正解析结果。
  • 无模态物体资产生成(Amodal Object Asset Generation) 对场景图中每个实例,利用其多视角证据生成完整的物体资产(形状与外观),即使原始观测中存在遮挡,也能输出可编辑的3D模型。
  • Agentic 3D Grounding with GizmoAct 将放置问题形式化为多轮 GUI 交互。VLM policy 观察图形化界面(包含物体 gizmo、多视点图像、遮挡提示),输出连续姿态更新动作或扩展动作。通过可执行语法保证动作合法。该 policy 先基于合成轨迹进行监督微调(特权专家策略生成轨迹,注入错误并恢复以增强鲁棒性),再用强化学习优化(基于对齐精度的奖励设计、动态采样)。策略在闭环中操作 gizmo,直至自身判定对齐完成。

输出:仿真就绪、可独立操控的室内场景复制品。

与同类方法差异:不同于传统流水线在开始时要求精确实例几何、无遮挡视图和匹配资产,Lucida 将精度压力后置到最终的 VLM 闭环放置阶段,使各模块只消费真实捕获中可靠的信息。

实验

实验设计

Lucida 在三个任务维度评估:场景级 3D 目标检测 在 R2S-Scene 上对比 Boxer;布局细化与 物体位姿估计 在 CA-1M 上评估 ADD-SB@0.05;场景重建以 SAM3D 为对照,衡量 F-Score。消融实验聚焦多视图解析与 GizmoAct 的 SFT/RL 训练策略。

关键发现

  • 3D 检测 mAP 比 Boxer 提升 69%,归因于多视图证据整合与关系感知场景精化。
  • 位姿指标 ADD-SB@0.05 从 57.8% 升至 83.4%,说明 GizmoAct 的闭环 GUI 交互能有效纠正初始位姿。
  • 场景重建 F-Score 从 0.794 提高到 0.924,验证了视频解析 + 资产生成 + 智能放置的链路优势。

与基线对比解读

Lucida 没有在每个步骤强求完美几何或无遮挡视图,而是将精确性延迟到最终布局阶段,用 VLM 策略在闭环中操作 gizmo。相比 Boxer 单帧解析,Lucida 利用时序多视图证据,减少了遮挡导致的漏检;相比 SAM3D 的隐式重建,可编辑资产与显式位姿优化带来更高保真度与实用性。

行业影响

落地场景

Lucida 将真实室内视频自动转换为可编辑、对象级 3D 资产,适用于需要快速构建仿真环境的行业:

  • 机器人仿真与具身智能:从实际环境视频生成数字孪生,用于导航、抓取等策略训练。
  • 电商家居家装:用户拍摄房间视频,生成可交互的 3D 家具布局,支持实时替换与预览。
  • AR/VR 内容平台:低成本生成场景级 3D 资产,加速虚拟空间搭建。

商业价值

  • 降本:传统人工建模一个室内场景需数天到数周,Lucida 自动化流水线可将时间压缩至分钟级,大幅降低 3D 重建人力成本。
  • 增收:电商场景中,高保真交互式 3D 展示可提升用户停留时长与转化率;机器人公司可加速仿真数据生产,缩短产品迭代周期。
  • 体验提升:对象级可编辑资产让仿真环境更接近真实,提高训练策略的迁移成功率。

与现有产品/工作流的接口

Lucida 可作为中间件集成进现有 3D 重建或仿真栈:

  1. 输入:RGB-D 视频或连续帧序列。
  2. 输出:场景图 + 各实例的完整网格资产 + 6DoF 位姿。
  3. 对接:输出可直接导入 Isaac Sim、ROS、Blender 等工具;解析与生成模块可封装为 API,或嵌入 MLOps 流水线做批处理。

GizmoAct 的 VLM 策略可基于现有视觉语言模型微调,提供闭环放置能力,适合部署在需要高精度对齐的自动化流程中。

具体落地 Use Case

  • 电商虚拟样板间:平台提供“上传房间视频,一键生成可编辑 3D 家装方案”功能,用户可拖拽替换家具,实时查看效果,直接下单购买。
  • 仓储机器人仿真:机器人公司用手机扫描仓库,快速生成包含货架、货物、托盘的仿真场景,用于测试叉车或分拣策略,减少实地部署调试成本。

局限

  • **多视角依赖**:Lucida 需要密集多视角视频作为输入,以构建 per-instance 多视角证据。对于单目或稀疏视角的真实捕获,其性能可能显著下降。论文未系统评估不同视角密度下的鲁棒性,这限制了它在低成本设备或特定机器人平台上的应用。
  • **资产生成解耦风险**:资产生成模块依赖预训练的 3D 生成模型(如多视图扩散模型),生成资产与实际观测物体的外观、几何可能存在偏差。当实例被严重遮挡或材质复杂时,资产保真度可能不足,进而影响后续放置和整体场景重建的精度。论文未讨论资产生成失败时的 fallback 策略。
  • **GizmoAct 的 sim-to-real 差距**:GizmoAct 通过合成轨迹监督微调和 RL 训练,在真实图像上的性能可能受合成数据分布影响。其多轮 GUI 交互策略在真实机器人操作中的执行延迟和闭环稳定性也未充分验证。此外,整个流程涉及多个模型串行,计算开销和端到端优化空间有限。
论文Minghan Qin2026-08-31原文

相关内容