FAMOS: 从稀疏观测进行前馈 3D 铰接建模
从稀疏单目视角对铰接物体建模颇具挑战,因为每次观测仅揭示部分几何与运动证据。多数 前馈方法 仅从单次观测推断铰接结构,因而严重依赖学到的类别级形状先验。 我们提出 FAMOS,一个从稀疏、无序的部分点云集合预测 可动部件分割 与 关节参数 的前馈模型。该模型联合推理多次观测,天然支持可变数量的输入,包括单视图。为跨观测聚合铰接线索,我们提出 多状态铰接 Transformer(Multi-state Articulation Transformer),交替使用状态内注意力与全局注意力;并进一步提出 观测铰接跨度目标(observed articulation span objective),监督各部件在输入观测中展现的运动范围,促使模型充分利用完整观测集。 为克服现有数据集规模与多样性的不足,我们引入 程序化数据生成器,在训练过程中合成自带标注的资产。在 PartNet-Mobility、ACD 与 ArtiCraft-10K 上的实验表明,相较前馈方法与基于优化的基线均取得一致提升。项目主页: https://kevinqu7.github.io/famos
论文精读
TL;DR FAMOS 从稀疏多视图点云直接前馈预测可动部件分割与关节参数,通过多状态 Transformer 聚合跨观测运动线索,并用观测跨度监督摆脱对单视图类别先验的依赖。
问题
问题背景
三维关节物体建模在机器人操作、场景理解与数字资产生成等应用中日益重要。传统方法依赖密集多视角重建或交互视频,但实际场景往往只有稀疏、无序的部分观测(如少数几张单目图像或局部点云),要求模型从有限证据中恢复完整的可动部件结构与关节参数。
现有方法局限
多数前馈式方法从单一观测直接推断关节,严重依赖类别级形状先验来补齐缺失的运动信息,无法利用同一物体在不同状态下的互补线索。优化式方法虽然能处理多视角或多状态输入,但存在以下问题:
- 推理需要迭代优化,耗时较长,难以满足实时应用;
- 对初始化敏感,容易陷入局部最优;
- 需要预先给定部件分割或关节类型,自动化程度低。
单观测方法无法估计运动范围(如门能开多大、抽屉能拉多长),因为仅从一个姿态很难辨别关节的完整自由度,导致下游抓取或操作任务中产生错误规划。
为什么这个问题难且重要
稀疏观测下每个状态只提供部分几何与运动证据,同一部件在不同状态间可能仅发生细微位移,跨观测聚合信息需要解决部件对应与状态间注意力问题。同时,输入观测数量可变(从 1 到 N),模型需具备对集合基数的鲁棒性。此外,现有公开数据集的规模和多样性不足,难以训练覆盖广泛关节类型与几何外形的模型。业界对可扩展、无需逐实例优化的前馈式方法有明确需求,因为真实机器人或 AR 应用无法承受分钟级的在线优化。
行业类比
该任务类似自动驾驶中从多帧稀疏点云进行目标检测与跟踪:需要融合时序信息以消除单帧歧义,同时保持前馈推理的实时性与可扩展性。
核心洞察
- FAMOS 的核心创新在于将 articulated object modeling 从单观测前馈推理范式扩展到多观测联合推理。现有 feed-forward 方法通常从单一视角推断 articulation,严重依赖类别级 shape prior,而 FAMOS 通过 Multi-state Articulation Transformer 在多个部分点云之间交替进行 state-wise 和 global attention,自然地聚合不同观测中的运动线索,支持可变输入数量(包括单视图),从而降低对强先验的依赖,更贴近真实世界多视角或交互视频的数据特性。
- Observed Articulation Span(OAS)目标为模型提供了显式的运动范围监督,这是与以往工作的一个重要差异。传统方法往往只利用观测到的几何信息,缺乏对关节运动幅度的直接约束,导致在稀疏观测下估计不准。FAMOS 通过 OAS 让模型监督每个 part 在输入观测中表现出的运动范围,促使模型充分利用全部观测集合,而不是只关注单个状态,从而提升了 motion estimation 的鲁棒性,且无需像 optimization-based 方法那样进行迭代拟合,保持了前馈效率。
- 程序化训练数据生成器是 FAMOS 能够突破数据规模限制的关键工程手段。现有 articulated object 数据集(如 PartNet-Mobility)规模有限且多样性不足,难以训练出泛化性强的模型。FAMOS 提出在训练时动态合成自标注资产,通过程序化方式构建不同关节类型和几何变体,从而提供几乎无限的训练样本,实验表明这一策略对模型性能有显著提升,为数据饥渴的 3D articulation 学习提供了可复用的方案。
方法
输入与整体流程
FAMOS 接收稀疏、无序的部分点云集合,每个点云对应一个观察状态(来自单目或少量视角)。每个观察仅提供局部几何与运动证据,模型需联合推理得到部件级结构。
关键模块
- Point encoding:对每个点云独立提取逐点特征,并聚合全局特征。
- Part queries:一组可学习的查询向量,代表潜在可动部件,通过 Multi-state Articulation Transformer 与多观察点云特征交互。
- 该 Transformer 采用交替的 state-wise attention(单观察内部件与点特征交互)和 global attention(跨观察聚合同一部件线索),从而支持任意数量输入,包括单视图。
Observed Articulation Span 损失:约束模型预测每个部件在输入观察集合中实际展现的运动范围,而非类别平均先验,鼓励利用完整观察集。
输出与训练
模型输出每个点的可动部件分割标签及每个部件的关节参数(关节类型、轴位置与方向、运动范围)。训练数据通过程序化生成器实时合成自标注资产,弥补现有数据集多样性不足。匹配采用匈牙利算法,损失包含分割损失、关节参数回归损失与 span 损失。
与同类前馈方法从单观察推断且依赖类别先验不同,FAMOS 显式聚合多观察的关节证据,并通过 span 监督强化跨观察推理。
实验
实验设计
FAMOS 在三个公开基准 PartNet-Mobility、ACD 和 ArtiCraft-10K 上进行评估,覆盖家具、储物、工具等常见 articulated 物体类别。评测采用 movable-part segmentation 和 motion estimation(关节参数回归)两项核心任务。对比方法包括单状态前馈模型与基于优化的多视角重建基线;FAMOS 支持可变输入状态数(含单视图),测试时分别验证稀疏多状态(如 2-5 个观测)与单状态条件下的性能。
关键发现
实验表明,FAMOS 在所有基准上均一致优于现有前馈和优化基线,尤其在多状态稀疏观测下提升明显。引入 Multi-state Articulation Transformer 与 observed articulation span 监督后,模型能更充分利用跨观测的运动证据,减少对类别级形状先验的依赖。单状态测试性能也保持竞争力,说明模型扩展性良好。
对比解读
与仅用单观测的 feed-forward 方法不同,FAMOS 显式联合推理多观测,缓解了因单视角遮挡或运动不充分导致的歧义。相比 optimization-based 方法,FAMOS 保持前馈推理速度,无需迭代优化。该设计对实际工程有直接启示:面向真实场景的 articulated 建模,收集少量不同状态的观测(如抓取前后、开合过程)即可显著提升精度,同时避免昂贵的手工参数调整。
行业影响
落地场景
- 电商 3D 商品展示: 对家具、家电、工具等可动部件商品,从少量手机拍摄的稀疏视图生成可交互 3D 模型。用户可旋转、开合抽屉、门、盖等,提升购买决策信心。
- 机器人操作: 服务机器人或仓储机器人需要快速理解环境中铰接物体的结构与运动范围(如柜门、抽屉、阀门),FAMOS 可从多视角点云直接推理,无需迭代优化,适合实时感知。
- AR/VR 与数字孪生: 快速将真实物体数字化,导入模拟环境。
商业价值
- 降低 3D 建模成本: 传统人工建模铰接物体需数小时/个,FAMOS 从稀疏图像秒级生成,人力成本大幅下降。
- 提升转化率: 交互式 3D 展示可增加用户停留和信任,带动电商转化。
- 机器人部署加速: 减少对 CAD 模型或人工标注的依赖,快速适配新场景,缩短项目周期。
与现有工作流的接口
- 数据侧: 兼容 unordered point clouds,可直接接入 NeRF/3DGS 重建管线输出的稀疏点云。
- 推理侧: 支持单视图与多视图,可作为插件嵌入现有感知 stack,无需改变采集流程。
- 训练侧: Procedural Data Generator 可无限生成自标注数据,适合 fine-tune 到特定品类或场景。
具体落地 use case:
- 家具电商平台: 用户上传 10-20 张手机照片,平台自动生成可交互 3D 商品模型;买家可拖动视角、模拟打开柜门或抽屉,减少退货率。
- 仓储机器人: 在无 CAD 模型的新仓库中,机器人通过多视角 RGB-D 相机捕获柜体点云,FAMOS 实时预测铰接关节位置与运动范围,路径规划模块据此规划开门、取货动作。
局限
- **训练数据与真实世界差异**:方法依赖程序化合成数据(如 PartNet-Mobility 资产和自定义生成器)进行训练,虽然缓解了数据稀缺,但合成点云与真实扫描/重建的点云在噪声模式、遮挡规律和几何完整性上存在分布差异。论文在真实物体上的评估仅包含定性示例,缺少大规模真实数据集上的定量对比,因此其在实际部署时的泛化能力尚未得到充分验证。若直接应用于机器人感知等真实场景,可能需要额外的域适应或真实数据微调。
- **关节模型假设限制**:模型假设每个可动部件对应一个关节,且关节参数化类型为常见旋转或平移,对于球窝关节、螺旋关节、柔性变形部件或多级联动机构可能表达不充分。此外,`observed articulation span` 目标依赖输入状态集合的多样性,如果稀疏观测中缺少某些运动范围(例如只提供了处于闭合状态的多个视图),则运动范围监督不准确,可能导致关节参数估计偏差。
- **精度与效率权衡**:与基于优化的方法(如通过物理仿真或几何拟合)相比,前馈模型虽然速度快,但可能牺牲分割边界精度和关节参数的几何一致性,尤其在低分辨率点云或部件细小的情况下。另外,**Multi-state Articulation Transformer** 的计算复杂度随输入状态数和点云规模增长较快,对多状态高分辨率输入的可扩展性有限,可能不适用于实时或大规模场景。