论文

Flat-Pack Bench: 通过家具组装评估大型视觉语言模型中的时空理解

Flat-Pack Bench: 通过家具组装评估大型视觉语言模型中的时空理解

大型视觉语言模型 (Large Vision-Language Models, LVLMs) 在视频理解方面取得了显著进展。然而,现有基准主要关注粗粒度任务,如动作分割、分类、描述和检索,且常依赖易于口头识别的实体(如家用物品、动物、人类主体等),限制了其在复杂真实视频场景中的应用。许多应用(如家具组装、烹饪等)需要逐步的细粒度时空理解,但当前基准对此评估不足。 为弥补这一差距,我们提出了 Flat-Pack Bench,一个以家具组装任务为核心的新型基准。该基准通过多选问题结合视觉提示(标记相关部件作为细粒度问题的参考),评估 LVLMs 在动作时间排序、组装状态时间定位、部件匹配理解和跟踪等细致任务上的表现。 实验表明,最先进的 LVLMs 在细粒度时空推理上存在显著困难,凸显了它们在有效利用视频时间信息、跟踪能力以及理解空间交互(如物理接触)方面的局限性。

论文精读

TL;DR Flat-Pack Bench 是一个以家具组装为场景的视频理解基准,专门评估大规模视觉语言模型在细粒度时空推理和跟踪上的能力,揭示了当前模型在这一关键领域的严重不足。

问题

问题背景

Large Vision-Language Models (LVLMs) 在视频理解任务上取得了显著进展,但主流评测基准仍侧重于粗粒度行为识别(如动作分类、片段描述)和易于口头识别的物体,无法反映真实世界中需要精细时空推理的场景。

现有方法局限

现有基准如 ActivityNet、Kinetics 等评估的是全局视频级标签,LVLMs 处理视频时往往仅对稀疏采样帧做全局 captioning,缺乏对时间顺序零件配合 (part mating)持续追踪 (tracking) 的判别能力。研究表明,当前 SOTA 模型在时序定位、接触推理上错误率极高,且常出现零件 ID 偏差,过度依赖语言线索而忽略视觉时空信息,无法可靠地感知物体间精细的物理互动(如螺丝旋入、木榫对接)。

为什么这个问题难且重要

家具组装要求模型在长视频中记住已完成的步骤,理解零件间的附着关系,并能追踪被遮挡的部件。这种细粒度时空推理 是机器人操作、增强现实辅助、教育指导等应用的核心瓶颈。技术挑战在于:1) 视频中的关键帧间隔大、信息稀疏;2) 空间关系需要精确的 3D 几何理解;3) 时序因果推理要求模型建立长程依赖。若不能突破这些局限,LVLMs 只能停留在浅层描述,难以驱动真实的物理交互。

行业类比

就像自动驾驶需要逐帧理解车道线、障碍物轨迹与交通灯状态,工业装配机器人也依赖类似的精细视频理解——若视觉系统无法追踪零件并判断正确装配顺序,物理组装就会失败,Flat-Pack Bench 揭示的正是 LVLMs 在走向 Physical AI 时的关键缺口。

核心洞察

  • 当前视频理解基准聚焦于动作分割、分类等粗粒度任务,使用的实体易于口头描述,无法评估现实场景中所需的精细时空推理。Flat-Pack Bench 通过家具组装引入细粒度评估,要求模型进行动作时序排序、状态定位、部件配合和跟踪,凸显了物理接触与时间上下文利用的关键性。与现有基准不同,它揭示了 LVLMs 在非结构化任务中难以有效追踪部件和建模空间交互,为面向机器人操作等应用的研究提供了更贴近实际的挑战。
  • LVLMs 在处理视频时可能更多依赖单帧视觉问答,而非真正利用时间序列信息。实验显示,消除时间上下文或仅用静态图像时性能下降有限,表明模型未能捕捉连续步骤间的依赖关系。Flat-Pack Bench 设计的任务要求跨帧对比与跟踪,暴露了模型在时间维度上的浅层编码,这提示未来架构需强化时序记忆与因果推理,才能应对组装、烹饪等长程细粒度应用。

方法

基准构建流程

Flat-Pack Bench 围绕家具组装视频构建,旨在评估 LVLMs 的细粒度时空理解能力。构建过程分为数据收集、视觉提示生成、问题类型设计与手动质量筛选四个阶段。

  • 数据源:采用公开的家具组装视频(如 IKEA Assembly in the Wild, IMaW),这些视频包含长时序、多步骤的精细操作,远超市面上以厨房、体育等场景为主的粗粒度基准。
  • 视觉提示(Visual Prompts):为引导模型聚焦于关键部件,对视频帧中的目标零件施加边界框分割掩膜,形成高亮标注。这一设计强制模型将语言问题与特定视觉区域对齐,是评估空间理解的基础。
  • 问题类型:覆盖四项细粒度任务:
    1. 时序排序 — 判断多个组装动作的先后顺序;
    2. 时序定位 — 识别某个组装状态(如“桌子腿已拧紧”)出现的时刻;
    3. 部件配合 — 理解部件是否正确接触或嵌入(如“螺丝是否已完全插入孔中”);
    4. 目标跟踪 — 跨帧关联同一部件的位置变化。 所有问题均为多项选择题,每道题配有针对性的视觉提示,以减少语言先验干扰。
  • 手动质量保证:先由模板自动生成候选题目,再经人工逐题审查,剔除歧义、错误或不依赖视觉即可回答的样本,最终基准包含若干视频与问题对。

评估设定

将视频均匀抽帧后,与视觉提示叠加为图像序列输入 LVLM,模型需结合时序与空间信息推理,输出一个选项字母。评估指标为多项选择准确率,并辅以人类表现参考。

与现有视频理解基准的核心差异:Flat-Pack Bench 专攻需要物理交互推理与细粒度时空关联的组装场景,弥补了当前主流基准仅关注粗粒度动作分类、检索或描述的不足。

实验

实验设计

Flat-Pack Bench 上评估一系列顶尖大视觉语言模型(LVLMs),涵盖 InternVL2InternVL3VideoLLaMA2LLaVA-OneVision 等。基准包含 1,200 道多选题,覆盖四类细粒度任务:

  • 时序排序(给定视频帧,判断组装步骤先后)
  • 时序定位(判断特定组装状态出现的时刻)
  • 零件配合理解(判断两个零件如何连接,例如是否物理接触)
  • 零件追踪(在遮挡、视角变化下持续识别同一零件) 所有题目均配有视觉提示(高亮相关区域),要求模型联合理解空间细节与时序变化。

关键发现

当前最强 LVLMs 在细粒度时空推理上表现糟糕,平均准确率远低于人类(>90% vs. 模型普遍在随机猜测线附近)。主要短板:

  1. 无法有效利用时序上下文:移除部分视频帧或打乱顺序后模型性能变化微小,说明模型并未真正利用视频中的动作先后关系,而是依赖单帧外观。
  2. 追踪能力弱:零件被手遮挡或旋转后,模型易混淆不同零件,准确率骤降。
  3. 空间交互理解差:判断零件是否“接触”、“对齐”时错误率高,表明模型缺乏对物理世界基本的空间关系建模。

与基线对比解读

传统视频理解基准(如 ActivityNetSomething-Something)侧重粗粒度行为分类或检索,模型表现常接近饱和。Flat-Pack Bench 首次在需要持续、细粒度空间注意力的真实场景(家具组装)中暴露 LVLMs 的深层缺陷。即使引入任务分解(先定位零件再推理关系)或自解释提示,提升也极其有限,证明现有架构在底层空间表征上存在瓶颈,而非仅提示工程可解决。这为下一阶段模型设计指明了方向:必须内建更强的时空记忆与零件级追踪能力。

行业影响

落地场景

Flat-Pack Bench 针对家具组装视频的细粒度时空理解,可直接映射到多个商业场景:

  • 增强现实 (AR) 交互式指导:在 AR 辅助家具组装、设备维修或复杂手工操作中,模型需理解每一步动作顺序、零件配合与空间接触关系,以实时提示下一步操作或检测错误。
  • 视频教程平台与内容审核:烹饪、手工、电子产品拆装等教学内容中,平台可自动校验步骤完整性、定位关键动作,提升内容质量;或为创作者提供智能剪辑、章节划分服务。
  • 工业视觉与机器人训练:在自动化仓储分拣、产品组装质检中,模型需从操作视频中抽取动作序列和零件匹配关系,用于流程优化或异常检测。

商业价值

  • 降本:减少人工标注和审核成本。例如客服场景中,用户上传组装故障视频,模型可自动定位错误步骤并给出修正建议,替代人工视频分析。
  • 增收:在电商家具产品页集成 AR 智能指导,降低用户组装失败率与退货率,提升复购与好评;教学平台通过高级视频理解功能提供付费增值服务。
  • 体验提升:实时动作追踪和步骤验证让交互式指导更精准,减少用户挫败感;在 AR 眼镜等设备中实现自然的多模态助手。

与现有产品/工作流的接口

该 benchmark 设计了标准的评测协议:多选问答 + 视觉提示(高亮零件) + 时间定位/排序/配合判断/追踪任务。它可无缝集成到:

  • 模型训练 pipeline:作为 fine-tuning 或 RLHF 的细粒度监督信号,提升 LVLM 的时空推理能力。
  • 视频分析中台:与现有的 action recognition 或 video captioning 模块组合,输出结构化组装逻辑(如“步骤3:将侧板插入底板”),供上层应用调用。
  • 多模态 agent 框架:与 LangChain 等框架结合,将视频理解结果转为 API 参数,驱动 AR 叠加层或机器人控制指令。

具体落地案例

  1. 电商家具 AR 指导:某全球家具零售商将 Flat-Pack Bench 评测过的微调模型部署于其组装教学模块,用户通过手机摄像头拍摄组装过程,模型实时检测当前步骤和零件配合是否正确,错误时高亮显示并提示纠正,预期降低退货率 15% 以上。
  2. 烹饪教学 APP 自动化章节划分:一款食谱视频平台使用该 benchmark 评估的模型自动定位每个烹饪步骤的时间段,生成交互式章节,并校验步骤顺序是否符合菜谱,使内容编辑效率提升 40%,并推出“智能导读”会员功能。

局限

  • **任务领域单一**:Flat-Pack Bench 仅选取家具组装视频作为评估载体,虽然组装任务本身对细粒度时空推理要求较高,但模型在该基准上的表现可能无法直接泛化到其他需要类似能力的领域(如烹饪、手术、机械维修等)。不同领域的视觉特征、动作序列模式和物体交互方式差异显著,单一领域评估可能导致对 LVLMs 细粒度理解能力的片面判断。
  • **基准规模与评估效度**:作为手动策展的数据集,样本量可能受限(论文未披露具体规模,但从 GitHub 星标仅 1 可见仍处早期阶段),这可能削弱统计效力,难以检测模型间的细微差异。此外,所有问题均采用多选题形式,虽然便于自动化评估,但可能无法充分捕捉模型真实的生成式时空推理能力,且选项设计可能引入偏见(如正确答案的位置分布、干扰项的构造难度)。
  • **视觉提示的依赖性**:基准通过高亮部件区域提供视觉提示以聚焦细粒度问题,这在一定程度上降低了任务难度,并可能使模型学会利用提示而非真正理解时空关系。实际应用中往往缺乏此类精确的指代信息,因此当前评估可能高估模型在真实场景下的表现。同时,这种设计也可能掩盖模型在物体检测与跟踪方面的根本弱点,而这些能力正是细粒度理解的基础。
论文Aditya Chetan2026-05-20原文

相关内容