JigShape: 通过拼图评估VLMs的视觉-几何推理
拼图求解需要同时推理视觉内容和几何约束,然而现有基准使用矩形切割,在纹理重复区域会产生模糊的真实值。我们引入JigShape,一个具有凸凹互锁拼片的基准,其几何约束提供强局部兼容性要求,与视觉内容结合后得到无歧义的真实值。 在95K实例、四种网格密度(4×4 至 16×16)上,我们发现零样本VLMs大多缺乏几何推理:五个前沿模型中仅一个(GPT-5.5)在4×4拼图上超过随机基线,其余均处于随机水平。尽管监督微调在4×4上能达到97%以上,但所有模型在更大网格上崩溃:GPT-5.5从70%降至8×8上的接近随机,即使微调模型在12×12上也低于5%。 这种“缩放悬崖”表明当前架构无法在拼图数量增加时保持一致的约束满足。该结果将可扩展的几何推理确立为视觉语言模型的一项开放挑战。
论文精读
TL;DR JigShape 通过互锁拼图基准揭示 VLMs 的视觉几何推理短板:零样本仅 GPT-5.5 超随机,微调模型随拼图增大性能急剧下降,暴露 scaling cliff。
问题
问题背景
视觉语言模型(VLMs)在图像理解、视觉问答等任务上表现显著提升,但空间几何推理 能力仍未被充分评估。当前研究关注模型能否联合处理视觉内容与几何约束,而拼图任务正是这一能力的典型测试场景。
现有方法局限
早期拼图基准(如矩形切割拼图)采用统一矩形拼块,导致在纹理重复区域出现歧义解:多组排列在视觉上均可能成立,无法有效区分模型是真正理解了图像内容还是仅依赖表面纹理匹配。此外,这些基准的网格规模有限,未对模型的全局约束满足 能力施加足够压力。因此,现有基准既缺乏几何特征的判别性,也未能揭示模型在约束数量增长时的性能衰减规律。
为什么这个问题难/重要
拼图求解要求模型同时满足两个层级的约束:局部形状兼容性(tab-and-blank 凸凹匹配)与全局内容一致性(图像语义)、空间排列。随着网格从 4×4 增至 16×16,约束数量呈二次方增长,模型必须维持所有局部决策的全局可行性。实验表明,即使经过监督微调(SFT)的模型在 4×4 上准确率超过 97%,在 12×12 上也骤降至 5% 以下,出现“scaling cliff”。这暴露了当前 VLM 架构在组合优化与长程一致性维护 上的根本缺陷,对需要精确几何推理的下游应用(如机器人操作、CAD 解析)构成直接障碍。
行业类比
这一挑战类似于自动驾驶中的多目标轨迹预测:模型必须同时满足车辆动力学约束、道路几何与交通语义,任何局部冲突都会导致全局失败,而当前端到端模型同样面临组合爆炸下的性能悬崖。
核心洞察
- 无歧义 ground truth 是评估视觉-几何推理的前提。现有矩形切割基准在纹理重复区域会产生多个合法解,导致模型可能仅靠视觉特征匹配就蒙对位置,评估信号被严重污染。**JigShape** 的 tab-and-blank 互锁形状引入强几何约束,使每个拼图块的位置唯一确定,从而强制模型必须同时理解形状兼容性与视觉内容。这一设计将评估重心从视觉匹配转向联合推理,更真实地暴露 VLMs 在几何约束处理上的能力缺口。
- **Scaling cliff** 现象揭示 VLMs 缺乏可扩展的约束满足能力。零样本 GPT-5.5 在 4×4 拼图上达到 70% 准确率,但 8×8 骤降至随机水平;SFT 模型在 4×4 超过 97%,但 12×12 低于 5%。这种断崖式下降不是性能渐近衰减,而是模型没有学到可泛化的全局求解策略(如回溯搜索或约束传播),仅依赖局部模式匹配。当拼图块数增加,局部冲突无法全局协调,导致整体失效。这提示工程实践需要为 VLM 引入外部搜索或结构化推理模块,而非仅靠扩大模型规模。
方法
任务与输入
JigShape 将拼图求解形式化为给定一组打乱顺序的拼图块(每块包含视觉内容和独特的 tab/blank 边缘形状),模型需预测完整布局。输入为源图像裁剪后的拼图块序列,输出为每块在网格中的位置坐标或排列顺序。
关键模块:形状约束机制
核心创新是采用 tab-and-blank interlocking pieces(凸耳与凹槽互锁结构)。与矩形切割不同,每个拼图块边缘具有非规则几何形状,只有形状匹配的块才能在物理上拼合。这提供了强局部兼容性约束:几何形状本身即可排除大量错误配对,结合视觉内容使 ground truth 无歧义。生成流程分为四步:
- 图像预处理:源图像标准化并分割为网格单元。
- 边缘分配:为每对相邻边随机生成互补的 tab/blank 形状,确保唯一匹配。
- 形状掩码与内容提取:根据边缘形状生成每块的二值掩码,并从源图像提取对应视觉内容。
- 布局组合:打乱块顺序并记录正确位置,生成实例。
网格密度设置 4×4、8×8、12×12、16×16 四档,共 95K 实例,覆盖从简单到极难的难度范围。
输出与评估
模型输出为每块的预测坐标或排列。评估指标包括 Piece Accuracy (PA)、Exact Match (EM)、Adjacency Accuracy (AA) 和 Shape Compatibility (SC),分别衡量单块定位准确率、整体布局完全正确率、相邻关系正确率以及形状兼容性。
原作者论断:几何约束与视觉内容联合才能产生无歧义 ground truth,现有矩形切割在纹理重复区域存在歧义。
与同类方法差异
相比已有矩形切割拼图基准,JigShape 通过 tab-and-blank 互锁结构显式引入可验证的几何推理维度,使评估从纯视觉匹配转向视觉-几何联合推理。
实验
实验设计
JigShape 采用 tab-and-blank 互锁拼图块,构建 4×4 至 16×16 四种网格密度,共 95K 实例。评估指标包括 Piece Accuracy (PA)、Exact Match (EM)、Adjacency Accuracy (AA) 和 Shape Compatibility (SC)。模型分为两组:五个前沿 VLM 进行 zero-shot 推理,以及基于特定 VLM 的监督微调(SFT)模型。输入包含拼图块图像与目标网格布局提示。
关键发现
Zero-shot 仅 GPT-5.5 在 4×4 上超出随机基线,达到 70%,其余模型处于 chance level。SFT 模型在 4×4 上准确率超过 97%,表现出对任务的拟合;但所有模型在更大网格上出现 scaling cliff:GPT-5.5 在 8×8 从 70% 掉至 near-random,12×12 上 fine-tuned 模型低于 5%。这表明当前 VLM 架构难以随着拼图块数增加维持一致的几何与视觉约束满足。
基线对比解读
与使用矩形切割的旧基准相比,JigShape 通过互锁形状提供强局部兼容性约束,消除了纹理重复区域的 ground truth 歧义。零样本模型普遍缺乏几何推理,说明视觉-语言模型对空间关系的建模仍弱;SFT 虽在小网格上快速习得任务,但泛化到更大网格时崩溃,暴露了模型在组合性几何推理上的根本缺陷。该基准将可扩展几何推理确立为 VLM 的开放挑战。
行业影响
落地场景
JigShape 评估的 几何推理 直接关乎三类产品:电商商品图合成与自动排版(将多张细节图拼成统一规格,需保证边缘与形状正确对齐)、AR/VR 装配指导与机器人抓取(识别 tab-and-blank 装配件相对位姿)、文档/海报版面重建(从碎片图像恢复原布局)。例如,电商平台自动生成 360° 商品拼接图时,现有 VLM 常因纹理重复区域误对齐;引入 JigShape 式带形状约束的采样 可生成对抗性高风险样本,在上线前筛出几何推理薄弱模型。
商业价值
该基准直接面向 可靠性提升与人工审核降本。视觉内容生成/编辑工具中,几何错位的返工率是隐性成本;若模型在 JigShape 4×4 即掉到随机水平,说明其无法稳定理解空间约束。企业可将 JigShape 分数作为 模型选型与准入门槛,避免为“看起来会看图”的多模态大模型付出过高推理成本。同时,SFT 数据合成管道能产出大规模几何-视觉联合监督样本,减少人工标注。
现有工作流接口
JigShape 可无缝接入 多模态模型 CI 评估链:用其 95K 实例作为回归测试,配合 piece accuracy / adjacency accuracy 指标监测模型版本更新。在 SFT 阶段,把 JigShape 训练集混入通用视觉指令数据,提升模型局部约束遵循能力;在 RAG/工具调用场景,可将拼图求解封装为几何验证工具,检查生成图像的布局一致性。项目数据已在 Hugging Face 开放,支持直接挂载到现有 dataloader。
局限
- **合成数据与真实场景差距**:JigShape 的拼图块由程序化生成,源图像来自公开数据集并进行切割与形状嵌入,缺少真实世界中拼图可能存在的**遮挡、光照变化、旋转、磨损**等自然扰动。虽然 tab-and-blank 几何约束解决了纹理重复区域的歧义,但合成渲染的块间颜色连续性与真实拼图块(如印刷偏移、材质反光)仍有差距,模型在合成 benchmark 上的表现可能高估或低估实际拼图求解能力。
- **评估模型覆盖有限**:零样本实验仅纳入五个前沿 VLM(GPT-5.5 等),且未系统测试开源模型、多模态 LLM 的不同尺寸版本或专门的视觉推理架构。此外,SFT 实验的基座模型与训练细节(如微调数据量、超参搜索)未完全展开,无法判断缩放悬崖是否在不同参数规模或训练策略下依然存在,这限制了结论的普适性。
- **任务形式单一,未涵盖更一般的几何推理**:JigShape 严格限定为网格排列、无旋转、固定边长的 tab-and-blank 拼图,缺少对部分遮挡、非规则网格、自由旋转块或更高阶空间关系(如三维装配)的评估。几何推理能力可能以多种形式体现,当前 benchmark 仅度量了其中一种狭窄设定,对未来研究的指引可能偏向于特定归纳偏置,而非通用视觉几何推理。