论文

CurveBench: 针对嵌套Jordan曲线精确拓扑推理的基准测试

CurveBench: 针对嵌套Jordan曲线精确拓扑推理的基准测试

我们提出 CurveBench,一个从视觉输入进行 层级拓扑推理 的基准测试。CurveBench 包含 756 张成对不相交的 Jordan 曲线图像,涵盖简单、多边形、地形模拟、迷宫式和密集计数配置。每张图像标注了一个有根树,编码平面区域间的包含关系。 任务形式化为 结构化预测:给定图像,模型必须恢复由曲线诱导的完整有根包含树。尽管视觉上简单,最强模型 Gemini 3.1 Pro 在 CurveBench-Easy 上仅达到 71.1% 的树生成准确率,在 CurveBench-Hard 上为 19.1%。我们进一步通过 RLVR 风格的微调 对开源视觉语言模型进行基准测试。训练的 Qwen3-VL-8B 模型在 CurveBench-Easy 上的树生成准确率从 2.8% 提升到 33.3%,在我们的评估协议下超过 GPT-5.4 和 Claude Opus 4.5。 剩余差距,尤其是在 CurveBench-Hard 上,表明精确的拓扑感知视觉推理仍远未解决。

论文精读

TL;DR CurveBench 通过嵌套 Jordan 曲线的包含树重建任务,测试模型的结构化拓扑推理能力,即使最强 VLM (Gemini 3.1 Pro) 在简单/困难集上也仅 71.1%/19.1% 准确率,证明精确拓扑视觉推理仍是重大挑战。

问题

问题背景

视觉理解中,物体间的嵌套与包含关系(例如平面曲线所围区域的层次结构)是拓扑推理的核心。然而,当前基准大多将视觉任务简化为分类或检测,缺乏对结构化拓扑输出的精确评估,尤其针对曲线族诱导的根树重建问题。

现有方法局限

主流视觉语言模型(VLM)在直接预测拓扑结构时表现远未达到可用水平:

  • 零样本能力弱:顶级模型 Gemini 3.1 Pro 在 CurveBench-Easy 上的树生成准确率仅 71.1%,Hard 子集暴跌至 19.1%;GPT-5.4 与 Claude Opus 4.5 在 Easy 上的准确率甚至只有个位数(<10%)。
  • 结构化输出的组合泛化不足:模型需要从像素推断出所有区域对的包含/分离关系,并组合成合法根树。现有方法常把任务退化为逐区域分类,丢失全局一致性,导致环形包含、深度错位的错误。
  • 缺少针对性的拓扑感知损失:普通微调或提示工程很难注入 Jordan 曲线定理的归纳偏置,模型对曲线自交、多重嵌套的推理几乎随机。

为什么这个问题难且重要

技术挑战源于像素到组合结构的鸿沟:

  1. 低级特征与抽象结构的错配:曲线图像视觉简单,但正确的包含树高度依赖精确的相邻性判断。微小裂缝、接近曲线都可能引发拓扑错误,而 CNN/ViT 的表征对此不够鲁棒。
  2. 输出空间指数爆炸:n 条曲线可能产生 Catalan 数复杂度的合法根树,模型需在极大空间中搜索,传统交叉熵可能遗漏有效结构。
  3. 长程一致性需求:一个局部误判(如把包含判为分离)会导致整个子树错位,形成雪崩效应。

业界关注度:拓扑感知推理是自动驾驶(车道线嵌套)、地理信息系统(地图等高线)、图表理解(流程图嵌套)等真实应用的安全关键能力。现有通用 VLM 的脆弱性意味着这些场景仍需大量规则后处理,无法端到端信赖。CurveBench 作为首个大规模、层级化拓扑基准,直接暴露了这一短板,为模型的结构化感知能力提供了严格检验。

行业类比

正如分子图生成要求模型输出精确的键接树而非期望在像素级别识别原子,CurveBench 同样要求视觉模型从曲线图像中直接输出区域包含的根树结构——一种对拓扑认知的“图灵测试”,推动视觉推理从统计模式匹配迈向代数拓扑一致。

核心洞察

  • 将**嵌套 Jordan 曲线的包含关系**定义为结构化预测任务,要求模型输出完整的**有根树**,而非简单的分类或检测,这显著提升了评估的严格性。 这项任务的核心挑战在于:模型必须从像素中推断出所有闭合曲线之间的精确拓扑层次,任何局部错误都会导致整棵树被判为错误。与常见的 VQA 或目标定位不同,CurveBench 的 `tree-generation accuracy` 指标不允许多个部分正确的输出,因此即使视觉上看似简单的图像(如 Easy 集),Gemini 3.1 Pro 也仅达到 71.1%。这揭示了当前 VLM 在**精确、无歧义的拓扑推理**上存在显著短板,远未解决。对实际工程的启示是:在需要层次化理解空间关系时(如地理信息提取、示意图解析),应避免直接使用现成的 VLM 进行端到端结构化预测,而需考虑专用解码策略或后处理验证。
  • 通过 **RLVR (Reinforcement Learning from Visual Reasoning)** 对开放权重的 VLM 进行参数高效微调(PEFT),在 CurveBench-Easy 上将 Qwen3-VL-8B 的准确率从 2.8% 提升至 33.3%,超过了 GPT-5.4 和 Claude Opus 4.5 在该任务上的零样本表现。 这一结果说明:对于结构化预测任务,强化学习能够有效提供**过程监督的奖励信号**,弥补标准指令微调的不足。但微调后模型在 Hard 集上仍只有 19.1%(Gemini 零样本) vs 33.3%(只在 Easy 上),意味着 RLVR 并未赋予模型真正的拓扑推理能力,更多是学会了 Easy 集的数据模式。这警示我们:在评估此类微调时,必须使用分布外、难度有显著差异的测试集以避免过拟合,且强化学习奖励的设计(文中进行了消融)对泛化至关重要。

方法

输入

模型接收单张 PNG 图像,图像中包含多条两两不相交的 Jordan 曲线(如简单闭合曲线、多边形、等高线或迷宫线)。这些曲线将平面划分为多个嵌套区域,构成一个层次包含关系。

关键模块

1. 基座视觉 - 语言模型

选用 Qwen3-VL-8B 等开源视觉 - 语言模型作为骨干,直接从像素输入生成结构化树表示。模型以文本序列形式输出一棵 有根树,例如 "( A ( B C ) )" 这样的括号表达式,其中叶子节点对应最小区域,根节点表示最外层背景。

2. RLVR 风格强化微调

采用 强化学习推理(RLVR)范式进行任务特化训练,核心是设计奖励函数来度量生成树与真实树的结构一致性:

  • 完全匹配奖励:若生成的树结构与标注完全一致,给予高分;否则返回低分或零分。
  • 树编辑距离奖励:基于 Zhang-Shasha 树编辑距离 设计连续奖励,鼓励模型输出与正确答案逐步接近的拓扑结构。
  • 消融实验表明,将编辑距离转换为奖励信号能更稳定地引导模型学习精确的包含关系,而仅使用 0/1 完全匹配奖励容易造成稀疏奖励问题。
3. 参数高效微调

为了降低计算开销,在 RL 微调阶段采用 LoRA(低秩适配)方法,仅更新模型的少量额外参数,原始权重保持冻结。训练配置包括使用 AdamW 优化器、批次大小为 16、总步数约 2000–4000 步,在单张 GPU 上即可完成。

4. 推理约束

在生成过程中,强制要求模型输出符合树语法,避免非法的嵌套结构。通过约束解码(constrained decoding)确保生成的括号序列能解析为一棵合法树,从而提升评估时的有效输出率。

输出

模型最终输出一棵 有根包含树,完整表示图像中所有区域的嵌套关系。对于简单样本(CurveBench-Easy),模型可达到较高的树生成准确率;但在复杂配置(CurveBench-Hard)下,准确率大幅下降,揭示了现有模型在精确拓扑推理上的短板。

与同类方法的差异

相比传统的视觉问答或图表理解任务仅要求语义层面的近似答案,CurveBench 要求严格的结构化拓扑推理,且评估采用完全树匹配指标,任何层次错位即判为错误,这使得该基准能精准暴露模型在精细空间关系理解上的不足,而非满足于模糊的语义对齐。

实验

实验设计

CurveBench 任务定义为:给定一幅由互不相交的 Jordan 曲线构成的图像,模型需输出完整的区域嵌套包含树(hierarchical containment tree)。数据集包含 756 张图像,覆盖 easy、polygonal、terrain-inspired、maze-like 和 dense counting 五种配置,按难度分为 CurveBench-EasyCurveBench-Hard 两个子集。评估框架采用严格的结构匹配:模型输出的树必须与标注树完全一致。

实验对比了多款闭源与开源视觉语言模型(VLM),包括 Gemini 3.1 ProGPT-5.4Claude Opus 4.5 以及 Qwen-3-VL-8B-Thinking。在此基础上,对开源模型 Qwen3-VL-8B 执行 RLVR(Reinforcement Learning with Verifiable Rewards) 风格微调,使用参数高效微调(如 LoRA)降低算力需求。奖励设计鼓励模型生成正确的树结构,并通过消融实验验证关键组件。

关键发现

  • 当前最强大模型在 Easy 子集上的准确率仅为 71.1%(Gemini 3.1 Pro),在 Hard 子集上则骤降至 19.1%,表明精确的拓扑推理对现有 VLM 极具挑战。
  • 未微调的 Qwen-3-VL-8B-Thinking 在 Easy 上的准确率低至 2.8%,但经过 RLVR 微调后,Qwen3-VL-8B 达到 33.3%超越 GPT-5.4 和 Claude Opus 4.5,提升幅度超过 30 个百分点
  • Hard 子集依然存在巨大进步空间(最高分仅 19.1%),说明简单视觉场景下的层次化拓扑推理远未解决。

与基线的对比及工程启示

与常见视觉推理基准(如 CLEVR、几何图题)不同,CurveBench 要求精确还原嵌套包含关系,不允许近似或语义理解,这暴露了 VLM 在结构化拓扑认知上的根本缺陷。闭源模型虽凭借规模取得一定表现,但微调后的中等规模模型即可大幅反超,证明RLVR 在引导模型生成严格格式化输出方面极具潜力

从工程视角看,该基准可作为评估模型在医学影像区域分割、地图图层解析、CAD 层级识别等需精确嵌套理解的任务中的可靠性标尺。Hard 子集的极低分警示从业者:当前 VLM 尚未掌握真正的拓扑不变性,实际部署前需进行此类针对性测试。微调方案的成本与效果比亦值得在多模态智能体架构中整合。

行业影响

落地场景

CurveBench 所定义的精确拓扑推理任务,主要面向那些需要从视觉输入中提取层次化包含关系的产品与业务。典型的工业落地场景包括:

  • 智能设计工具:解析 CAD 图纸、电路板布局或 UI 设计稿中图层与组件的嵌套关系,辅助自动标注与约束检查。
  • 地理信息系统 (GIS):从卫星或行政地图中推断区域轮廓的包含树,用于空间查询与分析。
  • 医学影像分析:识别器官与病变区域的多级包含结构,提升报告生成与异常检测的结构化程度。
  • 文档与图表理解:抽取组织结构图、思维导图、分类树图中的层次关系,支撑搜索与知识图谱构建。

具体用例:全球电商平台的商品类目图自动生成 —— 卖家上传描述产品线层级关系的示意图,模型直接输出可检验的 JSON 树,代替人工录入;在线教育中的几何证明题批改 —— 自动判定图形中区域包含关系的正确性,节省教师时间。

商业价值

当前最强的闭源模型 Gemini 3.1 Pro 在 CurveBench-Easy 上仅有 71.1% 准确率,Hard 子集仅 19.1%,且经过 RLVR 微调的 Qwen3-VL-8B 从 2.8% 跃升至 33.3%。这揭示了两条商业价值线:

  1. 降本增效:对于需要大量人工标注结构化树(如文档解析、图纸数字化)的流程,用微调后的视觉语言模型替代部分人力,大幅减少错误率与重复劳动。
  2. 体验升级:在交互式应用中(如智能相册的物体关系组织、搜索引擎的层次化结果展示),拓扑推理能力能提供更精准的反馈,改善用户满意度。

性能的巨大提升空间也意味着这是一块尚未饱和的蓝海 —— 率先攻克拓扑推理瓶颈的团队可快速建立壁垒。

跟现有产品/工作流的接口

CurveBench 本身可作为评估模块微调任务无缝集成到 VLM 工作流中:

  • 评估集成:将数据集挂载到现有的模型评测流水线(如 lm-evaluation-harness),增加拓扑推理能力分数,作为模型选型的参考指标。
  • 训练集成:利用项目提供的 RLVR(基于可验证奖励的强化学习)配置与 LoRA 微调方案,可直接在开源 VLM(Qwen3-VL、LLaVA 等)上追加拓扑推理能力,无需改动模型架构。
  • 奖励设计:文中采用的树编辑距离奖励函数可复用至其他结构化预测任务,如关系抽取、公式解析,形成一套通用的结构一致性反馈机制。

从工程角度看,CurveBench 的轻量级图像(尺寸小、场景简单)与标准化标注格式(rooted tree)非常利于自动化持续集成(CI/CD 中的模型回归测试),且支持 HuggingFace Datasets 快速加载,降低了落地门槛。

局限

  • CurveBench 目前仅包含**成对不相交的 Jordan 曲线**,未涉及相交、自相交或多连通域等更一般的拓扑情景。这使基准覆盖的推理类型较窄,对于地图轮廓、医学图像分割等现实应用的代表性不足。若要全面衡量模型的拓扑推理能力,需扩展曲线种类和结构复杂度。
  • 总样本量仅 756 张图像,划分出 Easy/Hard 子集后,对大规模视觉-语言模型的训练与评估可能不足。尤其在 **CurveBench-Hard** 上,所有方法(含微调)的准确率仍很低,这可能源于数据有限导致的过拟合或学习不充分。扩充数据集是可进一步挖掘模型潜力的直接途径。
  • RL 微调采用**树完全匹配准确率**作为奖励,信号极度稀疏:仅当生成树与真值完全一致时才给予正向反馈。在结构化预测任务中,这会忽视预测中的局部正确性(如部分父子关系正确),使模型难以获得有效梯度信号。引入部分匹配奖励或分步验证机制,可能提升训练效率和最终表现。
论文Amirreza Mohseni2026-05-13原文

相关内容