论文

没有系统性(systematicity)的思考?在规则归纳(rule induction)任务上评估推理模型

没有系统性(systematicity)的思考?在规则归纳(rule induction)任务上评估推理模型

人类认知的一个核心原则是 系统性(systematicity):理解一个概念,必然与理解该概念的相近变体相联系。推理模型是否稳健地具备这种系统性?若是,我们应预期模型在同一任务的结构等价变体上保持一致表现。 为此,我们将认知科学中已有的 规则归纳(rule induction) 任务扩展用于评估当前推理模型的思维系统性。每个任务族都具有 组合结构,我们借此通过任务同构(task isomorphism),如 重组(recombination) 与 替换(substitution),构造出结构等价的变体。 我们发现,尽管模型能正确求解某个任务,却常常在同一任务的结构等价变体上失败。这些发现表明,许多模型行为缺乏系统性,因而难以稳健地确立推理模型在其被评估的特定情境之外的认知能力。

论文精读

TL;DR 本文通过规则归纳任务评估推理模型的系统性,发现模型虽能正确解决特定任务,却常在结构等价变体上失败,表明其认知能力缺乏稳健性。

问题

问题背景

当前推理模型在数学、代码、逻辑等基准上表现抢眼,但评估大多基于固定测试集,对模型是否真正掌握规则、能否泛化到结构等价变体关注不足。

现有方法局限

常见评估方式依赖静态基准,模型可以通过记忆或模式匹配“刷分”。这些基准通常只考察单一任务实例,没有系统控制任务的 组合结构 与 同构变体。例如,同一规则的不同符号替换、排列重组,模型是否仍能识别?缺乏对 任务同构 的覆盖,导致无法区分“真正理解规则”与“对特定上下文的过拟合”。论文中指出,模型能够在某个任务上正确解题,却在结构等价的变体上频繁失败,表明其行为缺乏 系统性(systematicity),现有评估方法对认知能力的度量存在盲区。

为什么这个问题难/重要

系统性的缺失暴露了模型推理的脆弱性:模型可能学到了与任务表面形式相关的捷径,而非底层规则。该问题的难度在于:构造结构等价变体需要严格定义任务的 组合结构,并设计同构变换(如 重组、替换),这对评估框架要求很高;同时,模型的黑盒特性使得难以直接分析其内部表征。业界对此高度关注,因为推理模型正被用于需要稳定泛化的复杂决策场景,若缺乏系统性,则无法信任其在分布外或变体输入上的表现,也难以将单个基准上的高分推广到实际能力。

行业类比

类似于语音助手对同一指令的轻微措辞变化就失效,或代码模型在变量重命名后产出错误逻辑——表面上解决了问题,实则只记住了特定模式。推理模型的系统性缺失,意味着在真实应用中遇到输入扰动时,能力可能急剧下降。

核心洞察

  • 评估推理模型时,单点准确率掩盖了认知系统性的缺失。现有基准通常只报告模型在特定任务实例上的表现,而本文通过任务同构(重组与替换)构造结构等价变体,揭示模型虽能解决原始任务却在变体上大幅波动。这一视角将评估从“能否解决”转向“能否稳定迁移”,直接挑战了仅凭基准分数推断模型认知能力的主流做法。
  • 推理努力(如更长推理链或更多采样)并不必然带来系统性。作者发现增加推理预算未能一致提升跨变体稳定性,且模型随机性仅能部分解释系统性差距。这提示当前缩放推理计算的方式可能只是在拟合特定分布,而非习得可组合的规则表征;对工程实践而言,单纯堆算力或采样次数不能替代对任务结构不变性的显式建模。

方法

输入构建

本次评估基于四类来自认知科学的规则归纳任务(rule induction tasks),均具有组合结构(compositional structure):

  • 语法指令学习(grammar-based instruction-learning)
  • 符号 Raven 渐进矩阵(symbolic Raven’s progressive matrices)
  • 整数序列上的程序归纳(program induction over integer sequences)
  • 布尔概念学习(Boolean concept learning)

每项任务包含 instruction、support set 与 query set,并保持特定任务不变性(invariances)。

关键模块

通过对原始任务施加任务同构(task isomorphisms),生成结构等价变体(structurally equivalent variants)。同构操作包括:

  • 重组(recombination):重新排列组合组件,不改变底层规则
  • 替换(substitution):替换符号、词汇或对象映射,保持关系结构不变

这些变体共享相同的抽象规则,仅表面特征不同。系统性被定义为:若模型能掌握一个概念,则应在它的所有结构等价变体上表现一致。

度量与输出

评估时记录模型在每个变体上的准确率,并采用系统性度量(systematicity metrics)量化跨变体一致性。为区分随机性(stochasticity)影响,对同一任务进行多次采样,并同时测试贪婪解码(greedy decoding)下的表现;通过方差分解(总观察方差、期望任务内变异方差等)识别系统性缺口来源。

与同类评估的差异

以往基准通常只报告单一任务实例上的准确率,本方法通过任务同构强制考察模型行为是否具备系统性,从而揭示“能答对某个样本”并不等价于“理解底层规则”。

实验

实验设计

本文扩展了认知科学中的规则归纳任务,构建四个任务家族:语法指令学习、符号瑞文渐进矩阵、序列程序归纳、布尔概念学习。每个家族具有组合结构,通过任务同构(recombination、substitution)生成结构等价变体。评估 reasoning models 在原始任务与变体上的表现一致性,并将总方差分解为任务内变异与跨任务变异,计算系统性指标。

关键发现

  • 模型能在某些任务变体上正确求解,但换到结构等价变体时经常失败,存在系统性缺口。
  • 增加推理努力(如更多思考步骤或更长答案)并不能稳定改善系统性。
  • 对比多次采样与贪婪解码,模型随机性只部分解释缺口;贪婪解码下缺口仍显著。
  • 这表明当前 reasoning models 的行为缺乏系统性,不能仅凭单一上下文中的成功推断其认知能力。

与基线对比及工程启示

与人类认知的系统性假设相比,模型尚未达到;论文强调"可靠性是系统性的前提"。相比只测评单一 task instance 的常规 benchmark,本文方法要求跨结构等价变体 评估,更能暴露模型对表面特征或特定 prompt 格式的过拟合。 工程启示:构建评估集时应生成大量任务同构变体并测量跨变体方差;报告模型能力时需区分单点性能 与 系统性稳健性,避免将局部成功误判为泛化能力。

行业影响

落地场景

systematicity 缺口直接影响依赖规则归纳与组合泛化的推理型产品:智能客服政策问答、代码助手生成业务逻辑、医疗诊断规则解释、金融合规审核等。这些场景中,用户换一种等价表述(同义替换、条件重排)不应改变模型判断。可将本工作提出的任务同构变体(重组、替换)作为模型上线前的鲁棒性测试集,过滤系统性差的候选模型。

商业价值

  • 降低长尾错误成本:提前发现模型在结构化等价输入上的不一致,减少生产事故与客诉。
  • 提升信任与合规:在金融、医疗等强监管领域,可解释且系统性的推理是审计与认证的基础。
  • 减少人工兜底:无需为每种表述变体单独微调或编写规则补丁,依靠模型自身保证一致性。

与现有产品/工作流的接口

  • 将论文提出的重组/替换同构生成器集成到 eval 框架(如 lm-evaluation-harness、HELM),输出 systematicity score 作为 CI 质量门禁。
  • 在生产监控中,对关键推理服务记录输入的语义等价簇,统计模型输出分布漂移,触发再训练或回滚。
  • 与 A/B 测试平台联动,对比新旧模型在结构化变体上的稳定性,而非只看平均准确率。

具体 use case:电商平台退货政策助手——用户问“我 7 天前买的能退吗”和“购买超过一周能否退货”是等价问题,模型若对前者正确、对后者错误,则系统性差。企业服务 RPA 流程中,解析“如果金额 > 1000 且供应商属于 A 类,则审批”与等价重排条件,模型应生成相同决策逻辑,否则自动化流程会出错。

局限

  • 论文评估的模型范围较窄,主要覆盖了几个主流闭源推理模型(如 GPT-4 系列、Claude 系列),未纳入更多开源模型或不同架构的模型,且任务类型限定在语法学习、符号 Raven、程序归纳和布尔概念学习四类规则归纳任务。这限制了结论的普适性。对实际工程的启示:开发者不能假设一个模型在某一类任务上表现良好就能自动泛化到结构相似的变体,评估模型稳健性时必须引入多样化的同构变换测试。
  • 虽然论文尝试通过 greedy decoding 控制随机性,但实际部署中推理模型常使用温度采样,且输出分布对提示词敏感。论文承认模型随机性只能部分解释系统性差距,意味着即使在确定性设置下,模型仍存在本质上的非系统性表现。工程上建议在评估模型能力时报告多次采样的方差和分布,而非仅依赖单次 greedy 输出,否则可能高估模型的实际稳健性。
  • 该工作聚焦于诊断推理模型缺乏系统性的现象,但未提出任何提升系统性的方法或训练策略,与一些同时关注改进泛化能力的工作(如元学习、组合性增强)相比,其直接工程指导价值有限。它更像一个评估基准而非解决方案。后续工程实践若要增强模型的系统性,还需结合其他技术路线,如数据增强、显式组合约束或架构调整。
论文Simon Schug2026-09-12原文

相关内容