论文

ChLogic: 评估中文表达逻辑推理的鲁棒性

ChLogic: 评估中文表达逻辑推理的鲁棒性

大语言模型在标准化逻辑推理基准上表现日益提升,但这种能力在非英语环境下是否依然稳健尚不明确。我们提出 ChLogic,一个英汉对齐的基准,旨在测试当相同潜在逻辑结构分别以英语和多种中文表层实现形式表达时,模型能否保持推理性能。基于形式化逻辑模板构建,该基准包含三个数据集:(i) General 对齐集,源自 9 个模板家族的 60 条通用命题;(ii) Difficult 对齐集,源自 40 个困难问题;(iii) 纯中文集,覆盖 15 种语言特有的现象类型。每个对齐条目配对一个英语参考表达与五个中文实现。 在 Qwen3、Ministral 和 GLM 模型上的实验揭示了持续的英汉性能差距。从标准中文回译至英语通常能提升在 General 对齐集上的性能,但在 Difficult 对齐集上效果不一,其中 Qwen3-32B 和 GLM-5.1 在翻译后表现更差。这些结果表明,中文表层实现、翻译伪影和模型特定行为共同影响多语言逻辑推理。 总体而言,ChLogic 为多语言推理的鲁棒性提供了有效的压力测试。

论文精读

TL;DR ChLogic 构建英中严格对齐的逻辑推理基准,首次系统揭示大模型在中文表层实现下普遍存在推理性能衰减,并通过回译实验诊断出跨语言鲁棒性瓶颈。

问题

逻辑推理能力 一直是衡量大模型智能的核心维度,当前主流基准(如 BIG-Bench、LogiQA)显示模型已逼近或超越人类水平,但这些基准几乎全为英文设计。随着全球化部署加速,模型在非英文语言中是否仍能维持同等推理鲁棒性,已成为紧迫的工程验证需求。

现有评估方案存在显著局限。多数多语言基准采用直译方式构建,未能保持原文与译文在潜在逻辑结构 上的严格对齐,导致性能差异既可来源于语言表面形式的变化,也可能源自翻译过程中逻辑关系的失真,难以精准归因。回译(back-translation)虽常用于数据增强,但在复杂推理场景下会引入新的人工伪影,反而加剧模型表现的不可预测性。此外,缺乏对语言特有用例(如中文的省略、语序灵活等)的系统覆盖,进一步削弱了测试的判别力。

该问题的技术挑战在于:语言表面实现 (surface realization)差异可能通过注意力分布、分词边界等机制放大模型对推理路径的混淆,而不同模型对同一语言现象的敏感性高度分化,使得单一修复策略很难普遍适用。从业界视角看,多语言推理鲁棒性直接关系到 AI 系统在客服、法律、教育等关键领域的可信度与公平性,是 LLM 从实验室走向生产环境必须跨越的“语言围墙”。

这一挑战类似语音识别中应对不同方言或噪声环境的鲁棒性测试:只有当模型在相同逻辑命题的不同语言表达下输出一致,才能证明其推理能力超越了表层词汇模式匹配,真正具备任务泛化性。

核心洞察

  • - **逻辑推理的跨语言鲁棒性不仅取决于绝对准确,更依赖表层实现的稳定性**。ChLogic 通过为同一逻辑结构生成多种中文表达,直接量化了渲染变化造成的性能偏差,有别于仅评估单次翻译准确率的常见多语言基准。该视角将关注点从“能否正确推理”转向“推理是否对输入扰动鲁棒”,对多语言 LLM 在真实应用中的可靠性提出了更高工程要求。
  • - **回译在 ChLogic 中作为诊断工具揭示了模型特有的跨语言对齐缺陷,而非通用性能修复手段**。实验表明,标准中文回译为英文后,困难子集上的表现不升反降(如 Qwen3-32B 和 GLM-5.1),暴露出翻译 artifacts 与模型内部语言映射机制之间的复杂交互。这警示工程实践不能一刀切地依赖翻译桥接,而需要针对不同模型分析其多语言推理的脆弱环节并设计针对性训练策略。

方法

ChLogic 的构建遵循 形式逻辑模板 → 表面实现生成 → 质量控制 → 对齐数据集输出 的流水线, 核心目标是分离逻辑结构与语言表面形式, 系统评估 LLM 在多语言下的推理稳健性。

输入: 形式逻辑模板

基准从命题逻辑与一阶逻辑的经典模式出发, 定义了 9 个模板家族 (如蕴含、等价、三段论等), 覆盖 60 个一般命题40 个困难问题。每个模板确定一种抽象推理结构, 例如“若 P 则 Q; 非 Q; 因此非 P”, 并实例化为英文参考表述。

关键模块: 表面实现与中文多样化

对每个英文参考, 利用 LLM (如 GPT-4) 在控制逻辑不变的条件下, 生成 5 种不同的中文表面实现。这些实现涵盖:

  • 句法变换: 主动/被动、主谓宾序调整、修饰位置变化;
  • 词汇选择: 同义词、口语化/书面化表达;
  • 语用特征: 反问、双重否定、省略、语序倒装等, 包括 15 种中文特有现象 (如把字句、被字句、主题-述题结构等)。 生成后通过 验证器 LLM 检查每个中文实例是否与英文参考保持相同的真值条件与推理路径, 剔除改变逻辑的样本。

输出: 三部分数据集

  • General aligned set: 一般命题的中英对齐集, 每个英文对应 5 个中文表达, 用于测量表面变化带来的性能波动。
  • Difficult aligned set: 困难问题的对齐集, 侧重复杂推理链在翻译下的退化。
  • Chinese-only set: 仅针对中文特有语言现象的专项测试, 不设英文对照, 用于探测模型对中文独特的逻辑歧义、零指代等问题的处理能力。

差异点

与现有逻辑推理基准 (如 LogiQAReClor) 仅靠单语人工编写或简单翻译不同, ChLogic 通过模板驱动 + LLM 多样生成 + 逻辑一致性验证, 实现了对同一推理结构在不同表面形式下的 稳健性压力测试; 同时引入 回译诊断 机制, 区分性能差距来源于语言表面差异还是翻译本身引入的扭曲, 为跨语言推理的工程优化提供了更细粒度的分析工具。

实验

实验设计

ChLogic 基准包含三类对齐数据集:

  • General aligned set —— 基于 60 条一般命题、9 类逻辑模板生成,每项 1 条英文参考表达 + 5 条中文表面实现;
  • Difficult aligned set —— 源自 40 道困难逻辑问题,同样做英-中对齐;
  • Chinese-only set —— 覆盖 15 种中文特有语言现象,不包含英文对照。
    评估采用 Qwen3、Ministral、GLM 等主流大模型,重点检验同一隐逻辑结构在不同语言表面形式下的推理稳定性。另外设计了 中→英回译诊断 —— 将标准中文表达反向译为英文后再次评估,以区分语言表面与翻译噪声的影响。

关键发现

  • 持续英-中性能差:所有被评模型在中文表达上的逻辑推理准确率均低于英文基线,差距在不同命题族上普遍存在。
  • 回译效果分层:对 General aligned set,回译英文后多数模型性能回升,说明部分差距来自中文表面实现;但在 Difficult aligned set 上,回译带来混合效应——Qwen3-32B 与 GLM-5.1 翻译后反而表现更差,暗示困难逻辑场景中翻译假象可能引入额外扰动。
  • 模型特异性行为:不同模型对同一表面变化的敏感度差异明显,提示多语言推理鲁棒性不仅受语言差异影响,还与模型架构/训练数据分布强相关。

与基线及同类工作的差异

基线本质是同一逻辑结构在英文下的表现。ChLogic 的贡献在于首次系统性量化语言表面实现(surface realization) 对推理的衰减,而不是简单跨语言翻译评测。与以往多语言基准(如 XGLUE、M3Exam)不同,它剥离了知识差异,聚焦形式逻辑的跨语言迁移,因而能更纯粹地暴露模型的推理脆弱性。回译实验进一步将误差分解为“表面形式代价”与“翻译假象代价”,为多语言模型优化提供了明确诊断路径。工程启示:仅仅增加多语言训练数据不够,需要针对逻辑算子在不同语言中的编码差异做显式对齐或数据增强。

行业影响

落地场景

多语言逻辑推理的鲁棒性直接影响以下产品业务:

  • 全球客服与对话系统:跨语言 FAQ 匹配、复杂条件推理(退款政策、售后流程),要求模型在英/中文切换时结论一致。
  • 金融风控与合规审核:合同条款、交易规则解析,中文表述的语义变化可能导致漏洞,需模型对逻辑等价性保持稳定。
  • 教育科技(自适应学习):数理逻辑题的多语言变体生成与批改,模型判题需跨语言公正。
  • 内容安全审核:识别不当内容的逻辑模式,避免因中文表述方式不同而漏判。

商业价值

  • 降低风险与返工成本:发现模型在中文逻辑推理上的系统性短板,避免线上事故(如客服答错赔偿规则),减少人工复核开销。
  • 提升全球市场产品体验:保证多语言产品一致性,增强用户信任,支撑企业出海 SaaS 的 NPS 与留存率。
  • 加速模型选型与迭代ChLogic 作为压力测试工具,可量化模型跨语言鲁棒性,指导微调策略(如是否引入回译增强),缩短从研发到上线的验证周期。

与现有产品/工作流的接口

  • 集成进 LLMOps 评估管线:作为**持续测试(Continuous Testing)**的一部分,在模型版本发布前自动运行 ChLogic,生成逻辑-表面形式关系报告;通过 CI/CD 触发告警,防止中英文性能差距在更新中恶化。
  • 强化数据飞轮:基于 ChLogic 发现的模板级困难点(如特定逻辑连词的中文处理),定向收集或合成回译训练数据,补充进指令微调数据集。
  • 与 RAG/Agent 框架结合:在检索增强生成中,对中英输入统一进行逻辑标准化预处理(如用回译或逻辑式脱敏),再交给核心推理模块,减少表面形式干扰。

具体落地用例

  1. 跨国电商平台智能客诉处理:用户用中文描述“如果没有收到退款,且订单确实已退货,请联系客服”,模型需正确理解嵌套条件并执行下一步操作。ChLogic 可针对此类模板生成大量变体测试,提前暴露模型在中文否定、条件嵌套下的误判,避免因推理错误导致资损。
  2. 国际在线教育平台的逻辑练习自动批改:一道 IF-THEN 推理题分别以英文和多种中文表述(文言、口语化、省略连词)展示给学生。系统需对答案一致性打分。利用 ChLogic 的通用对齐集可评估批改模型在两种语言下的判决差异,基于此针对性微调中文分支,确保公平评分。

局限

  • **模型覆盖范围有限**:实验仅评估了 Qwen3、Ministral 和 GLM 三个模型系列,未包含 GPT‑4、Claude 等主流闭源模型,也未考虑其他开源模型(如 Llama 系列)。这限制了结论的普遍性,无法判断英语‑中文性能差距是否为特定架构或训练数据的产物,对于想要全面评估多语言逻辑鲁棒性的从业者来说,缺少关键参考。
  • **数据集规模与多样性不足**:通用对齐集仅含 60 个命题、困难对齐集 40 个问题、中文专有集 15 类现象,总数据点有限。逻辑模板虽覆盖九种类型,但难以穷尽真实场景中的推理模式;中文表面实现虽设计了多样性,但可能仍无法完全模拟自然语言中的复杂变异(如方言、口语化表达)。在工程应用中,更细粒度的难度分层和更大规模的数据是必要的。
  • **回译诊断存在混杂因素**:实验仅采用标准中文到英文的回译,未对比多种翻译方法或双向翻译,且未控制翻译质量。回译可能引入语义偏移或语言伪影,导致难以区分性能变化究竟是源自中文表面实现差异,还是翻译过程本身的信息损失。这削弱了将回译作为消除表面实现影响的诊断工具的信度,使跨语言因果分析存在干扰。
论文Peixian Zhou2026-06-16原文

相关内容