NOLLI:用于诊断英韩性能差距的难度校准谜题基准
我们提出 NOLLI,一个程序化生成的英韩谜题基准,用于定位韩国语言模型性能差距的来源。它包含 15 种谜题类型(25 个任务;7,500 个条目),每个实例均可通过种子重新生成,已验证具有唯一解,并采用确定性评分。我们并非简单地将“更难”等同于“更大”,而是对难度进行行为校准:调整每个生成器,直到固定的参考模型落在目标准确率区间内。其三层设计结合了匹配的直接翻译、基于韩文字母 jamo(子音节字母)的脚本改编,以及植根于韩国文化或拼写法的韩语专属任务。 我们评估了 15 个前沿模型、开放权重模型及韩国开发的模型;在整体准确率高于 3% 下限的 12 个模型中,匹配的英韩准确率在 ±10 个百分点范围内统计等价(TOST),表明仅呈现语言本身带来的代价很小。书写系统密集型任务显示出更明显的差距:韩文密码(Korean Cipher)比英文落后最多 68.7 个百分点,而相同 jamo 上的字母算术(Cryptarithmetic)没有系统性惩罚,并且 jamo 组合准确率可预测韩文密码准确率。这些对比具有诊断性而非因果性,与多步子音节执行的困难一致。韩语专属任务将规则应用缺陷(符号可变)与 亲属关系(Kinship)缺陷(在所有 12 个模型中均为正向)区分开来。最后,显著的大小度量在 15 种类型中有 7 种未能从 Easy 增长到 Hard,使得结构大小作为经验难度的代理并不可靠。
论文精读
TL;DR NOLLI 通过难度行为校准的英韩谜题基准,系统诊断出语言无关的子音节拆解瓶颈与韩语特有规则应用缺陷,揭示输入规模并非可靠难度指标。
问题
问题背景
随着大语言模型(LLM)在多语言场景中的部署日益普及,行业内亟需细粒度诊断工具来量化模型在非英语语言上的性能差距。现有评估多集中于英语基准,但英语与目标语言之间的表现鸿沟往往隐藏在不同任务层面——可能源于语言表层呈现、书写系统特性,或深层语言文化知识。
现有方法局限
当前跨语言基准主要存在三个技术短板:
- 翻译不可比:多数基准通过人工翻译或机器翻译将英语任务直接转换为目标语言,却未控制任务难度的一致性,导致无法区分性能差距是来自语言不同,还是任务本身难度差异。
- 书写系统忽略:对于像韩语这样采用Hangul jamo 组合的文字系统,模型在子音节级别的处理能力未得到独立测量;简单翻译式基准会掩盖模型在字符编解码层面的瓶颈。
- 知识混杂:任务中同时混杂了语言技能、通用推理和文化常识,使得评估无法隔离变量——例如,模型在“亲属称谓推理”上的失败,究竟是因为韩语称谓体系复杂,还是因为缺乏该文化背景,现有基准无法给出答案。
为什么这个问题难/重要
构建一个可公平对比且能诊断具体瓶颈的跨语言基准,面临难度校准与变量隔离双重挑战。不同语言在结构、文化上的差异使得机械等量替换任务参数无效——例如,单纯增加输入长度不一定提升难度。此外,业界对全球 AI 包容性的关注持续升温,如果无法定位非英语语言的性能短板,模型在面向全球用户时容易产生系统性偏见或错误,制约商业落地。因此,能够像 NOLLI 那样通过行为校准、三层设计(直接翻译、书写系统适配、语言特定任务)来解耦性能来源的基准,对工程化部署具有重大参考价值。
行业类比:这一挑战类似于语音助手在方言识别上的困境——仅靠标准语言训练无法覆盖方言变体,必须从音素、语调和文化用语层面进行专门诊断,否则用户场景覆盖面会大幅缩水。
核心洞察
- **行为难度校准取代结构大小作为难度指标**:与传统基准靠增加输入规模或规则复杂度来提升难度不同,NOLLI 通过调节生成器参数使固定参考模型准确率落入预设区间,确保每个实例的“难”是由模型行为定义的。这种校准暴露了 7/15 类谜题中结构大小无法预测经验困难的事实,颠覆了“更大=更难”的默认假设,为诊断性基准提供了更可靠的难度设计范式。
- **三层跨语言设计分离语言、书写系统与文化知识效应**:NOLLI 将任务分为直接翻译、韩文字素(jamo)脚本改编和纯韩语三类,在不混淆语言本身与书写系统复杂性的前提下定位性能缺口。关键发现是:同基于 jamo 的 Cryptarithmetic 无损而 Cipher 大幅落后,且 Jamo Composition 准确率可预测 Cipher 表现,暗示瓶颈在于多步子音节组装而非字符级操作。这种精细化设计为跨语言模型诊断提供了可复现的分析框架,超越简单的双语准确率对比。
方法
NOLLI 基准的构建以程序化生成、难度行为校准和三级跨语言设计为核心。输入是预设的谜题模板与参数化生成器,流程包含三个关键模块。
- 生成与验证:每个实例由种子驱动生成,通过约束求解器验证唯一解,保证评分确定性;所有 7500 项实例均可通过种子复现。
- 难度校准:摒弃以输入规模定义难度的做法,采用固定参考模型进行行为校准。迭代调整生成器参数,使 Easy / Medium / Hard 三个等级的模型准确率分别落入 60–80% / 40–60% / 20–40% 的目标区间。这意味着“更难”体现为模型行为上的可解性降低,而非结构尺寸增大。
- 三级跨语言设计:(1) 直接翻译任务(如数独、扫雷)提供英韩平行对照,控制语言呈现本身的影响;(2) 书写系统适应任务(如基于韩文 jamo 的密码题与密码算术)诊断子音节字母操作带来的瓶颈;(3) 韩语专属任务(如亲属称谓、四柱八字)捕捉文化或正字法知识的影响。
最终输出一个包含 15 种谜题类型、25 个任务、7500 个已校准实例的诊断性基准,可用于分离并量化语言形式、书写系统复杂性和领域知识对模型性能的贡献。与仅依赖翻译对或大小递增的跨语言基准不同,该方法通过行为校准与分层设计,实现了对不同性能差距来源的更细粒度定位。
实验
实验设计:NOLLI 基准包含 15 种谜题类型(25 个任务,7500 个实例),分为三个层次:直接翻译(8 种)、文字改编(2 种,利用韩文拆解)和韩国特有任务(5 种)。采用行为校准策略:针对每个生成器调整参数,使固定参考模型达到预设准确率区间,从而控制难度可比性。评估了 15 个前沿及开放权重模型,并聚焦于 12 个整体准确率高于 3% 的模型进行分析。
关键发现:
- 语言呈现本身不带来显著成本:匹配的英韩任务准确率在 ±10 pp 内统计等效(TOST 检验),表明翻译质量足以消除语言影响。
- 文字系统密集型任务显示出巨大差距:韩文密码 落后英文版本最高 68.7 pp,而同类 算式谜题 无系统性劣势,表明瓶颈在于多步子音节拆分执行(拆解谚文字母为子音/元音操作)。
- 谚文组合 准确率可预测 韩文密码 表现,印证子音节加工能力的关键性。
- 韩国特有任务中,亲属关系 在所有 12 个模型上均为正缺陷(韩文版本更差),而规则应用任务缺陷有正有负,揭示了文化知识而非纯规则掌握的差距。
- 结构大小指标在 15 种类型中的 7 种上未能随难度等级上升而增长,说明输入大小不是经验难度的可靠代理。
与基线对比:与传统基于固定规则或模板的基准不同,NOLLI 通过行为校准确保难度跨度合理,避免了“加大输入就是更难”的误区。其三层设计分离了语言呈现、文字处理和领域知识的影响,提供了细粒度诊断能力,优于现有仅关注整体得分的多语言评估。
行业影响
NOLLI 提供了一套程序化难度校准与多层级语言诊断的评估范式,其工业价值不仅限于韩语-英语,而是可复用到各类多语言模型的产品化流程中。
落地场景
- 多语言智能客服:全球化 SaaS 或电商平台需要评估 LLM 在处理韩语客服查询时的推理准确性。使用 NOLLI 中直接翻译类任务(如
array_formula、causal_dag)可快速验证模型在韩语界面上是否与英语保持同等水平的逻辑能力,避免因语言切换导致服务质量下降。 - 内容本地化与审核:面向韩语市场的 UGC 平台(如社交媒体、游戏社区)可利用书写系统密集型任务 (
jamo_composition、cipher) 检测模型对韩文字符结构的理解,确保自动审核或内容摘要时不会因字素拆解错误而出现关键信息遗漏。 - 教育科技:提供韩语学习服务的产品可以使用韩国特有任务(如
kinship、saju)评估模型对文化背景知识的掌握,从而部署更可靠的 AI 辅导或作业评分功能。
商业价值
- 降低多语言评估成本:程序化生成 + 确定性评分消除了昂贵的人工标注和主观评价。基准本身可再生 (
seed-regenerable),企业能以极低成本重复运行,持续监控模型在多语言上的表现退化或漂移。 - 加速多语言产品迭代:通过行为校准确定难度档位,团队可以精准定位模型在哪些任务上需要微调或提示工程,减少盲目调参的时间。对于出海或全球化产品,这意味着韩语特性带来的准确率缺口能被量化,从而优先修复高影响力的差距(如韩语密码落后英文达 68.7 pp)。
- 增强用户体验与信任:在多语言搜索引擎或金融合规工具中,韩语推理的稳定表现直接关乎用户留存与合规风险。使用此类基准作为模型选型标准,可避免因语言理解错误导致的商业纠纷。
与现有产品/工作流的接口
将 NOLLI 风格的基准集成进 MLOps 流水线十分便捷:
- 通过 Hugging Face Evaluate 或 LM Evaluation Harness 添加自定义任务配置,直接调用程序化生成器,将指标(如
match_accuracy、cipher_score)接入现有监控看板。 - 在自动化回归测试中,每次模型更新后运行基准,利用等效性检验 (
TOST) 判断英语-韩语性能是否维持在预先设定的 ±10 pp 容差带内,触发告警。 - 结合难度校准思路,可针对特定语言对构建类似的诊断套件,只需替换模板内容,复用生成与验证框架,快速覆盖更多低资源语言。
具体落地方案举例:
- 跨国电商智能导购:某全球电商平台接入 LLM 提供韩语商品推荐与比价。通过定期执行 NOLLI 的
number_baseball和inequality等直接翻译任务,验证模型量级推理在韩语下准确率 ≥ 英语的 90%,确保韩语用户获得和英语用户同质的推荐逻辑。同时,利用jamo_composition任务捕捉底层字符处理瓶颈,若准确率突降,则考虑加入 Jamo 分解预处理,避免模型因拼写缺陷给出错误的价格比较。 - 全球化金融文档分析:某投资分析平台需要自动提取韩语财报中的财务指标。使用
array_formula等表格推理任务评估模型对韩语数值信息的理解,并结合korean_units(韩国特有单位)检测领域知识覆盖度。若模型在单位转换上频繁出错,可以针对性地扩充训练数据或加入单位归一化的预处理步骤,从而确保关键数据的提取准确率,降低金融误判风险。
局限
- **难度校准依赖单一参考模型**:所有谜题生成器的参数调优仅基于固定参考模型(Llama-3.1-8B-Instruct)达到目标准确率区间,这可能导致基准对其他模型家族的难度分布不够均衡。不同架构、训练数据的模型对难度维度的敏感度可能不同,过拟合于单一模型的校准方式会削弱跨模型诊断的信度与泛化性。
- **子音节瓶颈的结论仅为相关性**:文中揭示韩语字母(jamo)操作任务(Cipher)的性能落后,并发现 Jamo Composition 准确率能预测 Korean Cipher 准确率,但作者明确承认这仅是相关性而非因果证据。多步子音节执行困难的机制仍未经严格因果验证,无法排除其他混淆因素(如模型对韩语拼写规则的曝光不足)。
- **韩语特有任务存在任务间混淆**:Korean-only 任务同时涉及规则应用与文化词库,且不同任务中规则应用缺陷的方向(正/负)不一致,例如 Kinship 对所有模型呈正向缺陷,但其他规则任务可能相反。这种混杂使得难以独立分离语言知识、文化背景与推理能力的影响,限制了细粒度归因。