UnpredictaBench:评估大语言模型分布随机性的基准
随着大语言模型(LLMs)越来越多地被用作其他实体的替代品(如经济模拟中的人类),许多模型倾向于坍缩到单个合理答案,导致无法捕捉真实系统的不可预测性。近期提升输出多样性的工作对此场景并不充分——模拟需要的是校准到目标分布的样本,而不仅仅是多样化的输出。 UnpredictaBench 提炼了这一问题的简化但基本版本:从单个目标分布中采样结果,包括经典统计分布、随机程序诱导的分布,以及描述随机过程的自然语言场景。我们引入了448个问题,并配备 KS@N ——一种通用评估指标,通过 Kolmogorov-Smirnov 统计检验量化模型输出的近似黑盒目标分布的质量。该指标衡量在样本量 N 下,无法拒绝模型样本与真实样本分布差异的比例;N 越大,难度越高。 在开源和闭源模型上的测试显示,分布能力存在巨大差异。例如,当模型生成100个样本时(标准指标 KS@100),得分范围从接近0到超过20%。没有任何模型能在 KS@100 上达到40%以上,表明分布采样能力仍有显著提升空间。尽管增加推理可以略微提高分数,但这一问题尚无直接解决方案。UnpredictaBench 表明,即使是最简单的分布模拟仍具挑战性,是使用LLMs替代复杂系统的必要第一步。
论文精读
TL;DR UnpredictaBench 评估 LLM 从统计分布、随机过程等目标分布采样的能力,揭示模型普遍难以捕捉真实分布的随机性,表明分布级采样仍是 LLM 模拟复杂系统的关键瓶颈。
问题
当前,大语言模型 (LLM) 越来越多地被用作仿真中的替代智能体(如经济模拟、社会行为预测),但模型的输出往往坍缩为单一“合理”答案,无法复现真实世界的内在随机性。
现有提高输出多样性的方法(如调整 temperature、使用 nucleus sampling)只能产生任意多变的文本,却无法保证样本的分布与目标分布一致。主流 LLM 评测基准(如 MMLU、HumanEval)几乎只评估单点正确性,忽略了分布层面的校准能力,这导致模型在需要大量采样并统计特性的仿真任务中表现不可靠。近期虽有工作改进多样性与推理,但并未系统性地测试模型是否能从给定分布中精确采样,这恰恰是仿真系统的刚性需求。
为什么难:分布校准要求模型隐式编码概率质量函数,并基于该函数进行受控随机采样,这对自回归生成本质上是挑战性的——模型天然倾向于高概率 token 序列,即使通过解码策略也无法精确复现任意分布形态。其重要性在于,若无法处理简单分布的随机性,就无从信任 LLM 在复杂系统(如流行病传播、金融市场)中的模拟行为。业界因此将此类能力视为从“语言生成”迈向“可信世界模拟”的关键缺口,也是 LLM 从工具走向基础设施的必经之路。
类比:就像推荐系统若不能校准用户兴趣分布,A/B 测试的效应估计会产生系统性偏误,最终误导产品迭代方向。
核心洞察
- 输出多样性不等于分布校准。现有工作多聚焦于让 LLM 产生多样但不重复的文本,而忽略了在仿真场景中,样本必须精确服从目标分布。UnpredictaBench 首次将评估目标从“多变”转向“分布准确”,揭示了 LLM 在模拟真实系统随机性时的根本缺陷。
- KS@N 指标为分布采样提供了统一且苛刻的黑箱检验。它基于 Kolmogorov-Smirnov 检验计算模型样本与真实样本的统计通过率,并通过调整 N 控制难度。该指标不依赖模型内部结构,可直接比较不同模型,结果显示出即使简单分布(如均匀和正态)对最先进 LLM 也是巨大挑战,几乎没有模型能在 KS@100 上超过 40%,为能力进步留出明确空间。
方法
基准构建:从三类来源构造 448 个分布模拟任务
UnpredictaBench 构造了 448 个独立问题,每个问题定义为一个目标分布,要求 LLM 从该分布中采样。问题来源涵盖三类:
- 标准统计分布(正态、指数、泊松等),直接给定分布参数;
- 随机程序诱导的分布,通过代码片段定义随机过程(如掷骰子、随机游走);
- 自然语言场景,用文本描述随机现象(如“抛一枚不均匀硬币 3 次”)。
每个任务提供真实采样方式(解析采样器或大量真实样本)以生成参考分布。
评估流程:KS@N 指标与黑盒检验
评估采用 KS@N 指标,核心是 Kolmogorov-Smirnov (KS) 检验:
- 对每个问题,提示 LLM 生成 N 个独立样本(默认 N=100);
- 从目标分布获取相同数量的真实样本;
- 计算两组样本经验 CDF 的 KS 统计量,得到 p 值;
- 重复上述过程多次(如 100 次),统计 未能拒绝原假设(p ≥ 0.05) 的比例,即 KS@N 分数。
分数越高表示模型输出的分布越接近目标真实分布。N 越大,对分布尾部一致性要求越高,难度越大。
关键设计:超越多样性的分布校准
不同于传统输出多样性评测(如熵、self-BLEU),该基准直接检验 分布校准:模型不仅需产生多样输出,还需使每个输出频次与目标概率匹配。提示中不透露真实分布参数,模型只能从描述中推理采样策略。
与同类方法的差异
现有生成多样性基准(如 Novelty / Creativity 评测)仅鼓励输出多变,而 UnpredictaBench 首次架构化地度量 LLM 模拟不可预测系统的能力,用严格的统计检验取代启发式多样性指标,直接暴露模型在分布模拟上的短板。
实验
实验设计
UnpredictaBench 构建了 448 个任务,覆盖三类分布:经典统计分布、随机程序诱导的分布,以及自然语言描述的随机过程。评估核心为 KS@N 指标,利用 Kolmogorov-Smirnov 检验比较模型生成样本与真实样本的分布,计算在给定样本量 N 下无法拒绝原假设的比例,N 越大难度越高(标准设置 KS@100)。实验横跨开源与商用模型,系统考察温度、采样预算、指令微调以及推理策略的影响,并与现有新颖性/创造力基准进行对齐分析。
关键发现
各模型分布采样能力差异显著:KS@100 得分从接近 0% 至 20% 以上,无一模型超过 40%,揭示出显著的能力天花板。添加推理步骤(如思维链)仅带来微弱提升,无法根本解决问题。温度对性能的影响呈非单调,过高温度反而破坏校准。指令微调对部分模型甚至产生负面效应。进一步的定性分析表明,模型常倾向于坍缩到单一典型答案,而非忠实再现目标分布的全貌。
与基线对比
与现有鼓励输出多样性的基准(如新颖性/创造力测试)对比显示,UnpredictaBench 关注的分布校准是另一维度的能力。仅追求多样化输出的模型在 KS@N 上表现仍差,因为仿真应用要求采样必须匹配预定的目标分布,而非随意变化。这一差异强调了在将 LLM 用作复杂系统组件(如经济仿真代理)前,专门评估分布模拟能力的必要性,也为后续改进指出了崭新的方向。
行业影响
分布对齐能力成为 LLM 模拟类应用的前置门槛
UnpredictaBench 揭示的分布坍塌现象(模型倾向于输出单一高概率答案,而非匹配目标分布)直接冲击所有将 LLM 用作随机代理的场景。当模型在经济模型、用户行为模拟或游戏 NPC 中替代真实个体时,其采样能力决定了仿真系统的保真度。
落地场景
- 合成数据生成:在金融风控、医疗诊断、自动驾驶边缘案例生成中,需要从稀有事件分布中采样,而非复制最常见的模式。模型若无法逼近真实长尾分布,会导致训练出的下游模型存在系统性偏差。
- 多智能体模拟:社会科学研究、经济学实验、推荐系统沙盒测试中,用 LLM 代替人类参与者时,必须要求模型行为具有与人类同构的不确定性。UnpredictaBench 的 KS@N 指标可直接作为校验是否“像人一样随机”的阀门。
- 策略随机化:游戏 AI、对话系统的多样性生成、创意工具中,需要模型在给定上下文中采样出符合特定分布的结果(如诗句风格分布、故事结局多样性),而非重复高频解。
商业价值
该能力的缺失意味着隐性决策风险:例如在金融衍生品定价模拟中,若 LLM 生成的场景分布与真实市场分布差异过大,会直接导致风险计量错误和资本误配置。将 KS@N 作为模型选型和持续监控指标,能降低因模拟失真引起的业务损失。同时,分布采样能力也是高级合成数据产品的收费壁垒——能提供统计保真度证明的 API 可以打开医药、自动驾驶等高合规需求市场。
与现有工作流的接口
UnpredictaBench 可嵌入 ML 管线中的生成质量评估层:
- 在模型注册阶段,增加 KS@100 等分布检验,与准确性指标互补,形成校准度评分卡。
- 在 RAG 或 Agent 框架中,对 LLM 生成的工具调用序列分布进行监控,防止策略退化到单一行为。
- 结合现有多样性基准(如创作类 benchmark),解释多样性与分布校准的差异:前者仅保证不重复,后者要求匹配真实统计规律。
具体用例:
- 电商:在用户点击率模拟中,要求 LLM 代理在给定商品特征下生成点击与否的伯努利样本,其分布需与历史真实 CTR 分布一致。错误采样会导致 A/B 测试效力计算偏差,造成无效实验和上千次迭代浪费。
- 企业服务:合同条款自动生成时,需要服从特定风险等级分布(如高风险条款出现概率 5%)。若模型只生成安全条款,客户将无法覆盖真实风险敞口。
局限
- **任务简化与泛化局限**:UnpredictaBench 聚焦于从单一静态目标分布中独立采样,而真实模拟场景(如经济仿真、社会动态)通常要求模型从高维联合分布或时序依赖过程中采样。当前基准未涉及多智能体交互、反馈循环或分布漂移,其测试结果能否直接迁移到复杂系统代理任务尚不明确。此外,448 个问题虽涵盖统计分布、随机程序和自然语言描述,但对重尾、多模态或条件分布的覆盖仍有局限,可能低估模型在真实应用中的脆弱性。
- **评估指标的片面性**:核心指标 KS@N 基于 Kolmogorov-Smirnov 检验衡量模型样本与真值样本的分布一致性,但该检验对尾部差异不敏感,且无法捕捉序列任务中元素间的排列特性(尽管作者用 Lehmer 码处理序列输出,但本质仍将其转化为数值分布)。同时,仅依赖统计检验通过率可能忽略样本的语用合理性与上下文连贯性,例如在自然语言任务中,模型可能生成分布匹配但语义荒谬的样本。
- **推理增强的收益有限**:实验表明,显式加入推理提示(如 chain-of-thought)仅小幅提升分数,且增加了计算开销与响应延迟。并未从根本上解决 LLM 在分布校准上的结构性缺陷——模型仍倾向于输出“典型”解而非保持随机性。论文未探索更根本的架构调整(如校准 token 概率、强化学习对齐分布)或后处理纠正,因此当前工作的直接工程指导价值受限。