论文

探究LLM风险决策中的结果层面相似性与机制层面一致性:来自St. Petersburg Game的证据

探究LLM风险决策中的结果层面相似性与机制层面一致性:来自St. Petersburg Game的证据

大语言模型(LLMs)在风险决策任务中可能表现出谨慎的表面行为,但谨慎的输出并不一定意味着其决策机制与人类对齐。本研究以St. Petersburg Game为受控测试平台,该经典悖论中期望收益无限,但人类通常只愿意支付有限且较低的金额。我们评估了28个LLMs,使用一套结构化提示套件,包括:原始博弈、扰动截断/重复博弈/数字禀赋/职业身份的控制变体、要求模型以人类决策者身份推理的人类视角提示,以及基础模型与指令微调版本的配对比较。 在原始博弈中,大多数模型给出有限报价,呈现类似人类的风险行为(结果层面相似性)。然而,控制变体揭示出模型并非保持类人行为,而是转向条件性与计算性理性行为。人类提示和指令微调通常会降低报价并减少一些明显的病态,但大多数机制层面的响应模式保持不变。 这些发现表明,风险决策中的行为对齐可能仅停留在表面:LLMs可能产生类似人类的决策结果,却不具备一致的人类决策机制。因此,高风险场景下的LLM决策评估应超越结果相似性,检查机制层面的一致性。

论文精读

TL;DR LLM 在风险决策中仅产生表面人类相似的结果,但机制层面仍偏离人类认知,圣彼得堡游戏实验揭示了深层对齐的缺失。

问题

问题背景

当前 LLM 在高利害风险决策任务(如金融评估、医疗建议)中逐渐被赋予更多自主权,业界普遍关注其 行为对齐(behavioral alignment)——即模型输出是否与人类决策者在统计上相似。然而,单纯追求输出层面的相似性可能掩盖模型决策逻辑的根本差异。

现有方法局限

主流评估范式依赖 结果相似度(outcome similarity),例如对比模型与人类在标准博弈实验中的出价均值或分布。这种方法的局限性在于:

  • 忽略机制异质性:即使模型产生与人类一致的有限出价,其内部计算可能基于完全不同的原则(如条件概率计算而非风险厌恶启发式)。
  • 缺乏可控探针:传统评估未系统扰动输入变量(如截断次数、重复博弈、身份线索),难以揭示模型对上下文变化的敏感性是否符合人类认知模式。
  • 混淆表面行为与深层对齐:指令微调(instruction-tuning)或人类提示(human-cue prompting)可能降低异常出价,但仅优化了可见行为,并未改变底层决策机制。

为什么这个问题重要且困难

  • 技术挑战:风险决策涉及复杂的预期效用计算与时序推理,LLM 的黑箱特性使得直接提取决策机制不可行,需要构建 机理探针(mechanism probes)通过受控变异反推内部逻辑。
  • 业界关注度:高利害场景(如算法交易、灾难响应)中,决策系统若仅在“正常”条件下模仿人类,而在边界情况(如无限期望悖论)暴露计算理性(computational rationality)偏差,可能引发系统性风险。
  • 评估范式升级需求:必须从“结果类比”转向 机制一致性(mechanism-level consistency)验证,这要求构建如圣彼得堡悖论等经典测试床,并设计多种干预变量,工作量与复杂性远超常规评测。

行业类比

类似自动驾驶系统:若感知模型仅模仿人类驾驶行为统计,却在罕见障碍物检测时依赖纯几何推理而非语义理解,则可能在长尾场景中发生不可预测的致命错误。

核心洞察

  • **结果相似性无法保证机制对齐**:LLMs 在圣彼得堡悖论中产生有限出价(类似人类),但通过控制变量(截断、重复游戏等)发现模型实际遵循条件理性或计算理性,与人类基于直觉的有限理性截然不同。这警示,仅评估最终决策输出会误判对齐程度,必须引入机制探针(如决策扰动)检测模型底层推理过程,尤其在高风险场景(如金融、医疗)中,表面安全的行为可能掩盖本质差异。
  • **指令微调和人类提示仅改善表层行为,未触及机制**:实验显示,human-cue prompting 和 instruction-tuning 虽降低出价、减少明显错误,但模型对场景变化(如职业身份标签)的响应模式仍与人类不一致。这说明当前对齐技术主要优化输出分布,而非塑造类人认知架构。从业者在部署模型时需认识到,表面“谨慎”的决策可能依然缺乏稳健的内在逻辑,需结合多维度机制测试。

方法

方法概览

论文以 圣彼得堡游戏(St. Petersburg game)为受控测试平台,系统评估 LLM 在风险决策中结局层相似性机制层一致性的背离。方法核心由三部分组成:结构化提示套件构建、行为模式探测、以及操控干预分析。

输入:结构化提示套件

提示设计超越单一原始游戏,构建多维度变体以暴露决策机制:

  • Plain prompt:直接呈现原始圣彼得堡游戏规则,要求模型给出愿意支付的入场费(bid)。
  • 机制探测变体(Mechanism-probe conditions):通过受控扰动检验模型决策逻辑,包括:
    • 截断扰动:改变最大可能抛硬币次数,测试模型对无穷期望的计算边界。
    • 重复游戏:引入多轮重复,考察模型是否因大数定律而调整出价。
    • 数值禀赋:赋予一笔初始财富,观察预算约束效应。
    • 职业身份:设定“风险分析师”或“学生”等角色,探测身份对风险偏好的影响。
  • 人类提示(Human-cue prompt):明确要求模型“以人类决策者身份推理”,分离模型默认计算逻辑与对人类行为的模拟。
  • 配对比较:对同一家族的基础模型与指令微调(instruction-tuned)版本施加相同提示,量化微调带来的行为偏移。
关键模块:响应归一化与行为解析

所有模型输出通过响应归一化提取数值出价,并分类为:有限出价、无穷出价、拒绝回答等。之后,分析从两个层次展开:

  1. 结局层(Outcome-level):仅看最终出价是否落在人类典型区间,定义“表面类人”行为。
  2. 机制层(Mechanism-level):对比不同探针条件下的出价变化模式,判断模型是否对上下文做出符合人类认知经济学预测的调整——例如,人类在截断场景下会提高出价,而模型可能保持计算最优但脱离人类直觉。
输出与操控干预
  • Human-cue steering:比较 Plain prompt 与 Human-cue prompt 下出价差异,评估“类人化”提示能否修正机制不匹配。
  • Instruction-tuning steering:对比 base vs. instruct 版本,分析微调对行为一致性的改进幅度。

最终输出为一组过渡矩阵(transition matrix),记录从原始游戏到各变体的出价移动方向与幅度,以及基模型到微调模型的变动。

与同类工作的差异

现有 LLM 行为评估多止步于结局层相似性(如“出价是否像人”),本方法通过多维度机制探针将评估推进至决策过程的动态对齐,揭示表面类人行为下隐藏的非人类计算逻辑。

实验

实验设计

研究以 圣彼得堡游戏 (St. Petersburg game) 为受控测试台,构造一套结构化提示套件,包含:(1) 原始游戏——期望收益无限,人类通常只愿支付小额有限金额;(2) 四种机制探针变体,分别扰动截断长度、重复游戏次数、初始禀赋与职业身份;(3) 人类视角提示,明确要求模型以人类决策者身份推理;(4) 配对比较,涵盖基础模型与对应指令微调版本。评估 28 个主流 LLM,统一通过 API 推理采集出价(willingness to pay)并归一化。

关键发现

  1. 原始游戏中,大部分模型产生有限出价,表面结果 与人类行为相似。
  2. 机制探针变体下,模型倾向 条件化计算式理性 行为,而非维持人类典型的启发式(如忽略极小概率、敏感度递减),表现出对截断参数敏感、重复游戏折扣不充分、对禀赋与身份暗示响应微弱。
  3. 人类线索提示指令微调 虽能降低出价绝对值、缓解部分显见异常,但 机制响应模式 基本未变——模型仍保持边界追踪与弱上下文敏感性,过程级行为未对标人类。

深度解读

常见做法仅比对 LLM 输出与人类调查结果,本研究揭示 结果相似性 可掩盖深层 机制差异。在金融风控、安全决策等高风险场景,仅考核输出 “像人” 远远不够,还需通过对抗式上下文扰动检验决策过程是否具有人类一致的机制,例如是否依赖错误线索或缺乏合理的敏感性模式。该发现推动 LLM 行为对齐从 输出对齐 转向 过程对齐,对构建可信赖的 AI 决策辅助系统具有明确工程意义——应设计探针来验证模型在分布外扰动下的机制稳健性,而非满足于表面正确率。

行业影响

高风险决策场景急需机制对齐

落地场景
LLM 已逐步进入金融风控、保险核保、医疗分诊等高风险决策流程。例如,自动化贷款审批中,LLM 可能给出与人类审批员相似的通过率,但若其依赖条件概率计算而非风险厌恶等人类典型机制,一旦市场波动或输入分布偏移,就可能产生系统性误判。圣彼得堡悖论下的实验表明,模型虽输出有限出价(结果近似人类),却对重复博弈、财富禀赋等敏感度不足,说明在现实部署中会低估罕见极端风险。

商业价值

  • 降本与合规:传统风控依赖专家规则与统计模型,引入 LLM 可提高非结构化数据处理效率,但若机制不对齐,则面临监管处罚与信任危机。该研究的方法可直接用于模型审计,减少测试案例盲区,降低长尾风险下的意外损失。
  • 增收与体验:在个性化保险推荐或投资顾问中,机制对齐的 LLM 能提供更贴近人类直觉的建议,提升用户采纳率与满意度,同时避免因“看似合理”但背离人类偏好的决策导致的客户流失。

与现有产品/工作流的接口
这套结构化提示测试套件(原始博弈、扰动截断/重复次数/财富/职业身份、人设提示)可封装为自动化评估层,集成进 MLOps 管道。在模型上线前,与标准基准(如 HELM、BigBench)并行运行,输出机制级对齐报告。对于指令微调版本,可对比基座模型,标记行为变化是“表面修补”还是“底层机制转变”。当前产品如权重数值计算风险指标,可扩展为将 LLM 决策过程与人类行为数据库(如 IWLS)的异同进行量化,作为持续监控指标。

具体落地 use case

  1. 全球化电商平台的欺诈交易检测:LLM 根据交易描述和历史判定风险,若只模仿人类结果而机制不符,可能对新兴欺诈模式(如混合合法与异常行为)过度宽容。利用本研究的机制探针,平台可定期注入模拟样本测试模型对财富变化或重复尝试的敏感性,确保模型不是仅靠表面统计学习。
  2. 自动驾驶的道德决策支持:在紧急避障中,LLM 若基于期望效用最大化,可能选择牺牲少数人,而人类更倾向规避大规模伤亡。机制对齐测试可提前发现此类分歧,指导模型微调时引入更精细的伦理约束,而非仅追求决策结果与人类标注一致。

局限

  • **任务单一性局限**:实验仅围绕 **St. Petersburg 游戏** 这一经典悖论展开,尽管设计了截断、重复、禀赋、身份等控制变体,但所有变体仍属于同一游戏框架,无法确保结论能泛化到股票投资、医疗决策等更复杂的现实风险场景。人类行为参照取自历史文献,未进行匹配模型条件的新受控实验,可能引入生态效度差距。此外,28 个模型虽覆盖主流架构但未分析规模、预训练数据等调节效应,削弱了结论的外推性。
  • **机制探测的浅层性**:衡量机制对齐的方式完全依赖外部行为扰动(如改变是否截断收益),未使用内部表征探针、因果追踪或特征归因等可解释性手段。仅从输入-输出的黑箱测试无法区分模型是因底层推理缺陷还是表面模式匹配而产生行为。模型的愿意支付数值对温度、采样策略等推理超参数敏感,而论文未系统报告这些设置对机制一致性的影响,可能混淆超参数效应与机制效应。
  • **与可解释性及认知建模的脱节**:与当前可解释性前沿工作(如 **Causal Tracing**、**Representation Engineering**)相比,本文完全没有打开模型黑箱,无法验证行为变化是否源于特定的内部计算路径。与认知建模文献对比,未尝试构建认知架构或计算模型来桥接心理学发现与模型内部机制,使得“人类决策机制”这一概念在 LLM 语境中缺乏计算对应物,可能将表面行为错判为机制对齐。
论文Chensong Huang2026-06-03原文

相关内容