论文

人类认知与行为的小型基础模型

人类认知与行为的小型基础模型

基于人类行为数据微调的大型语言模型已展现出作为通用认知代理的潜力,但其所需的规模,以及这些模型是真正处理任务结构还是利用统计捷径,仍是未解之谜。我们基于 Psych-101 数据集(包含 160 个实验中 1070 万次试验级选择)训练了 14 个模型,参数规模从 135M 到 14B,覆盖四个架构家族。 在分布内(in-distribution)场景下,规模影响甚微。所有模型的表现集中在狭窄区间内,仿佛触及天花板;仅 0.6B 到 1B 参数 即可匹敌 70B 基线在留出被试上的表现。而在分布外(out-of-distribution)场景下,该区间明显拉开,形成更陡峭的缩放梯度,更大模型在泛化到新任务结构时优势明显。 为探究这些模型所用信息,我们进行了两项诊断实验。在 27 个实验中逐步剥离四种提示通道:任务指令、实验刺激、结果反馈和选择历史,并打乱试验顺序。遮蔽刺激与反馈内容会破坏 75.7% 的已学信息,并将模型推至随机水平以下,表明仅凭选择历史无法解释其表现。打乱顺序则揭示:对独立试验任务具有不变性,而对由先前响应决定试验顺序的任务则敏感。 小型认知微调模型因此有望作为心理实验的 噪声天花板估计器,但其适用范围仍受限于训练中见过的范式。

论文精读

TL;DR 小规模认知微调模型(0.6B–1B)在人类行为数据上即可匹配 70B 基线的被试内性能,但分布外泛化仍受益于规模扩大,且模型确实利用刺激与反馈内容而非统计快捷方式。

问题

问题背景

使用大规模语言模型 (LLM) 模拟人类认知与决策,已逐渐成为计算认知科学和 AI 对齐研究的一条新兴路径。通过在海量人类行为数据上微调,研究者试图构建通用认知代理 (cognitive proxies),以替代昂贵的人类被试实验。

现有方法局限

当前方案主要依赖千亿参数级的 LLM,但存在三个关键局限:

  1. 规模必要性质疑:尚未明确多大参数规模是冗余的,现有工作默认使用超大模型,导致推理成本极高,且可能在分布内测试中遭遇性能天花板,规模收益不显著。
  2. 表征可解释性缺失:模型究竟是习得了任务底层的认知结构,还是仅仅利用统计捷径 (如选项位置偏置、反馈频次) 来匹配表面行为,仍无定量诊断方法。
  3. 跨任务泛化能力模糊:微调后的模型在未见过的新实验范式上是否仍能保持合理的人类行为模拟,缺乏系统评估,这使得模型离“通用认知引擎”仍有距离。

问题的重要性与技术挑战

该问题的核心挑战在于:人类行为数据本质上是高噪声、高维的,且实验范式多样,模型必须从 trial 级序列数据中抽取出不变的心理表征,而非简单记忆特定实验的应激模式。若模型仅过度拟合训练分布内的统计关联,那么其预测仅是噪声天花板的一种浪费性拟合,无法提供任何认知洞见。业界对此高度关注,因为一个低成本、可解释的轻量认知代理,能大幅加速心理学假设检验、人机交互设计验证以及 AI 系统的用户建模,但前提是我们必须严格证明这类代理的效度和边界。

行业类比

这类似于构建自动驾驶仿真测试环境——我们需要的不是对路测日志的像素级回放,而是一个能够抽象出交通物理和社会规范的轻量引擎;否则,即便仿真里程很长,也无法证明真实的安全性。

核心洞察

  • 规模对分布内认知行为拟合几乎无影响,但在分布外泛化中呈现陡峭的缩放曲线,这挑战了“越大越好”的普遍假设。小模型(0.6B-1B)在已知任务上即可达到与70B模型相当的性能,暗示分布内认知代理任务存在性能天花板,主要瓶颈可能是训练范式覆盖范围而非参数量。这与典型LLM Scaling Law不同,为面向特定场景部署轻量认知模型提供了实证依据。
  • 通过逐步剥落提示通道,发现模型主要依赖实验刺激和反馈的内容,而非选择历史;屏蔽这些内容直接导致75.7%信息丢失且性能降至随机水平以下。这证明模型确实学习到了任务结构而非利用统计快捷方式,强化了小模型作为可解释认知代理的可靠性,也为未来设计更精准的探针诊断方法、分离模型内部表征提供了范式。

方法

输入:Psych‑101 大规模行为数据集

模型接收来自 160 项心理学实验的 1070 万次试次级选择记录,每条样本包含四个信息通道:任务指令(自然语言描述)、实验刺激(文本或视觉刺激编码)、结果反馈(是否正确的二元信号或奖励)以及 选择历史(此前试次的响应序列)。这些多模态但统一的文本化表示允许将多种认知范式整合为单一语言建模任务。

关键模块:多架构微调与规模扫描

在四种架构家族(覆盖 135M 至 14B 参数)上,对预训练语言模型进行 监督微调。微调目标为预测参与者在给定上下文下的离散选择,相当于 下一个 token 分类(或条件生成),损失函数为交叉熵。

  • 训练策略:每个模型均在 Psych‑101 的全量实验上训练,未按任务单独分叉,强制跨实验共享表征。
  • 规模扫描:共训练 14 个模型,最小 135M,最大 14B,并引入一个 70B 基线作为性能上界参考。
  • 架构差异:覆盖不同 transformer 变体(如解码器‑only 和编码器‑解码器),考察架构选择的影响。

诊断模块:信息通道剥离与顺序置换

为揭示模型所利用的信息,执行两类受控实验:

  1. 渐进遮蔽:在 27 个实验上,依次移除四个通道(任务指令、刺激、反馈、历史),观察性能下降。
  2. 试次顺序置换:打乱试次序列,测试模型对试次独立性与依赖关系的敏感度。

输出与性能发现

  • 分布内:在留出参与者上,0.6B–1B 模型即可匹配 70B 基线的性能,所有模型落在一个狭窄的 性能天花板 附近,规模几乎不带来增益。
  • 分布外(新任务结构):规模梯度显著变陡,大模型具有明显泛化优势。
  • 信息源分析:掩蔽刺激和反馈内容使 75.7% 的已学信息丧失,模型降至几率水平以下,证明选择历史本身不足以支撑行为预测;试次顺序置换显示模型在独立试次任务上具有不变性,而在响应序列决定试次顺序的范式下敏感。

工程启示:小规模认知微调模型可作为心理学实验的 噪声天花板估计器,且计算成本远低于通用语言模型。

与同类方法的差异点:不同于仅比较模型规模或架构的工作,本研究通过系统剥离信息通道,直接量化了不同特征对代理准确性的贡献,并给出了在认知代理任务中“小型基础模型即足够”的实证边界。

实验

实验设计

  • 使用 Psych-101 数据集,包含 160 项心理实验的 1070 万 次试次选择,涵盖多种认知范式。
  • 训练了 14 个模型,规模从 135M 到 14B 参数,跨越四种架构家族(如 Transformer 变体)。
  • 评估分为 分布内(留出参与者)和 分布外(新任务结构),并设计诊断实验:逐步移除提示通道(任务指令、刺激、反馈、选择历史)和排列试次顺序。

关键发现

  • 分布内性能饱和:模型性能落在较窄区间,似乎触及天花板;0.6B–1B 参数 即可匹配 70B 基线 在留出参与者上的表现。
  • 分布外缩放明显:在分布外,性能区间扩大,缩放梯度变陡,大模型在泛化到新任务结构时优势显著。
  • 信息源诊断:
    • 遮盖刺激和反馈内容 破坏 75.7% 的学习信息,并将模型拉至随机水平以下,说明模型并非仅依赖选择历史。
    • 排列试次顺序在独立试次任务上无影响,但在顺序由先前响应决定的任务中表现敏感。
  • 小模型可作噪声上限估计器:微调的小模型有望为心理实验提供人类行为的 噪声上限估计,但泛化边界受限于训练范式的覆盖范围。

与基线对比解读

  • 基线为 70B 参数模型,在分布内评估中,0.6B–1B 模型即可达到同等水平,显示针对认知行为数据的微调可大幅降低所需规模,具备工程实用性。
  • 然而,分布外任务暴露了差距:小模型不足以泛化到全新任务结构,而规模仍是提升泛化的有效手段。这提示工程部署需按目标范畴选择模型规模——已知任务偏好的场景可用小模型,探索新范式则需更大规模。
  • 对比纯行为统计建模,小型认知微调模型提供更贴近人类行为上限的估计,为 AI 与认知科学的交叉验证开辟新途径。

行业影响

落地场景:从人类实验代理到自适应系统优化

小认知基础模型 的核心价值在于成为低成本、高并发的人类行为代理,适用于需频繁采集心理反应的场景:

  • 产品与 UX 优化:电商平台可用其模拟用户对不同促销 banner、定价方案的选择偏好,替代传统聚焦小组或在线调研,大幅缩短迭代周期。
  • 自适应教育:智能学习系统以此模拟学生对不同题序、反馈形式的认知负荷,动态调整学习路径,无需等待真实学生数据积累。
  • 健康行为干预:在戒烟、慢性病管理等 App 中,模型可作为用户反应模拟器,预评估各种提醒话术或奖励机制的效果,降低真人实验伦理风险。

商业价值:降本增效与合规性增强

  • 降本:用 135M–1B 参数的模型即可在分布内匹配 70B 基线,推理成本极低,可将行为实验成本从每人次数十美元降至近乎为零。
  • 增效:7×24小时并行模拟百万用户,快速筛选设计候选,将产品优化从数周压缩到数小时,直接提升研发投入产出比。
  • 隐私与合规:合成行为数据可避免收集真实用户隐私,适用于金融、医疗等强监管行业,作为内部决策支持工具。

与现有产品/工作流的接口

模型可通过轻量级 API 集成,无需重构现有基础设施:

  • A/B 测试流程增强:在实验调度平台中插入模型推断环节,先模拟再上线真实流量,降低劣化方案伤害实际用户的风险。
  • 推荐系统冷启动:将认知模型作为用户行为模拟器,与协同过滤等传统模块并联,为新品或新活动提供初始排序信号。
  • 工具链兼容:提供 ONNX 导出,可被 MLflow、Kubeflow 等 MLOps 栈直接管理,并与 Grafana 等监控工具联动展示模拟置信度。

具体用例

  1. 电商活动策划:平台运营人员输入多种满减券设计,模型输出模拟用户点击与转化率分布,快速锁定最优方案,减轻多轮真实 AB 测试带来的流量浪费与机会成本。
  2. 教育游戏化设计:学习 App 开发者使用模型预判不同积分规则对学生持久度的影响,设计出激励效果最优的成就系统,减少因设计不当导致的用户流失。

局限

  • **训练范式限制**:论文明确指出模型"范围受限于训练中见过的范式"。Psych-101 数据集涵盖 160 个实验,主要聚焦于决策与学习任务,但可能遗漏记忆、推理、语言理解等更广泛的认知领域。因此,模型对新类型认知任务的泛化仍存在未知边界,其作为通用认知代理的覆盖面有限。
  • **数据覆盖与多样性不足**:尽管包含 1070 万次试次选择,Psych-101 的认知任务种类和受试者群体可能不够多样,可能过度代表了某些实验范式或人口统计学特征。这会使模型的认知模拟偏向特定模式,在更复杂的现实认知过程(如风险决策、社会认知)上表现可能不佳,限制了其实用性。
  • **诊断实验的简化与指标单一**:消融实验仅基于 27 个任务,也许无法代表全部 160 个实验的复杂性。此外,性能评估仅依赖选择准确性,忽略了反应时间、信心等细粒度行为指标。这使得关于模型使用何种信息(指令、刺激、反馈)的结论可能不完整,对认知加工过程的还原程度尚待更全面的度量。
论文Nick Oh2026-08-05原文

相关内容