SAEScientist-Bench:AI Agents 能否开展自主 SAE 可解释性研究?
本文提出 SAEScientist-Bench,用于评估 AI agents 能否扮演"科学家"角色,借助 SAE 工具开展自主的机制发现。给定一个目标概念,agent 需要自行设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典(含 131K+ 特征)中导航,定位最优特征。 评估以 Neuronpedia 上的专家参考特征为锚点,覆盖三个维度:激活排名(activation rank)、对比文本上的概念选择性(concept selectivity),以及因果操控(causal steering)。 在 10 种 agent 配置与 20 项任务上,前沿 agent 展现出真实的发现能力,并在不同评估维度各有领先,但整体仍明显落后于专家基线: - 在区分目标概念与对比控制项方面已接近专家水平; - 在因果生成操控方面差距仍然较大。 进一步分析显示,尽管 agent 能设计对比以排除虚假候选,却频繁误读实验测量结果。这些结果将"实验性模型理解"确立为闭环自主 AI 研发中一项可度量的能力。代码见 https://github.com/Trae1ounG/SAEScientist 。
论文精读
TL;DR SAEScientist-Bench 用 SAE 工具评估 AI agent 能否自主做机制可解释性发现:前沿 agent 具备真实发现能力,但整体仍明显落后专家基线,尤其在因果 steering 上差距显著。
问题
问题背景
近年来,AI 安全与可控性研究推动 递归自我改进(RSI) 走向自主化,但现有框架主要自动化模型训练 pipeline,对训练后模型的内部表征审计与理解仍依赖专家手动完成。
现有方法局限
- 可解释性工具:Sparse Autoencoders (SAEs) 能分离可解释特征,但特征发现高度依赖专家手工设计对比文本、在 Gemma Scope 等大型字典中人工检索和验证。
- 自动化尝试:已有工作多局限于特征检索或简单排序,缺乏对激活测量(
Rank/Activation/Steering)的深入解读与迭代实验设计,无法排除虚假候选。 - 评测空白:尚无基准系统评估 AI 代理是否具备自主使用 SAE 工具进行机制发现的能力。
为什么这个问题难/重要
SAE 特征空间巨大(Gemma Scope 含 131K+ 特征)且语义稀疏,代理需要自主构造对比探针、解读激活与因果干预结果。高激活特征未必对应目标概念,代理常误判实验测量。若代理能可靠完成此类任务,将把模型理解变成可度量的闭环能力,支撑安全对齐与自主 AI R&D。
行业类比
类似把 AutoML 从训练延伸到审计阶段,让 AI 代理像代码审查员一样自动检查模型内部学到的概念,提升对齐审计的吞吐量。
核心洞察
- SAEScientist-Bench 首次把 SAE 可解释性研究转化为可量化的自主智能体评测任务,关键在于用专家参考特征锚定三个实证维度:激活排名、对比文本上的概念选择性、因果生成操控。这不同于以往仅关注自动化模型训练或单独评测 SAE 质量的工作,它直接检验智能体能否像研究者一样设计对比探针、迭代搜索并验证特征,为闭环自主 AI R&D 补齐了事后审计这一缺失支柱。
- 该基准揭示一个核心能力断层:前沿智能体在判别式特征发现上接近专家水平,但在因果生成操控上大幅落后。这意味着当前智能体的推理和搜索范式擅长从候选特征中筛出解释性强的方向,却未能把特征激活可靠地转化为对生成行为的稳定干预。相比已有的 SAE 特征评估或智能体工具调用测试,这个差异点明自主可解释性研究的关键瓶颈不在检索,而在把观测知识转化为可控因果机制。
- 进一步分析发现智能体失败的主因不是缺乏对比设计,而是对实验测量的误读。即使智能体构造了合理的对比探针来排除伪候选,它们仍经常错误解释激活数值或选择性结果。这凸显了benchmark 的设计独特性:它不仅测搜索和调用工具的能力,更测一种“实验科学素养”——从数值测量中做出正确归因和判断。这对开发用于自主科研的智能体给出直接启示:应引入校准的测量解读模块或强制自反思重测机制,而不仅是提升模型基础能力。
方法
输入与任务构建
SAEScientist-Bench 以自然语言描述的目标概念为输入,例如 “虚假信息” 或 “讽刺”。每个任务对应一个专家在 Neuronpedia 上标注的参考 SAE 特征(Ground Truth),但 agent 不可见。评测环境提供 Gemma Scope 字典,包含基于 Gemma-2-9B-IT 的 131K+ 个可解释特征,agent 需要在其中定位最优特征。
关键模块:交互式特征发现协议
Agent 通过受限 API 与 SAE 工具交互,可执行三类操作:
- 设计对比探针:编写正例与反例文本,用于探测候选特征是否真正对目标概念选择性激活;
- 检索与查询特征:基于激活值排序或文本描述检索字典中的候选特征,并获取其在任意文本上的 activation;
- 提交候选特征:在多轮实验后提交一个最终特征用于评估。
Agent 可在回合中动态调整探针,排除仅由表面词共现引起的虚假候选。
输出与评估度量
评测输出为候选特征在三个维度上的得分:
- Activation Rank:候选特征在目标概念文本上的激活值在全部字典特征中的排名;
- Activation Selectivity:候选特征在正例与反例文本上的激活差异,反映概念选择性;
- Causal Steering:对模型做 activation addition,放大该特征,再用 LLM judge 评估生成内容是否体现目标概念且保持指令遵循。
三个分数加权得到 Overall Score,与专家参考特征进行对比。
与现有 SAE 评测多聚焦静态解释质量或单步检索不同,该工作首次将特征发现定义为闭环、实验驱动、带因果验证的自主科研任务,强调 agent 的实验设计与测量解读能力。
实验
实验设计
SAEScientist-Bench 构造了 20 个概念发现任务,agent 需要利用 Sparse Autoencoders (SAEs) 在 Gemma Scope 的 131K+ 特征字典中定位与目标概念最匹配的特征。评估围绕三个指标:Activation Rank、Concept Selectivity 和 Causal Steering,并以 Neuronpedia 上人工标注的专家特征作为参考基准。Agent 通过设计 contrastive probes 来测试候选特征,交互过程遵循统一的 protocol。
关键发现
在 10 种 agent 配置与 20 个任务的组合评测中,前沿 agent 展现出真实的概念发现能力,部分指标上接近专家水平:在目标概念与对比控制文本的分离度上,agent 接近专家;但在 causal generation steering 上仍有显著差距。进一步分析表明,agent 能够设计对比探针来排除虚假候选,但经常错误解读实验测量结果,这暴露了当前 agent 在实验推理上的局限。
与基线对比解读
专家基线基于 Neuronpedia 人工标注特征,融合了人类对概念边界的精细理解。Agent 在排序与选择性上追近专家,说明其检索与对比设计能力较强;但 steering 层面的不足反映其缺乏对特征因果影响的可靠判断,可能源于激活统计与生成控制之间的复杂映射未被 agent 正确建模。这为自主 AI R&D 的闭环迭代提供了明确改进方向:需要更可靠的实验测量解释器与因果验证机制。
行业影响
落地场景
SAEScientist-Bench 所验证的 agent 能力可直接嵌入 模型可观测性平台 与 AI 安全审计工具。例如用于自动发现大模型内部与“欺骗”“偏见”“有害内容”对应的特征,实现持续行为监控;也可用于内容平台的审核模型,自动定位并削弱违规内容生成倾向。典型场景包括:
- 金融风控:审计信贷模型是否编码了敏感属性特征,满足公平性审计要求。
- 医疗 AI:验证诊断模型是否依赖虚假相关性,降低误诊风险。
商业价值
核心价值在于降本与风控。传统 Sparse Autoencoder 特征解释依赖专家手工设计对比探针、逐特征验证,人力成本高。Agent 自动化后可大幅缩短特征发现与验证周期,将可解释性研究从“实验室”推向“生产流水线”。对高风险行业,这类审计能力是合规准入的刚需;对模型供应商,可减少因不可控行为导致的品牌损失与法律风险。
与现有产品/工作流的接口
该套件可作为 MLOps 流水线中的可解释性插件,与已有 SAE 工具链(如 Gemma Scope、Neuronpedia)对接。通过 REST API 或 SDK 集成进 CI/CD,在模型更新后自动触发特征扫描,生成审计报告。Agent 输出的特征候选与因果验证结果可回写到特征库,供后续模型编辑或 steering 使用。
具体 use case:
- 电商内容审核:部署一个 agent 持续扫描商品描述生成模型,自动发现“夸大功效”特征并降低其激活,同时保持正常文案生成质量。
- 企业服务知识库:对 RAG 系统背后的生成模型做审计,防止检索结果诱导模型输出内部机密或歧视性内容。
局限
- 任务规模与概念覆盖有限:仅构建 20 个任务,且均基于 Gemma-2-9B-IT 的 Gemma Scope 字典(131K+ 特征),概念类型偏向可对比的语义属性。缺少对复杂抽象概念、跨层电路或多特征组合的评测,结论难以推广到其他模型架构、不同 SAE 训练配置或更广泛的机制解释任务。
- 评测范式偏向“已知目标的检索验证”而非开放科学发现:每个任务预先给定 target concept 和 expert reference features,agent 只需在已知特征空间内定位最优特征。真实 SAE 研究中,研究者需自行生成假设、设计探针、解释激活模式并迭代修正,当前设定可能高估 agent 的自主研究能力,且未评估其面对未知概念或噪声字典时的表现。
- 与同类自动化解释工作相比,缺少对 agent 工具使用策略的深入分析与优化:仅评估 10 个基础 harness 配置,未探索更复杂的工具调用链、反思机制或多智能体协作。此外,未评估跨 SAE 字典(不同层、宽度或训练目标)的泛化能力,且实验重复次数有限,可能掩盖不同随机性对结果的影响。