论文

在开源权重语言模型中读取和操控材料科学机制的表示

在开源权重语言模型中读取和操控材料科学机制的表示

大型语言模型能够回答科学问题,但正确的输出并不能揭示模型是否真正理解或运用了背后的物理机制。本文以开源权重模型 google/gemma-4-E4B-it 为研究对象,展示了材料科学机制信息在该模型中具有三种实验可分离的形式: - 概念可读:单个隐藏状态中可直接读取概念; - 构成本构方向:通过状态间的受控变换体现; - 因果控制:选定的内部表示能因果性地影响工程答案。 实验结合了匹配的直接与雅可比词汇读出、无选项状态几何、包含 60 条定律的反事实基准以及因果干预。在 50 个保留的材料描述中,三个独立拟合的雅可比透镜复现了概念排序;两种读出的无目标词集合实现了对 10 个机制家族中 9 个的盲识别。另一个 72 提示的基准测试产生了机制特定的隐藏状态邻域,但精确的图审计表明这种表象的物理组织同样能被数值比较所解释。 为此,我们对比了物理输入方向相反的相同提示,考察隐藏状态移动是否遵循所提供的本构定律。这些状态变换在 60 条冻结关系中对直接、物理中立和逆定律进行了排序,并正确地将 40 条方向性定律中的 39 条定向,而词汇控制接近随机。双向干预在所有 12 个匹配案例中将答案概率移向或远离物理上适当的结果。反事实状态补丁则跨机制和答案格式传递了相反的决策信号。 结论:物理关系在受控状态变化中比在绝对状态中更可见。

论文精读

TL;DR 在开源 LLM 中分离出材料科学机制的三种可读表示:概念可提取、状态变换编码本构方向、内部表示因果控制答案,证明物理关系在状态变化中比绝对状态更可读。

问题

问题背景

大型语言模型(LLM)在科学问答中表现日益提升,但输出正确并不等于模型真正编码了物理机理。如何从模型内部表征中读取操控底层的科学知识,已成为可解释性研究与科学 AI 可信度的核心议题。

现有方法局限

  • 单点探针(linear probe) 仅测量特定概念是否可被分离,无法揭示概念之间的关系方向(如“应力与应变成正比”的符号性)。
  • 输出正确率评估无法区分模型是靠记忆词汇共现还是内在物理推理,导致表面能力与真实理解的混淆。
  • 现有因果干预(activation steering)大多针对语言风格或安全偏好,缺乏面向连续物理量符号性关系的精细控制基准。

为什么这个问题难且重要

  1. 表征的歧义性:同一物理概念在不同上下文(如一维 vs 二维材料)中可能由不同的隐藏状态模式编码,导致单点读出结果高度异构
  2. 状态与变换的分离:绝对状态向量可能只是词汇统计的残留,而状态间受控变换(如输入方向反转时的向量差)才可能携带本构关系。区分二者需要构造严密的反事实对照
  3. 工程影响:若科学机理只是“模型中的观光客”而非“可操控的基板”,则 LLM 在材料发现、实验设计等高风险场景中将缺乏安全验证手段。业界急需方法从“黑箱输出”升级到“表征级审计”。

行业类比

如同自动驾驶需验证感知模型是否真正理解“距离-速度”的物理约束,而不仅是统计图像关联,科学 LLM 同样需要表征级机理验证,以避免在未见情况下的灾难性误判。

核心洞察

  • **物理关系在受控状态变化中比在绝对隐藏状态中更易识别**。该研究通过构造仅改变物理输入方向的配对提示,测量隐藏状态移动是否符合本构定律,发现定向状态变换能正确排列物理规律,而词汇对照组接近随机。这区别于仅从静态隐藏状态解码概念的传统可解释性工作,表明语言模型对物理机制的内部表征具有动态、关系性的维度,对构建物理感知的 AI 系统有重要启示。
  • **Jacobian 透镜结合直接读出可跨材料描述符复现概念排序**。在 50 个保留的独立描述上,三个独立拟合的 Jacobian 透镜重现了概念排名,且无目标词汇集实现了对 10 个机制家族中 9 个的盲识别。这突破了以往主要依赖单点激活或词表投影的线性探针方法,展示了在科学领域利用模型梯度信息进行鲁棒概念恢复的可行性,为低资源材料知识提取提供了工程基准。

方法

本研究以 google/gemma-4-E4B-it 模型为中心,通过三阶段管线系统解读并操控其内部的材料科学机制表征。

输入与前置处理

输入为 50 个材料描述提示及一组 60 条材料本构定律,涵盖直接、中性、反向物理关系。所有提示均经严格泄漏控制与词汇对抗构造,确保模型基于物理而非表面词汇作答。

关键模块

概念可读性分析:结合 直接读出(direct readout)与 雅可比透镜(Jacobian lens)两种相互匹配的表征解码器,在隐藏状态中独立恢复概念排名。雅可比透镜通过估计输入对输出的影响梯度,无监督地标注概念方向;直接读出则提供基线对比。

选项无关状态几何:利用 无靶标词集跨措辞提示对 构造隐藏状态的图结构,通过谱聚类与精确图审计,揭示状态邻域的组织方式。审计发现,状态间的“物理组织”可被数值比较等价解释,从而引出可控状态变换的必要性。

因果干预与操控:设计 状态变换实验:仅反转输入中物理量的方向,观测隐藏状态是否沿本构定律移动。冻结 60 条关系后,变换方向可区分直接/中性/逆向定律,定向准确率达 97.5%(39/40)。进一步通过 双向激活操控(activation steering)和 跨机制反事实修补(cross‑mechanism patching),在 12 个匹配案例中,干预可显著偏移答案概率至物理正确或不正确的结果;反事实修补甚至能在不同机制与答案格式间迁移相反的决策信号。

输出

验证了三类可分离的表征:隐藏状态中的可读概念、状态变换中的本构方向、以及因果可控的内部决策信号。最终给出 表征感知科学模型训练 的展望。

与同类工作差异:常见探针方法仅解码静态状态中的概念,本研究通过可控状态变换揭示物理关系的方向性,并以因果干预确认表征的机能角色,超越了相关性的解释层级。

实验

实验设计

研究以 google/gemma-4-E4B-it 开源模型为对象,通过三层实验分离材料科学机制的表示形式:

  1. 概念可读性:在 50 条保留材料描述上,组合 直接词汇读出Jacobian 透镜 恢复概念排序,验证可复现性。
  2. 状态几何分析:构建 72 提示基准及 60 定律反事实基准,利用无选项图匹配状态变化探查隐状态邻域与本构取向。
  3. 因果操控:实施双向干预与跨机制激活修补,在 12 组匹配案例中量化答案概率偏移。 所有实验关注物理机制,而非单纯词汇线索,通过词汇对照、反事实设计排除混淆。

关键发现

  • 概念读出异质但可复现:三个独立拟合的 Jacobian 透镜复现了概念排序,目标自由词集能盲识别 10 类机制中的 9 类。
  • 状态变化比绝对状态更体现物理:仅反转物理输入方向,隐状态移动遵循本构定律。在 60 组冻结关系中,定向准确率达 39/40,而词汇对照近随机水平。
  • 因果操控有效且具选择性:双向干预在全部 12 组案例中成功将答案概率推向或推离物理合理结果;跨机制修补可转移相反的决策信号,且对答案格式保持稳健。
  • 中层状态携带部分词汇化的机制几何,后期层出现物理等效性偏移,但受答案脚手架影响。

与基线对比的深度解读

工作未依赖通用可解释性基线,而是内设三种严谨对照:

  1. 词汇对照提示在方向任务中准确率接近随机,证明模型并非简单利用表面词频,而是内化了方向性物理关系。
  2. 绝对状态的图结构看似反映物理组织,经精确图审计发现亦可由数值比较解释,表明受控状态转换才是揭示物理信息的关键。
  3. 跨机制修补显示,物理结果与数值方向可分离,暗示表示中存在独立于具体数值的物理极性。 这些对照将结论从相关性提升到因果性,为构建表征感知的科学模型训练方法提供了实验范式,但当前局限在单一模型与材料领域,泛化性待验证。

行业影响

落地场景

该工作为物理一致性可解释的 LLM 提供了工程路径,可直接应用于以材料科学、化学工程、药物发现为代表的工业研发领域。典型场景包括:

  • 材料配方与工艺优化:模型在推荐候选材料时,其内部表示能被检测是否遵守本构定律,从而过滤违反热力学或力学原理的输出。
  • 安全敏感流程模拟:化工过程模拟中,通过操控隐状态方向使模型预测始终遵循已知的物理方向性(如传热方向),避免逆物理的错误建议。
  • 分子性质预测与药物设计:在生成分子结构时,利用因果干预确保输出符合化学键合理性,减少后期实验验证的失败率。

商业价值

  • 降低试错成本:通过前置物理校验,将原本需要湿实验验证的失效方案提前在计算阶段排除,缩短研发周期,节省实验资源。
  • 提升模型可靠性:在受监管行业(如制药、材料认证),可解释的物理一致性为 AI 辅助决策提供审计证据,降低合规风险。
  • 增强人机协作信心:研发人员可直观看到模型是否“理解”了物理机制,减少对黑箱输出的排斥,提高采纳率。

与现有工作流的集成

该方法基于开放权重模型(Gemma-4-E4B-it) 的中间状态操控,无需重新训练大模型,可轻量嵌入现有工具链:

  • 后处理校验层:对 LLM 生成的方案,实时读取隐状态并用 Jacobian 透镜 或直接读出进行概念合规检查,标记或重排序输出。
  • 激活操控补丁:通过 双向干预 调整特定机制方向,可作为微调替代,以低计算开销修正模型回答倾向。
  • 与科学计算平台对接:可与第一性原理计算软件(如 VASP、LAMMPS)或材料基因组数据库通过 API 联用,构成“LLM 生成 – 物理校验 – 操控修正”的闭环。

具体用例

  1. 材料信息学平台:在 Materials Project 或 AFLOWlib 等数据库的对话界面中,用户用自然语言描述需求,LLM 推荐化合物,系统自动检测其隐状态是否反映正确的弹性本构关系或相稳定性,过滤物理不合理项,并给出可解释的“状态证据”。
  2. 药物研发 LLM 助手:在分子生成任务中(如用 REINVENT 结合 GPT ),每次生成分子后,后台用该技术检查构象能量、氢键方向等物理表达是否与化学直觉一致,并通过操控隐状态引导生成朝向更合理的局部空间,减少合成后活性测试的失败率。

局限

  • **单模型与单领域评估**: 所有实验均基于 `google/gemma-4-E4B-it` 单一开源模型,未在其他架构(如 LLAMA 系列)、不同规模或预训练配方上验证读出的可迁移性。材料科学机制家族仅包含 10 类,且全部为人工构建的反事实或对比提示,未在更开放的真实科学文本或跨领域(如生物学、化学)概念上检验。因此,发现的三种表征分离形式可能受特定模型表征几何或训练数据分布的强烈影响。
  • **读出与干预的工程敏感性**: 雅可比透镜(Jacobian lens)和无目标解码的性能高度依赖词表选择、算术秩(rank)和提示格式,论文中也观察到“部分词汇化”的混淆;`match_ctrl` 与 `inverse_law` 等对照提示的手工设计限制了自动化扩展。因果干预需要针对每种机制构造冻结方向并校准强度,跨机制激活修补(activation patching)在答案格式改变时失败(见 2.11.3),表明这些工具距离稳定的“科学概念编辑器”仍有距离,实际部署需要更多鲁棒性验证。
  • **状态变换分析对基准构造的依赖**: 揭示本构取向的核心方法依赖于精心构造的“直接-中性-逆”定律三组对比提示(60 个冻结关系),并通过词汇对照证明物理信号超过浅层词关联。然而,若面对非对称或更复杂的非线性物理关系,这种基于方向翻转的几何探针可能失效。此外,图结构审计(2.6)显示机制邻域可被数值比较操作解释,说明绝对状态中的物理组织容易被表层统计模式掩盖,这限制了无监督发现物理概念的前景。
论文Markus J. Buehler2026-07-22原文

相关内容