论文

模块化认知架构在大语言模型中涌现

模块化认知架构在大语言模型中涌现

人脑展现出显著的功能专门化:不同网络分别支持语言、形式推理、心理推理和物理世界推理。这种模块化组织究竟是智能系统必须遵循的基本原则,还是生物大脑特有的进化偶然?我们对此进行了检验。 本研究以大语言模型(LLMs)——另一类经由截然不同优化过程产生的智能系统——为对象,考察其是否涌现出类似的组织。利用电路分析(circuit analyses),我们在覆盖四个认知域(语言、形式推理、社会推理、物理推理)的 46 个任务 上开展实验。结果显示,LLMs 形成了与人脑镜像的模块化架构: - 在人脑中调用同一网络的任务,会招募 LLM 中重叠的神经元; - 调用不同网络的任务,则招募不同的神经元。 大脑与神经网络中趋同涌现的模块性表明,这可能是智能系统的根本属性。

论文精读

TL;DR 对 46 项跨语言、形式、社会与物理推理任务做电路分析,发现 LLM 涌现出与人类大脑相似的模块化功能分化,提示模块化或是智能系统的普遍属性。

问题

问题背景

当前 LLM 研究愈发关注其内部表征是否自发形成功能分化,以及这种分化是否与人类大脑的认知模块化架构一致。

现有方法局限

此前工作多依赖 probing 分类器或单任务激活分析,只能验证某类信息是否“存在”于表征中,无法证明不同任务是否稳定复用同一组神经元。且已有研究通常局限于单一领域(如语言或推理),缺少跨领域、跨模型的一致比较框架。可解释性工具如 logit lens、attribution 只能给出粗粒度相关性,难以建立神经元级回路与行为输出的因果关系。

为什么这个问题难且重要

LLM 参数量巨大,内部表征高度纠缠;要在数十亿参数中识别稳定、可复用的功能模块,需要大量任务(论文用了 46 个任务、4 个认知域)和细粒度因果干预实验。这不仅是科学问题,更直接影响模型编辑、持续学习、稀疏更新、安全对齐等工程方向。若模块化确实是智能系统的基本属性,则未来架构设计可借鉴人类大脑的分工原则,而非仅依赖统一 Transformer 堆叠。

行业类比

类似在多模态大模型中,视觉编码器与语言解码器自然形成分工;若 LLM 内部也出现域特化模块,就可在特定认知模块上做类似 LoRA 的定向微调或剪枝,而不影响其他能力。

核心洞察

  • LLM 的电路级分析显示,不同认知任务招募的神经元重叠模式与人类大脑功能网络高度一致,说明模块化可能是智能系统优化过程中的共性收敛解。以往研究大多聚焦单一能力或注意力头级别的探针,本研究首次在 46 个任务、四个认知域(语言、形式推理、社会推理、物理推理)同时进行跨模型电路剖析,揭示了共享神经元池与人类 fMRI 静息态网络之间的映射,为“模块化是智能基本属性”提供了迄今最系统的计算证据,区别于仅靠行为相关性或单任务定位的间接推断。
  • 模块化自发涌现意味着 LLM 内部存在可分离的功能回路,这为模型编辑、能力解耦与安全干预提供了新的工程抓手。相比当前可解释性方法多在 token 或 layer 级别生成归因热图,本研究从认知功能粒度划分神经元子网络,允许更粗粒度但语义明确的操纵——例如单独抑制社会推理相关神经元集合而不影响语言能力,这在 API 受限或无法微调的大模型部署中,提供了一种类似“功能开关”的调试路径,与 SFT/RLHF 等全局调整手段形成互补。

方法

输入与任务组织

收集 N=46 个任务,覆盖四个认知域:语言、形式推理、社会推理、物理推理。每个任务与人类 fMRI 研究中已知的功能网络对应(如语言网络、心智化网络、物理推理网络),作为模块化对齐的基准。

关键模块:电路分析流程

  1. 对每个任务构建提示并输入 LLM,记录前向传播中各层 MLP 神经元的激活。
  2. 采用归因方法(如积分梯度或激活修补)计算每个神经元对任务输出的因果贡献,阈值筛选出“任务相关神经元”。
  3. 计算不同任务间神经元集合的重叠系数(如 Jaccard 或 Dice),生成任务间功能相似性矩阵。

输出与验证

将 LLM 中任务间神经元重叠矩阵与人类脑成像得到的任务网络重叠模式进行统计对比,检验两者是否显著一致。结果发现:同一人类网络内的任务在 LLM 中共享更多神经元,不同网络间任务神经元显著分离,形成模块化架构。

原作者论断:模块化在生物脑与人工神经网络中趋同出现,提示其可能是智能系统的基本属性。

与同类方法的差异点:以往 LLM 可解释性研究多聚焦单任务能力神经元或局部电路,本研究首次跨多个认知域使用统一电路分析框架,直接对齐人类功能网络拓扑,验证模块化架构的涌现。

实验

实验设计

论文对 46 个任务 进行电路分析,覆盖 语言、形式推理、社会推理、物理推理 四个认知域。通过电路分析方法(如因果干预 / 归因)定位 LLM 中每个任务所依赖的神经元子集,并与人类脑成像得到的功能网络进行对照。分析在多个 LLM 上进行,以验证模块化结构是否具有普遍性。

关键发现

  • 同一认知域内的任务激活的神经元高度重叠,不同认知域之间则相对分离,呈现 模块化架构。
  • 该架构与人类大脑的功能网络存在显著对应:在人类中共享同一网络的任务,在 LLM 中也倾向于激活相同的神经元。
  • 这种模块化并非训练目标直接指定,而是模型在优化过程中自发形成的 涌现属性。

与既有工作的差异解读

此前部分研究认为 LLM 内部表征较为弥散,缺少类似大脑的模块化组织。本工作利用精细的电路分析给出了相反证据,表明模块化可能是智能系统在通用优化压力下的 收敛解。对工程实践的启示:LLM 内部天然的模块化结构可为稀疏推理、模块化微调、可解释性分析提供新基础,避免人为强加模块边界的成本。

行业影响

落地场景

模块化稀疏推理 与 任务路由 可应用于多任务 LLM 产品。例如电商智能客服中,商品咨询与售后协商可分别激活物理/语言模块和社会推理模块,而非全模型前向计算,降低延迟与成本。内容平台的评论审核也可按语言、社交规则、物理常识分派模块。

商业价值

核心降本:按需激活模块可将推理计算量削减,直接降低 GPU 成本;模块独立性支持 持续学习 与 热更新——更新某一认知域(如医学知识)不会干扰其他能力,减少回归测试和全量重训开销。体验提升在于跨任务干扰减少,复杂场景中逻辑一致性更高。

与现有产品/工作流的接口

可集成进 MoE 路由:以发现的模块作为专家分组依据,替代启发式路由;或为不同模块挂载独立 LoRA 适配器,实现能力热插拔。也可对接 TransformerLens 等电路分析工具,输出模块激活热图,辅助审计与调试。

具体 use case:

  1. 企业知识库问答:查询意图分类后,仅激活形式推理/物理推理模块生成答案,节省算力;
  2. 医疗辅助诊断:病历解读与治疗方案逻辑校验分离,更新医学知识库时仅微调对应模块,降低安全风险。

局限

  • 论文的电路分析主要基于特定开源 LLM(如 GPT-2 / Llama 系列)和有限任务集(N=46),覆盖四个认知领域。虽然任务设计参考了人类 fMRI 研究,但任务多样性和生态效度仍然有限,尚不能证明模块化在更复杂、开放域或跨模态任务中同样稳定出现。此外,不同模型规模和架构下的模块化程度是否一致未充分验证,限制了结论的泛化性。
  • 神经元的“招募”判定依赖于激活重要性度量(如积分梯度或消融实验),这类方法本身存在近似偏差和阈值敏感性,可能高估或低估模块化程度。同时,模块化现象可能由训练数据的领域分布或 Transformer 架构的归纳偏置共同导致,未必是智能系统自发涌现的通用原则。论文缺少对模块化形成机制的因果解释或控制实验。
  • 与人类大脑网络的对应关系建立在已有 fMRI 元分析标签之上,这种跨物种映射较为粗糙,可能忽略网络拓扑、功能连接模式和动态特性的差异。因此,“镜像人脑”的结论强度需要谨慎解读,不能直接等同于生物脑的模块化组织原则。未来需要更精细的神经影像对齐和跨模型收敛性验证。
论文Pengrui Han2026-06-27原文

相关内容