ICML 2026论文推翻“唯一电路”假设,同一任务存在多条独立电路
大模型可解释性基础假设被证伪:同一任务背后并非只有一条电路,而是存在多条可互换的等效路径。
机制可解释性领域长期默认每个任务对应唯一的内部电路(模型处理信息的子网络)。但ICML 2026最新研究发现,同一任务可由多条结构几乎不重叠的电路独立完成。作者提出OASR方法,通过重叠惩罚系统地发现多条等效电路,彻底颠覆了“功能各向异性假说”。
正文摘录
  长期以来,机制可解释性(mechanistic interpretability)领域有一个几乎从未被明说、却被视为理所当然的前提:模型对于同一种任务的能力或表现,背后对应着一条唯一的、或近乎唯一的内部「电路」(circuit)。该领域的研究者们之所以要做「电路发现」(circuit discovery),是为了要把这些「特定的」电路找出来。 但一篇被 ICML 2026 接收的新论文给出了一个让人不太舒服的答案:「唯一电路」可能从一开始就不存在。 同一个任务,可以由许多结构上几乎完全不重叠、却有着同样高任务能力、稀疏、完备的电路独立完成。论文把这个被长期默认的前提命名为「功能各向异性假说」(Functional Anisotropy Hypothesis),并从实验与理论两种路径,系统性地把它推翻了。 一个被默认了很久,却从未被言明的假设 近几年,circuit 与 sheaf 发现(Circuit and Sheaf Discovery,简称 CSD)成了机制可解释性(Mechanistic Interpretability)里最热门的方向之一。