行业新闻

ICML 2026论文推翻“唯一电路”假设,同一任务存在多条独立电路

大模型可解释性基础假设被证伪:同一任务背后并非只有一条电路,而是存在多条可互换的等效路径。

机制可解释性领域长期默认每个任务对应唯一的内部电路(模型处理信息的子网络)。但ICML 2026最新研究发现,同一任务可由多条结构几乎不重叠的电路独立完成。作者提出OASR方法,通过重叠惩罚系统地发现多条等效电路,彻底颠覆了“功能各向异性假说”。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/380747fb-7de8-4b94-9cfc-3c2587581d36/0.jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 长期以来,机制可解释性(mechanistic interpretability)领域有一个几乎从未被明说、却被视为理所当然的前提:模型对于同一种任务的能力或表现,背后对应着一条唯一的、或近乎唯一的内部「电路」(circuit)。该领域的研究者们之所以要做「电路发现」(circuit discovery),是为了要把这些「特定的」电路找出来。 但一篇被 ICML 2026 接收的新论文给出了一个让人不太舒服的答案:「唯一电路」可能从一开始就不存在。 同一个任务,可以由许多结构上几乎完全不重叠、却有着同样高任务能力、稀疏、完备的电路独立完成。论文把这个被长期默认的前提命名为「功能各向异性假说」(Functional Anisotropy Hypothesis),并从实验与理论两种路径,系统性地把它推翻了。 一个被默认了很久,却从未被言明的假设 近几年,circuit 与 sheaf 发现(Circuit and Sheaf Discovery,简称 CSD)成了机制可解释性(Mechanistic Interpretability)里最热门的方向之一。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-30原文

相关内容