行业新闻

至知研究院提出稀疏权重分解法,数据成本不到1%

稀疏权重分解法用极少数据从权重中直接构造可干预单元,让大模型任务回路分析成本降至1%以下。

至知研究院等机构提出稀疏权重分解(SWD),将稠密权重矩阵分解为两个稀疏矩阵,共享维度成为可独立干预的瓶颈单元。相比训练型替代表示,SWD用不到1%的数据达到同等保真度,并能直接抽取任务回路,实现低成本、高精度的模型可解释性分析。

正文摘录

至知研究院提出大模型可解释性新路线:拆权重,数据成本不到 1% Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。 这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。 问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。 训练型替代表示通常还需要针对不同模型、层和 checkpoint 分别拟合,使大规模、系统性的回路分析更加困难。 更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。 至知创新研究院(IQuest Research)与 Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线: 这套方法名为 稀疏权重分解(Sparse Weight Decomposition,SWD)。 它把一个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。 △SWD 方法概览。预训练模型中的稠密权重被分解为两个稀疏因子,共享中间坐标成为可独立评分、选择和消融的瓶颈单元。 SWD 的出发点很简单。对于预训练模型中的稠密权重矩阵 W,寻找两个稀疏矩阵 A 和 B,使得 A 和 B 共享 m 个中间维度。第 i 个维度先通过 A 的第 i 列从输入中读出一个标量,再通过 B 的第 i 行写向输出。这样,一列和一行共同构成一个瓶颈单元,也就是一条固定的 rank-one 读写路径。

阅读原文(qbitai.com)→

行业新闻思邈2026-08-15原文

相关内容