Mechanist框架让AI自主探究模型内部机制
本文介绍Mechanist,让AI像科学家一样自动探究大模型内部机理,并能动调节其行为,走向机器智能的实验科学。
Mechanist是一个让AI自己研究机器智能机制的框架。它生成假设、设计实验、验证并修正结论,还发现模型区分事实与他人信念的不同神经机制。通过干预特定注意力头,可提升模型表现。此方法也可用于生物序列模型,如调控DNA序列的α-螺旋含量。
正文摘录
.jpg)  近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。而如果这种探究模型内部如何学习、组织和使用知识的「实验」不再完全依赖人类完成,而是交给 AI 自己呢?让它提出假设、寻找机制、设计实验、验证结果,甚至进一步干预模型。 正如医生、心理学家和脑科学家从不同层面研究人类自身,理解我们的行为、认知与大脑机制,我们也可以进一步追问:AI 能否成为研究机器智能自身的「科学家」?这正是 Mechanist 正在探索的问题。