Skip to content

Mechanistic Interpretability

Mechanistic Interpretability(机制可解释性,简称 Mech Interp)是一门通过逆向工程来理解神经网络内部计算机制的前沿研究领域。其核心目标是:将模型的行为分解为可理解的、可验证的底层计算单元,从而回答"模型为什么做出这个预测"的问题。

核心思想

传统 AI 可解释性方法(如注意力热力图、LIME、SHAP)提供的是相关性解释——指出哪些输入特征与输出相关。而机制可解释性追求的是因果解释——识别出具体负责某行为的神经网络子结构(电路),并通过干预验证其因果作用。

"我们不只想知道模型在做什么,还想知道它是如何做到的。" —— Chris Olah

核心方法

1. 电路追踪(Circuit Tracing)

电路追踪是机制可解释性的核心方法,目标是识别出负责特定行为的神经网络子图。

基本流程

  1. 定义 clean/corrupted 输入对(如正确的间接宾语识别 vs. 打乱后的版本)
  2. 使用修补/消融技术识别关键组件
  3. 追踪信息在网络中的流动路径
  4. 验证忠实性:消融已识别组件后,行为是否按比例退化

里程碑工作:Wang et al. (2022) 在 GPT-2 small 中首次完成了端到端电路追踪,识别出间接宾语识别(IOI)电路,发现了"Name Mover Heads""Negative Name Movers""S-Inhibition Heads"等专门化注意力头。

2. 激活修补(Activation Patching / Causal Tracing)

激活修补通过将 corrupted run 的激活替换到 clean run 中,来测试特定组件的必要性。

主要变体

方法原理优势局限
节点修补替换特定层/头的激活简单直接粒度较粗
路径修补仅替换特定路径(clean sender → corrupted receiver)更精确实现复杂
注意力修补专门修补注意力模式隔离注意力机制忽略 MLP 贡献

关键论文

  • Wang et al. (2022) — 建立标准方法论
  • Goldowsky-Dill et al. (2023) — 提出路径修补精化方法

3. 归因修补(Attribution Patching)

使用梯度估计组件重要性,无需运行完整消融:

  • 优势:速度快(线性 vs. 指数复杂度),适合作为初步筛选
  • 局限:线性近似可能遗漏非线性交互

Syed et al. (2023) 发现归因修补比自动化电路发现方法(ACDC)更可靠。

4. 特征可视化(Feature Visualization)

通过优化找到最大化激活特定神经元/特征的输入模式:

  • 优化法:通过梯度上升最大化激活
  • 数据集示例法:在真实数据中寻找高激活样本
  • 综合法:结合上述两种方法

演进:从神经元级可视化(Distill, 2017)→ 特征级可视化(配合 SAEs, 2023-2024)

5. 稀疏自编码器(Sparse Autoencoders, SAEs)

SAEs 是当前机制可解释性最重要的技术突破,用于无监督地将神经网络激活分解为稀疏、可解释的特征。

架构

输入激活 x

编码器: f = ReLU(W_enc · x + b_enc)

解码器: x̂ = W_dec · f + b_dec

损失 = ||x - x̂||² + λ · ||f||₁

L1 稀疏惩罚确保每次只有少量特征被激活。

关键性质

  • 单语义性(Monosemanticity):每个特征通常对应单一概念
  • 稀疏性:每个输入仅激活少量特征
  • 可干预性:可通过编辑特征来修改模型行为

里程碑成果

  • Bricken et al. (2023) — 首次将 SAEs 应用于语言模型,发现"金门大桥""法律文件"等具体概念特征
  • Anthropic (2024) — 将 SAEs 扩展到 Claude 3 Sonnet(70B 参数),提取数百万可解释特征,包括代码缺陷、安全漏洞、欺骗、谄媚等安全相关特征

6. 超位置(Superposition)

超位置是机制可解释性的核心理论问题:神经网络如何表示比维度更多的特征?

Elhage et al. (2022) 在 "Toy Models of Superposition" 中证明:

  • 网络使用近似正交方向编码特征
  • 这解释了多语义神经元(一个神经元响应多个无关特征)现象
  • 超位置使得简单的轴对齐解释方法失效,从而激励了 SAEs 的发展

Anthropic 的 Transformer Circuits 研究

Anthropic 是机制可解释性领域的领导者,其 Transformer Circuits 项目发表了一系列奠基性论文:

核心论文序列

论文年份核心贡献
"A Mathematical Framework for Transformer Circuits"2021建立 Transformer 计算的形式化框架,定义 QK-circuits 和 OV-circuits
"In-context Learning and Induction Heads"2022发现归纳头是上下文学习的关键机制,解释少样本学习如何无需参数更新而工作
"Toy Models of Superposition"2022建立超位置理论,解释多语义神经元现象
"Towards Monosemanticity"2023将 SAEs 应用于语言模型,实现从多语义神经元中提取单语义特征
"Scaling Monosemanticity"2024将 SAEs 扩展到生产级模型(Claude 3 Sonnet),提取数百万特征
"Refusal in Language Models: A Circuit Analysis"2024使用 SAEs 定位拒绝行为的电路,展示对齐干预的概念验证

归纳头(Induction Heads)

Olsson et al. (2022) 的突破性发现:

  • 归纳头执行 "[A][B]...[A] → [B]" 模式匹配
  • 在训练过程中突然涌现(phase change/phase transition)
  • 解释了 Transformer 的上下文学习能力——无需梯度更新即可从示例中学习
  • 具有普遍性:在不同规模、不同架构的模型中都会出现

应用

安全对齐(Safety Alignment)

  • 拒绝行为定位:识别模型拒绝有害请求的内部机制
  • 欺骗检测:发现谄媚、欺骗、操纵等行为的特征
  • 能力评估:从机制层面理解模型的真实能力边界
  • 对齐干预:Anthropic 的拒绝电路分析展示了通过特征编辑进行对齐干预的概念验证

能力定位(Capability Localization)

  • IOI 电路:理解间接宾语识别的完整机制
  • 归纳头:解释上下文学习的原理
  • 数学/推理电路:识别算术、逻辑推理的专门化组件

模型编辑

  • 特征操控:通过添加/减去特征方向修改模型行为
  • 消融:禁用特定电路以移除有害能力
  • 表示工程(Representation Engineering):Zou et al. (2023) 提出的自上而下方法,通过"读取向量"检测模型状态,通过"控制向量"引导模型行为

关键研究者和组织

Anthropic

  • Chris Olah:Distill Circuits 线程领导者,Transformer Circuits 项目核心
  • Catherine Olsson:归纳头研究领导者
  • Nelson Elhage:数学框架、超位置理论
  • Trenton Bricken:单语义性/SAEs 研究领导者

Neel Nanda

独立研究者,机制可解释性领域最具影响力的开源贡献者:

  • TransformerLens:开源机制可解释性库,提供便捷的内部激活访问和修补工具
  • 200+ Concrete Open Problems in Mech Interp:系统性研究议程
  • 运行 Google SERI MATS 项目培养新一代研究者

Redwood Research

AI 安全研究机构,贡献包括:

  • Eliciting Latent Knowledge (ELK):提取模型潜在知识的方法论
  • Causal Scrubbing:因果擦除验证方法

其他重要贡献者

  • Andy Zou(Stanford):表示工程(Representation Engineering)
  • David Bau(MIT):网络解剖、GAN 可解释性

重要工具

工具作者功能
TransformerLensNeel Nanda访问 GPT-2、LLaMA 等模型的内部激活,内置修补和消融工具
pyveneStanford NLP通用模型干预库,支持多种架构
SAE Lens社区SAE 训练和分析工具

开放问题与未来方向

Neel Nanda 提出的 200+ 开放问题中的核心挑战

  1. 自动化电路发现:当前方法需要大量人工工作,如何实现可扩展的自动发现?
  2. 大规模模型扩展:能否在 100B+ 参数模型中追踪电路?
  3. 组合性理解:电路如何组合产生复杂行为?
  4. 训练动态:特定电路为何在训练中涌现?
  5. 真实世界任务:多数工作集中在玩具任务,需要更复杂的行为分析
  6. 忠实性验证:已识别的电路是否真正具有因果作用?
  7. 超位置解析:是否存在比 SAEs 更好的方法?

2024-2025 前沿方向

  • 特征电路(Feature Circuits):结合 SAEs 与电路追踪,在特征空间而非神经元空间发现电路
  • 通用电路:寻找跨模型共享的电路
  • 自动化可解释性:使用 LLM 自动解释特征含义
  • 实时监测:将 SAEs 用于部署时的安全监测
  • 模型编辑:从概念验证走向实用的对齐干预

相关页面

Sources

AI Knowledge Base — 持续积累