AI 基础

什么是机制可解释性?研究人员如何分析 AI 模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

机制可解释性研究神经网络内部学习到的组件如何因果地产生行为。研究人员不只是将输入与输出进行相关性分析,而是围绕特征、注意力头、神经元和电路提出假设,并通过干预来检验这些假设。

该领域已经为小型和中型模型中的特定行为提供了详细解释,但对前沿模型的完整、忠实的说明仍难以实现。自动化的解释和精美的可视化可以作为有用的起点,却不能视为证据。

要点概览

  • 特征是被表示的模式;电路是被提出用于实现计算的交互组件。
  • 激活修补、消融和因果追踪用于检验某个组件是否会改变行为。
  • 叠加意味着单个神经元可以参与多个特征;稀疏自编码器尝试构建不同的特征基。
  • 可解释性方法需要真实标签、可证伪的测试、覆盖率以及相对于替代解释的评估。
What Is Mechanistic Interpretability? How Researchers Analyze AI Models workflow diagram
当因果干预能够预测并再现行为时,机制性主张才变得可信。

从表征到机制

探测旨在判断是否可以从激活中解码出信息。归因估计哪些输入或组件重要。机制性工作更进一步,提出内部计算模型并检验干预是否改变预期的中间和最终行为。

这使其与可解释人工智能有关,但范围更窄。对单一决策的事后解释并不一定等同于模型内部的逆向工程算法。

电路与因果干预

研究人员可能会识别与任务相关的注意力头或特征,随后对其进行消融、使用另一轮的激活进行修补,或追踪信息在层之间的流动。一个好的假设能够在新样本上预测行为并在对照实验中站得住脚。

干预可能导致分布外的状态,因此行为变化并不自动揭示自然计算。应使用多种方法、匹配的对照以及量化的效应,而非单一示例提示。

叠加与稀疏特征

神经网络可以通过叠加在单个维度上表示更多特征。因此,一个神经元可能会对多种无关的模式激活,使得基于神经元的标签具有误导性。

稀疏自编码器从模型激活中学习更大的特征词典。它们可以使模式更易分离,但所选的稀疏度、训练数据、重构误差以及自动标签都会影响恢复的内容。神经网络特征仍需因果验证。

安全、调试与局限性

机制性工具可以帮助发现记忆的事实、偏见、欺骗性策略或失效电路,并可能支持编辑或监控。然而,同样的工具可能遗漏分布式、罕见或上下文依赖的计算。

将发现视为有范围的证据:模型版本、任务、数据集、层、干预、效果以及不确定性。将解释与行为评估、红队测试以及负责任 AI治理相结合,而不是将其作为笼统的安全认证。

表征、电路与因果证据

机制可解释性研究内部计算如何产生模型行为。研究人员检查激活、权重、注意力和中间特征,然后对表征和电路提出假设。表征不一定存储在单个神经元中;它可能分布在不同的方向、层、标记以及上下文相关的组合中。

稀疏自编码器尝试将稠密激活分解为更大的一组可选择性激活的特征。特征标签是对观察到的示例的人为解释,而非真实标签。重构误差、稀疏度、特征拆分、吸收以及死特征都会影响分解所揭示的内容及其遗漏。

相关性不足以支撑机制性主张。激活修补、消融、因果追踪、引导以及有针对性的权重干预用于检验组件是否按预测改变行为。干预同样可能产生分布外状态,因此结果需要对照、剂量‑反应分析、替代解释以及在不同提示和模型上的复现。

严谨的可解释性工作流

首先确定精确测量的行为以及能够区分竞争假设的数据集。定位相关层、位置、组件或特征;检查候选机制;进行干预;并测试所提议的电路是否能预测新案例。将探索性示例与验证性评估分开,以降低选择偏差。

自动化工具可以对神经元、特征、注意力头或路径进行排序,语言模型则可提供描述。自动化提升了覆盖范围,但也可能编造看似合理的故事。对保留的激活示例和因果预测对解释进行打分,记录不确定性,并通过模型版本、分词器、提示和代码使产出可复现。

机制可能是多义的、冗余的、非线性的且分布式的。移除一个组件可能会被其他组件补偿,而一个特征可以参与多种行为。负面发现同样具有信息价值:在非精选示例中失效的表面电路应被收窄或否定,而不是用日益模糊的解释去拯救它。

应用、局限性与安全声明

可解释性可以帮助调试幻觉、偏见、记忆、越狱行为或意外的泛化;比较模型;并生成科学假设。它还能识别用于监控或干预的特征。这些用途需要任务特定的验证,因为有用的研究可视化并不自动等同于可靠的生产控制。

未检测到某特征并不证明模型缺乏相应能力或意图,可读的特征也不证明模型在特定答案中使用了它。工具只能观察到计算的投影,覆盖范围有限。安全声明必须说明检测灵敏度、误报率、分布、对手以及已知盲点。

在使用可解释性的同时,应结合行为评估、红队测试、数据治理、访问控制、监控和事件响应。尽可能公开方法和反例。该领域发展迅速,但现有技术仍无法对前沿模型的推理提供完整、忠实的解释,也无法给出通用的对齐保证。

案例分析:测试提出的模型电路

假设一个模型似乎使用一组注意力头和特征来解析句子中的间接宾语。研究人员构建包含不同姓名、位置、干扰项和反例的受控数据集,并测量其行为。激活检查可识别候选组件,但假设在干预之前就已写好:每个组件携带何种信息、信息流向何处,以及改变它应如何影响输出。

激活修补和消融在保留示例上检验必要性和充分性。若有针对性的编辑能够在预期方向上改变预测标记,则支持该机制;若导致整体性能受损则不支持。对照实验会修补无关位置和组件,改变干预强度,并比较替代电路。团队会公布解释失效的负面案例,避免仅凭相关性赋予人类可读的目的。

若要声称安全应用,该方法必须在真实提示和对抗性适应下以已知灵敏度检测相关行为。特征监控需评估误报、规避、模型更新以及因果关联。可解释性证据可以指导调试和后续测试,但执行仍依赖外部控制和行为监测。引人注目的电路图是一种有证据支撑的科学假设,而非对模型的完整解释或对未见行为的保证。

实用实施清单

将概念转化为有界、可测试的工作流:观察 → 假设 → 追踪 → 干预 → 测量 → 复现。指定负责人,记录数据和依赖,建立简易基线,设定接受和停止标准,测试代表性故障,并在扩大范围前定义监控、回滚和审查。记录版本和假设,以便其他团队复现结果并了解变更情况。

在上线前,进行有文档记录的就绪审查,参与者包括构建、运营、保障以及受系统影响的人员。测试正常情况、边界条件、依赖失效和误用;保留证据和未解决的风险。明确谁可以批准发布、修改阈值、覆盖输出或停止运行。实际数据到来后重新评估决策,因为技术上成功的试点并不保证在更大规模上的可靠表现。

  • FEATURES: 表征的候选单元。
  • CIRCUITS: 交互组件及信息流。
  • VALIDATION: 对照、干预、覆盖率和不确定性。

常见问题

机制可解释性等同于读取模型权重吗?

不是。原始权重并不能自我解释。研究人员分析激活、特征、组件和干预,以构建并检验因果假设。

稀疏自编码器能够完整解释大型语言模型吗?

不是。它们提供了一套候选特征基础并可支持电路分析,但覆盖率、忠实度、重构、标注以及可扩展性仍是未解决的问题。

主要参考文献

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。