AI 基础
什么是可解释 AI?
可解释 AI (XAI) 包括帮助人们理解 AI 系统行为或输出的方法和实践。解释可能描述有影响力的输入,展示相似示例,提供反事实变化,总结全局规则,或在系统不确定时进行说明。
没有哪种解释是普遍最佳的。调试模型的开发者、审计政策合规性的审计员以及受决策影响的个人都需要不同的证据。因此,解释必须从准确性、意义和预期用途等方面进行评估,而不仅仅是视觉吸引力。
关键要点
- 透明性描述可获得的信息;可解释性关注意义;解释则传达证据或理由。
- 全局方法对模型进行概括,而局部方法针对单一预测或小范围进行解释。
- 事后解释可能有用,但可能不稳定或与底层模型不一致。
- 解释并不能证明公平性、因果关系、鲁棒性或正确性。

有用解释的四大原则
NIST 提出,系统应提供解释,使其对预期用户有意义,确保其准确反映系统的过程,并传达其知识的局限性。这些原则将解释的存在与其质量区分开来。
意义取决于受众。简明的理由代码可能帮助申请人,而模型开发者则可能需要分布、特征行为和失效集群。二者都应关联到同一份文档化的系统和决策背景。
内在方法与事后方法
稀疏线性模型或受约束的决策树在其有效范围内可直接解释。复杂模型则可能采用事后特征归因、局部代理、示例、显著性图或反事实等方法。
当特征定义不清或流水线被隐藏时,内在的简洁并不必然忠实。事后方法的复杂性也不一定误导。必须将方法针对其预期回答的问题进行测试。
特征归因与相关输入
归因方法在明确假设下将输出的部分归于输入特征。LIME 在预测周围拟合一个简易的局部代理;与 SHAP 相关的方法将加性归因与 Shapley 值概念相联系。
相关特征可能共享或相互转移归因,且高归因并不等同于因果效应。单独改变某一特征可能导致不可能的个人、图像或交易。解释应说明其基线、抽样和依赖假设。
反事实、示例与全局行为
反事实问题询问哪些可行的改变会导致结果变化。约束条件至关重要: 可操作的解释不应建议不可变、更改非法或不切实际的内容。基于示例的方法展示原型或有影响力的训练案例,但可能泄露私人数据。
全局分析考察性能、偏依赖性、单调性、交互作用以及子群行为。对于如梯度提升等集成模型,需要将概括与局部证据以及对预期约束的直接测试相结合。
验证解释与系统
测试解释的忠实度、在小扰动下的稳定性、对等输入的一致性、用户理解程度以及解释是否支持恰当的决策。对抗性测试应检查具有说服力的解释是否会伴随错误或被操纵的输出。
可解释 AI 属于更广泛的评估范畴: 包括留出集质量、校准、公平性、隐私、安全、监控和申诉机制。解释可以支持问责,但不能取代负责任的治理。
解释目标与方法族
可解释 AI 应从问题和受众出发: 为什么会出现某个决策、模型整体如何表现、哪些证据影响了它、什么会改变结果,或是否遵循了政策。局部解释针对单一预测;全局解释概括更广泛的行为。内在可解释模型展示系数、规则或结构,而事后方法则近似复杂模型。对模型行为的解释并不自动等同于对世界的因果解释,也不等同于对决策公平性的证明。
特征归因方法包括梯度、集成梯度、SHAP 风格值、置换以及局部代理模型。基于示例的解释检索有影响力或相似的案例;反事实提出与不同输出相关的改变;概念方法将内部表征与人类类别关联。每种方法都对基线、特征独立性、局部线性或模型访问有假设。相关变量、交互作用和预处理可能导致归因不稳定或误导。比较不同方法并扰动输入,以检验解释是否能够预测行为。
评估与人为因素
评估忠实度——解释是否与模型匹配——应独立于对人的可信度。测试稳定性、敏感性、完整性、稀疏性以及在调试或申诉等特定任务中的实用性。人类研究需要具备代表性的参与者,并应衡量决策质量、错误检测、依赖程度和耗时,而不是用户是否觉得图表清晰。具有说服力的解释可能提升对错误模型的信任,因此界面必须展示不确定性、备选方案和局限性。
反事实应是可行且可操作的,并且不建议改变受保护或不可变的特征。解释可能泄露模型或个人信息,帮助攻击者逆向推断决策。应实施访问控制和最小化输出。对于受监管或高影响的使用场景,需要保留数据来源、模型版本、阈值以及实际决策逻辑;通用的特征重要性图表无法取代具有法律意义的理由或人工审查。
负责任地使用解释
选择满足性能和运营需求的最简模型,但不要为表面的可解释性而牺牲有效性。将解释与子群测试、鲁棒性检查、相关的因果分析以及结果监控相结合。记录预期受众和无效推断。如果解释在无害扰动后发生变化,应在部署前进行调查。可解释性是关于系统在特定方法下的证据,虽对调试、监督和沟通有价值,但并不证明真相、公平、安全或理解。
案例分析:解释信用风险模型
贷款机构首先明确受众和所需的理由: 申请人需要准确的决策因素和纠错路径,开发者则需要诊断信息。将经过校准的可解释基线与提升模型进行比较。对局部归因、反事实和全局误差分析进行忠实度、稳定性、相关特征行为以及实用性的测试。解释不得建议更改年龄、残疾或其他不可变特征,也不以因果效应呈现。
生产决策记录保存源数据、特征转换、模型、阈值、政策以及人工操作。申请人可以质疑不正确的数据并获得有意义的复审。监控检查不同群体和模型更新下的结果与解释稳定性。如果在无害特征扰动下合理解释发生变化,或遗漏关键政策规则,则停止部署。可解释性是对验证和程序性权利的补充,但并不能为无效目标、歧视性结果或缺乏负责任的人为授权开脱。
实施证据与运营准备
生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、所有者以及每项重要故障的后果。调优前建立可复现的基线和带版本号的评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最可能被服务不足的群体或环境。衡量任务质量时同步考虑校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全。记录每一次转换和阈值,以便独立审查员复现结果,并将证据与诱人的原型区分开来。
上线前,指定发布、例外、变更、回滚和退役的责任人。采用分阶段发布,保留安全回退,并通过人为注入故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及已确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,随后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据来源、用户、模型、供应商、政策、硬件或目标发生变化时,都需重新评估。维护中的系统还需有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时点。
常见问题
注意力图是解释吗?
它们可以作为诊断信号,但仅凭注意力权重并不能保证忠实地反映模型输出的原因。
可解释 AI 是否需要简单模型?
并非总是如此。复杂模型可以通过事后方法进行分析,但这些解释需要独立验证并明确其限制。












