AI 기초
Explainable AI란 무엇인가?
Explainable AI (XAI)는 사람들에게 AI 시스템의 동작이나 출력 결과를 이해하도록 돕는 방법과 실천을 포함합니다. 설명은 영향력 있는 입력을 기술하거나, 유사한 예시를 보여주거나, 반사실적 변화를 제시하거나, 전역 규칙을 요약하거나, 시스템이 알지 못할 때 이를 전달할 수 있습니다.
어떤 설명도 보편적으로 최선은 없습니다. 모델을 디버깅하는 개발자, 정책 준수를 테스트하는 감사인, 그리고 결정의 영향을 받는 사람은 서로 다른 증거가 필요합니다. 따라서 설명은 정확성, 의미, 의도된 사용 목적을 기준으로 평가되어야 하며, 단순히 시각적 매력만으로는 충분하지 않습니다.
핵심 요약
- 투명성은 제공되는 정보를 의미하고, 해석 가능성은 의미와 관련되며, 설명은 증거 또는 이유를 전달합니다.
- 전역 방법은 모델을 요약하고, 지역 방법은 하나의 예측이나 작은 영역을 다룹니다.
- 사후 설명은 유용할 수 있지만, 기본 모델에 대해 불안정하거나 충실하지 않을 수 있습니다.
- 설명이 공정성, 인과관계, 견고성 또는 정확성을 증명하는 것은 아닙니다.

유용한 설명을 위한 네 가지 원칙
NIST는 시스템이 설명을 제공하고, 이를 의도된 사용자에게 의미 있게 만들며, 시스템의 과정을 정확히 반영하고, 지식의 한계를 전달해야 한다고 제안합니다. 이러한 원칙은 설명의 존재와 그 품질을 구분합니다.
의미는 청중에 따라 달라집니다. 간결한 사유 코드는 지원자에게 도움이 될 수 있지만, 모델 개발자는 분포, 특성 행동 및 실패 클러스터가 필요합니다. 두 경우 모두 동일한 문서화된 시스템 및 의사결정 맥락과 연결되어야 합니다.
내재적 방법과 사후 방법
희소 선형 모델이나 제약이 있는 의사결정 트리는 그 유효 범위 내에서 직접 해석 가능합니다. 복잡한 모델은 대신 사후 특성 기여도, 지역 대리 모델, 예시, 중요도 맵 또는 반사실적 방법을 사용할 수 있습니다.
특성이 제대로 정의되지 않았거나 파이프라인이 숨겨진 경우, 내재적 단순성이 자동으로 충실성을 보장하지 않습니다. 사후 복잡성도 자동으로 오해를 일으키는 것은 아닙니다. 방법은 목표로 하는 질문에 대해 테스트되어야 합니다.
특성 기여도와 상관된 입력
기여도 방법은 명시적 가정 하에 출력의 일부를 입력 특성에 할당합니다. LIME은 예측 주변에 간단한 지역 대리 모델을 맞추고, SHAP 계열 방법은 가산적 기여도를 Shapley 값 개념과 연결합니다.
상관된 특성은 기여도를 공유하거나 교환할 수 있으며, 높은 기여도가 인과 효과를 의미하지는 않습니다. 특성을 단독으로 변경하면 불가능한 사람, 이미지 또는 거래가 생성될 수 있습니다. 설명은 기준선, 샘플링 및 의존성 가정을 명시해야 합니다.
반사실, 예시 및 전역 행동
반사실은 어떤 실현 가능한 변화가 결과를 바꿀 수 있는지를 묻습니다. 제약 조건은 필수적이며, 실행 가능한 설명은 변경할 수 없거나 불법, 비현실적인 변화를 권장해서는 안 됩니다. 예시 기반 방법은 원형이나 영향력 있는 학습 사례를 보여주지만, 개인 데이터를 노출할 위험이 있습니다.
전역 분석은 성능, 부분 종속성, 단조성, 상호작용 및 하위 그룹 행동을 검토합니다. 그래디언트 부스팅과 같은 앙상블의 경우, 요약을 지역 증거와 기대 제약에 대한 직접 테스트와 결합합니다.
설명과 시스템 검증
충실도, 작은 교란에 대한 안정성, 동등한 입력에 대한 일관성, 사용자 이해도 및 설명이 적절한 결정을 지원하는지를 테스트합니다. 적대적 테스트는 설득력 있는 설명이 잘못되거나 조작된 출력과 함께 제공될 수 있는지를 확인해야 합니다.
XAI는 보류된 품질, 보정, 공정성, 프라이버시, 보안, 모니터링 및 항소 메커니즘 등 더 넓은 평가의 일부입니다. 설명은 책임성을 지원할 수 있지만, 책임 있는 거버넌스를 대체할 수는 없습니다.
설명 대상 및 방법군
설명 가능한 AI는 질문과 청중으로 시작해야 합니다: 왜 특정 결정이 발생했는지, 모델이 일반적으로 어떻게 동작하는지, 어떤 증거가 영향을 미쳤는지, 결과를 바꾸려면 무엇이 필요한지, 혹은 정책이 준수됐는지 등. 지역 설명은 하나의 예측을 다루고, 전역 설명은 보다 넓은 행동을 요약합니다. 내재적으로 해석 가능한 모델은 계수, 규칙 또는 구조를 드러내며, 사후 방법은 복잡한 모델을 근사합니다. 모델 행동에 대한 설명이 자동으로 세계에 대한 인과 설명이나 결정이 공정하다는 정당성을 의미하지는 않습니다.
특성 기여도 방법에는 그래디언트, 통합 그래디언트, SHAP 스타일 값, 순열, 지역 대리 모델 등이 포함됩니다. 예시 기반 설명은 영향력 있거나 유사한 사례를 찾아내고, 반사실은 다른 출력과 연관된 변화를 제안하며, 개념 방법은 내부 표현을 인간 카테고리와 연결합니다. 각각은 기준선, 특성 독립성, 지역 선형성 또는 모델 접근성에 대한 가정을 갖습니다. 상관된 변수, 상호작용 및 전처리는 기여도를 불안정하거나 오해하게 만들 수 있습니다. 방법을 비교하고 입력을 교란하여 설명이 행동을 예측하는지 테스트하십시오.
평가 및 인간 요인
충실도—설명이 모델과 일치하는지—를 사람에게 설득력 있는지와 별도로 평가합니다. 디버깅이나 항소와 같은 정의된 작업에 대한 안정성, 민감도, 완전성, 희소성 및 유용성을 테스트합니다. 인간 연구는 대표적인 참여자를 필요로 하며, 결정 품질, 오류 탐지, 의존도 및 시간 등을 측정해야 하며, 차트가 보기 좋다는 의견만으로는 충분하지 않습니다. 설득력 있는 설명은 잘못된 모델에 대한 신뢰를 높일 수 있으므로 인터페이스는 불확실성, 대안 및 제한을 보여줘야 합니다.
반사실은 실현 가능하고 실행 가능해야 하며, 보호되거나 불변인 특성을 변경하도록 권장해서는 안 됩니다. 설명은 모델이나 개인 정보를 유출하여 공격자가 결정을 역공학할 수 있게 할 위험이 있습니다. 접근 제어와 출력 최소화를 적용하십시오. 규제되거나 고영향 사용의 경우, 데이터 출처, 모델 버전, 임계값 및 실제 의사결정 논리를 보관해야 하며, 일반적인 특성 중요도 그래프는 법적 의미가 있는 이유나 인간 검토를 대체할 수 없습니다.
설명을 책임감 있게 사용하기
성능과 운영 요구를 충족하는 가장 간단한 모델을 선택하되, 피상적인 해석 가능성을 위해 타당성을 희생하지 말아야 합니다. 설명을 하위 그룹 테스트, 견고성 검사, 관련된 경우 인과 분석 및 결과 모니터링과 결합하십시오. 의도된 청중과 부적절한 추론을 문서화합니다. 무해한 교란 후 설명이 변한다면 배포 전에 조사해야 합니다. 설명 가능성은 방법에 따른 시스템에 대한 증거이며, 디버깅, 감독 및 커뮤니케이션에 가치가 있지만, 진실, 공정성, 안전 또는 이해를 보증하지는 않습니다.
실제 예시: 신용 위험 모델 설명
대출 기관은 먼저 청중과 필요한 이유를 정의합니다. 지원자는 정확한 결정 요인과 수정 경로가 필요하고, 개발자는 진단 정보를 필요로 합니다. 보정된 해석 가능한 기준 모델을 부스팅 모델과 비교합니다. 지역 기여도, 반사실 및 전역 오류 분석을 충실도, 안정성, 상관 특성 행동 및 유용성을 기준으로 테스트합니다. 설명은 연령, 장애 또는 기타 불변 특성을 변경하도록 권장할 수 없으며, 인과 효과로 제시되지 않습니다.
생산 의사결정 기록은 원본 데이터, 특성 변환, 모델, 임계값, 정책 및 인간 행동을 보존합니다. 지원자는 잘못된 데이터를 이의 제기하고 의미 있는 검토를 받을 수 있습니다. 모니터링은 그룹 및 모델 업데이트 전반에 걸쳐 결과와 설명의 안정성을 확인합니다. 무해한 특성 교란으로 설득력 있는 설명이 변하거나 결정적인 정책 규칙이 누락될 경우 배포를 중단합니다. 설명 가능성은 검증 및 절차적 권리를 보완하지만, 부적절한 목표, 차별적 결과 또는 책임 있는 인간 권한의 부재를 정당화하지는 않습니다.
구현 증거 및 운영 준비성
생산 의사결정은 성공적인 시연보다 더 많은 것이 필요합니다. 의도된 사용자, 운영 환경, 입력, 출력, 의존성, 소유자 및 각 중요한 실패의 결과를 정의합니다. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 구축합니다. 일반적인 사례, 경계 조건, 형식이 잘못되었거나 누락된 입력, 분포 변화, 의존성 중단, 오용 및 소외될 가능성이 높은 그룹이나 환경을 테스트합니다. 작업 품질을 보정 또는 불확실성, 지연 시간, 처리량, 자원 비용, 접근성, 프라이버시 및 보안과 함께 측정합니다. 모든 변환 및 임계값을 기록하여 독립적인 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있게 합니다.
출시 전에 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 지정합니다. 단계적 롤아웃을 사용하고 안전한 백업을 유지하며, 의도적으로 주입된 실패를 통해 모니터링을 검증합니다. 운영 텔레메트리는 입력 품질, 출력 행동, 모델 또는 규칙 버전, 의존성 상태, 인간 오버라이드 및 확인된 결과를 불필요한 민감 데이터 수집 없이 보여줘야 합니다. 알림 임계값과 대응 담당자를 정의하고, 배포 후 실제 증거를 검토하며 오프라인 성능이 지속될 것이라고 가정하지 않습니다. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어 또는 목표가 변경될 때마다 재평가합니다. 유지되는 시스템은 문서화된 복구, 사고 학습, 삭제 및 보존 절차와 비활성화 또는 교체 시점을 명확히 해야 합니다.
자주 묻는 질문
주의 맵은 설명인가요?
주의 맵은 진단 신호가 될 수 있지만, 주의 가중치만으로는 모델 출력의 이유를 충실히 나타낸다고 보장할 수 없습니다.
설명 가능한 AI는 단순한 모델을 필요로 하나요?
항상 그런 것은 아닙니다. 복잡한 모델도 사후 방법으로 분석할 수 있지만, 이러한 설명은 독립적인 검증과 명확히 제시된 한계가 필요합니다.












