Anderson의 관점
설명 가능한 AI는 개인 정보를 더 쉽게 노출시킬 수 있다

싱가포르 국립 대학의 연구진은 설명 가능한 AI가 더 많이 개발될수록 기계 학습 시스템의 개인 정보 보호 기능을 우회하는 것이 더 쉬워질 수 있다고 결론지었다. 또한 모델이 설명 가능하지 않더라도 유사한 모델의 설명을 사용하여 비説明 가능한 모델의 민감한 데이터를 ‘디코딩’할 수 있다고发现했다.
연구진의 연구는 ‘모델 반전 공격을 위한 설명 활용’이라는 제목으로, 기계 학습 시스템의 ‘우연한’ 불투명성을 보안 기능으로 사용하는 위험성을 강조한다. 이는 유럽 연합의 인공 지능 규제 초안을 포함한 새로운 글로벌 이니셔티브가 설명 가능한 AI(XAI)를 사회에서 기계 학습의 정상화를 위한 전제 조건으로 간주하고 있기 때문이다.

연구에서 실제 身分을 성공적으로 재구성한 예. 설명 가능한 기계 학습 시스템의 출력을 사용하여 얼굴 표정 데이터에서 身分을 재구성했다. Source: https://arxiv.org/pdf/2108.10800.pdf
연구진은 다음과 같이 말한다:
‘설명 가능한 인공 지능(XAI)은 모델의 결정 과정을 이해하는 데 도움이 되는 정보를 제공하지만, 이러한 추가적인 지식은 개인 정보 공격에 대한 추가적인 위험을 노출시킨다. 따라서 설명을 제공하면 개인 정보를 해칠 수 있다.’
개인 데이터의 재식별
기계 학습 데이터셋의 참여자는 익명성에 대한 가정 하에 포함될 수 있다. 개인 식별 정보(PII)가 기계 학습 시스템에 포함되는 경우, 참여는 기술적으로 합법할 수 있지만 ‘동의’의 개념을 왜곡시킨다.
最近 몇 년 동안 개인 식별 정보를 기계 학습 데이터에서 익명화하는 여러 방법이 개발되었다. 모델 추출은 API 액세스를 사용하여 높은 규모의 MLaaS 제공업체에서 개인 식별 정보를 추출할 수 있다. Amazon Web Services 를 포함하여, 멤버십 추론 공격은 기밀 의료 정보를 얻을 수 있다. 또한 속성 추론 공격은 민감한 데이터를 회복할 수 있다.
얼굴의 노출
새로운 연구에서 연구진은 얼굴 감정 데이터의 하위 집합에서 身分을 얻는 모델 반전 공격에 중점을 두었다.
시스템의 목적은 인터넷에 게시된 이미지 또는 데이터 침해에서 이미지와 기계 학습 알고리즘의 데이터셋에서 이미지의 포함을 연관시키는 것이었다.
연구진은 원래 아키텍처에 대한 특별한 액세스 없이 익명화된 API 출력에서 기여 이미지의 재구성을 가능하게 하는 반전 공격 모델을 훈련시켰다. 이전 연구에서는 식별(보호 또는 노출)이 목표인 시스템과 공격 시스템 모두에서 시스템을 설계했다. 이 경우, 프레임워크는 한 도메인의 출력을 사용하여 다른 도메인에 적용하도록 설계되었다.
전치된 합성곱 신경망(CNN)을 사용하여 감정 인식 시스템의 목표 예측 벡터(살리언시 맵)에 기반하여 원래 소스 얼굴을 예측했다. U-Net 아키텍처를 사용하여 얼굴 재구성 성능을 향상시켰다.
테스트
시스템을 테스트하기 위해 연구진은 세 가지 데이터셋을 사용했다: iCV-MEFED 얼굴 감정; CelebA; 및 MNIST 손글씨 숫자. 각 데이터셋은 128×128, 265×256 및 32×32 픽셀로 크기가 조정되었다. 각 데이터셋의 50%는 훈련 데이터로 사용되었고, 나머지 50%는 공격 모델을 훈련시키기 위한 공격 데이터셋으로 사용되었다.
각 데이터셋에는 다른 목표 모델이 있었으며, 각 공격 네트워크는 설명의 제한에 따라 조정되었으며, 설명의 일반화를 초과하는 더 깊은 신경망의 복잡성은 사용되지 않았다.
XAI 설명 유형은 그래디언트 설명, 그래디언트 입력, Grad-CAM 및 계층별 관련성 전파(LRP)를 포함하여 여러 설명을 사용하여 공격을 시도했다.
테스트에 사용된 지표는 픽셀별 유사도(mean squared error, MSE); 이미지 유사도(image similarity, SSIM); 공격 정확도; 공격 임베딩 유사도 등이다.
재식별은 모든 데이터셋에서 달성되었으며, 작업과 데이터셋에 따라 다양한 수준으로 달성되었다. 또한 연구진은 대리 목표 모델을 생성하여 외부의 ‘닫힌’ 모델에서 데이터를 재식별할 수 있다는 것을 발견했다.
연구진은 활성화 기반(saliency map) 설명이 가장 정확한 결과를 제공했으며, 감도 기반(그래디언트) 접근법보다 더 많은 개인 식별 정보를 노출시켰다.
미래 연구에서 연구진은 새로운 공격에 대한 다양한 유형의 XAI 설명을 통합할 계획이다.














