Anderson의 관점
합성 데이터는 개인 정보를 신뢰할 수 있게 보호하지 않는다, 연구자들은 주장한다

프랑스와 영국의 새로운 연구 협력은 합성 데이터가 기계 학습 부문에서 개인 정보, 품질 및 가용성 문제(그 외의 문제)를 해결할 수 있다는 산업의 확신에 의문을 제기한다.
다양한 주요 사항 중에서, 저자들은 합성 데이터가 실제 데이터에서 모델링되며 실제 정보를 충분히 유지하여 추론 및 멤버십 공격으로부터 신뢰할 수 있는 보호를 제공하지 않는다고 주장한다. 이러한 공격은 데이터를匿名化하고 실제 사람과 다시 연결하려고 시도한다.
또한, 이러한 공격으로부터 가장 위험에 처한 개인, 즉 의료 기록 匿名化의 경우 높은 병원 비용이나 중대한 의료 조건을 가진 개인들은 그들의 상태의 ‘외부자’ 성质으로 인해 이러한 기술에 의해 다시 식별될 가능성이 가장 높다.
연구 논문은 다음과 같이 관찰한다:
‘합성 데이터 세트에 접근하면, 전략적 적은 원본 데이터에 대상 레코드가存在하는지에 대해 높은 확신으로 추론할 수 있다.’
연구 논문은 또한 차등 개인 정보 보호 합성 데이터, 즉 개별 레코드의 서명을 흐리며 개인의 개인 정보를 보호한다. 그러나 이러한 정보 검색 시스템의 유용성을 크게 손상시킨다.
연구자들은, 차등 개인 정보 보호 접근 방식 – 즉 ‘실제’ 정보를 합성 데이터를 통해 간접적으로 사용하는 방식 – 보안 시나리오를 더悪化시킨다고 관찰한다:
‘합성 데이터 세트는 이러한 트레이드오프에 대한 투명성을 제공하지 않는다. 어떤 데이터 특성이 보존되고 어떤 패턴이 억제될지 예측할 수 없다.’
새로운 연구 논문, 즉 합성 데이터 – 匿名化 그라운드호그 데이,는 파리의 École Polytechnique Fédérale de Lausanne (EPFL)와 런던의 University College London (UCL) 연구자들로부터 나왔다.
연구자들은 기존의 개인 정보 보호 생성 모델 훈련 알고리즘을 테스트했으며, 이러한 알고리즘의 구현 결정이 제공된 프레임워크에서 공식적인 개인 정보 보호 보장을 위반하여 다양한 레코드가 추론 공격에 노출되도록 했다.
연구자들은 이러한 노출을 완화할 수 있는 각 알고리즘의 수정된 버전을 제공하며,이를 오픈 소스 라이브러리로 제공한다. 그들은 이것이 연구자들이 합성 데이터의 개인 정보 보호 이점을 평가하고 유용한 匿名화 방법을 비교할 수 있도록 도와줄 것이라고 주장한다. 새로운 프레임워크는 생성 모델 훈련 알고리즘에 적용할 수 있는 두 가지 관련 개인 정보 공격 방법을 포함한다.
합성 데이터
합성 데이터는 기계 학습 모델을 훈련시키기 위해 다양한 시나리오에서 사용되며, 정보가 부족한 경우를 대체 데이터로 채울 수 있다. 예를 들어, CGI 생성 얼굴을 사용하여 이미지 합성 데이터 세트에서 ‘어려운’ 또는 드문 얼굴 사진을 제공할 수 있다.
다른 유형의 CGI 이미지도 최종적으로 비합성 데이터에서 실행될 데이터 세트를 채우기 위해 사용되었다. 예를 들어, 손과 가구가 있다.
개인 정보 보호 측면에서 합성 데이터는 실제 데이터에서 생성될 수 있으며, 생성적 적대적 네트워크(GAN) 시스템이 실제 데이터에서 특징을 추출하여 이후(실제) 데이터에 일반화할 수 있는 유사한 가상의 레코드를 생성한다. 그러나 실제 데이터의 세부 사항을 흐리기 위해 설계되었다.
방법론
새로운 연구를 위해, 저자들은 5개의 생성 모델 훈련 알고리즘에서 개인 정보 보호 이점을 평가했다. 세 가지 모델은 명시적인 개인 정보 보호를 제공하지 않으며, 다른 두 가지 모델은 차등 개인 정보 보호 보장을 제공한다. 이러한 테이블 모델은 다양한 아키텍처를 대표하기 위해 선택되었다.
공격된 모델은 BayNet, PrivBay(BayNet의 파생), CTGAN, PATEGAN 및 IndHist였다.
모델의 평가 프레임워크는 두 가지 핵심 클래스 – GenerativeModels 및 PrivacyAttacks -를 갖는 Python 라이브러리로 구현되었다. 후자는 멤버십 추론 적과 멤버십 추론 공격을 특징으로 한다. 이 프레임워크는 또한 ‘위조된'(즉, 匿名화된) 데이터 및 합성 데이터의 개인 정보 보호 이점을 평가할 수 있다.
테스트에 사용된 두 가지 데이터 세트는 Adult Data Set와 Hospital Discharge Data Public Use Data File였다. 텍사스 데이터 세트는 2013년 환자 기록에서 샘플링된 50,000개의 레코드를 포함한다.
공격 및 결과
연구의 일반적인 목표는 실제 데이터와 합성 데이터를 다시 연결하는 ‘연결 가능성’을 확립하는 것이다. 연구에서 사용된 공격 모델에는 로지스틱 회귀, 랜덤 포레스트 및 K-최근접 이웃 분류기가 포함된다.
저자들은 ‘소수자’ 인구 통계의 다섯 개의 임의로 선택된 레코드로 구성된 두 개의 대상 그룹을 선택했으며, 이러한 레코드는 연결 공격에 취약할 가능성이 가장 높다. 또한 저자들은 특성의 95% 분위수 외부에 있는 레코드를 선택했으며, 이러한 예로는 높은 사망률, 높은 총 병원 비용 및 질병 심각도와 관련된 레코드가 있다.
연구 논문은 이러한 측면에 대해 자세히 설명하지 않지만, 실제 공격자의 관점에서 볼 때, 이러한 레코드는 회원 추론 및 기타 유형의 데이터 유출 공격의 목표가 될 가능성이 가장 높은 레코드이다.
다중 공격 모델이 공공 참조 정보에 대해 훈련되어 10개의 대상에 대한 ‘쉐도우 모델’을 개발했다. 실험 결과(이전에 설명한대로), 연구자들이 공격한 여러 레코드가 연결 공격에 매우 취약하다는 것을 나타냈다. 결과는 또한 GAN 방법으로 생성된 합성 데이터에서 20%의 모든 대상이 개인 정보 보호 이점을 얻지 못했다.
연구자들은 결과가 합성 데이터를 생성하는 방법, 공격 벡터 및 대상 데이터 세트의 특징에 따라 달라진다고 지적한다. 보고서는 많은 경우에 효과적인 身分 억제를 통해 합성 데이터 접근법이 결과 시스템의 유용성을 낮춘다고 발견했다. 실제로, 이러한 시스템의 유용성과 정확도는 재식별 공격에 취약한 정도의 직접적인 지표가 될 수 있다.
연구자들은 다음과 같이 결론을 내린다:
‘합성 데이터 세트가 원본 데이터의 특성을 높은 정확도로 보존하며, 따라서 광고된 사용 사례에 대한 데이터 유용성을 유지한다면, 동시에 적에게 개인 정보를 추출할 수 있도록 한다.’
‘우리가 평가한 匿名화 메커니즘을 통해 개인 정보 보호를 얻는 높은 이익은 원본 데이터의 레코드 신호를 전달하지 않으며, 효과적으로 레코드를 억제하는 경우에만 달성될 수 있다.’












