Anderson의 관점
GAN 생성기 소스 데이터 재식별

프랑스의 새로운 연구에서 GAN으로 생성된 데이터의 원본 소스 데이터를 재식별하는 기술을 제안했습니다. 예를 들어, 이 사람不存在과 같은 얼굴 생성 프로젝트에서 생성된 “존재하지 않는 사람”의 얼굴과 같은 합성 데이터입니다.
연구에서 제시된 방법은 논문에서 설명되어 있으며, 이 사람 (아마도) 존재합니다. GAN 생성 얼굴에 대한 身分 회원 공격이라는 제목으로 되어 있습니다. 이 방법은 훈련 아키텍처나 모델 데이터에 대한 접근이 필요하지 않으며, GAN을 사용하여 개인 정보를 익명화하거나 소스 데이터를 보호하는 다양한 응용 분야에 적용할 수 있습니다.
연구자들은 身分 회원 공격이라는 방법을 개발했으며, 이는 단일 身分이 데이터셋에 빈번하게 나타날 가능성을 평가합니다. 이는 특정 身分의 특징을 찾는 대신, 원본 이미지의 픽셀 그룹과 같은 특징을 찾는 것입니다.
위의 이미지에서, 각 행은 StyleGAN으로 생성된 이미지로 시작합니다. 왼쪽 블록의 이미지들은 40,000개의 이미지 데이터베이스에서 생성되었으며, 중간 블록의 이미지들은 80,000개의 이미지 데이터베이스에서 생성되었으며, 오른쪽 블록의 이미지들은 46,000개의 이미지 데이터베이스에서 생성되었습니다. 모든 이미지들은 VGG2Face2 데이터셋에서 가져왔습니다.
가치 이상
이러한 종류의 재식별 접근법은 여러 연구 분야에 걸쳐서 다중한 의미를 가지고 있습니다. 연구자들은 그들의 기술이 얼굴 세트나 얼굴 생성 GAN 프레임워크에만 국한되지 않는다고 강조하며, 의료 이미지 데이터셋이나 생체 데이터와 같은 다른 공격 표면에서도 적용될 수 있다고 말합니다.
‘우리는 이러한 공격이 성공할 경우, GAN을 민감한 상황에서 안전하게 교환하는 데 심각한 장애물이 될 것이라고 믿습니다. 예를 들어, 그림이나 다른 예술 작품의 경우, 비공개 생성기를 배포하는 것은 명백한 저작권 문제로 인해 제외될 수 있습니다. 더 중요한 것은, 생체 회사 A가 소비자 身分을 노출하는 생성기를发布하는 경우, 다른 회사 B는 потен적으로 자신의 소비자가 회사 A의 클라이언트인지 감지할 수 있습니다. 이러한 상황은 의료 데이터의 경우에도 심각한 문제를 일으킬 수 있습니다. 여기서 GAN을 공개하는 것은 개인 정보를 침해할 수 있습니다.’
부정한 웹 스크래핑 또는 사적 데이터의 재식별
연구 논문은 이 주제에 대해 간략하게触れて 있지만, 추상화된 출력(예: GAN 생성 얼굴)에서 원본 소스 데이터를 식별하는 능력은 향후 5-10년 동안 저작권 보호 구현에重大한 의미를 가지고 있습니다.
현재 대부분의 국가에서는 기계 학습 경제의 발전 단계에서 뒤처지지 않기 위해 공개적으로 접근 가능한 웹 데이터를 스크래핑하는 것을 허용하는 자유방임주의 접근 방식을採用하고 있습니다. 그러나 이 기후가 상업화되고 통합됨에 따라, 데이터 트롤이 역사적으로 기계 학습 알고리즘의 개발에 기여한 이미지에 대한 저작권 주장을 제기할 가능성이 있습니다.
다양성 대 빈도도의 멕시코 스탠드오프를 악용
프랑스 연구자들이 사용한 주요 기술은 원본 데이터셋 이미지의 빈도를 재식별의 열쇠로 사용합니다. 특정 身分이 데이터셋에 빈번하게 나타날수록, 공개적으로 또는 사적으로 उपलब한 데이터셋과 공격 결과를 상관시켜 원본 身分을 식별할 가능성이 높아집니다.
연구자들은 이것을 데이터의 다양성을 증가시키고 과적합을 방지함으로써 완화할 수 있다고 말합니다. 그러나 모델이 좋은 추상화를 달성하기 위해서는 더 높은 차원 공간과 더 많은 데이터가 필요하며, 이는 비용이 많이 들고 시간이 많이 걸리는 작업입니다.
또한, 과적합된 생성 알고리즘은 출력 데이터가 완전히 추상화되지 않은 경우에도 매우 현실적인 합성 데이터를 달성할 수 있습니다. 현재의狂野 서부 기후에서, 더 적은 자원을 가진 작은 프로젝트가 FAANG의 리드를 도전하거나 인수에 관심을 끌기 위해 더 빠른 훈련 속도와 더 낮은 개발 비용을 목표로 합니다. 따라서 이러한 표준이 항상 높은 수준에 도달하는지는疑問입니다.
연구 논문은 또한 소스 데이터 포인트의 다양성만으로는 이러한 방법과 유사한 방법을 통해 재식별을 방지하기에 충분하지 않으며, 훈련의 초기 중지를 통해 원본 身分이 불충분하게 추상화될 수 있다고 관찰합니다.













