Anderson의 관점
기계 학습 모델을 API 출력을 통해窃取하는 것

캐나다의 새로운 연구는 공격자가 비용이 많이 드는 기계 학습 프레임워크의 결과를窃取할 수 있는 방법을 제공합니다. 이는 공격자가 사설 시스템에 접근할 수 있는 유일한 방법이 고도로 제한된 API를 통해 접근하는 경우에도 가능합니다.
연구 분야는 기계 학습을 서비스로 제공하는 MLaaS 구현을 통해 비용이 많이 드는 모델 훈련을 수익화하는 방향으로 이동하고 있습니다. 새로운 연구는 Self-Supervised Learning(SSL) 모델이 이러한 종류의 모델 추출에 더 취약하다고 제안합니다. 이는 SSL 모델이 사용자 레이블 없이 훈련되기 때문에 추출이 더 쉽고, 일반적으로 유용한 정보를 포함하는 결과를 제공하기 때문입니다.
연구자들은 ‘블랙 박스’ 테스트 시뮬레이션에서 모델을 복제할 수 있었습니다. 여기서 연구자들은 일반적인 최종 사용자와 마찬가지로 로컬 ‘피해자’ 모델에 접근할 수 있었습니다.
‘[우리의] 공격은 피해자 모델의 복사본을窃取할 수 있습니다. 이는 다운스트림 작업에서 상당한 성능을 발휘하는 모델입니다. 1.2M개의 ImageNet 레이블이 없는 샘플에서 훈련된 피해자 모델의 경우, 91.9%의 Fashion-MNIST 분류 작업 정확도를 달성했습니다. 우리의 직접 추출 공격은 InfoNCE 손실을 사용하여 200K개의 쿼리에서 90.5%의 정확도를 달성했습니다.
‘또한, 50K개의 CIFAR10 레이블이 없는 샘플에서 훈련된 피해자 모델의 경우, 79.0%의 CIFAR10 분류 작업 정확도를 달성했습니다. 우리의 직접 추출 공격은 SoftNN 손실을 사용하여 9,000개의 쿼리에서 76.9%의 정확도를 달성했습니다.’

연구자들은 세 가지 공격 방법을 사용하여 ‘직접 추출’이 가장 효과적인 방법임을 발견했습니다. 이러한 모델은 로컬로 재현된 CIFAR10 피해자 인코더에서 9,000개의 쿼리를 사용하여窃取되었습니다. Source: https://arxiv.org/pdf/2205.07890.pdf
연구자들은 또한 감독 학습 모델을 공격으로부터 보호하는 방법이 비감독 학습 모델에 잘 적용되지 않는다는 것을 발견했습니다.
새로운 논문은 Self-Supervised Learning을 모델 추출 공격으로부터 보호하는 어려움에 관한 연구라는 제목을 가지고 있으며, 토론토 대학교와 인공 지능 벡터 연구소에서 나왔습니다.
자기 인식
자기 학습 모델은 레이블이 없는 데이터로 훈련됩니다. 레이블이 없기 때문에, 자기 학습 모델은 데이터의 내재된 구조에서 연관성과 그룹을 학습해야 합니다.
자기 학습 접근 방식은 매우 생산적입니다. 이는 비용이 많이 드는 레이블링을 피할 수 있기 때문입니다.
새로운 논문의 저자들은 세 가지 자기 학습 접근 방식을 고려했습니다: SimCLR, Siamese Network, Barlow Twins.
모델 추출은 감독 학습 모델의 경우 상대적으로 잘 문서화된 연구 분야입니다. 그러나 공격자가 피해자 모델의 레이블을 얻어야 하므로 모델을 재현하는 것이 더 어렵습니다.

감독 학습 아키텍처에 대한 ‘nockoff classifier’ 공격 모델. Source: https://arxiv.org/pdf/1812.02766.pdf
연구자들은 직접 추출이 가장 효과적인 방법임을 발견했습니다.
아키텍처와 데이터
연구자들은 세 가지 자기 학습 모델 추출 방법을 테스트했습니다: 직접 추출, 프로젝션 헤드 재현, 프로젝션 헤드 액세스.
연구자들은 세 가지 이미지 데이터셋을 사용했습니다: CIFAR10, ImageNet, SVHN.
모델의 다운스트림 성능은 CIFAR100, STL10, SVHN, Fashion-MNIST와 비교하여 테스트되었습니다.
연구자들은 직접 추출이 가장 효과적인 방법임을 발견했습니다.
연구자들은 다음과 같이 말합니다:
‘직접 추출은 피해자 모델의 복사본을窃取할 수 있습니다. 이는 다운스트림 작업에서 상당한 성능을 발휘하는 모델입니다. 공격에는 피해자 모델을 훈련하는 데 필요한 쿼리의 일부만 필요합니다.’
‘인코더는 상당한 양의 정보를 누출합니다. 가장 유망한 방어는 반응형 방법입니다. 이러한 방법은 고용량 인코더에 특정 aumentations를 삽입할 수 있습니다.’
* 논문의 인라인 인용을 하이퍼링크로 변환했습니다.
2022년 5월 18일 처음 게시되었습니다.












