Anderson의 관점
MLaaS: Variational Autoencoders를 사용한 API-Driven 모델 도난 방지

Machine Learning As a Service(MLaas)는 비싼 연구와 모델 훈련의 결과를 API를 통해 고객에게 제공함으로써 상용화합니다. 시스템의 이유는 이러한 거래를 통해 어느 정도 공개되지만, 모델의 핵심 아키텍처, 모델의 유용성을 정의하는 가중치, 모델을 유용하게 만든 특정 훈련 데이터는 여러 가지 이유로 철저하게 보호됩니다.
첫째, 프레임워크는 아마도 무료 또는 오픈 소스(FOSS) 코드 저장소를 많이 사용했을 것이며, 잠재적인 라이벌은 같은 목적을 위해 쉽게 그렇게 할 수 있습니다. 둘째, 많은 경우 모델에서 사용되는 가중치는 모델이 훈련 데이터를 라이벌 모델보다 더 잘 해석하는 능力的 95% 이상을 나타내며, 아마도 비싼 투자의 핵심 가치, 즉 연구 시간과 산업급 GPU에서 수행되는 대규모 모델 훈련을 구성합니다.
또한 모델 훈련 데이터셋 뒤에 있는 사유 및 공개 데이터의 혼합은 잠재적으로 민감한 문제입니다. 데이터가 비싼 방법으로 얻은 ‘원본’ 작업인 경우, API 사용자가 API를 통해 허용되는 요청으로 데이터 구조 또는 내용을 추론할 수 있으며, 이는 본질적으로 작업의 가치를 재구성하는 것을 허용할 수 있습니다. 즉, 데이터의 스키마를 이해하여 실제 재현을 허용하거나 데이터의 특징을 조직하는 가중치를 재현하여 효과적인 아키텍처를 재구성할 수 있습니다.
데이터 세탁
또한 기계 학습 모델의 잠재 공간에서 데이터가 훈련 중에 추상화되는 방식은 본질적으로 데이터를 일반화된 함수로 ‘세탁’하여 저작권자들이 자신의 원본 작업이 허가 없이 모델에 통합되었는지 이해하기 어렵게 만듭니다.
현재 세계적으로 이 관행에 대한 자유 방임 기후는 향후 5-10년 동안 점점 더 엄격한 규제를 받을 가능성이 있습니다. EU의 인공 지능에 대한 초안 규정에는 데이터 출처에 대한 엄격한 규정과 투명성 프레임워크가 포함되어 있으며, 이는 데이터 수집 회사들이 연구 목적으로 웹 스크래핑에 대한 도메인 규정을 우회하는 것을 어렵게 만들 것입니다. 미국을 포함한 다른 정부들도 장기적으로 유사한 규제 프레임워크에 대한 약속을 하고 있습니다.
기계 학습 분야가 증명된 개념 문화에서 상업적으로 жиз력 있는 생태계로 발전함에 따라, 제한된 데이터를 위반한 것으로 밝혀진 ML 모델은 제품의 이전 버전에서도 법적 책임을 질 수 있습니다.
따라서 API 호출을 통해 데이터 소스를 추론하는 위험은 산업 스파이의 모델 반전과 같은 방법을 통해 발생하는 것뿐만 아니라, 기계 학습 연구의 ‘와일드 웨스트’ 시대가 끝나면 회사에 대한 IP 보호를 위한 새로운 法의학적 방법에 의해 발생할 수 있습니다.
API-Driven Exfiltration as a Means to Develop Adversarial Attack
일부 기계 학습 프레임워크는 역사적인 데이터의 큰 코퍼스에서 파생된 결정적인 장기 모델을 얻는 대신에 실시간 데이터에 대한 지속적인 업데이트를 수행합니다. 이러한 시스템에는 트래픽 정보와 같은 영역에서 실시간 데이터가 ML 기반 서비스의 지속적인 가치에 중요한 영역이 있습니다.
모델의 논리 또는 데이터 가중치를 API를 통해 체계적으로 폴링하여 매핑할 수 있다면, 이러한 요소는 시스템에 대한 적대적 공격의 형태로 사용될 수 있습니다. 여기서 악의적으로 제작된 데이터를 시스템이 이를 찾을 가능성이 있는 영역에 남겨둘 수 있습니다. 또는 데이터 수집 루틴을 다른 방법으로 침투시킬 수 있습니다.
따라서 API 중심 매핑에 대한 대책은 기계 학습 모델의 보안에도 영향을 미칩니다.
API-Driven Exfiltration 방지
최근 몇 년 동안 API 호출을 통해 모델 아키텍처와 특정 소스 데이터의 추론을 방지하기 위한 방법론을 제공하기 위한 연구가 나타났습니다. 가장 최근의 연구는 인도 과학 연구소의 방갈로르와 매사추세츠 주 케임브리지에 있는 Nference라는 AI 기반 소프트웨어 플랫폼의 연구자들 간의 공동 연구에서 제시되었습니다.
이 연구는 VarDetect라는 시스템을 제안하며, 이는 Stateful Detection of Model Extraction Attacks라는 제목의 프리프린트에서 설명되어 있습니다. 연구자들은 VarDetect의 예비 코드를 GitHub에서公開했습니다.
서버 측에서 실행되는 VarDetect는 API에 대한 사용자 쿼리를 지속적으로 모니터링하여 모델 추출 공격의 세 가지 구별되는 패턴을 찾습니다. 연구자들은 VarDetect가 이러한 공격의 모든 유형에 대해 처음으로 방어 메커니즘을 제공한다고 보고 있으며, 또한 공격자가 방어 메커니즘을 무력화하기 위해 공격 패턴을 숨기거나 쿼리량을 증가시키는 대책에도 대응할 수 있다고 합니다.
VarDetect는 들어오는 요청에 대한 평가 프로브를 생성하기 위해 Variational Autoencoders(VAE)를 사용합니다. 이전 방법과 달리, 이 시스템은 사유 데이터에 훈련되므로 공격자 데이터에 대한 접근이 필요하지 않습니다.

프로젝트를 위한 사용자 지정 모델은 스위스 연방 공과 대학과 코넬 테크에서 2016년에 개발된 작업, 핀란드에서 2017년에 발표된 PRADA 논문에서 처음 시연된 ‘문제 도메인’ 데이터에 노이즈를 추가하는 방법, 그리고 인도 과학 연구소에서 2020년에 발표된 ActiveThief 연구에서 영감을 받은 공공 이미지를 크롤링하는 방법을 결합하여 개발되었습니다.

VarDetect에서 사용된 5개의 데이터셋에 대한 양성 및 악성 샘플 비교.
온보드 데이터셋의 특성과 일치하는 빈도 분포는 추출 신호로 표시됩니다.
연구자들은 일반적인 요청 패턴을 보이는 양성 사용자로부터의 요청이 시스템에서 거짓 양성으로 트리거될 수 있으며, 이는 정상적인 사용을 방해할 수 있다고 인정합니다. 따라서 이러한 인식된 ‘안전한’ 신호는 이후 VarDetect 데이터셋에 추가되어 호스트 시스템의 선호도에 따라 알고리즘에 통합될 수 있습니다.













