Anderson의 관점
컴퓨터 비전 데이터셋을 불법 사용으로부터 보호하는 방법

중국 연구진은 컴퓨터 비전 훈련에 사용되는 이미지 데이터셋을 저작권 보호하는 방법을 개발했습니다. 이는 데이터셋에 효과적으로 ‘워터마크’를 추가하고, 클라우드 기반 플랫폼을 통해 인증된 사용자만이 ‘클린’ 이미지를 복호화할 수 있도록 합니다.
시스템을 테스트한 결과, 워터마크가 추가된 이미지로 머신 러닝 모델을 훈련하면 모델의 정확도가 급격히 떨어지는 것으로 나타났습니다. 두 개의 인기 있는 오픈 소스 이미지 데이터셋을 사용하여 테스트한 결과, 원래 데이터셋의 정확도가 86.21%와 74.00%에서 워터마크가 추가된 데이터셋으로 훈련한 경우 38.23%와 16.20%로 떨어지는 것으로 나타났습니다.

원본 이미지, 보호된 이미지, 복구된 이미지의 예시. 출처: https://arxiv.org/pdf/2109.07921.pdf
이로 인해 고화질의 비싼 데이터셋을 대중적으로 배포할 수 있으며, 데이터셋의 기능을 약간 제한된 ‘데모’ 형태로 제공하여 기능을 약간 제한적으로 보여줄 수 있습니다.
클라우드 기반 데이터셋 인증
이 연구는 난징 항공우주 대학의 두 부서에서 진행되었으며, 데이터셋 관리 클라우드 플랫폼(DMCP)을 사용하여 원격 인증 프레임워크를 제공하는 것을 목표로 합니다. 이는 Adobe Creative Suite와 같은 부담적인 로컬 설치에서 일반적으로 사용되는 전자 인증과 같은 유형의 텔레메트리 기반 전자 인증을 제공합니다.
보호된 이미지는 2019년 노스 캐롤라이나 주립 대학에서 개발된 적대적 공격 방법인 피처 공간 변형을 통해 생성됩니다.

피처 공간 변형은 하나의 이미지의 피처를 다른 이미지의 피처 공간으로 이동시킵니다. 출처: https://openaccess.thecvf.com
다음으로, 원본 이미지는 블록 페어링과 블록 변환을 통해 왜곡된 이미지에 삽입됩니다. 이는 2016년 연구에서 제안된 방법입니다.
블록 페어링 정보를 포함하는 시퀀스는 임시 이미지에 AES 암호화를 사용하여 삽입됩니다. 키는 이후 인증 시 DMCP에서检索됩니다. 이 과정은 수정된 가역적 이미지 변환(mRIT)이라고 합니다.
mRIT 루틴은 복호화 시에 역으로 수행되어 ‘클린’ 이미지를 복원합니다.
테스트
연구진은 ResNet-18 아키텍처와 두 개의 데이터셋(CIFAR-10과 TinyImageNet)을 사용하여 시스템을 테스트했습니다.
ResNet 모델은 세 가지 구성(클린, 보호, 복호화된 데이터셋)에서 훈련되었습니다. 두 데이터셋 모두 Adam 옵티마이저와 초기 학습률 0.01, 배치 크기 128, 훈련 에포크 80을 사용했습니다.

암호화 시스템의 훈련 및 테스트 정확도 결과.
연구진은 복호화된 데이터셋에서 모델의 성능이 영향을 받지 않는다고 결론지었습니다. 그러나 결과는 원본 데이터와 복호화된 데이터 간에 약간의 정확도 손실을 보여주었습니다(86.21%에서 85.86%로, 74.00%에서 73.20%로).
모델 보호 풍경
이전 연구는 주로 실제 머신 러닝 모델을 지적 재산으로 보호하는 데 중점을 두었습니다. 2018년 일본의 연구에서는 깊은 신경망에 워터마크를 삽입하는 방법을 제안했습니다.
2018년 IBM의 연구에서는 신경망 모델에 대한 워터마크 삽입을 위한 깊은 조사를 수행했습니다. 이 접근법은 데이터에 비가역적 워터마크를 삽입하고 신경망 내의 필터를 사용하여 데이터의 변형을 할인하는 것을 목표로 합니다.

IBM의 신경망 워터마크 삽입 방식. 출처: https://gzs715.github.io/pubs/WATERMARK_ASIACCS18.pdf
해적행위 벡터
데이터셋 암호화 프레임워크를 개발하는 것은 기계 학습 문화의 맥락에서辺緣적인 경우로 보일 수 있습니다. 그러나 개인 정보 보호를 위한 알고리즘에 대한 지속적인 관심으로 인해 기업이 특정 데이터를 보호하기 위한 시스템을 개발할 가능성이 있습니다.
새로운 연구에서는 이미지 데이터에 임의의 변형을 추가하지 않고, 의도적으로 피처 공간을 변경합니다. 따라서 현재의 워터마크 제거 및 이미지 향상 컴퓨터 비전 프로젝트는 인간이 인식하는 이미지 품질을 향상시키지 않고도 피처 공간의 변형을 유발할 수 있습니다.
컴퓨터 비전의 많은 응용 분야에서, 특히 레이블링 및 엔티티 인식과 관련된 경우, 이러한 비법적으로 복원된 이미지는 여전히 오분류를 유발할 가능성이 있습니다. 그러나 이미지 변환을 주요 목적으로 하는 경우(예: 얼굴 생성 또는 딥페이크 애플리케이션), 알고리즘적으로 복원된 이미지는 여전히 기능적인 알고리즘 개발에 유용할 수 있습니다.













