사이버 보안
적대적 이미지 공격이 농담이 아님

이미지 인식 시스템을 조작된 적대적 이미지로 공격하는 것은 지난 5년 동안 재미있지만 사소한 증명으로 간주되어 왔습니다. 그러나 호주에서 새로 나온 연구에 따르면 상업용 AI 프로젝트에서 매우 인기 있는 이미지 데이터셋을 무심코 사용하면 지속적인 새로운 보안 문제가 발생할 수 있습니다.
이제 2년 동안 애들레이드 대학교의 한 nhóm 학자들은 AI 기반 이미지 인식 시스템의 미래에 대해 매우 중요한 것을 설명하려고 시도해 왔습니다.
현재(그리고 매우 비싼)로 수정하기 어려울 것이며 5-10년 후에 완전히 개발되고 산업화된 배포에서 이미지를 인식하는 연구의 현재 트렌드가 완전히 개발되면 비용이 엄청날 것입니다.
그 전에, 연구 팀이 게시한 6개의 비디오 중 하나에서 바락 오바마로 분류된 꽃을 보겠습니다: 프로젝트 페이지에:

소스: https://www.youtube.com/watch?v=Klepca1Ny3c
위 이미지에서 명확하게 바락 오바마를 인식할 수 있는 얼굴 인식 시스템은 80%의 확신으로 익명 男가 들고 있는 조작된, 인쇄된 적대적 이미지의 꽃도 바락 오바마라고 속습니다. 시스템은 ‘가짜 얼굴’이 어깨 대신 가슴에 있는지 신경 쓰지 않습니다.
그것은 연구자들이 일반적인 노이즈가 아닌 일관된 이미지를 생성하여 이러한 종류의 身分 캡처를 수행할 수 있다는 점에서 인상적입니다. 그러나 이러한 종류의 공격은 컴퓨터 비전 보안 연구에서 비교적 자주 발생하는 것 같습니다. 예를 들어, 2016년에 얼굴 인식 시스템을 속일 수 있는 이상한 패턴의 안경이나 도로 표지판의 의미를 변경하려고 하는 특별히 제작된 적대적 이미지와 같은 경우입니다.
관심이 있다면, 위 예에서 공격받는 Convolutional Neural Network(CNN) 모델은 VGGFace(VGG-16)로, Columbia University의 PubFig 데이터셋으로 학습되었습니다. 연구자들이 개발한 다른 공격 샘플은 다른 자원과 다른 조합을 사용했습니다.

WideResNet50 모델에서 키보드를 콘치로 재분류합니다. 연구자들은 모델이 콘치에 편향되지 않는다는 것을 확인했습니다. https://www.youtube.com/watch?v=dhTTjjrxIcU에서 확장된 및 추가적인 시연을 보실 수 있습니다.
이미지 인식의 새로운 공격 벡터
연구자들이 설명하고 시연하는 많은 공격은 특정 데이터셋이나 특정 기계 학습 아키텍처를 비판하는 것이 아닙니다. 또한 이러한 공격을 쉽게 방어할 수 있는 방법은 데이터셋이나 모델을 교체하거나 모델을 재학습하거나 다른 ‘간단한’ 해결책을 사용하는 것이 아닙니다.
애들레이드 팀의 공격은 현재 이미지 인식 AI 개발의 전체 아키텍처에 있는 중심적인 약점을 보여줍니다. 이 약점은 많은 미래의 이미지 인식 시스템을 공격자에 의해 쉽게 조작될 수 있게 할 수 있으며, 이후의 방어 조치를 뒤처지게 할 수 있습니다.
새로운 적대적 공격 이미지가(위의 꽃과 같은) 미래의 보안 시스템에 ‘제로데이 익스플로잇’으로 추가되는 것을 상상해 보십시오. 현재의 안티바이러스 및 안티맬웨어 프레임워크가 매일 바이러스 정의를 업데이트하는 것과 마찬가지로입니다.
새로운 적대적 이미지 공격의 가능성은 무한할 것입니다. 왜냐하면 시스템의 기초 아키텍처는 다운스트림 문제를 예상하지 않았기 때문입니다. 이것은 인터넷, 밀레니엄 버그, 피사의 사탑과 같은 경우와 마찬가지입니다.
이러한 상황을 어떻게 설정할 수 있을까요?
공격을 위한 데이터 수집
위의 ‘꽃’ 예와 같은 적대적 이미지는 컴퓨터 모델을 학습시킨 이미지 데이터셋에 접근하여 생성됩니다. 데이터셋이나 모델 아키텍처에 ‘특권’ 접근이 필요하지 않습니다. 가장 인기 있는 데이터셋과 많은 훈련된 모델은 광범위하게 사용 가능하며, 끊임없이 업데이트되는 토렌트 장면에서 사용할 수 있습니다.
예를 들어, 컴퓨터 비전 데이터셋의 거대한 고리인 ImageNet은 토렌트로 모든 버전이 사용할 수 있습니다. 이는 제한을 우회하여 중요한 보조 요소인 검증 세트를 사용할 수 있게 합니다.

소스: https://academictorrents.com
데이터셋이 있으면(애들레이드 연구자들이 관찰한 대로) 효과적으로 인기 있는 데이터셋을 ‘역공학’할 수 있습니다. 예를 들어, CityScapes 또는 CIFAR와 같은 경우입니다.
이전 예에서 사용된 PubFig 데이터셋의 경우, 컬럼비아 대학교는 이미지 데이터셋의 재배포를 둘러싼 저작권 문제에 대한 증가하는 추세를 해결하기 위해 연구자들에게 데이터셋을 직접 제공하는 대신 큐레이션된 링크를 통해 데이터셋을 재현하는 방법을 지시했습니다. 이는 ‘이것이 다른 대규모 웹 기반 데이터베이스가 진화하는 방식인 것 같습니다’라고 관찰했습니다.
대부분의 경우에는 그러한 조치가 필요하지 않습니다. Kaggle은 추정에 따르면 컴퓨터 비전에서 가장 인기 있는 10개의 이미지 데이터셋은 CIFAR-10 및 CIFAR-100(둘 다 직접 다운로드 가능), CALTECH-101 및 256(둘 다 사용 가능하며 현재 토렌트로도 사용 가능), MNIST(공식적으로 사용 가능이며 토렌트로도 사용 가능), ImageNet(위 참조), Pascal VOC(사용 가능이며 토렌트로도 사용 가능), MS COCO(사용 가능이며 토렌트로도 사용 가능), Sports-1M(사용 가능), YouTube-8M(사용 가능)입니다.
이러한 데이터셋의 사용 가능성은 더 넓은 범위의 컴퓨터 비전 이미지 데이터셋의 사용 가능성을 대표합니다. 왜냐하면 ‘공개 또는 폐기’ 개발 문화에서 비명은 죽음이기 때문입니다.
어떤 경우에든지, 새로운 데이터셋을 개발하는 비용이 높고, 기존 데이터셋을 사용하는 경향이 있기 때문에, 새로운 데이터셋의 부족은 문제를 더욱 심각하게 만들 것입니다.
적대적 이미지 공격 방법의 일반적인 비판
기계 학습 엔지니어들이 적대적 이미지 공격 기술의 효과에 대한 가장 빈번하고 지속적인 비판은 공격이 특정 데이터셋, 특정 모델 또는 둘 다에 특정적이라는 것입니다. 즉, 공격은 다른 시스템에 일반화되지 않으며, 따라서 사소한 위협만을 나타냅니다.
두 번째로 빈번한 비판은 공격이 ‘화이트 박스’라는 것입니다. 즉, 훈련 환경 또는 데이터에 직접 접근해야 합니다. 이것은 대부분의 경우에 실제로 일어날 가능성이 낮은 시나리오입니다. 예를 들어, 런던의 메트로폴리탄 경찰의 얼굴 인식 시스템을 악용하려면 NEC에 콘솔이나 도끼로 침입해야 합니다.
인기 있는 컴퓨터 비전 데이터셋의 장기적인 ‘DNA’
첫 번째 비판과 관련하여, 우리는 컴퓨터 비전 산업을 지배하는 데이터셋의 작은 집단이 매년 반복되는 것을 고려해야 합니다. 예를 들어, ImageNet은 여러 유형의 객체에 대해, CityScapes는 운전 장면에 대해, FFHQ는 얼굴 인식에 대해 사용됩니다. 또한 이러한 데이터셋은 단순한 주석이 달린 이미지 데이터이기 때문에 ‘플랫폼 독립적’이며 매우 전이 가능합니다.
의도하는 바에 따라, 컴퓨터 비전 훈련 아키텍처는 ImageNet 데이터셋의 객체와 클래스의 일부 특징을 찾을 것입니다. 일부 아키텍처는 다른 아키텍처보다 더 많은 특징을 찾거나 더 유용한 연결을 만들 수 있지만, 모든 아키텍처는 적어도 가장 높은 수준의 특징을 찾을 것입니다.
이러한 ‘고수준’ 특징이 데이터셋을 구분하고 ‘지문’하며, 장기적인 적대적 이미지 공격 방법론을 구축할 수 있는 신뢰할 수 있는 ‘후크’입니다. 이 방법론은 다른 시스템을 가로지르며, ‘오래된’ 데이터셋이 새로운 연구와 제품에서 지속되는 동안 함께 성장할 수 있습니다.
보다 복잡한 아키텍처는 더 정확하고 세부적인 식별, 특징 및 클래스를 생성할 것입니다.
그러나 적대적 공격 생성기가 이러한 ‘저수준’ 특징(예: ‘젊은 백인 남성’ 대신 ‘얼굴’)에 더 많이 의존할수록, 원래 데이터셋의 다른 버전을 사용하는 후속 아키텍처에서 효과가 줄어들 것입니다. 이러한 아키텍처에서는 원래 데이터셋의 많은 이미지가 존재하지 않습니다.
‘제로된’, 사전 훈련된 모델에 대한 적대적 공격
사전 훈련된 모델을 다운로드하여 완전히 새로운 데이터로 제공하는 경우는 어떨까요?
모델은 이미 ImageNet과 같은 데이터셋으로 훈련되었으며, 남은 것은 훈련에 몇 주 또는 몇 개월이 걸렸을 수 있는 가중치입니다. 이제는 비슷한 객체를 식별하는 데 도움이 될 것입니다.

원본 데이터가 훈련 아키텍처에서 제거되면 모델이 원래 학습한 방식으로 객체를 분류하도록 하는 ‘선입견’이 남습니다. 이는 원래 ‘서명’이 다시 형성되어 같은 오래된 적대적 이미지 공격 방법에 취약해지게 합니다.
그 가중치는 귀중합니다. 데이터 또는 가중치가 없으면, 빈 아키텍처만 남고, 원래 저자들이 했던 것과 마찬가지로 처음부터 훈련해야 합니다. 이는 많은 시간과 컴퓨팅 자원을 필요로 할 것입니다.
그 가중치는 이미 잘 형성되어 있고 강력합니다. 훈련 중에 약간 적응할 수 있지만, 새로운 데이터에서 원래 데이터에서와 마찬가지로 비슷하게 작동할 것입니다. 이는 적대적 공격 시스템이 다시 키를 맞출 수 있는 특징을 생성할 것입니다.
장기적으로, 이것은 12년 이상 된 컴퓨터 비전 데이터셋의 ‘DNA’를 보존합니다. 이러한 데이터셋은 오픈 소스 노력에서 상업적 배포로 진화했으며, 원래 훈련 데이터가 프로젝트 시작 시점에 완전히 제거된 경우에도 vậy입니다. 이러한 상업적 배포 중 일부는 아직 몇 년 후에 발생하지 않을 수 있습니다.
화이트 박스가 필요하지 않음
두 번째 일반적인 비판과 관련하여, 새로운 논문의 저자들은 조작된 꽃 이미지로 인식 시스템을 속일 수 있는 능력이 여러 아키텍처에 걸쳐 전이될 수 있음을 발견했습니다.
저자들은 자신의 ‘Universal NaTuralistic adversarial paTches'(TnT) 방법이 처음으로 인식 시스템을 속일 때 인식 가능한 이미지를 사용한다고 주장합니다(랜덤 노이즈가 아닌). 또한 저자들은 다음을 말합니다:
‘[TnTs]는 ImageNet 데이터셋의 Large-Scale Visual Recognition 태스크에서 널리 사용되는 WideResNet50부터 VGG-face 모델까지 PubFig 데이터셋의 얼굴 인식 태스크에서 대상 및 비대상 공격 모두에서 최신 분류기에 효과적입니다.
‘TnTs는 트로이 공격 방법에서 사용되는 트리거와 같은 자연스러움을 가질 수 있습니다. 그리고 적대적 예제의 일반화 및 다른 네트워크로의 전이 가능성을 가질 수 있습니다.
‘이것은 이미 배포된 DNN과 미래의 DNN 배포에서 공격자가 자연스럽게 보이는 물체 패치로 신경 네트워크 시스템을误導할 수 있으므로 안전성과 보안에 대한 우려를 높입니다. 모델을 조작하거나 발견의 위험 없이’
저자들은 전통적인 대책, 즉 네트워크의 Clean Acc.를 저하시키는 것이 이론적으로 방어를 제공할 수 있다고 제안합니다. 그러나 ‘TnTs는 여전히 대부분의 방어 시스템에서 0%의 강건성을 달성하면서 이러한 최신 방어 방법을 우회할 수 있습니다.’
가능한 다른 해결책에는 연합 학습이 포함되며, 여기서 기여하는 이미지의 출처가 보호됩니다. 또한 데이터를 훈련 시에 직접 ‘암호화’할 수 있는 새로운 접근 방식이 있습니다. 예를 들어, 난징 항공우주 대학교에서 최근 제안한 접근 방식과 같은 경우입니다.
이러한 경우에도真正로 새로운 이미지 데이터로 훈련하는 것이 중요합니다. 현재 가장 인기 있는 컴퓨터 비전 데이터셋의 이미지와 관련 주석은 전 세계 개발 주기에서 너무 깊이 자리 잡고 있기 때문에, 이미지를 더 이상 데이터라고 보지 않고 소프트웨어로 간주할 수 있습니다. 이 소프트웨어는 몇 년 동안 주목할 만큼 업데이트되지 않았을 수 있습니다.
결론
적대적 이미지 공격은 오픈 소스 기계 학습 관행뿐만 아니라, 이미 증명된 컴퓨터 비전 데이터셋을 재사용하는 것을 동기부여하는 기업 AI 개발 문화로 가능해집니다. 이러한 데이터셋은 이미 효과적임이 입증되었으며, 처음부터 시작하는 것보다 훨씬 저렴하며, 학계와 산업을 통해 유지되고 업데이트됩니다.
또한, 많은 경우에 데이터가 원본이 아닌 경우(예: CityScapes와 달리), 이미지는 최근의 개인 정보 및 데이터 수집 관행 논란 이전에 수집되었으므로, 이러한 오래된 데이터셋은 회사 관점에서 볼 때 ‘안전한 항구’로 보일 수 있는 반(半) 합법적 지위에 있을 수 있습니다.
TnT Attacks! Universal Naturalistic Adversarial Patches Against Deep Neural Network Systems는 애들레이드 대학교의 Bao Gia Doan, Minhui Xue, Ehsan Abbasnejad, Damith C. Ranasinghe와 함께 럿거스 대학교 컴퓨터 과학과의 Shiqing Ma가 공동으로 저술했습니다.
2021년 12월 1일 7:06 GMT+2 – 오타 수정.















