Anderson의 관점

광학 적대적 공격은 도로 표지판의 의미를 변경할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

미국 연구진은 기계 학습 시스템이 올바르게 해석하는 능력에 대한 적대적 공격을 개발했으며, 이는 도로 표지판과 같은 임무에 중요한 항목을 포함하여 현실 세계의 객체에 패턴화된 빛을 비추는 방식으로 이루어집니다. 한 실험에서, 이 접근법은 ‘STOP’ 도로 표지판의 의미를 ’30mph’ 속도 제한 표지판으로 변환하는 데 성공했습니다.

객체에 제작된 빛을 비추어 기계 학습 시스템에서 해석이 왜곡되는 Perturbations. 출처: https://arxiv.org/pdf/2108.06247.pdf

객체에 제작된 빛을 비추어 기계 학습 시스템에서 해석이 왜곡되는 Perturbations. 출처: https://arxiv.org/pdf/2108.06247.pdf

연구Optical Adversarial Attack이라고 불리며, 인디애나 주 퍼듀 대학교에서 수행되었습니다.

OPtical ADversarial attack (OPAD)은 구조화된 조명을 사용하여 대상 객체의 외관을 변경하며, 이는 일반 프로젝터, 카메라 및 컴퓨터만으로 수행할 수 있습니다. 연구진은 이 기술을 사용하여 सफ적으로 백박스와 블랙박스 공격을 수행했습니다.

OPAD 설정 및 인간이 거의 인식하지 못하는 왜곡으로 인한 오분류.

OPAD 설정 및 인간이 거의 인식하지 못하는 왜곡으로 인한 오분류.

OPAD 설정은 ViewSonic 3600 Lumens SVGA 프로젝터, Canon T6i 카메라 및 랩톱 컴퓨터로 구성됩니다.

블랙 박스 및 타겟 공격

백박스 공격은 공격자가 직접 모델 학습 절차 또는 입력 데이터의 관리에 액세스할 수 있는 비현실적인 시나리오입니다. 블랙박스 공격은 일반적으로 기계 학습 모델의 구성 또는 동작을 추론하여 ‘그림자’ 모델을 만들고 원래 모델에서 작동하는 적대적 공격을 개발하는 방식으로 수행됩니다.

분류기를 속이는 데 필요한 시각적 왜곡의 양.

분류기를 속이는 데 필요한 시각적 왜곡의 양.

이 경우 특별한 액세스가 필요하지 않지만, 이러한 공격은 현재 학술 및 상업 연구에서 널리 사용되는 오픈 소스 컴퓨터 비전 라이브러리와 데이터베이스의 普遍성으로 크게 도움을 받습니다.

새로운 논문에 설명된 모든 OPAD 공격은 ‘타겟’ 공격으로, 특정 객체의 해석을 변경하려고 시도합니다. 시스템은 일반화된 공격을 수행할 수 있음을 입증했지만, 연구진은 실제 공격자는 더 구체적인 혼란의 목표를 가지고 있을 것이라고 주장합니다.

OPAD 공격은 컴퓨터 비전 시스템에서 사용되는 이미지에 노이즈를 주입하는 원리를 현실 세계에서 구현한 것입니다. 이 접근법의 가치는 왜곡을 대상 객체에 투영하여 오분류를 트리거할 수 있다는 것입니다. 그러나 ‘트로이 목마’ 이미지를 학습 과정에 포함시키는 것은 더 어렵습니다.

‘speed 30’ 이미지의 해시된 의미를 ‘STOP’ 표지판에 부과하는 경우, 기준 이미지는 140/255 강度로 객체를 균일하게照明하여 얻었습니다. 그런 다음 프로젝터 보정 조명을 적용하여 경사 하강 공격을 수행했습니다.

OPAD 오분류 공격의 예.

연구진은 프로젝터 메커니즘을 조정하고 설정하여 깨끗한 ‘속임수’를 달성하는 것이 프로젝트의 주요 도전 과제였으며, 각도, 광학 및 기타 여러 요인이 이 공격에 도전이 된다고 지적합니다.

또한, 이 접근법은 밤에만 작동할 가능성이 있습니다. 명백한 조명이 ‘해킹’을 드러내는지도 고려해야 합니다. 이미 조명된 객체의 경우 프로젝터는 그 조명을 보상해야 하며, 반사된 왜곡은 헤드라이트에 저항해야 합니다. 도시 환경에서 환경 조명이 더 안정적일 가능성이 있으므로 이 시스템이 가장 잘 작동할 것입니다.

이 연구는 2004년 Columbia University의 연구를 이어받아 객체의 외관을 변경하기 위해 다른 이미지를 투영하는 광학 실험을 수행했으며, 이는 OPAD의 악의적인 잠재력을 갖지 않습니다.

테스트에서 OPAD는 64번의 공격 중 31번에 성공하여 48%의 성공률을 보였습니다. 연구진은 성공률은 공격 대상이 되는 객체의 유형에 크게 따라 달라진다고 지적합니다. 무늬가 있는 또는 구형의 표면(예: 테디 베어 및 머그)은 직접 반사성을 제공할 수 없으므로 공격을 수행할 수 없습니다. 반면, 의도적으로 반사되는 평면 표면인 도로 표지판은 OPAD 왜곡에 이상적인 환경입니다.

오픈 소스 공격 표면

모든 공격은 특정 데이터셋에 대해 수행되었습니다. 독일 트래픽 사인 인식 데이터베이스(GTSRB, 새로운 논문에서는 GTSRB-CNN라고 함)는 2018년 유사한 공격 시나리오에 대한 모델을 학습하는 데 사용되었습니다. ImageNet의 VGG16 데이터셋과 ImageNet의 Resnet-50 세트도 사용되었습니다.

이러한 공격은 오픈 소스 데이터셋을 대상으로 하므로 ‘순전히 이론적’인 것일까요? 자율 주행 자동차의 독점적이고 폐쇄적인 시스템이 아닌 오픈 소스 데이터셋을 대상으로 하기 때문입니다. 주요 연구 기관이 오픈 소스 알고리즘과 데이터셋을 사용하지 않고 폐쇄적인 데이터셋과 불투명한 인식 알고리즘을 개발하는 것이 아니라면 그렇습니다.

그러나 일반적으로 그렇지 않습니다. 랜드마크 데이터셋은 모든 진행 상황과 명성의 기준이 되는 벤치마크가 됩니다. 오픈 소스 이미지 인식 시스템인 YOLO 시리즈는全球적인 협력을 통해 폐쇄적인 시스템보다 앞서갑니다.

FOSS 노출

컴퓨터 비전 프레임워크의 데이터가 완전히 폐쇄적인 데이터로 대체되더라도, 초기 개발 단계에서 빈 모델의 가중치는 종종 FOSS 데이터로 조정되며, 이는 결국 폐기되지 않습니다. 따라서 결과 시스템은 FOSS 방법에 의해 잠재적으로 대상이 될 수 있습니다.

또한, 이러한 유형의 CV 시스템에 대한 오픈 소스 접근 방식을 사용하면 사기업이 다른 글로벌 연구 프로젝트의 분기 혁신을 무료로 활용할 수 있으므로, 건축을 접근 가능하게 유지하기 위한 재정적 인센티브가 있습니다. 이후 상업화 단계에서만 시스템을 폐쇄하려고 시도할 수 있으며, 그 때까지 전체 배열의 추론 가능한 FOSS 메트릭이 깊이 내장됩니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai