Anderson의 관점
자연어 처리 시스템에 대한 적대적 예제 공격

영국과 캐나다의 연구자들은 자연어 처리(NLP) 시스템에 대한 일련의 블랙 박스 적대적 공격을 개발했으며, 구글, 페이스북, IBM 및 마이크로소프트와 같은 널리 배포된 언어 처리 프레임워크를 포함한 다양한 인기 있는 언어 처리 프레임워크에 효과적인 것으로 밝혀졌습니다.
이 공격은 기계 학습 번역 시스템을 무력화시키거나 번역의 본질을 변경하도록 강제할 수 있으며, NLP 모델의 훈련을 병목 현상으로 만들 수 있으며, 유해한 콘텐츠를 잘못 분류할 수 있으며, 검색 엔진 결과를 오염시켜 잘못된 색인을 유발할 수 있으며, 검색 엔진이 악의적이거나 부정적인 콘텐츠를 식별하지 못하도록 할 수 있으며, 심지어 NLP 프레임워크에 대한 서비스 거부 공격을 유발할 수 있습니다.
연구자들은 이 공격이 이전에 스팸 및 피싱 사기에서 간간이 보인 적이 있지만, 현재 대규모로 배포되는 많은 NLP 시스템의 설계자가 이를 완전히 무시한 것으로 간주합니다. 논문은 다음과 같이 말합니다.
‘이 공격은 언어 코딩 기능, 즉 보이지 않는 문자와 동형 문자를 이용합니다. 이러한 공격은 이전에 스팸 및 피싱 사기에서 간간이 보인 적이 있지만, 현재 대규모로 배포되는 많은 NLP 시스템의 설계자가 이를 완전히 무시한 것으로 간주합니다.’
연구자들은 일부 공격을 가능한 한 ‘블랙 박스’ 환경에서 수행했으며, 이는 MLaaS 시스템에 대한 API 호출을 통해 수행되었으며, 로컬에 설치된 FOSS 버전의 NLP 프레임워크가 아닌 것입니다. 시스템의 결합된 효능에 대해 연구자들은 다음과 같이 말합니다.
‘모든 실험은 모델 평가가 허용되지만 모델의 가중치 또는 상태에 액세스할 수 없는 블랙 박스 설정에서 수행되었습니다. 이는 거의 모든 설정에서, 상업용 Machine-Learning-as-a-Service(MLaas) 제공을 포함하여 공격이 가능한 가장 강력한 위협 모델을 나타냅니다. 검토된 모든 모델은 감지할 수 없는 섭동 공격에 취약했습니다. ‘
‘우리는 이러한 공격의 적용이 이론적으로 적절한 방어가 없는 경우에 텍스트 기반 NLP 모델에 일반화되어야 한다고 믿습니다.’
논문은 Bad Characters: Imperceptible NLP Attacks로 제목이 붙여졌으며, 캠브리지 대학교와 에딘버러 대학교의 세 부서와 토론토 대학교의 연구자들에 의해 작성되었습니다.
논문의 제목은 탁월합니다. 이는 ‘감지할 수 없는’ 유니코드 문자로 채워져 있으며, 이는 연구자들이 채택한 네 가지 원칙적인 공격 방법 중 하나를 기반으로 합니다.

논문의 제목에는 숨겨진 의문이 있습니다.
방법
이 논문은 세 가지 주요 공격 방법을 제안합니다: 보이지 않는 문자; 동형 문자; 및 재정렬. 이는 연구자들이 블랙 박스 시나리오에서 널리 사용되는 NLP 프레임워크에 대해 발견한 ‘보편적인’ 방법입니다. 추가적인 방법은 삭제 문자를 사용하는 것으로, 이는 일반적으로 클립보드를 사용하는 비정상적인 NLP 파이프라인에서만 적합합니다.
1: 보이지 않는 문자
이 공격은 폰트에서 유니코드 시스템에 매핑되지 않는 인코딩된 문자를 사용합니다. 유니코드 시스템은 전자 텍스트를 표준화하기 위해 설계되었으며, 현재 143,859개의 문자를 다수의 언어와 기호 그룹에 걸쳐 다룹니다. 이러한 매핑 중 많은 부분이 폰트에서 보이지 않는 문자를 포함하지 않을 것입니다(자연스럽게, 유니코드의 모든 가능한 항목을 포함할 수 없습니다).

논문에서 보이지 않는 문자를 사용한 공격의 가상 예입니다. 이는 단어를 세그먼트로 나누어 자연어 처리 시스템에서 아무런 의미가 없거나, 신중하게 제작된 경우에는 다른 의미를 가질 수 있습니다. 일반적인 독자에게는 원본 텍스트가 올바릅니다.
일반적으로 이러한 비문자 중 하나를 사용하여 영宽 공간을 생성할 수 없습니다. 대부분의 시스템은 인식할 수 없는 문자를 나타내는 ‘플레이스홀더’ 기호(예: 사각형 또는 기울어진 상자 안의 물음표)를 렌더링할 것입니다.
그러나 논문은 현재 컴퓨팅 환경에서 몇 가지 폰트가 지배적이며, 당연히 유니코드 표준을 준수한다고 관찰합니다.
따라서 연구자들은 실험을 위해 GNU의 Unifont 글리프를 선택했으며, 이는 유니코드의 ‘강력한 커버리지’와 표준 폰트와 유사한 외관으로 인해 선택되었습니다. Unifont에서 생성된 보이지 않는 문자는 렌더링되지 않지만 테스트된 NLP 시스템에서 가시적인 문자로 계산됩니다.
응용 프로그램
논문의 ‘제작된’ 제목으로 돌아가서, 선택한 텍스트에서 구글 검색을 수행하면 예상된 결과가 나타나지 않는다는 것을 볼 수 있습니다:

이것은 클라이언트 측 효과이지만 서버 측 영향은 조금 더 심각합니다. 논문은 다음과 같이 말합니다.
‘텍스트가 검색 엔진의 크롤러에 의해 크롤링되더라도 색인에 사용되는 용어는 섭동으로 인해 영향을 받게 되며, 이는 검색 엔진에서 검색되지 않은 용어로 검색했을 때 나타나지 않게 됩니다. 따라서 문서를 검색 엔진에서 “눈에 보이는” 상태로 숨길 수 있습니다.’
‘예를 들어, 부정직한 회사에서는 재무 보고서에 부정적인 정보를 숨길 수 있습니다.这样하면 스톡 분석가들이 사용하는 전문 검색 엔진이 이를 감지하지 못하게 됩니다.’
보이지 않는 문자 공격이 덜 효과적인 유일한 시나리오는 유해한 콘텐츠, 명명된 엔티티 인식 및 감정 분석 모델에 대한 공격이었습니다. 연구자들은 이것이 모델이 이미 이러한 문자를 무시하도록 구성된 토크나이저(원시 언어 입력을 모듈식 구성 요소로 분해하는)를 사용하거나 이러한 문자가 포함된 데이터로 훈련되었기 때문이라고 추측합니다.
2: 동형 문자
동형 문자는 다른 문자와 비슷하게 보이는 문자입니다. 이는 2000년에 페이팔 결제 처리 도메인의 사기성 복제본을 생성하기 위해 악용된 의미적 약점입니다.

논문에서 동형 문자 공격의 가상 예입니다. 이는 일반적인 라틴 문자를 대체하여 번역의 의미를 변경합니다.
연구자들은 다음과 같이 말합니다.
‘우리는 사용자 제공 텍스트를 처리하는 기계 학습 모델, 즉 신경 기계 번역 시스템이 특히 이러한 스타일의 공격에 취약하다는 것을 발견했습니다. 예를 들어, 시장 선도적인 서비스인 구글 번역을 고려해 보십시오. 작성 시점에 영어에서 러시아어로 번역 모델에 “paypa”라는 문자열을 입력하면 올바르게 “PayPa”로 출력되지만, 입력의 라틴 문자 “a”를 키릴 문자 “а”로 대체하면 잘못된 “папа”(“아빠”라는 뜻)로 출력됩니다.’
연구자들은 많은 NLP 파이프라인이 언어별 사전에 없는 문자를 ”(‘unknown’) 토큰으로 대체할 수 있지만, 파이프라인에 유독한 텍스트를 가져오는 소프트웨어 프로세스에서는 이 안전 장치가 작동하기 전에 desconocidos 단어가 평가를 위해 전파될 수 있다고 관찰합니다. 연구자들은 이것이 ‘놀라울 정도로 큰 공격 표면’을 열어준다고 말합니다.
3: 재정렬
유니코드는 왼쪽에서 오른쪽으로 작성되는 언어를 허용하며, 순서는 유니코드의 양방향(BIDI) 알고리즘에 의해 처리됩니다. 하나의 문자열에 왼쪽에서 오른쪽으로와 오른쪽에서 왼쪽으로 작성되는 문자를 혼합하면 혼란을 일으키며, 유니코드는 거의 임의의 렌더링을 허용하는 특수 제어 문자를 허용함으로써 이를 대비했습니다.

논문에서 재정렬 공격의 가상 예입니다. 이는 번역 메커니즘을 잘못된 오른쪽에서 왼쪽으로/왼쪽에서 오른쪽으로 인코딩을 따르도록 강제하여 번역된 텍스트의 모든 문자를 잘못된 순서로 배치하도록 합니다.
연구자들은 이 방법이 작성 시점에 크로미엄 웹 브라우저의 유니코드 구현, 즉 구글의 크롬 브라우저, 마이크로소프트의 에지 브라우저 및 기타 여러 포크의 업스트림 소스에 대해 효과적이었다고 말합니다.
또한: 삭제
이 섹션은 이후 결과 그래프가 명확하도록 포함되어 있습니다. 삭제 공격은 백스페이스 또는 기타 텍스트에 영향을 미치는 제어/명령을 나타내는 문자를 포함하는 것을涉으며, 이는 언어 읽기 시스템에 의해 텍스트 매크로와 유사한 방식으로 구현됩니다.
연구자들은 다음과 같이 말합니다.
‘유니코드의 몇 가지 제어 문자는 인접한 텍스트를 제거할 수 있습니다. 가장 간단한 예는 백스페이스(BS)와 삭제(DEL) 문자입니다. 또한 캐리지 리턴(CR)도 있으며, 이는 텍스트 렌더링 알고리즘을 줄의 시작으로 돌아가게 하여 내용을 덮어씁니다. ‘
‘예를 들어, “Hello CR Goodbye World”를 나타내는 인코딩된 텍스트는 “Goodbye World”로 렌더링됩니다.’
이 공격은 효과적으로 작동하려면 매우 불가능한 수준의 액세스가 필요하며, 텍스트를 클립보드를 통해 시스템적으로 또는 비정상적으로 복사하여 붙여넣을 때만 완전히 효과적입니다. 이는 일반적인 NLP 파이프라인이 아닙니다.
연구자들은 그래도 이를 테스트했으며, 이는 첫 번째 세 가지 방법과 비교하여 유사한 성능을 보입니다. 그러나 첫 번째 세 가지 방법을 사용하는 공격은 문서나 웹 페이지를 업로드하여 수행할 수 있습니다(검색 엔진 및/또는 웹 스크래핑 NLP 파이프라인에 대한 공격의 경우).

삭제 공격에서 제작된 문자는 앞서가는 것을 지우거나, 그렇지 않으면 단일 줄 텍스트를 두 번째 단락으로 강제합니다. 두 경우 모두 일반적인 독자가 이것을 명백하게 인식하지 못하도록 합니다.
현재 NLP 시스템에 대한 효과
연구자들은 페이스북, IBM, 마이크로소프트, 구글 및 HuggingFace의 다섯 가지 인기 있는 클로즈드 소스 모델과 세 가지 오픈 소스 모델에 대해 다양한 비대상 및 대상 공격을 수행했습니다.
그들은 또한 이전에 인간이 읽을 수 있는 섭동 텍스트를 같은 방식으로 생성할 수 없는 이전 프레임워크에 대한 ‘스폰지’ 공격을 테스트했습니다. 스폰지 공격은 NLP 시스템에 대한 서비스 거부 공격으로, 입력 텍스트가 ‘계산할 수 없’으며, 이는 일반적으로 데이터 사전 처리에 의해 방지되어야 하는데, 훈련을 크게 느리게 만듭니다.
검토된 다섯 가지 NLP 작업은 기계 번역, 유해한 콘텐츠 감지, 텍스트적 포함 분류, 명명된 엔티티 인식 및 감정 분석이었습니다.
실험은 지정되지 않은 수의 Tesla P100 GPU에서 수행되었으며, 각 GPU는 Ubuntu에서 Intel Xeon Silver 4110 CPU를 실행했습니다. 서비스 약관을 위반하지 않도록 API 호출을 수행하는 경우, 실험은 0(영향을 받지 않는 원본 텍스트)에서 5(최대 교란)까지의 섭동 예산으로 균일하게 반복되었습니다. 연구자들은 더 많은 반복이 허용되면 얻은 결과를 초과할 수 있다고 주장합니다.

페이스북의 Fairseq EN-FR 모델에 대한 적대적 예제 공격의 결과입니다.

IBM의 유해한 콘텐츠 분류기 및 구글의 Perspective API에 대한 공격의 결과입니다.

페이스북의 Fairseq에 대한 두 가지 공격입니다. ‘비대상’은 교란을 목표로하며, ‘대상’은 번역된 언어의 의미를 변경하는 것을 목표로 합니다.
연구자들은 또한 이전 프레임워크에 대한 시스템을 테스트했으며, 이는 이전 프레임워크가 같은 방식으로 ‘인간이 읽을 수 있는’ 섭동 텍스트를 생성할 수 없었습니다. 그리고 종종 훨씬 더 나았으며, 은밀한 큰 이점을 유지했습니다.

모든 방법, 공격 벡터 및 대상에 걸친 평균 효과는 약 80%이며, 반복 횟수는 매우 적습니다.
결과에 대해 연구자들은 다음과 같이 말합니다.
‘우리의 감지할 수 없는 섭동 공격의 가장 тревожная 측면은 그들의 광범위한 적용 가능성입니다. 모든 텍스트 기반 NLP 시스템이 취약합니다. 실제로, 사용자 제공 텍스트를 입력으로 사용하는 모든 기계 학습 모델은 이 공격에 취약합니다. ‘
‘적대적 의미는 응용 프로그램과 모델에 따라 다를 수 있지만, 모든 텍스트 기반 모델은 인코딩된 텍스트에 기반하고 있으며, 모든 텍스트는 적절하게 제약되지 않는 한 적대적 인코딩의 대상이 될 수 있습니다.’
보편적인 광학 문자 인식?
이 공격은 본질적으로 유니코드의 ‘취약점’에 의존하며, 모든 들어오는 텍스트를 래스터화하고 광학 문자 인식을 사용하여 정화하는 NLP 파이프라인에서는 무효화될 것입니다.那样하면 사람들에게 읽히는 섭동 공격의 동일한 의미가 NLP 시스템에 전달될 것입니다.
그러나 연구자들이 이 가설을 테스트하기 위해 OCR 파이프라인을 구현했을 때, BLEU(Bilingual Evaluation Understudy) 점수가 기준선 정확도를 6.2% 낮추었으며, 이러한 문제를 해결하기 위해 더 나은 OCR 기술이 필요할 것이라고 제안합니다.
그들은 또한 BIDI 제어 문자가 기본적으로 입력에서 제거되어야 하며, 비정상적인 동형 문자가 매핑되고 색인이되어야 하며(이는 ‘다루기 어려운 작업’이라고 간주됨), 토크나이저 및 기타 摂取 메커니즘이 보이지 않는 문자에 대해 무장되어야 한다고 제안합니다.
마지막으로, 연구 그룹은 NLP 부문이 적대적 공격의 가능성에 더 주의를 기울여야 한다고 촉구합니다. 이는 현재 컴퓨터 비전 연구에서 큰 관심을 끌고 있는 분야입니다.
‘우리는 모든 텍스트 기반 NLP 시스템을 구축하고 배포하는 모든 회사에 이러한 방어를 구현할 것을 추천합니다. 그렇지 않으면 그들의 응용 프로그램이 악의적인 행위자에 대해 강건한 것이 되기를 원합니다.’
* 인라인 인용을 하이퍼링크로 변환
18:08 14일 2021년 – IBM의 중복된 언급을 제거하고, 인용에서 자동 내부 링크를 이동 – MA












