AI 모델 및 플랫폼
TextFooler 알고리즘, NLP AI를 속여버리다
최근 몇 년 동안 자연어 처리 알고리즘과 시스템이 매우 발전했지만, 여전히 “적대적 예제”라는 종류의 취약점에 노출되어 있습니다. 적대적 예제는 의도적으로 설계된 문구로, NLP 시스템이 예상치 못한 방식으로 작동하도록 만들 수 있습니다. 이러한 예제를 사용하면 AI 프로그램을 의도치 않게 작동시킬 수 있으며, 따라서 AI 연구자들은 이러한 적대적 예제의 영향을 방지하기 위한 방법을 설계하려고 합니다.
최근에 홍콩 대학교와 싱가포르 과학기술연구소의 연구팀이 협력하여 적대적 예제의 위험성을 보여주는 알고리즘을 개발했습니다. 와이어드에 따르면, 이 알고리즘은 “TextFooler”라고 명명되었으며, 문장의 일부를 미묘하게 변경하여 NLP 분류기가 문장을 해석하는 방식을影响합니다. 예를 들어, 알고리즘은 한 문장을 다른 문장으로 변경하고, 이 문장을 긍정 또는 부정적인 리뷰를 판단하는 분류기에 입력했습니다. 원래 문장은 다음과 같았습니다.
“캐릭터들은, 불가능한 조작된 상황에 처해 있으며, 완전히 현실과 단절되어 있습니다.”
이 문장은 다음과 같이 변경되었습니다.
“캐릭터들은, 불가능한 설계된 상황에 처해 있으며, 완전히 현실과 단절되어 있습니다.”
이러한 미묘한 변경으로 인해 텍스트 분류기가 리뷰를 긍정적으로 분류하도록 만들었습니다. 연구팀은 이 접근법을 여러 데이터셋과 텍스트 분류 알고리즘에 적용하여, 알고리즘의 분류 정확도를 90%에서 10%로 낮추는 데 성공했습니다. 이는 사람們이 이러한 문장을 읽을 때 동일한 의미를 이해하는 반면, 알고리즘이 다르게 반응한다는 것을 보여줍니다.
이러한 결과는 NLP 알고리즘과 AI가 점점 더 많이 사용되고, 의료 청구나 법적 문서를 분석하는 중요한 작업에 사용되는 시대에 우려를 불러일으킵니다. 현재 사용되는 알고리즘에 대한 적대적 예제의 위험성은 아직 알려지지 않았으며, 연구팀은 이러한 위험성의 영향을 조사하기 위해 노력하고 있습니다. 최근 스탠퍼드 대학교의 Human-Centered AI 그룹이 발간한 보고서에 따르면, 적대적 예제는 AI 알고리즘을 속여서 세금 사기를 저지르도록 사용할 수 있습니다.
이 연구에는 몇 가지 제한이 있습니다. 예를 들어, UC 어바인의 컴퓨터 과학 조교수 Sameer Singh는 이 적대적 방법이 효과적이지만, AI의 구조에 대한 지식을 필요로 한다고 지적합니다. AI를 반복적으로 공격하여 효과적인 단어 집합을 찾을 수 있지만, 이러한 반복적인 공격은 보안 프로그램에 의해 обнаруж될 수 있습니다. Singh와 그의 동료들은 이 주제에 대한自己的 연구를 수행하여, 고급 시스템인 OpenAI 알고리즘이 특정 트리거 문구에 대한 반응으로 인해 인종차별적이고 유해한 텍스트를 생성할 수 있음을 발견했습니다.
적대적 예제는 시각적 데이터인 사진이나 비디오에도 문제가 될 수 있습니다. 한 유명한 예는 특정 디지털 변환을 고양이 이미지에 적용하여, 이미지 분류기가 이를 모니터 또는 데스크톱 PC로 해석하도록 만드는 것입니다. 다른 예는 UC 버클리의 Dawn Song 교수가 수행한 연구로, 적대적 예제를 사용하여 자율 주행 자동차의 컴퓨터 비전 시스템이 도로 표지를 인식하는 방식을 변경할 수 있음을 보여주었습니다.
홍콩-싱가포르 팀의 연구와 같은 연구는 AI 엔지니어가 AI 알고리즘의 취약점을 더 잘 이해하고, 이러한 취약점을 방지하기 위한 방법을 설계하는 데 도움이 될 수 있습니다. 예를 들어, 앙상블 분류기를 사용하여 적대적 예제가 컴퓨터 비전 시스템을 속여서 분류할 수 있는 가능성을 줄일 수 있습니다. 이 기술에서는 여러 분류기를 사용하고, 입력 이미지에 미묘한 변환을 적용하여, 대부분의 분류기가 이미지의 실제 내용을 식별할 수 있도록 합니다. 이렇게 하면 몇몇 분류기가 속여도, 대부분의 분류기는 속지 않으며, 이미지의 올바른 분류를 보장할 수 있습니다.












