사상 리더

프롬프트 주입 공격: 막을 수 없는 위협인가?

mm
Unite.AI를 Google의 선호 소스에 추가
A digital 3D render of a dark server room with a computer monitor displaying a

이 글에서 나는 독자와 함께 생각 실험을 해보려고 한다. 나는 가까운 미래에 특정 유형의 프롬프트 주입 공격이 효과적으로 막을 수 없을 것이라는 주장을 할 것이다. 내 주장은 구체적인 증거보다 추측적일 것이므로, 나는 당신을 납득시키려고 하는 것이 아니다. 대신, 나는 이 생각을 탐구해 보기를 초대한다. 시작하기 전에, 매력적인 글을 쓰는 것처럼, 나는 체스와 체스 엔진에 대해 논의하고 싶다.

초인급 체스 엔진과 인간 경험에 대한 주장

체스에는 다른 분야에서 부족한 요소 중 하나가 있다. 즉, 플레이어의 품질이나 강도를 객관적으로 측정할 수 있는 능력이 있다. 이 목적으로 사용되는 ELO 등급 시스템에는 결점이 있지만, 시간이 지남에 따라 매우 좋은 대략적인 추정이 제공된다. 2700 이상의 등급은 일반적으로 세계 최정상급(세계에서 30위 내)으로 인식된다. 세계 최고의 플레이어는 2850 아래에 있다. 인간은 2900의 등급에 도달한 적이 없다.

1990년대 중반에, 우리는 세계 최정상급 수준에 도달한 첫 번째 AI 엔진(Deep Blue)을 보았다. 이 里程碑의 실제 의미는 모든 수준의 플레이어가 연습과 분석을 위해 엔진을 사용하는 것이었다. 실제로, 엔진 사용은 세계 최고의 플레이어에게 필수적이었다. 그러나 이러한 세계 최정상급 엔진의 여러 世代에서, 추천된 이동(즉, 출력)을 검토하는 것은 필수적이었다. 실제로, 인간과 엔진이 함께 경쟁하는 “고급 체스”라는 특별한 형식이 만들어졌으며, 인간 + 기계 조합은 기계만으로는 우수한 것으로 간주되었다.

약 20년이 지나고, 딥 러닝과 강화 학습의 일부关键적인 진보가 체스 엔진이 초인급 수준(약 3200 ELO)에 도달하도록 했다. 그러나 일단이 天空을 돌파한 후, 매우 놀라운 두 가지 일이 일어났다. 첫 번째는 완전히 예상된 것으로, 엔진이 99%의 모든 위치에서 “ground truth”의 facto 소스가 되었다. 실제로, 이는 우리가 엔진의 “blind trust” 시대에 들어간 것을 의미했다. 요즘, 인간이 엔진보다 훨씬 더 좋은 이동을 제안하는 것은 거의 불가능하다. “고급 체스”는 재미있었지만, 이제는 무의미한 연습이다. 인간은 게임에 거의 기여하지 않는다. 그러나 두 번째는 대부분의 체스 플레이어에게 충격적인 것이었다. 이러한 초인급 뉴럴(즉, 딥 뉴럴 네트워크) 엔진은 때때로 “로맨틱”이라고 опис할 수 있는 스타일로 이동했다. 즉, 이동의 가치는 매우 멀리, 인간이나 세계 최정상급 엔진이 계산할 수 있는 것보다 훨씬 더 멀리, 평가될 수 있었다. 이는 거의 엔진이 특정 위치에 대한 “감정” 또는 “직관”을 개발한 것처럼 느껴졌다. 그러나 이 직관은 인간이 이해하거나 모방할 수 있는 것이 아니다.

다르게 말하면, 초인급 뉴럴 엔진은 인간의 인지 수준을 넘어서는 이동을 할 수 있다. 여기서의 핵심은 설명 가능성의 문제가 아니다. 인간은 이동을 추천하는 엔진을 이해할 수 없기 때문에, 이동을 제안하는 엔진의 출력을 검토하는 것은 불가능하다. 결과적으로, 우리는 능력의 불가결한 간격을 가지고 있다. 엔진 출력을 검토하지 않고 수락하는 것이 객관적으로 최적이다. 나는 나의 주장을 다음과 같이 요약할 수 있다:

체스는 초인급 AI가 일부 도메인에서 자율적으로 작동할 수 있음을 증명한다. 이러한 시스템을 인간의 검토 없이 결정하게 하는 것이 최적의 배포 방법이다.

나의 주장이 너무나 명백하거나 평범한 것으로 들릴 수 있으므로, 나는 몇 가지 세부 사항을 강조하고 싶다. 우리는 복잡하고, 중요한, 구체적이고, 돌이킬 수 없는 결과를 가진 태스크에서 초인급 수준을 보여주는 AI 시스템을 상정해 보자. 내 주장에는 두 가지 의미가 있다:

  1. 시스템은 인간의 검토 없이 태스크에 대한 결정하게 배포될 것이다. 내재된 위험에도 불구하고
  2. 이러한 시스템을 모니터링하여 얻은 통찰력은 유해한 결정은 방지하지 못할 것이다. 이미 손상이 발생했을 것이다

시스템 출력 검토와 모니터링은 정확히 프롬프트 주입 공격에 대한 마지막 두 가지 방어 수단이다. 따라서, 우리의 가상 프롬프트 주입 공격은 이러한 수단을 간단히 우회할 수 있다.

이 시나리오는 내 생각에 매우 현실적이다. 특정 도메인에서 초인급 AI 시스템은 AGI가 아니며, 대부분의 전문가들은 이러한 시스템이 곧 나타날 것이라고 믿는다. 우리는 결정이 시간에 민감하다는 것을 가정할 필요가 없으며, 태스크가 인간의 검토가 불가능할 정도로 복잡하다는 것만 가정하면 된다.

물론, 우리는 아직 두 가지 방어 수단만 우회했다.幸い하게도, 몇 가지 다른 방어 수단이 개발되었다. 나머지 방어 수단을 해결하기 위해, 프롬프트 주입 공격의 핵심 요소를 살펴보겠다.

프롬프트 주입이란 무엇인가?

프롬프트 주입은 대규모 언어 모델(LLM)을 조작하여 공격자가 의도하는 출력을 생성하는 것이다. 이는 AI에 대한 사회 공학이라고 할 수 있다. 중요하게는, 이는 전통적인 소프트웨어 버그가 아니다. 프롬프트 주입 공격은 내재된 LLM 취약점을 악용한다. LLM은 시스템 및 사용자 프롬프트를 모두 텍스트 시퀀스로 처리하므로, 합법적인 지침과 유해한 지침을区別할 수 없다. 따라서, 취약점은 설계상으로 인한 것이 아니라, 우연히 발생한 것이다.

프롬프트 주입 기술

프롬프트 주입은 일반적으로 LLM 애플리케이션의 1위 위험으로 간주된다. 몇 가지 이유가 있지만, 가장 명백한 요인은 개발된 주입 기술의 다양성이다. 대략 네 가지 범주로 분류할 수 있다. 가장 잘 알려진 기술에는 다음이 포함된다:

  • 구문 기반: 특수 문자, 이모티콘 또는 대체 언어를 사용
  • 간접: 외부 소스(사이트에서 가져오기), 인코딩(베이스 64), 또는 다중 모달 참조(이미지에 텍스트)를 사용
  • “가상” 방식: 역할 놀이, 가상, 감정적 호소, 윤리적 프레임, 형식 전환 등
  • 직접: 모델 지침을 강제로 변경하거나 부정적인 프롬프트를 사용

다양성만으로도 애플리케이션 개발자에게 도전을 제공하지만, 이러한 공격은 또한 빠르게 진화하고 있다. 아래 다이어그램의 왼쪽은 2023년 초의 최신 기술을 설명하며, 오른쪽은 현재의 공격 특성을 반영한다.

공격 벡터의 진화

LLM 애플리케이션 개발자는 또한 표준 사용성 대 安全성 트레이드오프를 고려해야 한다. 개발자는 모든 적절한 방어 수단과 디자인 패턴을 도입할 수 있지만, 어떤 비용으로인가? 방어 수단은 상당한 지연을 추가하고, 잘못된 양성(FPs)을 생성하며, 사용자 경험에 부정적인 영향을 미친다. 결과적으로, 실제로는 일부妥協이 불가피하다. 그러나, 이 글에서 나는 이러한 끊임없는 고양이와 쥐 게임에 관심이 없다. 나는 공격이 원칙적으로 막을 수 없는지 살펴보고 싶다. 개발자/방어자의 관점에서, 핵심적인 통찰력은 하나뿐이다:

프롬프트에서 지침과 데이터를 분리하는 것이 프롬프트 주입 위험을 해결하는 데 기본적이다

우리는妥協이 문제가 되지 않는다고 가정할 수 있다. 또한, 모든 방어 수단과 기술을 사용할 수 있다. 이러한(강한) 가정 하에서, 프롬프트에서 지침-데이터 분리가 실제로 불가능한 시나리오를 구성할 수 있는가?

DNA 아날로지

이 문제를 지침-데이터 분리라는 관점에서 바라보자.

세포와 DNA(유전자라고도 함)의 일부를 생각해 보자. 유전자는 단백질을 구축하기 위한 지침을 제공하며, 전사와 번역을 통해 단백질의 구조와 기능에 영향을 미치는 정보를 포함한다. 따라서, 유전자는 동시에 무엇을 구축하고, 어떻게 구축할지를 결정한다. 그러나, 이는 단순히 잘못된 것이다. 유전자는 자신을 해석하는 방법을 결정하지 않는다. 유전자의 “지침-추종”은 세포 기계에 외부화된다.

따라서, 미래의 LLM 世代 – 또는 더 정확하게, 그들이 진화하는 시스템 – 이 생물학적 기계와 훨씬 더 많이 닮을 것이라는 느낌을 떨쳐버릴 수 없지만, 제안된 아날로지는 작동하지 않는다. 우리는 세포를 LLM으로, 유전자를 프롬프트로 대체하여, 유전자에 주입 공격을 수행하여 “손상된” 단백질을 구축할 수 없다. 자연어와 의미적 해석을 필요로 하는 태스크에 집중하는 것이 더 생산적이다.

방어의 계층을 벗기다

프롬프트 주입 공격을 막는 다중 계층 방어 전략이 더 효과적이라고 생각하는 것은 놀라운 일이 아니다. 아래 이미지는 가장 일반적인 방어 계층과 각 계층에서 사용되는 기술을 보여준다.

프롬프트 주입 방어 계층

우리는 이미 마지막 두 계층(출력, 모니터링)에 대해 논의했으므로, 첫 네 계층에 집중해 보자.

입력 계층을 고려하면, 간접적인 공격을 탐지하는 데 프롬프트의 정제 또는 검증이 상당히 성공적일 수 있다. 그러나, 주입이 직접적으로 제공되고, 의미적 해석에 의존하는 경우, 정제는 관련이 없을 수 있다(정제할 것이 없음). 또한, 계산을 완료하여 문제를 식별해야 하므로, 검증은 기본적으로 불가능하다.

검출 계층에는 거의 제한이 없다. 실제로, 전용 LLM을 주입 공격 탐지에 사용할 수 있다. 그러나, 한 번 더, 분류기 또는 이상 탐지기가 의미적으로 숨겨진 유독을 가진 프롬프트를 의심스럽다고 플래그할 수 있을 것이다.

모델 계층은 작업 범위가 좁고, 미세 조정이 가능할 때 효과적일 수 있다. 유사한 논리가 도구 사용이 예측 가능할 때 시스템 계층에 적용될 수 있다. 그러나, 직관적으로, 둘 다 해석기가 공격에 경고를 발할 수 없다.

하우스 오브 카드

이 글을 쓰기 시작했을 때, 나는 “막을 수 없는” 프롬프트 주입 공격을 큰 그림으로 설명하고 싶었다. 아마도, 나는 기존의 방어 계층에 구멍을 내는 “비구성적” 접근 방식을 따랐다. 방어 기술은 빠르게 진화하고 있으며, 공격 표면도 그렇다. 이 게임은 곧 끝날 것처럼 보이지 않는다. 그러나, 나는 우리가 더 이상 이 게임을 하는 것이 아니라고 믿는다. 나는 성공적인 프롬프트 주입 공격이 여전히 자연어로 이루어질 것이라고 추측한다. 그러나, 인간이 이해할 수 없는 언어일 것이다. 또한, 이는 특정 목적을 위해 구축된 시스템에 의해 자동으로 발견되거나, 관련된 태스크(예: 의미적 모호성을 검색)를 수행하는 과정에서 우연히 발견될 것이다.

제어를 잃고, 이것이 가장 합리적인 일이라고 생각하는 것이 불쾌한 점이 있다. 이것을 “직관적 증명”이라고 생각할 수 있다. 일부 공격은 막을 수 없다는 것을 의미한다. 그리고, 이것이 당신에게 불안감을 주면, GPT 5.2가 이 논증을 “논쟁의 여지도 없고 새로운 것도 아님”으로 판단하고, 내가 “주장을 과도하게 강조하지 말라”고 조언하며, 이 글을 40% 줄여야 한다고 주장했다는 것을 알면 기뻐할 것이다.

엘리 보브샤(Eli Vovsha)는 Fortra의 데이터 사이언스 매니저입니다. 데이터 사이언스 팀과 함께, 그는 CEP와 XDR 제품에서 사용되는 모든 기계 학습(ML) 모델의 개발과 유지 보수를 담당하며, 일반적인 ML 연구도 수행합니다. 그는 스티븐스 기술 연구소(Stevens Institute of Technology)에서 응용 수학 석사 학위를 취득한 후, 컬럼비아 대학교에서 컴퓨터 과학 박사 과정에 진학하며, 또한 강사로 활동했습니다. 이후 그는 에듀테크 스타트업을 공동 설립하여 AI 기반 학습 플랫폼을 구축하려 했으며, 이후 뉴욕시의 사립 고등학교에서 수학과 컴퓨터 과학을 가르쳤습니다. 대학원 과정에 진학하기 전에, 엘리는 체스에 많은 시간을 할애하여 국제 마스터(IM) 타이틀을 획득했습니다.