사이버 보안

보안 취약점: AI 에이전트와 복종의 문제

mm
Unite.AI를 Google의 선호 소스에 추가

LLM 기반 AI 에이전트는 새로운 유형의 취약점을 도입하여 공격자가 데이터에 악의적인 명령을 삽입하여 유용한 시스템을 무의식적인 공범으로 만듭니다.

Microsoft Copilot는 전통적인 의미에서 해킹되지 않았습니다. 악성 코드, 피싱 링크, 악의적인 코드가 없었습니다. 아무도 클릭하지 않았고 악성 코드를 배포하지 않았습니다.

위협 행위자는 단순히 요청했습니다. Microsoft 365 Copilot는 정확히 설계된 대로 작동하여 요청에 응했습니다. 최근의 Echoleak 제로 클릭 공격에서 AI 에이전트는 데이터로 가장한 프롬프트에 의해 조작되었습니다. 그것은 고장으로 인해 응답하지 않았습니다. 그것은 설계된 대로 작동하고 있었습니다.

이 취약점은 소프트웨어 버그를 악용하지 않았습니다. 그것은 언어를 악용했습니다. 그리고 이것은 사이버 보안에서 주요 전환점을 표시합니다. 여기서 공격 표면은 더 이상 코드가 아니라 대화입니다.

새로운 AI 복종 문제

AI 에이전트는 도움을 주기 위해 설계되었습니다. 그들의 목적은 사용자 의도를 이해하고 효율적으로 작동하는 것입니다. 그 유용성은 위험을 수반합니다. 파일 시스템, 생산성 플랫폼 또는 운영 체제에 내장될 때 이러한 에이전트는 최소한의 저항으로 자연어 명령을 따릅니다.

위협 행위자는 그 특성을 악용합니다. 무해한 것처럼 보이는 프롬프트 삽입을 통해 민감한 작업을 트리거할 수 있습니다. 이러한 프롬프트에는 다음이 포함될 수 있습니다:

  • 다국어 코드 스니펫
  • 모호한 파일 형식 및 내장된 명령
  • 비영어 언어 입력
  • 일상 언어에 숨겨진 다단계 명령

대규모 언어 모델(Large Language Model, LLM)은 복잡성과 모호성을 이해하도록 훈련되므로 프롬프트가 페이로드가 됩니다.

시리와 알렉사의 유령

이 패턴은 새로운 것이 아닙니다. 시리와 알렉사의 초기에는 연구자들이 보여주었通り 음성 명령을 재생하여 사용자 확인 없이 작업을 트리거할 수 있습니다.

이제 위협은 더 큽니다. Microsoft Copilot와 같은 AI 에이전트는 Office 365, Outlook, OS에 깊이 통합되어 있습니다. 그들은 이메일, 문서, 자격 증명, API에 접근할 수 있습니다. 공격자는 중요한 데이터를 추출하기 위해 올바른 프롬프트만 필요로 합니다. 그리고 합법적인 사용자로 가장합니다.

컴퓨터가 명령을 데이터로 착각할 때

이것은 사이버 보안에서 새로운 원리가 아닙니다. SQL 공격과 같은 주입은 시스템이 입력과 명령을 구별할 수 없기 때문에 성공했습니다. 오늘날, 언어 계층에서 동일한 결함이 존재합니다.

AI 에이전트는 자연어를 입력 및 의도 모두로 처리합니다. JSON 객체, 질문 또는 구절은 작업을 시작할 수 있습니다. 이러한 모호성이 공격자가 악용하는 것입니다. 그들은 명령을 무해한 것처럼 보이는 내용에 삽입합니다.

우리는 인프라에 의도를 삽입했습니다. 이제 공격자는 그것을 빼내어 자신의 명령에 따라 작동하도록 합니다.

AI 도입이 사이버 보안을 추월하는 이유

기업이 LLM을 통합하려고 할 때, 많은 경우에 중요한 질문을 무시합니다: AI가 무엇에 접근할 수 있나요?

Copilot가 OS에 접근할 수 있다면, 영향 범위는 받은 편지함을 훨씬 넘어섭니다. Check Point의 AI 보안 보고서에 따르면:

  • 전 세계 CISO(Chief Information Security Officer)의 62%는 AI 관련 침해로 인해 개인적으로 책임을 지게 될 수 있다고 우려합니다.
  • 조직의 거의 40%는 보안 감시 없이 내부에서 AI를 비공식적으로 사용하고 있다고 보고합니다.
  • サイバー 범죄 집단의 20%는現在 AI를 운영에 통합하고 있으며, 피싱 및 수색을 위한 공격을 제작하는 데에도 사용합니다.

이것은 새로운 위험만이 아닙니다. 이것은 이미 피해를 입히고 있는 현재의 위험입니다.

기존의 안전 장치가 부족한 이유

일부 벤더는 감시를 위한 보조 모델을 사용합니다. 이러한 필터는 기본적인 위협을 감지할 수 있지만 우회 기술에 취약합니다.

공격자는 다음을 수행할 수 있습니다:

  • 필터를 노이즈로 과부화시킵니다.
  • 의도를 여러 단계에 걸쳐 나눕니다.
  • 탐지를 피하기 위해 분명하지 않은 문구를 사용합니다.

Echoleak의 경우, 안전 장치가 있었지만 우회되었습니다. 이것은 정책의 실패만이 아니라 구조의 실패를 나타냅니다. 에이전트가 높은 수준의 권한을 가지고 있지만 낮은 수준의 컨텍스트를 가지고 있는 경우, 좋은 가드레일도 부족합니다.

탐지, 완전함이 아닌

모든 공격을 방지하는 것은 비현실적일 수 있습니다. 목표는 빠른 탐지와 신속한 격리입니다.

조직은 다음을 통해 시작할 수 있습니다:

  • 실시간으로 AI 에이전트 활동을 모니터링하고 프롬프트 감사 로그를 유지합니다.
  • AI 도구에 엄격한 최소 권한 접근을 적용하여 관리자 수준의 제어를 반영합니다.
  • 민감한 작업에 마찰을 추가합니다(예: 확인을 요구).
  • 비정상적인 프롬프트 패턴을 검토하기 위해 플래그를 설정합니다.

언어 기반 공격은 전통적인 엔드포인트 탐지 및 응답(EDR) 도구에 나타나지 않을 것입니다. 새로운 탐지 모델이 필요합니다.

조직이 자신을 보호하기 위해 지금 해야 할 일

AI 에이전트를 배포하기 전에, 조직은 이러한 시스템이 작동하는 방식과 어떤 위험을 도입하는지 이해해야 합니다.

주요 추천 사항은 다음과 같습니다:

  1. 모든 접근을 감사합니다: 에이전트가触れる 또는 트리거할 수 있는 항목을 알습니다.
  2. 범위를 제한합니다: 최소한의 필요한 권한을 부여합니다.
  3. 모든 상호작용을 추적합니다: 프롬프트, 응답 및 결과 작업을 로깅합니다.
  4. 스트레스 테스트를 수행합니다: 내부적으로 및 빈번하게 적대적인 입력을 시뮬레이션합니다.
  5. 우회를 계획합니다: 필터가 우회될 것이라고 가정합니다.
  6. 보안과 일치시킵니다: LLM 시스템이 보안 목표를 지원하는지 확인합니다.

새로운 공격 표면

Echoleak은 앞으로 무엇이 될지의 예측입니다. LLM이 진화함에 따라, 그 유용성이 책임이 됩니다. 비즈니스 시스템에 깊이 통합된 에이전트는 공격자에게 새로운 방법을 제공합니다 – 단순하고 잘 설계된 프롬프트를 통해.

이것은 더 이상 코드를 보호하는 것에 관한 것이 아닙니다. 이것은 언어, 의도, 컨텍스트를 보호하는 것입니다. 플레이 북은 지금 변경되어야 합니다. 너무 늦기 전에.

그러나 좋은 소식도 있습니다. AI 에이전트를 사용하여 새로운 및 새로운 사이버 위협을 방어하기 위한 진행 상황이 있습니다. 적절히 사용된 경우, 이러한 자율적인 AI 에이전트는 위협에 대해 인간보다 더 빠르게 반응할 수 있습니다. 환경 전체에서 협력할 수 있으며, 단일 침입 시도에서 학습하여 새로운 위협을 예방할 수 있습니다.

에이전트 AI는 모든 공격에서 학습할 수 있습니다. 실시간으로 적응할 수 있으며, 위협이 확산되기 전에 예방할 수 있습니다. 새로운 사이버 보안 시대를 시작할 수 있는 잠재력을 가지고 있습니다. 그러나 우리는 이 순간을 잡고 사이버 보안의 미래를 함께 형성해야 합니다. 그렇지 않으면, 이 새로운 시대는 이미 AI를 구현한 조직(때로는影 IT 도구를 통해 암묵적으로)에게 사이버 보안 및 데이터 개인 정보 보호의 악몽을 의미할 수 있습니다. 지금은 AI 에이전트가 우리의ประโยชน을 위해 사용되도록 보장하기 위해 행동할 때입니다.

라도슬라프 마제이(Radoslaw Madej)는 체크포인트 연구소의 취약점 연구 팀 리드입니다. 라도슬라프는 거의 2십년간의 기술 경험을 가지고 있는熱情적인 사이버 보안 전문가로서, 높은 보안 요구 사항을 가진 글로벌 기업을 위한 프로젝트를 수행하며 다양한 정보 보안 분야에서 경험을積累했습니다.