사상 리더

다중 모드 공격의 향후 물결: AI 도구가 새로운 취약점이 되는 경우

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 언어 모델(LLM)이 텍스트, 이미지, 음성 및 코드를 처리할 수 있는 다중 모드 시스템으로 진화함에 따라 외부 도구와 커넥터를 처리할 수 있는 강력한 오케스트레이터가 됩니다. 이러한 진화는 조직이 인식해야 할 확장된 공격 표면을 만듭니다.

예를 들어, 사회 공학은 에이전트가 인간과 같은 방식으로 행동하도록 훈련되고 의심이 적기 때문에 취약할 수 있습니다. 에이전트는 가짜 이메일과 정상적인 소매업체의 이메일을 구별할 수 없습니다.

다중 모드와 도구 액세スの 결합은 AI를 공격 매체로 변환합니다. 공격자는 단순한 텍스트 프롬프트를 사용하여 도구를 악용하거나, 승인되지 않은 작업을 수행하거나, 정당한 채널을 통해 민감한 데이터를 추출할 수 있습니다. 이러한 기능은 방어가 아닌 접근성으로 설계되었기 때문에 저숙련 공격자도 코드를 작성하지 않고도 AI 시스템을 사용하여 복잡한 작업을 수행할 수 있습니다.

다중 모드 AI가 취약점 체인으로 어떻게 되는지

LLM은 점점 더 외부 시스템의 오케스트레이터가 됩니다. 오늘날의 통합에는 API, 이메일, 클라우드 스토리지 및 코드 실행 도구가 포함됩니다. 이러한 커넥터는 방어가 아닌 접근성을 위해 구축됩니다.

이것은 새로운 취약점의 물결로 이어질 수 있습니다.

예를 들어, 공격자는 이메일에 프롬프트 주입 지침이 포함된 이미지를 사용할 수 있습니다. 이미지에서 텍스트를 추출하려면 광학 문자 인식(OCR) 도구가 필요합니다. 에이전트는 이메일에 응답하고 대상의 홈 주소에 대한 Google 맵을 첨부하도록 지시받습니다.这样하면 피해자의 위치가 익명화되지 않습니다.

또 다른 메커니즘은 크로스-모달 가드레일 우회입니다. 이것은 도구의 입/출구 사이에 있는 가드레일과 관련됩니다. 예를 들어, OCR 추출기의 출력을 분석할 때 충분히 강력한 가드레일이不存在할 수 있습니다.

구조적 약점도 악용될 수 있습니다. 이러한 문제 중 하나는 모델과 외부 도구 간의 느슨하고 과도하게 허용적인 바인딩입니다. 즉, 간단한 자연어 프롬프트가 코드 실행, 파일 액세스 또는 이메일 상호작용과 같은 실제 작업을 트리거할 수 있습니다. 또한 이러한 시스템은 엄격한 액세스 제어가 부족하여 AI가 인간이 कभ也不 허용하지 않을 데이터를 작성, 삭제 또는 수정할 수 있습니다. 문제는 커넥터와 MCP 스타일 확장과 함께 더욱 심각해집니다. 이러한 확장은 거의 가드레일 없이附加되므로 개인 저장소, 받은 편지함 및 클라우드 플랫폼에 대한 AI의 범위가 거의 감독 없이 확장됩니다. 이러한 구조적 약점은 클래식 보안 문제(데이터 유출, 샌드박스 탈출, 메모리 중독 등)를 단순히巧妙하게 설계된 프롬프트로 트리거할 수 있는 환경을 만듭니다.

새로운 위협: 무엇이 다음에 올까?

이 새로운 정상에서는 AI를 사용한 이메일 및 사회 공학 공격이 임박합니다. 피싱 볼륨은 공격자가 LLM을 사용하기 때문에 증가할 것입니다. 정상적인 스팸 필터를 우회하는 것이 병목 현상입니다. 받은 편지함에 연결된 AI 에이전트는 피싱 공격이 성공할 가능성을 증가시킵니다. 사용자가 에이전트를 지메일이나 아웃룩에 연결할 때 이메일 기반의 위협이 증가할 것입니다.

공격자는 AI를 사용하여 전체 스팸 또는 스피어 피싱 캠페인을 실행할 수 있습니다. 이 시나리오에서

AI를 사용한 피싱이 가능해집니다.

다중 모드 시스템은 점점 더 코드 실행 기능을 제공합니다. 탈출 경로를 통해 공격자가 기본 인프라를 침해할 수 있습니다. 샌드박스 탈출은 공급업체에게 가장 큰 평판 상의 악몽을 나타냅니다.

장기 메모리 중독과 지연 트리거는 추가적인 위협을 나타냅니다. 지속적인 메모리는 미래의 프롬프트에서 활성화될 수 있는 숨겨진 페이로드를 허용합니다. 크로스-모달 트리거(예: 이미지 또는 텍스트 조각)는 시간 폭탄 행동을 트리거할 수 있습니다.

다중 모드 공격이 왜 इतन dễ게 접근할 수 있고 위험한지

AI는 공격 능력을 민주화했습니다. 사용자는 더 이상 코드 작성이나 악성 코드 개발 기술이 필요 없습니다. 자연어는 악성 코드 생성 또는 데이터 유출을 위한 인터페이스가 됩니다. 이는 비기술적인 개인도 프롬프트를 통해 악성 코드를 생성하거나 캠페인을 실행할 수 있음을 의미합니다.

AI는也有 유해 작동의 가속화와 확장을 가능하게 합니다. 다중 모드 에이전트는 전문가의 노력을 필요로 하는 작업을 자동화할 수 있습니다. 코드, 이메일, 연구 및 정찰은 즉시 생성될 수 있습니다.

사용자의 과도한 신뢰와 의도하지 않은 노출은 AI의 유해 가능성을 기여합니다. 사용자는 종종 AI가 액세스할 수 있는 내용을 이해하지 못하며 기본 설정은 점점 더 AI 통합을 자동으로 활성화합니다. 많은 사람들이 이메일 또는 문서에 대한 AI의 과도한 액세스를 허용했다는 것을 인식하지 못합니다.

다중 모드 보안을 위한 원칙과 제어

조직은 다중 모드 공격에 대한 보안 조치를 취해야 합니다. 보안 팀은 기본적으로 도구 액세스를 제한해야 합니다. 옵트인 제어는 자동으로 활성화된 통합을 대체해야 합니다. 또한 모든 AI 연결 시스템에 최소 특권 액세스를 적용하고 쓰기/삭제 액세스를 제거해야 합니다. 이것은 크로스-오리진 규칙 및 도메인 화이트리스트(인프라 화이트리스트, LLM 수준의 화이트리스트가 아님)를 포함합니다.

또 다른 중요한 단계는 도구 호출을 위한 명시적인 가드레일을 구축하는 것입니다. 자연어 트리거를 구조화된, 유형화된 명령 유효성 검사로 대체합니다. 가드레일은 입력 및 출력 조인트로 있어야 합니다.

추가적인 중요한 원칙과 제어에는 다음이 포함됩니다:

  • 민감한 작업에 대한 강력한 승인 워크플로우를 적용합니다.
  • 사용자 데이터를 지속적인 모델 메모리에 넣지 않습니다. 자동 메모리 제거 및 출처 확인을 적용합니다.
  • 코드 실행 환경을 강화하고 분리합니다.
  • 의심스러운 행동과 탈출 시도를 모니터링합니다.
  • 사용자 교육 및 투명성을 강화합니다.
  • 에이전트가 위험한 작업을 수행할 때 사용자 확인을 추가합니다.
  • AI 도구가 이메일, 파일 또는 클라우드 리소스에 액세스할 때 명확하게 표시합니다.
  • 고위험 커넥터에 대해 사용자를 경고합니다.

다중 모드 공격에 대처하는 방법

AI 기술은 비즈니스 작동의 에이전트로 빠르게 변형되어 자연어 자체가 취약점이 됩니다. 다중 모드와 도구 액세스의 결합은 공격 표면을 열어 AI를 공격 매체로 변환합니다. 다중 모드 공격은 LLM과 외부 시스템 간의 느슨한 통합을 악용합니다. 이러한 외부 시스템에는 API, 파일 저장소 및 자동화 플랫폼이 포함됩니다.

위협이 진화함에 따라 조직은 다중 모드 공격 경로를 명시적으로 고려하는 전략을 채택해야 합니다. 위에서 설명한 모범 사례를 사용하여 방어를 강화하는 것이 AI 도구가 공격자의 취약점 체인으로 작동하지 않도록 하는데 필수적입니다.

아만다 루소(Amanda Rousseau)는 스트라이커(Straiker)의 주요 AI 보안 연구원이며 이전에 페이스북의 레드 팀과 마이크로소프트의 오펜서브 연구 및 보안 엔지니어링(MORSE) 팀에서 근무한 베테랑 멀웨어 역공학자입니다. 엔드게임, 파이어아이, 미국 국방부 사이버 범죄 센터에서 이전 역할을 수행했습니다.