사상 리더

AI 능력이 보안 모델을 능가할 때

mm
Unite.AI를 Google의 선호 소스에 추가

AI 도구는 일반적으로 익숙한 피치를 가지고 있습니다. 그들은 워크플로우를 간소화하고 생산성을 높이고誰도 좋아하지 않는 작업을 수행하는 것을 약속합니다. 그리고 대부분의 경우, 그들은 정확히那样을 수행합니다. 그들은 로그인을 간소화하고 문서를 요약하고 워크플로우를 자동화하며 일상적인 활동을 거의 노력없이 느끼게 합니다.

하지만 모든 편리성 아래에는 다른 이야기가 있습니다. 이러한 도구는 더 이상 텍스트 상자에 국한되지 않습니다.它们는 운영 체제 자체에서 작동하기 시작했습니다. 그들은 파일을 탐색하고 이메일을 작성하고 응용 프로그램과 상호 작용하며 이전에 주의 깊은 인간이 결과를 이해해야 했던 작업을 수행할 수 있습니다. 이러한 전환은 AI를 기존 보안 가정으로 관리할 수 없는 위치에 둡니다.

AI가 시스템 액세스를 얻는 순간

AI 시스템이 실제 파일을 읽고 실제 명령을 실행할 수 있는 경우, 그것은 신뢰할 수 있는 컴퓨팅 베이스의 일부가 됩니다. 그것은 기존의 AI 안전성에 대한 기대가 깨지기 시작하는 순간입니다.

수년 동안 프롬프트 주입은 이상한 모델 동작으로 간주되었습니다. 그것은 챗봇이 잘못된 또는 부적절한 응답을 생성하게 했지만, 손상은 대화에서 끝났습니다. 이제 같은 결함이 호스트 수준의 동작을.trigger할 수 있습니다. PDF, 웹사이트 또는 이메일 내에 숨겨진 악의적인 명령은 더 이상 이상한 응답을 생성하지 않습니다. 그것은 기계에서 수행되는 동작을 생성합니다.

이것은 산업이 이론적으로 간주할 수 있는 것이 아닙니다. 카네기 멜런과 워싱턴 대학의 연구자들은 반복적으로 chứng명했듯이, 숨겨진 명령이 대규모 언어 모델을 의도하지 않은 동작으로 유도할 수 있습니다. 한편, 비전 모델을 연구하는 연구자들은 조작된 이미지가 모델의 인식에 영향을 미치는 방식으로 다운스트림 동작을 변경할 수 있음을 보여주었습니다.

이러한 실험은 이전에 연구소의 기이한 것으로 간주되었습니다. 그러나 AI가 운영 체제에 액세스할 수 있는 경우, 더 이상 학술적이지 않습니다.

에이전트 능력이 방어자 제어를 능가할 때

이러한 에이전트를 구축하는 회사조차도 이러한 도전의 심각성을 인정합니다. 그들은 프롬프트를 처리하기 위한 필터를 강화했지만, 그들은 공개적으로 실제 세계에서 AI 시스템의 동작을 제어하는 것이仍然적으로 업계 전반에 걸쳐 진행 중인 작업이라는 것을 인정합니다. 에이전트가 수행할 수 있는 것과 방어자가 제어할 수 있는 것 사이의 간격은 기존 보안 플레이북이 흡수할 수 없는 새로운 위험 범주를 도입합니다.

AI 에이전트는 산업이 완전히 준비하지 못한 경계를 넘었습니다. 이를 이해하는 방법은 프롬프트 주입이 어떻게 공격 체인과 교차하는지 살펴보는 것입니다.

프롬프트 주입이 공격 체인과 어떻게 교차하는지

공격자는 항상 예측 가능한 패턴을 따랐습니다. MITRE ATT&CK 프레임워크는 이러한 단계를 명확하게 설명합니다. 초기 액세스는 실행, 지속성, 발견, 수평 이동, 수집 및 유출을 따릅니다. 기술은 다를 수 있지만 구조는 안정적입니다.

변화하는 것은 전달 메커니즘입니다. 사용자가 악의적인 첨부 파일을 열거나 위험한 링크를 클릭하도록 설득하는 대신, 공격자는 에이전트가 읽을 수 있는 위치에 명령을 배치할 수 있습니다. 에이전트는 실행 환경이 됩니다. 그것은 설명된 대로 단계를 수행합니다. 모델은 명령이 유해한지 여부를 질문하지 않습니다. 그것은 판단이나 직관을 적용하지 않습니다. 그것은 단순히 행동합니다.

공격자가 에이전트의 추론을 影響할 수 있는 경우, 공격 체인은 빠르게 함께 모입니다. 조작된 파일은 실행을 트리거합니다. 후속 명령은 지속성을 생성하고 시스템 검색은 발견을 제공하며 파일 업로드는 수집 및 유출을 가능하게 합니다. 악성 코드는 필요하지 않습니다. 에이전트는 단순히 작성된 대로 단계를 수행합니다.

이것은 보안 팀이 적응하기 위해 어려움을 겪는 이야기의 일부입니다. 그들은 코드 기반의 실행을 중심으로 탐지 규칙, 제어 및 응답 프로세스를 구축하기 위해 수년을 보냈습니다. AI 에이전트는 다른 종류의 인터프리터를 도입합니다. 그들은 컴파일된 바이너리가 아닌 자연어로 실행됩니다. 기존 도구는 이러한 추론 프로세스를 추적하거나 분석하도록 설계되지 않았습니다.

보안 팀이 준비되지 않았고 깨닫지 못하는 경우

보안 프로그램은 여전히 사용자가 콘텐츠와 액션 사이에 존재한다고 가정합니다. 인간은 속아 넘어갈 수 있지만, 그들은 이상한 것을 느끼면 일시 정지합니다. 그들은 이상한 문구를注意하고 예상치 못한 동작을 질문하며 마지막 마일의 결정에 판단을 적용합니다.

AI 에이전트는 이러한 것을 수행하지 않습니다. 그것들은 일관적이고 문자 그대로이며 적보다 빠릅니다. 숨겨진 텍스트 한 줄은 에이전트가敏感한 파일을 읽거나 응용 프로그램을 통해 이동하거나 원격 서버에 연락하도록 지시하는 데 충분합니다. 이것은 방어자가 이전에 존재하지 않았던 위치에 둡니다.

보안 팀은 에이전트가 어떻게 결정에 도달하는지에 대한 가시성이 제한되어 있습니다. 또한 사용자 또는 AI에서 동작이 시작되었는지 쉽게 결정할 수 없습니다. 전통적인 악성 코드 탐지는 도움이 되지 않습니다. 일반적인 의미에서 악성 코드가 실행되지 않기 때문이며, 에이전트가 정상적인 콘텐츠 내에 숨겨진 유해한 명령을 질문하거나 거부할 것이라는 보장이 없습니다.

인간 행동을 위한 도구는 자연어로 시스템 동작을 구동하는 세계로 전환되지 않습니다.

보상 제어는 무엇입니까

모델 강화는 충분하지 않습니다. 에이전트를 둘러싼 제어가 필요합니다. AI가 그 추론이 影響받을 때 수행할 수 있는 동작을 제한합니다.

다음 전략은 약속을 보여주고 있습니다:

  • 최소 특권 액세스는 필수입니다. 에이전트는 작업에 필요한 파일과 동작에만 액세스할 수 있어야 합니다. 불필요한 권한을 줄이면 조작된 명령의 영향을 제한할 수 있습니다.
  • 인간 승인 단계는 유해한 동작이 발생하기 전에 이를 중지할 수 있습니다. 에이전트가敏感한 작업을 시도할 때, 사용자는 요청을 승인 또는 거부해야 합니다.
  • 콘텐츠 필터링은 에이전트와 신뢰할 수 없는 자료 사이에 버퍼를 생성합니다. 문서, URL 및 외부 텍스트를 검사하면 숨겨진 명령이 모델에 도달할 가능성이 줄어듭니다.
  • 포괄적인 로깅은 필수입니다. 에이전트가 시작한 모든 동작은 기록되고 검토되어야 합니다. 이러한 동작은 특권 사용자 활동과 동일하게 처리되어야 합니다.
  • 에이전트 동작을 ATT&CK 기술과 매핑하면 방어자가 에이전트가 유해한 동작으로 밀어붙일 수 있는 위치와 가드레일을 배치해야 하는 위치를 식별할 수 있습니다. 이것은 이미 방어 전략을 구조화하는 동일한 시스템을 사용합니다.

이러한 보상 제어는 위험을 제거하지는 않지만, 모델 수준의 방어가 할 수 없는 방식으로 위험을 포함합니다.

산업이 어디로 가는지

AI 에이전트는 컴퓨팅이 작동하는 방식에서 주요 전환을 나타냅니다. 그들은 놀라운 생산성을 제공하지만, 기존 보안 프레임워크 내에서 맞지 않는 운영 위험의 범주를 도입합니다. 영국 국립 사이버 보안 센터의 지침은 시작점이지만, 대부분의 조직은 아직 에이전트를 관리하기 위한 명확한 방법이 없습니다.

이 순간은 클라우드 채택의 초기와 비슷합니다. 기술은 제어보다 빠르게 이동했습니다. 조직이 빠르게 적응한 것은 기술의 전환을 인식하고 이를 따라가는 프로세스를 구축한 것입니다.

同じことが 여기에서도 적용됩니다. AI 에이전트는 단순한 도우미가 아닙니다. 그것들은 시스템 수준의 범위를 가진 연산자입니다. 그것들을 보안하는 것은 새로운 플레이북, 새로운 가드레일 및 새로운 노출 모델링 방식을 필요로 합니다.

산업은 이러한 도구를 두려워할 필요는 없습니다. 그러나 그것들을 이해해야 합니다. 그리고 빠르게 움직여야 합니다. 공격자는 이미 기회를 보이고 있습니다. 방어자가 여전히 시간이 있는 동안 적절한 보안을 구축할지 여부는 질문입니다.

Jon Baker, VP Threat-Informed Defense at AttackIQ, 20년 이상의 사이버 보안 분야에서 혁신을 주도하며 대규모 보안을 더 효율적이고 효과적으로 만드는 데 중점을 두고 있습니다. 그는 MITRE의 Center for Threat-Informed Defense (CTID)의 전 디렉터이자 공동 창립자로, 글로벌적으로 위협 정보 기반 방어의 상태와 관행을 발전시키기 위해 정교한 보안 팀을 단결시켰습니다. CTID를 시작하기 전에 Jon은 MITRE의 사이버 위협 인텔리전스 및 적대자 에뮬레이션 부서를 이끌었으며, MITRE 전반에서 중요한 기능을 발전시키고 CALDERA 및 MITRE ATT&CK® 팀을 관리했습니다. Jon은 STIX 및 TAXII를 포함한 오픈 표준을 개발하는 팀을 이끌었으며, MITRE의 보안 자동화 프로그램을 관리하는 동안 OVAL의 공동 창조자였습니다.