사상 리더

AI 애플리케이션을 위한 가드레일 재고하기

mm
Unite.AI를 Google의 선호 소스에 추가

AI 애플리케이션이 단순한 채팅봇을 넘어 사용자의 대리인으로 행동할 수 있는 에이전트 시스템으로 발전함에 따라, 위험은 기하급수적으로 증가합니다. 에이전트 애플리케이션은 도구를 통해 행동을 취할 수 있으며, 이로 인해 공격자가 사용자 애플리케이션과 데이터의 상태를 변경할 수 있는 새로운 위협 벡터가 열립니다.

전통적인 가드레일과 보안 모델은 狭い, 잘 정의된 위협에 대해 설계되었지만, 현대적인 공격 기법의 다양성과 창의성에 대응하기에는 어려움이 있습니다. 이러한 새로운 현실은 패러다임의 전환을 요구합니다: AI를 사용하여 AI를 방어하는 것입니다. 즉, 적응性과 확장성이 있는 보안을 가능하게 하는 것입니다.

확장된 위험 이해

AI는 모든 소프트웨어 계층에 침투하고 있습니다. CRM, 달력, 이메일, 워크플로우, 브라우저 등에 지능을 집어넣고 있습니다. 대화형 어시스턴트에서 시작하여 독립적인 행동을 취할 수 있는 자율 에이전트로 발전하고 있습니다.

예를 들어, OpenAI의 새로운 “에이전트”는 인터넷을 검색하거나 온라인에서 작업을 실행할 수 있습니다. 이러한 기능은 엄청난 생산성을解放하지만,同時에 광범위한 未知의 공격 표면도 노출됩니다. 위험은 데이터 누출을 넘어 行動 조작, 모델 회피 및 프롬프트 주입 공격 등으로 확장되며, 이러한 위협은 동적으로 진화하고 모델의 논리보다는 인프라를 대상으로 합니다.

기업에서는 이로 인해 보안이 AI 자체와 같은 속도로 발전해야 합니다. 기술 및 보안 리더들의 도전은 혁신을 방해하지 않으면서도 이를 보호하는 방법을 찾는 것입니다.

전통적인 가드레일의 한계

대부분의 현재 AI 보안 도구는 아직 정적이고, 狭い 기계 학습 모델에 의존하여 특정 유형의 공격을 인식합니다. 각 새로운 회피 또는 프롬프트 주입 방법은 별도의 모델을 재학습하거나 재배포해야 합니다. 이러한 반응적인 접근법은 악의적인 행위자가 예측 가능한 방식으로 행동할 것이라고 가정합니다. 그러나 실제로는 공격자가 AI를 사용하여 적응性, 창의성, 속도가 빠른 위협을 생성하며, 전통적인 방어 수단은 이를 예측할 수 없습니다.

심지어 최신의 가드레일도 범위와 능력에서 제한적입니다. 이러한 구식 패러다임은 새로운 공격 기술마다 별도의 모델을 학습해야 하므로, 취약하고 지속 불가능한 접근법입니다. 또한, 보안과 AI 팀 사이에 문화적 단절이 존재합니다. AI 개발자들은 보안을 발전을 방해하는 요소로 보며, 보안 팀은 실패의 책임을 지게 됩니다. 이러한 협력을欠如한 상태로 많은 조직이 설계상 취약해졌습니다. 필요한 것은 AI 라이프사이클에 無摩擦으로 통합되는 방어 수단입니다.

AI를 사용하여 AI를 방어하기

이러한 도전에 대응하기 위해 새로운 보안 패러다임이 등장하고 있습니다: AI를 사용하여 악의적인 AI를 공격하고, 자신의 AI를 방어하는 것입니다. 정적인 규칙이나 수작업으로 만든 서명에 의존하지 않고, 대형 언어 모델(LLM)의 생성 및 분석 능력을 활용하여 AI 시스템을 프로브하고 보호합니다.

  • AI 기반 레드 팀 공격: LLM은 다양한 적대적인 행동을 시뮬레이션할 수 있습니다. 이러한 접근법은 공격을 예측하고, 취약성을 이해하는 데 도움이 됩니다.
  • 계속적, 적응적 방어: 동일한 AI 시스템은 각 공격에서 학습하여 자동으로 방어를 강화할 수 있습니다. 狭い 모델을 관리하는 대신, 다양한 위협을 인식하고 적응할 수 있는 단일의 확장 가능한 방어 계층을 배포할 수 있습니다.

이것은 수동적인, 특정 시점의 테스트에서 살아있는 가드레일로의 근본적인 전환을 의미합니다.

자율 방어 생태계 구축

AI를 사용하여 AI를 방어하는 것은 탐지만을 개선하는 것이 아닙니다. 전체 방어姿勢를 변환합니다. 적절하게 통합된 이러한 시스템은:

  • 다양한 공격 유형에 대해 보호를 확장할 수 있습니다.
  • 생산 환경에서 새로운 위협을遭遇함에 따라 지속적으로 개선할 수 있습니다.
  • AI와 보안 팀 사이의 간격을 메울 수 있습니다.
  • 디지털 환경에서 자율적으로 행동하는 AI 시스템의 복잡한 위험 표면에 대한 가시성을 제공할 수 있습니다.

목표는 공격자의 생각을 예측하고, 그들의 움직임을 예상하며, 그들과同じ 속도로 발전하는 보안 시스템을 구축하는 것입니다.

적응적 사고의 필요성

산업은 전환점에 있습니다. 2023-2024년의 초기 호재 이후, 많은 기업 AI 이니셔티브가 생산성에 부딪혔습니다. 이는 잠재력이 부족해서가 아니었지만, 인프라와 보안 패러다임이 따라가지 못했기 때문입니다. AI가 중요한 워크플로에 통합됨에 따라, 보안 설계의 취약성은 더 크게 나타날 것입니다.

조직은 적응적 보안 사고를 채택해야 합니다. 즉, AI 시스템이 다른 AI 시스템을 지속적으로 모니터링하고, 테스트하고, 강화하는 것입니다. 이는 처음부터 지능형 가드레일을 통합하는 것을 의미합니다. 소프트웨어가 본질적으로 AI 기반이고, AI가 본질적으로 안전하지 않다면, 이는 위험합니다.

살아있는 AI 가드레일

AI는 소프트웨어의 새로운 기초입니다. 그리고 모든 기초와 같이, 그 강도는 얼마나 잘 스트레스를 견딜 수 있는지에 달려 있습니다. 정적인 방어 수단은 이 순간을 충족할 수 없습니다. 다음 보안 시대는 스스로 학습하는 시스템(AI가 AI를 방어함)에 속할 것입니다. 즉, 위협의 속도, 창의성, 규모를 따라갈 수 있는 시스템입니다. AI가 자신을 보호할 수 있도록 가르침으로써, 우리는 함께 구축하고 있는 미래를 보안할 수 있습니다.

기리시 찬드라세카르(Girish Chandrasekar)는 스트라이커(Straiker)의 제품 책임자로서, 회사를 0에서 1로 성장시키는 것을 도와왔다. 그는 이전에 로버스트 인텔리전스(Robust Intelligence, 시스코가 인수함)의 제품 팀에서 근무하였으며, 그 이전에는 포스트메이트(Postmates)와 JP모간 자산 관리(JPMorgan Asset Management)의 머신 러닝 팀에서 기술 역할을 수행하였다.