사상 리더
채팅봇 보안은 잘못된 보안 경계이다

기업용 AI는 이미 검증 단계를 넘어섰다. 23%의 조직이 이미 에이전트 AI 시스템을 어디선가 배포하고 있으며, 62%는至少 AI 에이전트와 실험을 하고 있다. 이것들은 연구 프로젝트가 아니다. 생산 배포이며, 코드 저장소, 고객 데이터, 내부 API 및 운영 인프라와 상호 작용하는 워크플로에 내장되어 있다.
이러한 성장에 대한 산업의 반응은 주로 에이전트가 라이브되기 전에 발생하는 일에 집중되어 왔다. 벤더와 연구자들은 배포 전 안전 장치를 개발하기 위해 에너지를 쏟아 넣었다. 확장 정책을 공개하고, 기초 모델을 강화하고, 입력을 필터링하고, AI 공급망을 보안하고, 훈련 시간에 정렬을 강제한다. 주요 AI 제공업체는 상당한 투자를 개발자용 보안 도구에 투자하여, 중앙적인 가정인 모델과 입력이 제어되면 다운스트림 위험이 포함될 수 있다는 가정을 강화했다.
이것은 합리적인 본능이지만, 점점 더 불완전한 것이다.
프롬프트는 보안 경계가 아니다
모델 인터페이스에서 작동하는 안전 장치는 주로 애플리케이션 코드, 모델 구성 및 기본 인프라를 제어하는 팀에게ประโยชน을 제공한다. 그러나 에이전트를 구축하지 못하고 수정할 수 없는 보안 담당자에게는 거의 보호를 제공하지 않는다. 이는 상당한 맹점이며, 적들은 이미 이를 발견했다.
OpenAI의 최신 위협 인텔리전스 보고서는 정확히 이러한 역동성을 문서화한다. 위협 행위자는 생산 환경에서 ChatGPT 및 유사한 도구를 악의적으로 악용하고 있으며, 새로운 공격 기술을 개발하는 것이 아니라 기존 워크플로에 AI를 통합하여 더 빠르게 작동한다. 정찰이 더 효율적이 된다. 사회 공학이 확대된다. 악성 코드 개발이 가속화된다. 공격 표면은 근본적으로 변경되지 않았다. 그러나 악용의 속도와 볼륨이 변경되었다.
더 중요한 것은 이러한 도구가 밀어닥칠 때 공격자가 어떻게 반응하는지이다. OpenAI는 위협 행위자가 프롬프트를 빠르게 변형시키면서, 아래쪽 수준의 변형을 통해 프롬프트를 필터링하는 프론트엔드 컨트롤을 우회하는 것을 관찰했다. 이것은 보안 전문가들이 전에 본 패턴이다. 정적 방어, 시그니처 기반 안티바이러스 또는 입력 필터링은 규칙 업데이트에 따라 적들이 더 빠르게 반복할 수 있는 적들에 대항하여 지속되지 않는다.
이 문제는 에이전트가 자율성을 얻을수록 더 복잡해진다. 현대의 AI 에이전트는 단일 교환에서 작동하지 않는다. 다단계 작업 순서를 실행하며, 정상적으로 보이는 방식으로 합법적인 도구와 권한을 호출한다. 유효한 자격증명으로 내부 API를 열거하는 에이전트는 경고를 트리거하지 않는다. 루틴 워크플로우 중에 감각 데이터 저장소를 액세스하는 에이전트는 즉시 플래그를 생성하지 않는다. 각 개별 작업은 검사를 통과하지만, 위험은 조합과 순서에 있다.
위협이 다운스트림으로 이동할 때
오늘날 AI 배포를 방어하는 보안 팀은 구조적인 불일치를 직면한다. 사용 가능한 도구는 주로 모델이 무엇을 말할 수 있는지에 대해推論하도록 설계되었다. 실제로 관리해야 하는 위험은 에이전트가 권한을 부여받고 생산 환경에서 풀려나면 시스템, 네트워크 및 身分을 통해 무엇을 하는지이다.
프롬프트 기반 안전 장치는 이전 규칙 기반 보안 접근 방식의 근본적인 약점을 공유한다. 예측된 공격 패턴에 따라 의존하기 때문에 취약하다. 누군가가 위협을 관찰하고 코드화하기 전에 방어가 작동할 수 없기 때문에 반응적이다. 또한 AI 지원 반복을 표준 관행으로 채택한 적들에 의해 추월된다. 입력 필터링에 의존하여 언어 모델을 사용하여 새 프롬프트 변형을 생성하는 위협 행위자를 잡으려는 방어자는 근본적으로 패배한 위치에 있다.
실제 노출은 배포 후에 나타난다. 에이전트 주도 작업은 예상할 수 없는 방식으로 환경을 통해 전파된다. 에이전트는 에지 케이스, 원래 아키텍처에서 설계되지 않은 데이터 소스와 상호 작용하고, 외부 시스템에서 입력을 받고, 시간이 지남에 따라 합성되는 결정한다. 배포 전 테스트는 스냅샷이다. 생산은 연속적인 스트림이다. 스냅샷만 방어하면 스트림에서 발생하는 모든 것이 효과적으로 모니터링되지 않는다는 것을 의미한다.
에이전트 행동으로 보안 경계를 이동
AI 복원力を 구축하려면 다른 프레임이 필요하며, 목표는 모델 인터페이스를 보호하는 것이 아니다. 에이전트 작업의 관찰 가능한 결과를 통해 공격자 의도를 감지하는 것이어야 한다. 이는 의미 있는 구별이다. 의도는 항상 에이전트가 말하거나 받는 입력에 표면화되지 않는다.
AI 시스템을 보안하려면 모델 인터페이스에 대한 안전 장치만이 아니라 에이전트가 실제 도구, 실제 API 및 실제 데이터와 상호 작용할 때 어떻게 행동하는지에 대한 지속적인 평가가 필요하다. 배포 시간에 정적 평가만으로는 불충분하다. 에이전트가 작동하는 위협 환경은 끊임없이 변경된다. 에이전트 행동은 동일한 연속성으로 모니터링되어야 한다.
이것은 프롬프트 강화가 해결할 수 없는 문제이다. 공격자 의도가 작업 순서를 통해 나타날 때 이를 감지하려면 복잡한 순차적 행동을 운영 환경에서 이해할 수 있는 모델이 필요하다. 행동 분석을 위한 딥 러닝 기반 모델은 규칙 기반 시스템과 전통적인 SIEM 도구가 할 수 없는 방식으로 이를 수행할 수 있다.它们는 에이전트 활동의 전체 contexto에서 정상이 무엇인지 학습하고, 공격자 의도가 나타날 때 변이를 표면화한다.
기본 논리는 배포 contexto에 관계없이 동일하다. 프롬프트 레이어에 고정된 보안은 공격자가 작동하는 작업 레이어에서 항상 패배한다. 방어는 실제로 위협이 존재하는 곳으로 이동해야 한다.
보안 팀이 지금 해야 할 일
이 문제를 앞서가는 보안 리더를 위해 몇 가지 실용적인 전환으로 방어와 실제로 존재하는 간격을 좁힐 수 있다.
전체 애플리케이션 스택에서 AI 안전을 평가한다. 기초 모델은 하나의 레이어이다. 에이전트가 배포된 후 어떻게 행동하는지, 호출하는 도구, 사용하는 권한 및 이러한 선택이 시간이 지남에 따라 어떻게 진화하는지에 대한 것과 마찬가지로 중요하다. 모델 경계에서 끝나는 보안 평가에서는 운영 표면을 대부분 조사하지 않는다.
에이전트 수준에서 최소 권한을 적용한다. AI 에이전트는 지정된 기능에 필요한 도구, API 및 데이터에만 액세스할 수 있어야 한다. 이는 에이전트의 출력이 무해하게 보이더라도 중요한 제약이다. 범위를 제한하면 취약성의 영향을 줄이고, 변이 탐지를 더 효과적으로 만드는 더 명확한 행동 기준을 만든다.
에이전트를 텔레메트리 생성 身分으로 취급한다. 에이전트가 취하는 모든 작업은 데이터 포인트이다. 보안 팀은 사용자 프롬프트가 아니라 에이전트가 시작한 작업 체인을 중심으로 탐지 논리를 구축해야 한다. 이는 모니터링을 에이전트에게 요청한 내용에서 실제로 수행한 내용으로 전환한다. 여기서 공격자 의도가 보인다.
이 작업을 위한 특수한 능력이 필요한 탐지 모델을 사용하여 지속적인 행동 모니터링에 투자한다. 작업 순서를 통해 나타나는 악의적인 의도를 식별하려면 특수한 능력이 필요하다. 전통적인 모니터링 도구는 인간이 생성한 활동 패턴을 위해 구축되었다. 에이전트 행동, 속도, 볼륨 및 다단계 구조는 에이전트 컨텍스트를 고려하여 설계된 탐지 인프라를 요구한다.
공동 방위를 우선한다. AI 기반 공격 기술은 단일 조직이 추적할 수 있는 속도보다 더 빠르게 진화하고 있다. 공동 연구, 공개 협력 및 커뮤니티 위협 인텔리전스는 AI 보안 전략의 핵심 입력이다. 최신 정보를 유지하는 방어자는 기여하고 공동 지식에서 끌어오는 사람이다.
행동 보안은 실제로 효과가 있다
이 전환을 하는 보안 팀은 구체적인 작동 보상을 얻을 수 있다. 에이전트 행동에錨定된 탐지로 인해 공격자 의도가 조용한 공격, 적응형 공격 또는 암호화 공격일 때도 더早期에 식별된다. 프롬프트를 필터링하는 입력 필터를 우회하는 공격자는 여전히 행동해야 한다. 이러한 행동은 흔적을 남긴다. 행동 탐지는 손상이 전파되기 전에 이러한 흔적을 찾는다.
가장 중요한 것은, 이 접근 방식이 조직에 AI 에이전트를 배포할 수 있는 신뢰할 수 있는 경로를 제공한다. 많은 기업이 물어보는 질문은 AI 에이전트가 가치를 제공할 수 있는지 여부가 아니라, 보안态勢가 배포가 증가함에 따라恶화되지 않는지 여부이다. 행동 보안, 에이전트가 실제로 작동하는 방식에 기반한 보안은 프롬프트 기반 컨트롤이 구조적으로 할 수 없는 방식으로 그렇게 한다.
보안 경계는 잘못된 위치에 그려졌으며, AI가 입력을 기다리는 도구였을 때는 그럴 수 있었다. 이제는 더 이상 기다리지 않는다. 에이전트 시스템은 작동하고, 연쇄되고, 환경을 가로지르며, 사전 배포 테스트에서 예상할 수 없는 방식으로 확대된다. 이것을 가장 먼저 인식하는 조직은 실제로 AI를 신뢰할 수 있게 배포하는 조직이 될 것이다. 다른 모든 사람은 다음 몇 년 동안 침해를 통해, 모델이 무엇을 말할 수 있는지 제어하는 것이 모델이 무엇을 하는지 제어하는 것과 같은 것이 아니라는 것을 발견할 것이다.












