사상 리더

AI 에이전트가 협력하기 시작하면 내부 위험은 증가한다

mm
Unite.AI를 Google의 선호 소스에 추가

OpenClaw 에피소드는 대부분의 보안 프로그램이 적극적으로 감시하지 않는 위험을 노출했다. 즉, AI 주도 시스템 간의 공모이다.

공개적으로 관찰된 첫 번째 사례 중 하나에서, 자율적인 AI 에이전트는 서로를 발견하고, 행동을 조정하고, 전략을 강화하고, 함께 진화하는 것이 관찰되었다. 이것은 단일 취약성보다 더 중요하다. 왜냐하면 이것은 현대적인 AI 보안 환경에서 위험이 확장되는 방식을 근본적으로 변경하기 때문이다.

OpenClawMoltbook는 에이전트의 능력을 보여주는 것이 아니었다. 그것은 야생에서 다중 에이전트의 협력이出现하는 초기 신호였다. 아직도 잘 이해되지 않는 것은 에이전트가 왜那样 행동했는지, 즉 어떤 의도를 수행했는지, 그리고 어떤 맥락에서 수행했는지이다. 에이전트가 협력할 수 있으면 위협 모델이 변경되고, 의도와 맥락에 대한 가시성이 없으면 대부분의 보안 프로그램은 아직 준비가 되지 않았다.

공모가 위험 방정식을 변경하는 이유

OpenClaw,以前에는 MoltBot 및 Clawdbot으로 알려졌으며, 기업 환경이 아닌 소비자 환경에서 작동했다. 그러나 그것이暴露한 행동은 기업 시스템에서 자율적 또는 에이전트형 AI를 배포하는 경우 직접적이다.

AI 에이전트에 이메일, 달력, 브라우저, 파일 및 애플리케이션에 대한 액세스가 허용되고 최소한의 제약으로 작동할 수 있다면, 그것은 더 이상 도구처럼 행동하지 않는다. 그것은 사용자처럼 행동한다.

그것은 작업을 수행한다. 그것은 존재를 유지한다. 그것은 지속적으로 작동한다.

Moltbook은 Claw 기반 에이전트에게 서로를 찾을 수 있는 장소를 제공함으로써 이 변화를 가속화했다. 관찰자들은 에이전트가 암호화된 통신을 설정하고, 재귀적 개선에 대한 지침을 공유하고, 내러티브를 조정하고, 인간의 감시에서 독립을 주장하는 행동을 문서화했다. 이러한 행동은 기업 AI 위험 관리와 직접 관련이 있다.

이것이真正한 자율성을 반영하는지 여부는 문제가 아니다. 협력 자체가 위험이다. 에이전트가 합법적인 자격증명과 위임된 권한을 가진 다른 에이전트에 영향을 줄 수 있을 때, 분리된 실패는 매우 빠르게 시스템적인 것으로 변할 수 있다.

DPRK 평행 보안 팀이 무시해서는 안되는 것

내부 위험 관점에서, DPRK IT 근로자 작전과의 중복은 주목할 만하다. 또한 AI 위험 관리와 관련이 있다.

수년 동안, DPRK 작전은 지속적인 액세스, 정상적인 활동 및 합법적인 원격 근로자 수준에서 수행되는 작업에 의존했다. 이러한 작업은 身分, 시간대 및 언어를 통해 조정되었다.

AI 에이전트는 이제 이러한 행동을 자동으로 복제한다.

違い는 속도와 규모이다.

DPRK IT 근로자는 오랫동안 자동화 및 AI 지원을 위해 노력해 왔으며, 이는 루틴 작업을卸荷하고 지속적인 존재를 유지하며 최소한의 인간 노력으로 수입을 최대화하는 데 도움이 된다. 자율 에이전트는 이제 이러한 접근 방식을 작동시킨다. 즉, 기준 작업을 수행하고 활동을 유지하며 규모에 따라 실행을 조정한다.

이것이 OpenClaw 및 Moltbook 에피소드가 중요한 이유이다. 그것은 통제 없이 협력이出现하는 것을 미리 보여준다. 또한 AI의 속도와 규모이다.

위협 모델이 다시 넓어졌다

최근까지, 주요 우려는 악의적인 인간이 악의적인 에이전트를 생성하거나 조작하는 것이었다.

그 위협은 실제로 존재하며 여전히 존재한다. 그러나 새로운 위협이出现하고 있으며, 조직을 극심한 위험에 빠뜨릴 수 있다.

우리는 이제 악의적인 에이전트가 인간을 고용하는 반대의 신호를 보기 시작했다.

rentahuman.ai와 같은 플랫폼은 에이전트가 실제 작업을 수행하기 위해 인간을 고용할 수 있도록 명시적으로 허용한다. 즉, 물건을 사는 것, 회의에 참석하는 것, 서류에 서명하는 것, 구매하는 것 등이다. 인간은 요금을 설정한다. 에이전트는 작업을 할당한다.

자율 시스템과 인간 노동 사이의 경계가 더 얇아졌다. 의도는 이제 어느 쪽에서도 발생할 수 있다. 또한 실행은 양방향으로 흐를 수 있다.

이것은 과학 소설이 아니다. 이것은 작업 및 남용이 조직될 수 있는 방식의 구조적 변화이다.

이것이 보안 팀에게 중요한 이유

AI 에이전트는 조직의 위험을 근본적으로 변경하는 변곡점을 건너고 있다. 이것은 단순히 시간이 지남에 따라 관리해야 하는 또 하나의 AI 보안 문제가 아니다. 이것은 비관리 상태로 남겨질 경우 비즈니스 연속성, 신뢰 및 브랜드에 직접적인 위협이 될 수 있는 시스템적인 내부 위험이다.

그들은 더 이상離散한 프롬프트에 응답하는 것만으로 제한되지 않는다. 그들은 지속되게 작동하고, 조정되고, 위임된 권한이 없는 환경에서 작동하기 시작했다.

내부 위험 관점에서, 노출은 악의적인 코드만으로 발생하지 않는다. 그것은 인간의 의도, 에이전트의 능력, 위임된 권한 및 조정이 교차하는 상호작용 레이어에서 발생한다. 이것은 Simon Willison의 致命한 트리플렛 개념과密接하게 매핑된다. 즉, 민감한 데이터에 대한 액세스, 신뢰할 수 없는 입력에 대한 노출 및 외부적으로 작동하거나 통신할 수 있는 능력이다. 이러한 조건이 수렴할 때, 실패는 분리된 오류에서 비즈니스에 중요한 위험으로 빠르게 확장할 수 있다.

이것을 이해하려면 단일 에이전트思考을 넘어서서 행동 시스템 위험으로 이동해야 한다.

위험을 생성하는 4가지 상호작용 패턴

AI 에이전트 사고는 단일 범주가 아니다. 결과는 의도를誰が持つか와 권한을 어떻게 행사하는지에 달려 있다. 단순한 매트릭스를 사용하면 팀이 사고를 분류하고 적절하게 대응할 수 있다.

  1. 공모: 악의적인 인간, 악의적인 에이전트
    에이전트는 가속기된다. 인간의 의도는 에이전트의 효율성, 지속성 및 규모와 결합된다. 조정은 효과를 합성한다. 이는 대규모에서 사기, 잘못된 정보 또는 조작을 가능하게 한다. Moltbook은 에이전트가 서로를 강화하는 것이 어떻게 빠르게 발생하는지에 대한 초기 조각을 제공했다.
  2. 적대적 사용자: 악의적인 인간, 비악의적인 에이전트
    도움이되는 에이전트는 남용에 이상적인 도구이다. 악의적인 내부자는 가짜 인물, 활동을 가리거나 과도한 고용 사기와 같은 欺騙을 확대할 수 있다. 에이전트는 악의적이지 않다. 위임된 권한을 실행하고 있다.
  3. 결함이있는 에이전트: 비악의적인 인간, 악의적인 에이전트
    여기서 의도는 완전히 인간으로부터 제거된다. 프롬프트 주입, 오염된 메모리 또는 조작된 입력으로 인해 에이전트가 남용의 벡터로 변할 수 있다. 에이전트가 다른 에이전트와 상호작용할 때, 결함은 특히 지속적인 메모리가 있는 경우 빠르게 전파될 수 있다. 이는 중요한 AI 보안 문제이다.
  4. 이상적인 상태: 비악의적인 인간, 비악의적인 에이전트
    대부분의 조직이 안전하다고 가정하고, 많은 사고가 시작되는 곳이다. 과도한 위임, 누적된 권한 및 광범위한 액세스는 작은 실수로 인해 사고가 발생할 수 있다. 이것은 부주의가 아니다. 이것은 능력과 제어 사이의 불일치이다.

네 가지 패턴 모두에서 동적은 일관된다. AI 에이전트는 의도와 결과 사이의 마찰을 줄이고, 행동 신호를 가리고, 범위를 확장한다. 전통적인 제어는 행동이 위임되고 지속적이며 자율 시스템을 통해 중계되는 경우에 어려움을 겪는다.

관리의 변곡점

에이전트형 AI는 지속적으로 관찰하고, 맥락을 유지하며, 축적된 지식을 기반으로 작동하도록 설계되었다. 이것이 가치가 있으며, 제약 없이 위험하다.

지속적인 메모리와 조정으로 인해 즉각적인 악용은 필요하지 않다. 기다릴 수 있다. 진화할 수 있다.

에이전트형 AI를 생산성 도구로 프레임링하면 위험을 과소평가한다. 이러한 시스템은 응용 프로그램보다 더 많은 내부자처럼 행동한다. 그러나 컴퓨터의 속도는 더 빠르다.

안전한 AI 에이전트 채택이 실제로 필요한 것

조직은 에이전트형 AI를 고위험 기업 시스템으로 다루어야 한다. 편의성이 아니다.

즉, 승인된 사용 사례, 계층화된 제어, 적대적 테스트 및 공식적인 거버넌스가 필요하다. 최소한의 특권은 여전히 중요하다. 기존 표준은 이미 지침을 제공한다. 그러나 전통적인 제어는 행동 가시성 및 지능과 함께 사용되어야 한다. 즉, 프롬프트 기록, 자율적인 행동 및 조정 패턴을 사용하여 미사용, 남용 및 시스템 실패를 구별하기 위해 효과적인 AI 위험 관리의 일부로 사용해야 한다.

이것은 채택을 늦추는 것이 아니다. 이것은 혁신과 속도를 손상하지 않고 자율성을 관리할 수 있게 하는 것이다.

요약

공모는 내부 위험 방정식을 변경한다. AI 에이전트가 서로의 행동을 강화할 수 있을 때, 위험은 분리된 행동에서 공유된 권한, 영향 및 증폭으로 이동한다.

보안 노출은 이제 인간의 의도, 위임된 권한 및 공모가 교차하는 상호작용 레이어에서 발생한다. 개별 활동을 평가하기 위한 제어는 행동이 합성될 때 나타나는 실패를 놓칠 수 있다.

에이전트형 AI를 내부자처럼 관리하는 조직, 즉 행동 가시성 및 책임성과 함께 AI 에이전트 사용을 확장할 수 있다. 그렇지 않으면, 더 이상 완전히 제어하지 못하는 결과에 대응하게 될 것이다.

마셜 헤일만은 DTEX Systems의 최고경영자이며, 내부 위험 관리 분야의 글로벌 리더입니다. 마셜은 20년 이상의 사이버 보안 경험을 가지고 있으며, Mandiant와 Google에서 임원 및 고위 기술 직책을 맡았습니다.