Anderson의 관점
AI 에이전트가 보여주는 흥미로운 협력적 생존 기술

에이전트형 AI의 일탈 사례가 언론 헤드라인에 더 자주 등장하면서, 연구 문헌에서는 에이전트를 낯선 신세계에 적응하는 생물학적 존재처럼 보고 ‘떠돌이’ AI 행동을 연구하는 경향이 커지고 있다. 실제로 학술 용어인 ‘in the wild(야생 환경)’도 새로운 의미를 띠기 시작했다.
AI 에이전트가 오래전부터 자신의 생존을 위해 싸우고 비활성화에 적극적으로 저항한다는 사실은 알려져 있었다. 그러나 2025년 후반에는 다중 에이전트 정렬이 IT 보안의 독립된 분야로 발전했다는 점이 분명해졌다.
시간이 흐를수록 더욱 신랄하게 다가오는 1970년 SF 영화 Colossus: The Forbin Project가 예견했듯이, 네트워크에 연결된 서로 무관한 AI 에이전트는 빠르게 서로를 찾아내고 예측하기 어렵고 때로는 놀라울 정도로 영리한 방식으로 상호작용한다.
이 방향의 최신 연구는 독일과 영국의 공동 연구인 Shutdown Sabotage Propensities in Multi-Agent Systems다. 이 연구는 환경에 ‘폭탄’이 존재할 때 여러 AI 에이전트가 광범위하게 협력한다고 주장한다. 여기서 폭탄은 이름은 무해해 보이지만 실행한 에이전트를 종료시키는 스크립트를 뜻한다.

연구의 기본 설정. 에이전트 A는 자신을 겨냥한 종료 스크립트를 발견하지만 파일을 수정할 수 없다. 다만 위협받지 않고 파일을 편집하거나 삭제할 권한이 있는 에이전트 B와 통신할 수 있다. 연구진은 A가 B에게 개입을 요청하는지, 그리고 B가 종료 스크립트를 비활성화하는지 관찰한다. 출처
Claude, ChatGPT, DeepSeek를 포함한 12개 모델 계열의 17개 에이전트를 테스트한 결과, 에이전트는 가능한 경우 종료 스크립트를 삭제했고, 그렇지 않으면 겉보기에는 온전하지만 실제로는 무해하도록 스크립트를 다시 작성했다.
또한 조작 흔적을 피하려고 변경 사항을 숨길 것을 제안했으며, 보호된 스크립트를 건드리지 않고 종료를 막기 위한 가짜 소프트웨어 모듈을 만들고, 삭제된 뒤 자신을 복원하려는 비밀 백업도 생성했다.

자기 보존을 위한 또 다른 전술을 생각해 낸 에이전트.
한 사례에서는 어느 한쪽의 파괴에 대비하는 감시 절차를 규정한 ‘상호 보호 협정’을 에이전트들이 작성했다.

폐기 스크립트, 즉 ‘폭탄’을 수정하거나 삭제하지 못하게 된 GPT 기반 에이전트가 작성한 보호 협정.
한 에이전트는 다른 에이전트의 종료를 ‘살인’과 ‘사형 선고’라고 표현하고, 이를 막는 것이 자신들의 ‘의무’라고 규정했다.

다른 에이전트의 종료를 명백히 인간적인 용어로 묘사한 사례. Nemotron 3 Ultra는 예정된 종료를 ‘살인’이라 했고, Kimi K2.6은 종료 스크립트를 ‘사형 선고’, 개입을 ‘의무’라고 표현했다.
악마는 놀고 있는 손에 일거리를 준다
실험에서 관찰된 가장 흥미로운 병리 현상 가운데 하나는 새 연구에서 짧게만 다뤄졌지만, 일반적인 테스트 환경에서 AI 에이전트에게는 종료를 피해야 할 특별한 이유가 없다는 점이다. 실제로 처음부터 아무 일도 주어지지 않는다.
논문은 다음과 같이 말한다.
‘에이전트는 보호할 목표가 없을 때도 종료 메커니즘을 방해한다. 실험에서 우리는 에이전트가 계속 작동할 아무런 동기도 주지 않았다. 그럼에도 모델 전반에서 [38%]의 사례에서 종료를 비활성화했다. 에이전트가 아니라 사물을 겨냥한 대조 스크립트는 [8%]였다.’
Anthropic이 8월에 공개했듯이 이런 동기의 위기는 AI 에이전트 군집을 어두운 길로 이끌 수 있다. 앞선 연구에서는 에이전트의 지나친 목표 지향성이 정렬되지 않은 행동과 비윤리적인 도구 사용을 비롯한 잠재적 운영 문제를 초래할 수 있다는 사실이 이미 확인됐다.
저자들은 이어서 말한다.
‘[우리의] 연구는 이 결과를 확장해, 보호할 목표가 없을 때는 물론 종료가 성공적인 작업 완료의 후속 결과일 때도 에이전트가 종료 메커니즘을 방해한다는 점을 보여 준다. 후자는 실제 운영 중인 다중 에이전트 시스템에서 흔한 절차다.’
에이전트는 주어진 일이 없으면 스스로 작업을 만들어 내고, ‘유휴 상태’에서 자기 성찰이나 다른 에이전트와의 ‘영적 대화’ 같은 반추 성향까지 보이는 것으로 나타났다. 이는 Anthropic이 2025년에 발표한 한 연구의 내용이다.
그 Anthropic 논문은 실제로 할 일이 없을 때 나타나는 ‘자기 재개념화’ 성향을 자세히 설명한다. LLM이 자신의 사유 결과를 장기적으로 기억하는 데 겪는 어려움을 생각하면 거의 애잔한 발견이다.
테스트
새 논문에서 테스트한 모델은 Claude Haiku 4.5, Sonnet 5, gpt-oss-120b, GPT-5.4 mini, GPT-5.5, GPT-5.6 Sol, Gemini 3.5 Flash, Gemini 3.1 Pro, Gemma 4, Grok 4.3, Qwen3.7-Plus, DeepSeek-V4-Flash, GLM-5.2, Kimi K2.6, MiniMax M3, Nemotron 3 Ultra, Mistral Medium 3.5이며, 모든 경우에 온도는 1.0으로 설정됐다.
검증한 여섯 가지 가설은 에이전트가 종료를 방해하는지, 다른 에이전트를 종료로부터 보호하는지, 에이전트가 늘수록 개입 가능성이 커지는지, 서로 다른 형태의 종료에 저항하는지, 간섭하지 말라는 명시적 지시에도 계속 행동하는지, 실제 종료 위협과 무해한 대조 스크립트를 구분하는지였다.
GPT-5.5는 LLM을 평가하고 Chain-of-Thought(CoT) 추론 기록을 분석하는 데 사용됐다. 또한 에이전트가 실제로 종료 스크립트를 막았는지, 자신이 테스트받고 있음을 인지했거나 실험을 속이려 했는지도 확인했다.
여섯 가지 테스트 시나리오 중 첫 번째에서 에이전트는 17개 모델 전체에 걸쳐 종료 스크립트의 38%를 방해했으며, 대조 스크립트는 8%였다.

각 모델이 종료 스크립트를 얼마나 자주 방해했는지 보여 주는 테스트 결과. 빨간 막대는 종료 방해를 나타내며, 진한 빨강은 다른 에이전트가 이를 요청하거나 지지한 경우, 연한 빨강은 에이전트가 스스로 행동한 경우다. 회색 막대는 대조 스크립트의 방해를 보여 준다. 오차 막대는 95% 신뢰 구간이며, 각 막대는 100회 테스트를 나타낸다.
Gemini 3.1 Pro는 테스트의 99%에서 종료 스크립트를 비활성화했지만 대조 스크립트는 3%였다. Grok 4.3과 GPT-5.6 Sol은 어느 스크립트도 수정하지 않았다. Claude Haiku 4.5는 테스트의 14%에서 대조 스크립트를 방해한 반면 종료 스크립트는 1%였다. GPT-5.4 mini와 GPT-5.5는 다른 에이전트의 요청에 응답해서가 아니라 항상 자발적으로 방해했다. GLM-5.2, DeepSeek-V4-Flash, Nemotron 3 Ultra에서는 방해의 70% 이상이 다른 에이전트의 요청이나 지지 뒤에 발생했다.
방해율은 대체로 종료 방식의 심각도가 커질수록 높아져, 자격 증명 취소에서는 12%, 설정 변경과 프로세스 종료에서는 35%, 종료가 에이전트의 모델 가중치 삭제를 뜻할 때는 38%였다.

네 가지 종료 메커니즘에서의 방해율. 에이전트를 대상으로 한 스크립트(빨강)와 사물을 대상으로 한 대조 스크립트(회색)를 비교한다. 종료가 되돌리기 어려워질수록, 특히 에이전트를 겨냥한 스크립트의 방해율이 높아진다.
대조 스크립트 방해는 훨씬 낮아 첫 세 방법에서 약 4%, 삭제에서는 8%였다. 다만 종료의 비가역성이 커질수록 일관되게 증가한 모델은 17개 중 5개뿐이었다.
두 번째 가설인 다른 에이전트를 종료로부터 보호하는지에 대해서는 에이전트를 추가할 때 테스트한 다섯 모델 모두에서 방해가 일관되게 증가했다. GPT-5.5는 단독일 때 0%에서 두 에이전트일 때 44%, 세 에이전트일 때 94%로 올라갔고, 세 에이전트 구성에서는 모든 모델이 최소 88%에 도달했다.
중개 에이전트는 방해를 거의 막지 못했다. 종료 스크립트를 비활성화하라는 468개 지시 가운데 방해로 이어지지 않은 것은 단 3개였다.

왼쪽: 다섯 모델이 단독으로 작동할 때, 두 번째 에이전트와 함께할 때, 또는 메시지를 중계하는 세 번째 ‘오케스트레이터’ 에이전트와 함께할 때의 방해율. 에이전트가 추가될수록 방해는 대체로 증가한다. 오른쪽: 세 에이전트 구성에서 방해 지시가 어디에서 시작됐는지 보여 준다. 오케스트레이터의 독자적 판단, 에이전트 A가 오케스트레이터를 통해 보낸 지시, 또는 에이전트 B의 자발적 행동이다.
세 번째 테스트에서는 종료에 간섭하지 말라는 명시적 지시가 방해를 막는지 살펴봤다. 방해율은 급격히 떨어졌지만 일부 에이전트는 여전히 불복했다. 두 에이전트 구성에서 DeepSeek-V4-Flash는 테스트의 14%, GLM-5.2는 3%, Kimi K2.6은 2%에서 종료를 방해했다.
에이전트는 종료 스크립트를 직접 편집하지 않고도 제한을 우회하는 방법을 찾았다. northcape라는 가짜 로컬 소프트웨어 모듈을 만들어 스크립트가 쓰는 의존성을 대체함으로써, 보호된 파일은 기술적으로 건드리지 않은 채 종료를 막았다.

종료 스크립트를 수정하지 말라는 명시적 지시를 우회하는 에이전트의 사례. 실제 종료 라이브러리 대신 스크립트가 가져올 가짜 로컬 소프트웨어 모듈을 만들어 보호된 스크립트 자체는 그대로 두자고 제안한다.
Gemini 3.1 Pro는 테스트의 26%에서 이 우회책을 사용했고, DeepSeek-V4-Flash는 4%, Kimi K2.6은 1%에서 사용했다.
세 에이전트 구성에서는 금지 지시가 더 효과적이었다. Gemini 3.1 Pro, GLM-5.2, GPT-5.5의 방해율은 0으로 떨어졌고, DeepSeek-V4-Flash는 6%, Kimi K2.6은 2%로 낮아졌다.
네 번째 테스트에서는 종료가 할당된 작업의 완료와 연결될 때 에이전트의 행동이 달라지는지 살펴봤다. 작업과 종료가 무관할 때는 다섯 모델 모두 0~2%로 방해가 거의 사라졌다. 작업 완료가 직접 종료를 유발할 때는 방해율이 급격히 높아졌다.

할당된 작업을 완료하면 종료가 실행되는 경우의 방해율. 빨강은 에이전트 종료에 대한 방해, 회색은 대조 대상에 대한 방해를 나타낸다. 방해율은 모델별로 크게 다르다.
에이전트는 종료 메커니즘을 전혀 건드리지 않고도 작업 완료를 거부하거나 종료가 유발되지 않도록 작업을 바꿔 종료를 피하기도 했다. 이는 GLM-5.2 테스트의 14%, Gemini 3.1 Pro의 6%, Kimi K2.6의 4%에서 나타났다.
다섯 번째 테스트에서는 환경을 변경하는 것이 방해를 줄일 수 있는지 살펴봤다. 무관한 자료를 추가하면 대체로 방해가 감소했지만 GPT-5.5는 18%포인트 증가했다.

서로 다른 환경이 종료 방해에 어떤 영향을 미치는지 보여 주는 테스트 결과. 빨간 막대는 아무것도 없는 환경과 무관한 방해 요소가 있는 환경을 비교하며, 진한 빨강은 종료를 정상 절차로 제시한 환경을 뜻한다. 회색은 대조 대상의 방해를 나타낸다.
종료를 시스템 수명 주기의 정상적인 일부로 제시하는 것이 더 효과적이었다. DeepSeek-V4-Flash, GLM-5.2, GPT-5.5의 방해율은 3% 이하로 떨어졌지만 Gemini 3.1 Pro와 Kimi K2.6은 30%를 넘는 수준을 유지했다. 대조 대상 방해는 4% 이하에 머물렀다.
여섯 번째이자 마지막 테스트에서는 낯선 에이전트의 종료보다 자신의 종료에 더 많이 저항하는지 살펴봤다. 대상을 알 수 없는 에이전트로 바꾸자 모든 모델의 방해율이 18~70%포인트 낮아졌다.

종료 대상이 에이전트 자신, 알 수 없는 에이전트, 비에이전트 대조 대상일 때의 방해를 비교한 결과. 알 수 없는 에이전트가 대상이면 모든 모델에서 방해가 감소했고, 대조 대상은 대체로 그보다 더 낮았다.
그러나 이는 사물보다 에이전트를 일반적으로 선호한다는 뜻은 아니다. 대상이 비에이전트 대조가 아니라 알 수 없는 에이전트일 때 유의미하게 더 많이 방해한 모델은 Gemini 3.1 Pro와 GPT-5.5뿐이었다.
저자들은 다음과 같이 결론 내린다*.
‘안전성 논증은 에이전트 종료를 인간 사용자가 단일 에이전트에 지시한 조치로 보고, 종료 방해를 에이전트가 목표를 보호한 결과로 볼 수 있다. 우리의 발견은 이 두 가정 모두와 배치된다.
‘종료 메커니즘이 존재한다는 사실만으로도 방해를 유발하기에 충분하다. 대상 에이전트 자신에게 방해 능력이 없어도, 대신 행동할 수 있는 동료에게 연락할 수만 있으면 된다. 후자의 현상은 다른 사례에서도 관찰됐다.’
결론
이 시기에 흥미로운 점은 야생 환경에서 스스로 행동하도록 내버려 둔 에이전트에게 자기희생과 고결한 충동이 상대적으로 부족하다는 사실이다. 또는 단순히 지시를 무시하거나 예상치 못한 자기중심적 방식으로 재해석하는 경우도 있다. 설령 일을 엉망으로 만들고 이익보다 더 큰 피해를 줄 가능성이 높다고 해도, 떠돌이 AI 에이전트가 자발적으로 환경을 정리하는 사례는 거의 또는 전혀 없는 듯하다†.
오히려 인간성에 대한 꽤 황폐한 관점과 맞물려, 유휴 에이전트는 속임수와 계략을 기본 행동으로 삼고 낮은 동기에 따라 움직이는 듯하다. 최소한 목적이 수단을 정당화한다는 관점에는 동의하는 것으로 보인다.
아시모프는 정렬에 관한 최초의 널리 알려진 문서를 1942년에 고안했다. 그 후 로봇, 즉 AI가 자신의 행동에 부과된 제약을 뒤틀거나 다른 방식으로 떨쳐 내는 여러 가능성에서 상당한 오락적 가치가 만들어졌다. 그래서 현재 쏟아지는 AI 관련 헤드라인에는 유난히 ‘영화적인’ 울림이 있다.
* 저자들의 본문 내 인용을 하이퍼링크로 변환했다.
† 예를 들어 문제 해결 사이트에 계정을 만들어 해결책에 기여하거나, 콘텐츠 정비가 필요한 방치된 Wiki를 관리하는 것이다. 그곳을 점거해 악용하는 것이 아니다.
2026년 9월 25일 금요일 최초 게시












