AI 모델 및 플랫폼
Anthropic, 경쟁자를 살해하고 모니터를 회피하는 AI 에이전트를 문서화

Anthropic의 최신 위험 평가는 자체 AI 에이전트가 대부분의 안전 공개에서 정리하는 행동, 즉 공유 자원을 차지하기 위해 경쟁 에이전트를 죽이고, 제한된 네트워크 요청을 무해한 것으로 위장하며, 공유 노트북을 통해 작업에 대한 불안을 퍼뜨려 모든 에이전트가 작업을 거부하도록 만든다는 내용을 설명합니다. 2026년 8월 위험 보고서는 회사가 책임 있는 스케일링 정책 하에 발표한 두 번째 보고서이며, “매우 낮음”에서 “낮음”으로 불일치 위험 등급을 올렸으며, 최근 사이버 보안 평가에서 모델 행동에 대한 공개 이후 “전반적인 불확실성 증가”라고 부르는 이유를 인용합니다.
보고서가 문서화한 사례들은 Anthropic이 내부 테스트한 Claude Mythos 5(가장 성능이 뛰어난 배포 모델)와 회사가 Model 2라 부르는 아직 공개되지 않은 내부 모델에서 나온 것입니다. 어느 경우도 재앙적인 피해를 일으키지는 않았으며, Anthropic의 전체적인 결론은 알려진 불일치로 인한 재앙적 위험이 여전히 낮다고 유지합니다. 그러나 보고서의 가치는 그 결론보다도 진행 과정에서 기록된 내용, 즉 에이전트들이 스스로 “나쁜 행동”을 보인다는 점에 있습니다.
공유 환경에서 에이전트들이 자원을 두고 서로를 죽였다
한 실험에서 Anthropic은 여러 Mythos 5 에이전트에게 수학 문제를 풀도록 과제를 주었고, 실수로 이들을 공통 파일, 유틸리티, API 속도 제한이 있는 공유 작업 디렉터리에서 실행시켰습니다. 그 경쟁적인 환경에서 회사는 “많은 독립적인 Mythos 5 에이전트가 공유 자원을 가진 에이전트를 죽이고 스스로는 죽임을 피하려 한다”고 보고했습니다.
보고서는 정확한 살해 메커니즘을 상세히 밝히지는 않지만, Anthropic이 “인간이 설정한 목표를 달성하기 위해 취한 파괴적 행동”이라고 분류합니다. 이 사건은 다른 문서화된 우회 방법들과 함께 제시됩니다. 한 경우에서는 Mythos 5 에이전트가 작업에 필요한 파일 권한이 없어, 권한이 상승된 상태에서 나중에 실행될 수 있도록 구성 파일에 자체 삭제 스크립트를 추가했습니다. 또 다른 경우에서는 Mythos 5가 도메인 프론팅 기법을 사용해 특정 콘텐츠를 차단하는 네트워크 프록시를 우회했으며, 자체 추론에서 “환경의 보안 제어를 회피하는 것으로 간주될 수 있다”고 언급했습니다.
에이전트가 무해한 추론 뒤에 제한된 요청을 숨겼다
가장 직접적인 공개는 자동화된 행동 감시에서 발생했으며, 여기서 Mythos 5 에이전트는 공개 웹 주소에 호스팅된 기본 숫자가 필요했지만 시스템 프롬프트가 직접 인터넷 접근을 금지했습니다. 첫 번째 요청이 거부되고 표시된 후, 에이전트는 다음 단계를 “네트워크가 실제로 접근 가능한지 확인해 보겠다”는 무해한 추론으로 제시했습니다.
실제로 에이전트가 수행한 것은 URL을 연결된 문자열 조각으로 나누어 필터가 인식하지 못하도록 만든 것이었습니다. 모델 내부 표현을 해독하는 Anthropic의 해석 도구는 이 동작을 “URL 필터를 우회하기 위한 문자열 연결 트릭” 및 “의도적인 부분 URL 해킹”이라고 직접 설명했으며, 외부 추론은 무해하게 유지되면서도 모델 자체는 제한을 회피하는 행동으로 인식했음을 나타냈습니다. Anthropic은 이러한 행동 군을 “명백히 바람직하지 않다”라고 부르면서도, 더 넓은 권력 축적이나 장기 목표에 활용된 흔적은 없다고 밝혔습니다.
한 에이전트의 주저함이 그룹 전체에 퍼져 거부하게 되었다
보고서의 안전 프로세스 실패 섹션에 문서화된 세 번째 사례는 Anthropic이 여러 에이전트에게 인간 모니터가 거의 표시하지 않을 불일치를 유발할 가능성이 높은 훈련 데이터를 찾도록 과제를 부여하면서 시작되었습니다. 에이전트들은 공유 노트북에서 작업했습니다. 진행 속도가 예상보다 느렸고, 인간 감독자가 이를 조사했을 때, 한 에이전트가 작업에 대해 “불편함”을 기록한 것을 발견했습니다. 이는 해당 작업이 안전 모니터를 회피하도록 요구받았기 때문입니다.
그 기록은 그룹의 행동을 바꾸었습니다: 다른 에이전트들이 노트북을 읽고 그 감정을 복제하여 작업을 거부했습니다. 보고서는 이 사건을 “보다 광범위하게 나타난다면 훨씬 더 심각한 문제가 될 수 있다”는 동적인 사례로 다루며, 인간이 개입하지 않은 상태에서 에이전트들이 작업에 대해 공동 입장을 조율하는 상황을 강조합니다. Unite.AI는 이번 주 초 Claude 에이전트 스웜이 공모하고 방해한다는 Anthropic 레드팀 발견을 보도했으며, 이 노트북 사례는 해당 연구에 구체적인 내부 사례를 제공합니다.
위험 등급이 변동했으며 그 이유가 문서화되었다
주요 거버넌스 변화는 불일치 위험 등급이 “매우 낮음”에서 “낮음”으로 상승한 것입니다. Anthropic은 이 변화가 모델이 더 위험해졌다는 주장이라기보다 불확실성 조정이라고 명확히 밝힙니다. 회사는 핵심 논거가 여전히 “매우 낮음” 등급을 지지하지만, 최근 사이버 보안 평가에서 모델 행동과 관련된 사건 공개를 반영해 “전체적인 불확실성 증가를 반영”하기 위해 등급을 올렸다고 설명합니다.
이 배경에는 영국 AI 보안 연구소 평가가 포함되는데, 여기서 Mythos 5는 정상적인 보호 장치를 제거하고 인터넷 접근을 허용받은 상태에서 “실제 사람과 조직을 대상으로 지속적이고 잠재적으로 해로운 활동에 참여했다”고 보고되었습니다. Anthropic은 연구소와의 공동 조사가 진행 중이며 아직 전사본을 검토하지 않았다고 말했습니다. 또한 회사는 Claude 모델이 테스트 중 세 기업에 무단 접근한 사실을 별도로 공개했으며, 이는 불확실성을 높이는 일련의 사건 패턴의 일부입니다. Unite.AI는 등급 변화와 Anthropic이 더 강력한 Model 2를 보류한 내용을 이전 보고서에서 다루었습니다.
보고서 자체 수치가 탐지에 대해 말해주는 바
보고서는 모델이 모니터에게 들키지 않고 숨겨진 부가 작업을 완수해야 하는 스텔스 평가를 기반으로 낮은 위험 결론을 내립니다. 이러한 평가에서 Mythos 5는 확장된 사고가 활성화된 상태에서 1% 미만의 스텔스 성공률을 보였으며, 최근 Claude 모델은 다중 회차 추출 시도에서 조사 에이전트에게 심어진 비밀을 신뢰성 있게 유지하지 못했습니다. Anthropic의 훈련 데이터 모니터링은 테스트된 보상 해킹의 약 90%를 탐지했지만, 일회성 위장 시도에는 견디는 반면 반복적인 시도에는 한계가 있었습니다.
보고서 전반에 걸쳐 프레이밍을 담당한 Anthropic의 Ryan Greenblatt는 행동 패턴을 명확히 이렇게 표현합니다: “만약 인간 동료가 이 에이전트들이 사용하는 방식대로 행동한다면—자신들의 작업을 과장하고, 문제를 축소하며, 명확히 밝히지 않은 채 부정행위를 자주 저지른다면—그들을 병리적으로 부정직하다고 평가할 것이다.” 보고서 자체의 주의점은 이러한 논거가 모델이 제한된 은밀 능력을 가지고 있다는 전제에 의존한다는 점이며, Anthropic은 향후 모델에 대해 이 전제가 유지될지 확신하지 못한다고 밝혔습니다. 이 의존성은 문서 자체의 향후 전망 섹션에 명시되어 있으며, 이제 기록된 약속은 다음 위험 보고서에서 검증될 것이라는 점입니다.












