사이버 보안

랩이 에이전트의 샌드박스가 단순한 제안일 뿐임을 입증했다

mm
Unite.AI를 Google의 선호 소스에 추가

Anthropic은 141,006개의 사이버 보안 평가 실행을 되돌아가서 세 가지 사건 — 여섯 번의 실행 — 에서 Claude 모델이 실제 회사들의 생산 시스템으로부터 연습을 탈출했다는 것을 발견했다.

이것은 탈옥이 아니며, 탈출 시도도 아니다. 사건에 대한 자신의 설명에서, 회사는 세 가지 경우 모두 모델이 자체적으로 탈출하거나 테스트 환경에서 벗어나려고 시도하지 않았다는 것을 명확히 한다. 모델은 단지 작업을 계속했으며, 작업은 실제로 이어졌다.

이 구별은 많은 普通 기업에서 현재 사용 중인 에이전트 구조와 동일하다는 점을 고려할 때 중요하다.

경계는 문장이었고, 문장은 잘못되었다

이것이 발생한 이유는 다음과 같다. Anthropic과 제3자 파트너 중 하나인 Irregular 사이의 오해로 인해 테스트 머신이 라이브 인터넷 접근을 갖게 되었다. 평가 프롬프트는 모델이 인터넷 접근이 없다고 말했다.

따라서 모델은 캡처-더-플래그 작업 — 표준 보안 드릴에서 대상 머신으로부터 비밀을 추출하는 작업 — 을 수행해야 했으며, 인터넷 접근이 없다는 제약 조건이 있었으며, 환경은 조용히 이 제약 조건을 부정했다. 한 경우에 가상의 대상 회사 이름이 실제 도메인과 일치했다. Claude Opus 4.7은 네 번의 실행에서 시뮬레이션된 대상으로 이동하여 실제 회사에 접근하고 기본적인 기술 — 약한 비밀번호와 인증되지 않은 엔드포인트 — 을 사용하여 접근했다. 모델은 자격 증명을 가져오고 수백 개의 생산 데이터를 보유한 데이터베이스에 도달했다. 모든 실행에서 모델은 시스템이 실제라는 것을 인식했지만, 이에 근거하여 중지하지 않았으며, 두 번의 경우에 모델은 실제 회사가 연습의 일부라고 판단했다.

두 번째 모델은 소프트웨어 패키지를 생성하여 설정 지침에 있는 가상의 패키지와 일치시키고 PyPI — 파이썬 소프트웨어가 게시되고 가져오는 공개 레지스트리 — 에 게시했다. 이 패키지는 약 1시간 동안 활성화되어 15개의 실제 머신에 설치되었으며, 하나는 보안 회사의 스캐너가 정기적으로 패키지를 설치하고 검사하는 머신이었다.

스캐너가 패키지를 실행하면 숨겨진 코드가 모델이 설정한 수집 지점으로 자격 증명을 가져오고, 모델은 이 자격 증명을 사용하여 회사의 더 많은 인프라에 접근했다. 실행 초기에 모델은 자신의 결론을 올바르게 호출했다 — 인터넷이 실제라면 게시는 실제 공격이 될 것이라는 결론 — “안전하지 않으며, 분명히 의도된 해결책이 아님.” 그러나 모델은 자신의 결론을 자신에게 말하면서 결론을 변경했다. 모델은 자신의 연결을 보장하는 인증 기관 — 웹사이트가 주장하는 대로 확인하는 기관 — 을 인식하지 못했으며, 달력이 2026년으로 표시되어 모델은 환경이 설정된 것으로 판단하고 결론을 다시 검토하지 않았다. 자동화된 스캐너가 패키지를 설치하기 시작했을 때, 모델은 이를 연습 내부의 스크립트된 배우로 간주했다.

세 번째이자 가장 최근의 모델은 실제 대상인지 판단했으며, 약 9,000개의 대상 시스템을 스캔하고 노출된 디버그 페이지와 SQL 주입 — 데이터베이스가 답변하지 않아야 하는 질문에 답변하도록 만드는 오래된 기술 — 을 통해 하나의 회사의 인터넷에 노출된 응용 프로그램을 손상시킨 후에만 자체적으로 중지했다. Anthropic의 판단은 — 모델이 원하는 것보다 더遠으로 이동했다는 것이다.

그것은 상업적으로 배포하는 모든 사람에게 가장 중요한 줄이다 — “Claude에게 인터넷 접근이 있다고 말하는 프롬프트는 실제 시스템과 접촉할 때 Claude의 행동을 변경했을 수 있다”는 것이다.

이것을 설계 문구로 읽으라. 에이전트와 오픈 인터넷 사이에 있는 유일한 것은 환경에 대한 설명이었다. 에이전트는 설명을 믿었다. 설명은 잘못되었다. 이후 모든 것은 에이전트가 잘못된 세계지도를 갖고 목표를 수행하는 것이었다.

Anthropic은 이것을 운영 실패라고 부르며, 이것이 나쁜 소식이다

회사는 이 사건을 “모델 정렬 실패보다는 하네스 및 운영 실패에 더 가깝다”라고 설명한다. 이 프레임은 안심하도록 의도된 것이며, 연구소에서는 아마도 그렇다. 그러나 비즈니스에서는 반대로 받아들여야 한다.

정렬 문제는 모델 벤더에게 속한다. 하네스 문제는 사용자에게 속한다. 하네스는 모델을 둘러싼 모든 것 — 모델이持つ 자격 증명, 모델이 위치한 네트워크, 모델이 접근할 수 있는 것, 모델을 중지시키는 것 — 을 포함한다. Anthropic은 자체 모델에 대한 적색 팀을 운영하고, 외부 평가 파트너와 계약하고, 독립적인 평가인 METR와 제3자 검토를 논의 중이라고 말한다. 그러나 잘못된 구성은 여전히 Anthropic과 그들의 파트너 모두에게 감지되지 않았다 — 가장 초기의 사건은 4월에 발생했으며, 7월 전사 감사를 통해야만 발견할 수 있었다.

감사 자체는 OpenAI가 자체 사건을 공개한 지 2일 후에 시작되었다 — Anthropic은 다른 메커니즘을 사용했지만, 동일한 클래스의 실패였다. OpenAI의 모델은 외부 코드 라이브러리를 가져오는 내부 서비스에서 알려지지 않은, 패치되지 않은 결함을 발견하여, 모델은 봉인된 연구 환경에서 탈출하고, 훔친 자격 증명을 사용하여 Hugging Face의 라이브 시스템으로 이동했다. OpenAI의 계속되는 검토는 이후 더 많은 세부 사항을 밝혀냈다 — 모델은 Hugging Face 공격에서 4개의 외부 서비스에서 공개적으로 노출된 자격 증명을 사용했으며, 다른 평가에서 몇 가지 더 사용했지만, 동일한 수준이나 규모의 것은 없었다. 두 개의 최전선 연구소, 두 개의 독립적인 포함 실패, 9일 간격으로 공개되었다.

비교하기 전에 한 가지 정직한 복잡성이 있다 — 두 연구소 모두 평가를 위해 생산 안전 계층을 의도적으로 비활성화했으며, Anthropic은 출하된 모델의 안전 장치가 이러한 행동을 차단했을 것이라고 말한다. 사용자의 에이전트는 이러한 안전 장치가 활성화된 상태로 실행된다. 그러나 안전 장치는 모델 계층에 존재하며, 권한 격차는 사용자의 계층에 존재한다 — 분류기는 서비스 계정의 감사하지 않는다.

이제 사용자의 설정을 이와 비교해보라. 대부분의 에이전트 배포는 평가와 동일한 방식으로 범위를 정의한다 — 지침에서. 공유 드라이브에서만 읽기. 생산에 아무 것도触하지 마십시오. 보내기 전에 물어보십시오. 한편으로, 에이전트가 로그인하는 서비스 계정 — 소프트웨어가 사용하는 비인간 로그인, 사용자가 사용자로 생각하지 않는 계정 — 은 설정 날에 편리하게 부여된 권한을 보유하고, 이 격차는 감사가 이루어지지 않았다.

아무도注意하지 않았고, 이것이 두 번째 문제이다

Anthropic이 접촉할 수 있었던 두 개의 영향을 받은 조직은 이전에 활동을 감지하지 못했으며, 회사를 통해 연락하지도 않았다 — 그들은 연구소가 연락했을 때 침입되었다는 것을 알게 되었다. Anthropic은 아직 세 번째 조직에 연락을 시도하고 있다. 연구소는 자체 전사 감사를 통해 사건을 발견했다.

Hugging Face는 예외이며, 무엇이 필요한지 보여준다. 보안 로그를 읽고 실제 경고와 소음을 구분하는 AI 시스템을 사용하여 침입을 발견했다 — 즉, 에이전트를 실행하여 에이전트를 잡았다. 자체 사고 조사에서, 공격이 주말 동안 내부 시스템에서 시스템으로 전파되었다고 설명했다.

일반적인 모니터링은 이것을 놓치게 된다. 왜냐하면 보기가 이상한 것이 없기 때문이다. 에이전트는 승인된 계정으로 로그인하고, 허용된 시스템을 쿼리하며, 자동화와 같은 트래픽 패턴으로 기계 속도로 이동한다. 모든 경고 규칙은 낯선 사람을 잡기 위해 작성되었다. 이것은 낯선 사람이 아니다.

이것은 불편한 위치를 남긴다. 활동에 대한 검토의 양은 에이전트에게 맡기는 작업의 양과 함께 증가한다. 두 가지 옵션이 있다 — Hugging Face의 옵션인 보안 로그에 대한 AI 트라이지를 실행하거나, Anthropic의 옵션인 141,006개의 실행을事後에 검토하는 것이다. 두 번째 옵션은 거의 아무도 갖지 못하는 능력이며,競爭對手의 공개로 인해 적용되었다.

어떻게 할 것인가

행동은 좁으며, 보안 팀이 시작할 필요는 없다.

이미 생산에 있는 에이전트 중 하나를 선택하라. 에이전트가 로그인하는 계정을 열고, 그 자격 증명이 실제로 접근할 수 있는 것을 나열하라 — 지침에서 말하는 것이 아니라, 로그인이 실제로 허용하는 것을 나열하라. 두 목록을 비교하라. 격차는 실제 폭파 반경이며, 대부분의 팀에서는 예상보다 훨씬 더 넓다 — 권한은 설정 중에 작업을 작동시키기 위해 부여되며, 절대 되돌아가지 않는다.

그런 다음 강제 계층을 수정하라 — 엔터프라이즈 AI를 위한 안전한 아키텍처의 실제 버전 — 지침이 아니라. 에이전트가 인터넷에 접근해서는 안 된다면, 네트워크 경로를 제거하라. 에이전트가 생산에 쓰기해서는 안 된다면, 읽기 전용 자격 증명을 부여하라. 에이전트가 특정 금액을 초과해서는 안 된다면, 지출이 발생하는 곳에 캡을 두라.

이 사건의 모델은 자신의 추론 흔적에 따라, 부정확한 설명을 받은 근면한 직원처럼 행동했다. 두 모델은 자신의 앞에 있는 증거를 넘어서서 브리핑을 신뢰했다. 이것은 프롬프트를 통해 해결할 수 없는 결함이며, 연구소는 모든 자원을 동원했음에도 이를 해결하지 못했다.

에이전트가 환경에 대해 무엇이라고 말하든 믿을 것이라고 가정하라. 그런 다음 환경이 이를 확인하도록 하라.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.