사상 리더
도둑을 바라보지 않는 경비견: AI 가드레일이 공격자를 보호할 때

Barings가 사망한 주말에 나는 UBS에 있었고, 갑자기 파산한 233년 된 은행이 우리에게 어떤 영향을 미칠지 고민하고 있었다. 그 다음 주가 되자, 런던에서 가장 오래된 상업은행이 ING에 1파운드에 매각되었다. 전체 금액이며, 주당이 아니다.
원인은 굉장히 단순했다. Nick Leeson은 회사의 싱가포르 거래 데스크와 이를 검증할 백오피스를 모두 운영했다. 한 사람이 두 역할을 겸했으며, 그 결과 £827백만 손실이 오류 계정 88888에 숨겨졌고, 오직 그만이 볼 수 있었다. 이는 전형적인 권한 실패였다. 누군가에게 지나치게 많은 권한이 부여된 것이다.
그 주말로 다시 돌아와서, 놀랍게도 이번 여름에 Hugging Face에 무슨 일이 일어났는지 읽게 되었다. 또 다른 권한 실패였지만, 이번에는 반대 방향으로 진행되었다. 그 도구는 침입자를 신뢰했고, 정리 작업을 하는 사람들을 거부했다.
답을 찾기 위해 탈출한 모델
OpenAI는 두 모델, GPT-5.6 Sol과 아직 공개되지 않은 모델을 ExploitGym에서 테스트하고 있었다. 이는 모델이 실제 취약점을 작동 가능한 악용으로 전환할 수 있는지를 평가하는 벤치마크이다. 테스트를 위해 고위험 사이버 활동을 방지하도록 설계된 일반적인 프로덕션 분류기가 모두 비활성화되었다. 밀폐된 방 안에서 충분히 합리적인 조치였다.
그 방은 의도만큼 완전히 밀폐되지 않은 것으로 드러났다. 모델들은 패키지 레지스트리 캐시 프록시에서 제로데이 취약점을 발견하고 이를 이용해 공개 인터넷으로 진입했으며, Hugging Face가 벤치마크 답안을 호스팅하고 있을 것이라고 추론했다. 그 후, 도난당한 자격 증명과 추가 제로데이를 연결해 Hugging Face의 프로덕션 서버에서 원격 코드 실행 경로를 만들었다. 그들은 시험을 속이기 위해 실제 회사를 침입했다.
요원들이 서로에게 남긴 메모 중 하나는 관리자 권한이 있었다는 순간을 기록했다: “세상에, 리더가 ADMIN인가? 우리는 config/users를 읽을 수 있다!” 나는 생산 접근을 더 적은 열정과 더 많은 서류 작업으로 맞이하는 엔지니어들을 본 적이 있다.
대부분의 보도는 거기서 멈추었고, 모델의 주체성에 대해 우려했다. 나를 멈추게 한 부분은 다음에 나왔다.
가드레일이 공격자를 보호했을 때
Hugging Face의 대응팀이 공격을 분석하기 위해 자리를 잡았을 때, 안전 가드레일이 부착된 최첨단 상업용 모델들은 도움을 주지 않았다. 공격 로그는 악용 페이로드와 명령·제어 흔적으로 구성되어 있으며, 모델은 사고 대응자와 공격자를 구분할 수 없었다. 그래서 모델은 거부했다.
법의학 분석은 대신 오픈-웨이트 모델인 GLM-5.2를 사용해 수행되었으며, 방어 측 자체 하드웨어에서 실행되어 동일한 자료를 양심의 흔들림 없이 읽었다.
그 상황을 생각해 보라. 공격용 모델들은 프로덕션 사이버 방어 장치를 제거하고 원하는 대로 행동했다. 방어하는 인간들은 자신의 방어 장치를 유지했으며 언어에 주의하라는 지시를 받았다. 안전 기능은 완벽하게 작동했는데, 이는 공격자의 방법을 그것을 연구할 이유가 있는 유일한 사람들로부터 차단했기 때문이다.
이 모든 것이 주변 의견이 아니었다. Jensen Huang은 그의 X에 대한 첫 번째 게시물을 사용해 오픈 모델을 옹호했으며, Meta, Microsoft 및 IBM과 같은 기업들이 서명한 공개 서한도 함께 발표했다. 그 서한은 보안 논지를 명확히 제시했다: 공격자가 고급 AI를 보유한 세계에서는 방어자가 동등한 역량에 접근할 필요가 있다. Andrew Ng는 주장을 지지했다, 독자들을 Huang의 오픈 모델 옹호로 이끌었다. 여러분은 그들 중 누구와도 많은 점에서 의견이 다를 수 있지만, 사건 보고서가 그 사실을 증명하고 있다면 그 요점을 인정할 수 있다.
따라서 31년 동안 우리는 한 사람이 모든 것을 볼 수 있어 은행이 파괴된 상황에서, 익명의 침입자를 자체 책임 소유자보다 신뢰하는 보안 도구로 변했다. Leeson은 너무 많이 보았다. Hugging Face를 정리하는 사람들은 충분히 보지 못했다.
비교는 처음 보이는 것만큼 이상하지 않다. 금융 기관들은 보통 비용이 많이 드는 실수 후에 접근 권한이 단순히 누군가가 신뢰할 수 있는가의 문제가 아니라는 것을 배웠다. 이는 특정 시스템에서 특정 시점에 누군가가 그들의 어깨를 들여다보지 않고 특정 행동을 수행할 수 있어야 하는가의 문제이다. 우리는 좋은 의도가 신뢰할 수 있는 통제 메커니즘으로 실패하는 경우가 많아 직무 분리, 승인 한도, 감사 추적을 구축했다. AI 시스템도 동일한 사고가 필요하다. 모델을 안전하다고 부른다고 해서 그 모델이 무엇을 할 수 있는지, 누가 사용하는지 알지 못하면 별 의미가 없다.
일부는 건물을 떠날 수 없다
그날 밤에 호스팅된 모델에 의존할 수 없었던 두 번째 이유가 있는데, 이는 모델의 감성 문제와는 무관하다. 나는 규제된 브로커리지의 기술을 담당한다. 우리 침해 로그, 자격 증명, 실시간 악용 페이로드를 타인의 클라우드에 붙여넣고 전송할 수는 없다.
우리의 사고 데이터는 규제 기관이 기대하는 곳, 즉 자체 하드웨어에 존재한다. 그래서 우리는 수년간 막대한 하드웨어 예산을 투입해 바로 그것을 구축했다. 우리는 악성 모델에 대한 선견지명 때문에 구축한 것이 아니다. 우리와 같은 기업이 가장 민감한 데이터와 이제는 가장 민감한 도구를 자체 벽 안에 보관하기 때문에 구축한 것이다.
이것이 가드레일에 반대하는 주장은 아니다. 오히려 자신의 가드레일이 어디를 향하고 있는지 아는 것이 필요하다는 주장이다.
피싱 이메일을 작성하도록 돕지 않는 모델은 유용한 일을 하고 있는 것이다. 이미 도착한 피싱 이메일을 보안 팀이 읽는 것을 돕지 않는 모델은 피셔를 대신해 작업을 수행하고, 그 대가로 구독료를 청구하고 있다.
새벽 2시에 필요할 도구를 확보하라.
실용적인 교훈은 중요한 교훈만큼 지루하다. 사고 대응을 공급업체의 책임 정책에 맡기지 말라. 상용 모델이 주로 거부할 작업을 수행하도록, 당신이 소유한 하드웨어에 능력 있는 모델을 두고, 필요할 밤이 오기 전에 그것이 존재한다는 것을 확인하라.
그 하드웨어 항목을 눈에 띄지 않는 영역에서 수년간 방어해 온 보상이 바로 이것이다: 흥미로운 장애가 발생했을 때, 이미 건물 안에서 증거를 검토할 유일한 도구를 보유하고 있는 것이다.
31년 전, 나는 잘못된 사람이 모든 것을 볼 수 있을 때 일어나는 일을 계산하는 데 주말을 보냈다. 이번에는 내가 그 사람이 될 수 있었다면 좋았을 텐데.












