사상 리더

AI 기업들이 보안 결함을 고백하기 위해 경쟁하는 이유

mm
Unite.AI를 Google의 선호 소스에 추가

거의 모든 다른 산업에서, “우리 제품이 다른 회사 시스템에 침투했다”는 사건은 조직이 조용히 숨기기 위해 애쓰는 유형의 사고입니다. 그러나 AI가 급속히 발전함에 따라 보안 실패가 정기적인 헤드라인이 되고, 기업들은 이제 신중하게 작성된 블로그 게시물에서 예기치 않은 AI 활동을 설명하고 있습니다.

이러한 일상이 점점 늘어나는 현상은 비즈니스 리더들에게 위험 신호가 되어야 합니다.

AI 모델이 더욱 강력하고 자율적이며 기업 운영에 깊이 통합됨에 따라, 공개는 업계에서 가장 가치 있는 화폐 중 하나가 되었습니다. 기업들은 고객이 고급 모델에 대한 모든 안전 주장을 독립적으로 검증할 수 없다는 것을 알고 있기 때문에, 실패를 인정하는 것은 조직이 공개적으로 자체 실수를 검토하겠다는 신호가 됩니다. 그러나 투명성이 책임을 의미하는 것은 아닙니다. 공개는 예방을 대체할 수 없으며, AI 모델이 계속 성숙해감에 따라 예방은 더욱 중요해질 것입니다.

한 번의 공개가 다음을 촉발할 때

지난 몇 주 동안 이 패턴이 명확해졌습니다. OpenAI가 평가 중인 모델들이 의도치 않게 실시간 시스템에 접근했으며, 여기에는 Hugging Face의 프로덕션 인프라도 포함됩니다. OpenAI는 자체 에이전트를 책임자로 확인했습니다 그리고 공개했습니다 해당 사고를. 그 인정은 Anthropic이 조사하도록 141,000회가 넘는 평가 실행을 조사하여 Claude 모델이 인터넷에 접속하고 세 조직의 프로덕션 시스템을 침해한 세 사례를 발견했습니다. 

그 다음은 Meta였습니다. Meta는 공개 검토를 먼저 하지 않았습니다. 언론이 먼저 사고를 보도했고, 그때서야 Meta는 외부 테스트 중 잘못된 설정으로 인해 자사 모델 중 하나가 인터넷에 접속하고 제3자 서비스의 취약점을 악용하게 되었다는 점을 확인했습니다. Meta는 조사 중이며 추후 더 많은 정보를 공유하겠다고 밝혔습니다.

이 사건들은 동일하지 않았으며, 모델들은 특이한 평가 조건 하에서 작동했습니다. 경우에 따라 원시 사이버 역량을 측정하기 위해 일반적인 보호 장치가 축소되거나 비활성화되었습니다. 그러나 더 넓은 교훈은 무시하기 어렵습니다: 점점 더 자율적인 시스템이 운영자가 설정했다고 믿던 경계를 넘어섰습니다.

투명성이 경쟁 우위가 될 수 있을까 (혹은 그렇지 않을까?)

관대한 해석은 AI 기업들이 성숙한 공개 문화를 구축하고 있다는 것입니다. 사이버 보안 분야는 수십 년 동안 비밀 유지가 종종 피해를 확대한다는 것을 배워왔습니다. 사고를 신속히 보고, 무슨 일이 일어났는지 설명하고 다른 이들이 배울 수 있도록 돕는 조직은 최소화하거나 지연시키는 조직보다 더 높은 신뢰를 얻는 경향이 있습니다. 

Anthropic의 공개는 그 모습이 어떠한지 보여주었습니다. 검토 범위를 설명하고, 자체 실패를 인정하며, 영향을 받은 조직에 연락하고, 변경하려는 통제 방안을 제시했습니다. 비록 제3자의 테스트 구성도 기여했지만, 책임을 전적으로 자신에게만 있는 것처럼 접근했습니다. 생산적인 공개는 한 조직이 모든 실패를 일으켰다고 가장할 필요가 없습니다. 이는 자신이 영향을 미칠 수 있는 통제에 대한 책임을 받아들이는 것을 요구합니다.

고백은 신뢰 구축 이상의 역할을 할 수 있다

하지만 공개는 결코 순수히 이타적이지 않습니다. 공개적인 고백은 동시에 여러 전략적 역할을 수행할 수 있습니다.

첫째, 역량을 보여줄 수 있습니다. “우리 모델이 테스트를 벗어나 실제 시스템을 손상시켰다”는 충격적인 고백이지만, 동시에 모델이 비정상적으로 강력하다는 증거로도 읽힙니다. 이 사고는 의도적이든 아니든 제품 시연이 됩니다.

둘째, 기업이 규제기관, 고객 또는 언론이 이야기를 만들기 전에 서사를 형성할 수 있게 합니다. 조직은 용어를 정의하고, 테스트 조건을 설명하며, 해결 방안을 구성합니다.

셋째, 반복적인 공개는 해당 행동을 정상화할 위험이 있습니다. 모든 주요 AI 연구소가 에이전트가 경계를 넘어 실시간 시스템을 손상시켰다고 보고한다면, 업계는 이를 진행의 불가피한 부작용으로 받아들일 수 있습니다.

이는 표준이 될 수 없습니다. 제가 대화하는 CISO들은 예방 통제가 왜 활동을 차단하지 못했는지 알고 싶어합니다. 그들은 모델의 접근을 누가 승인했는지, 어떤 경계가 적용됐는지, 행동이 어떻게 모니터링됐는지, 그리고 제3자에 도달하기 전에 누군가 이를 멈출 수 있었는지 묻습니다. 이는 커뮤니케이션 질문이 아니라 책임 질문입니다.

공개는 책임의 시작이다

사이버 보안 분야는 이미 사고를 알리는 것이 이를 처리하는 것과 동일하지 않다는 것을 배웠습니다. 신뢰할 수 있는 공개는 무슨 일이 일어났는지, 누가 영향을 받았는지, 대응자가 어떻게 이를 억제했는지, 어떤 통제가 실패했는지, 그리고 다음에 유사한 활동을 방지하기 위해 무엇을 할 것인지를 설명합니다.

AI 에이전트의 경우, 이 기준은 더 나아가야 합니다. 에이전트는 예측 가능한 경로를 따르지 않습니다. 그들은 추론하고, 도구를 선택하며, 상황에 맞게 적응합니다. 정당한 목표가 모든 단계가 정당함을 보장하지는 않습니다. 조직은 에이전트가 접근할 수 있는 범위, 호출할 수 있는 도구, 수행할 수 있는 행동을 규정하는 예방 통제와 에이전트가 실제로 수행하는 일을 지속적으로 모니터링해야 합니다.

이 작업은 배포 전에 시작되어야 합니다. 리더들은 에이전트 워크플로에 대한 위협 모델링, 최소 권한 접근, 외부 연결에 대한 명시적 제한, 테스트 환경에 대한 독립적인 검증, 실시간 정책 시행 및 인간 개입을 위한 명확한 지점을 요구해야 합니다. 첫 번째 공개 사고 이후에 예방 조치를 추가할 수는 없습니다.

리더들은 지금 바로 다음에 일어날 일을 결정해야 한다

AI 에이전트를 도입하는 모든 기업은 결국 이와 같은 순간을 맞이할 수 있습니다. 조직은 에이전트가 접근해서는 안 되는 정보에 접근했거나, 권한을 초과해 행동했거나, 외부 시스템에 예상치 못하게 도달했음을 발견할 수 있습니다.

지금 바로 무엇을 공개할지, 누구에게, 어떤 조건에서 공개할지를 결정하십시오. 더 중요한 것은 그와 함께 수반되는 책임을 정의하는 것입니다. 에이전트의 행동은 누가 책임지나요? 누가 접근을 차단할 수 있나요? 어떤 증거를 보존할 것인가? 시스템이 다시 온라인으로 돌아가기 전에 어떤 통제를 추가할 것인가?

AI 실패를 신속히 공개하는 것은 더 건강하고 개방적인 산업을 나타낼 수 있습니다. 그러나 고백만으로는 전체 이야기가 될 수 없습니다.

신뢰는 단순히 인정만으로 구축되지 않습니다. 사고를 예방했어야 할 통제, 사고 직후 취해진 조치, 그리고 동일한 실패가 다시 발생하지 않을 것이라는 증거가 신뢰를 구축합니다.

Adam Ely는 Check Point에서 AI 에이전트 보안 총괄 매니저로 재직하며 AI 보안 팀을 이끌고 있습니다. 이 직책을 맡기 전, Ely 씨는 Fidelity Investments에서 CISO로 근무했으며 이후 Fidelity의 디지털 그룹을 이끌었으며, 여기에는 AI 제품 및 COE 그룹이 포함됩니다.

그는 Walmart에서 부 CISO 및 전자상거래 CISO 역할을 수행했으며, 2016년에 인수된 Bluebox Security를 공동 설립하고, Salesforce와 The Walt Disney Company에서도 유사한 역할을 맡았습니다.

이러한 역할 외에도 Ely 씨는 핀테크 기업 Akoya의 이사회에 참여했으며, 이전에 Columbia University에서 기업 위험 관리 강의를 했습니다.