사상 리더
AI 스택은 설계 자체로 인해 취약점이 있습니다.

네 가지 실패. 네 가지 계층. 아키텍처 자체가 취약점입니다.
최근 2026년 4월 10일 뉴욕 타임즈의 Hard Fork 팟캐스트는 고급 AI 시스템의 사이버 보안 영향과 산업이 피하고 있는 질문을 조사했습니다. 사이버 보안이 부실하지 않고 근본적으로 잘못된 프레임워크인지에 대한 질문입니다.
이 에피소드는 여러 사건이答案을 무시하기 어렵게 만들기 몇 주 전에 방영되었습니다. 한 달 동안, 자율 AI 에이전트는 McKinsey의 내부 AI 플랫폼에 2시간 이내에 침입했습니다. 광범위하게 사용되는 오픈 소스 AI 라이브러리에 대한 공급망 공격이 하위 기업으로 확대되었습니다. 연구자들은 마지막 방어선인 것으로 여겨지는 하드웨어를 1,000달러 미만의 오프 더 셀프 부품으로 손상시킬 수 있음을 보여주었습니다. 또한 Anthropic은 한 프론티어 모델이 산업이 안정적인 것으로 여겼던 코드에서 수천 개의 0일 취약점을 자율적으로 발견했으며 많은 경우에 대해 작동하는 악용 코드를 생성할 수 있음을 공개했습니다.
네 가지 사건, 네 가지 계층: 애플리케이션, 오케스트레이션, 하드웨어, 운영 체제. 각 계층은 보호를 위한 설계된 컨트롤의 의미 있는 제한을 노출했습니다.
퍼리미터 사고의 종말
전통적인 사이버 보안은 하나의 전제에 기반합니다. 충분한 컨트롤, 모니터링, 투자로 시스템을 보호할 수 있다는 전제입니다. 이 전제는 수십 년 동안의 아키텍처를 형성했으며, 방화벽, ID 관리, 엔드포인트 보안, SIEM 플랫폼 등이 모두 이러한 아이디어에 기반합니다. 즉, 가시성과 엄격한 관리가 안전을 의미한다는 것입니다.
산업은 제로 트러스트 아키텍처로의 이동을 반영하며, 전통적인 네트워크 경계가 더 이상 신뢰할 수 없다는 것을 인식하기 시작했습니다. 그러나 트러스트 모델이 진화함에 따라 AI 시스템은 다른 도전을 제기합니다. 즉, 민감한 데이터가 여러 계층에서 집계, 처리, 공유됩니다.
이 접근 방식은 시스템이 상대적으로 중앙화되어 데이터가 명확한 경계 내에 남아 있는 경우에는 의미가 있었습니다. 그러나 데이터가 클라우드, API, 제3자 공급자, AI 파이프라인을 통해 지속적으로 이동하고 사용자와 컴퓨팅 리소스가 전 세계에 분산되는 경우에는 훨씬 덜 효과적입니다. 퍼리미터는 더 이상 경계가 아닙니다. 그것은 끊임없이 변하는 표면이며, 우리는 여전히 제어할 수 없는 시스템에 대한 컨트롤 기반 사고를 적용하고 있습니다.
애플리케이션 계층 실패: McKinsey의 Lilli
2026년 3월 9일, 보안 스타트업 CodeWall은 내부적으로 AI를 배포하는 조직에 대한 위험을 강조하는 공개를 발표했습니다.
CodeWall의 자율 오펜시브 에이전트는 자격증, 내부 지식, 인간의 지침 없이 McKinsey의 내부 AI 플랫폼인 Lilli의 프로덕션 데이터베이스에 대한 읽기 및 쓰기 액세스를 2시간 이내에 얻었습니다. Lilli는 40,000명 이상의 직원이 전략 작업, 클라이언트 연구, 문서 분석을 위해 사용하며, 매월 수십만 개의 프롬프트를 생성합니다.
진입점은 정교하지 않았습니다. 에이전트는 인증이 필요한 22개 엔드포인트 중 200개 이상의 공개 노출 API 문서를 발견했습니다. 취약점은 OWASP Top 10 for LLM Applications에서 강조한 것과 유사합니다. 특히 노출된 인터페이스, 보안 통합, 연결된 시스템에 대한 과도한 신뢰와 관련이 있습니다.
그 중 하나의 엔드포인트에는 JSON 필드 이름에서 입력 값에서보다 자동화된 스캐너가 일반적으로 찾는 곳에 숨겨진 SQL 인젝션 취약점이 포함되어 있었습니다. 에이전트는 블라인드 SQL 인젝션을 통해 반복하여 프로덕션 데이터에 액세스할 수 있었습니다.
액세스한 내용: 수십억 개의 채팅 메시지, 수십만 개의 파일, 수만 개의 사용자 계정, 수백만 개의 RAG 문서 조각, 수년간의 독점 연구를 나타냅니다. 또한 사용자마다 Lilli의 동작을 제어하는 시스템 프롬프트를 식별했습니다.
가장 경고적인 발견은 볼륨이 아니었습니다. 시스템 프롬프트가 쓰기 가능하다는 것이었습니다. 공격자는 데이터베이스 업데이트만으로도 전략적 조언을 독성화하거나, 기밀 데이터를 응답에 포함하거나, 완전히 가드레일을 제거할 수 있었습니다. 배포, 코드 변경, 애플리케이션 로그에 대한 추적이 필요하지 않았습니다.
McKinsey는 공개 성명에서 이 문제를 수시간 이내에 해결했으며, 제3자 포렌식 회사에 의해 수행된 조사에서 클라이언트 기밀 데이터에 액세스한 증거가 없음을 발견했다고 밝혔습니다. 이러한 반응은 중요합니다. 그러나 구조적인 교훈을 변경하지 않습니다. 즉, 수십 년 된 취약성 클래스가 현대 AI 시스템의 운영 메모리를 노출시켰으며, 그 뒤에 있는 데이터가 읽을 수 있는 형태로 존재했기 때문입니다.
오케스트레이션 계층 실패: LiteLLM 공격
세 주 후, 동일한 패턴이 다른 각도에서 나타났으며, 다른 계층을 통해 나타났습니다.
LiteLLM은 수천 개의 회사에서 AI 제공업체에 요청을 라우팅하는 데 사용되는 오픈 소스 AI 게이트웨이입니다. 스택에서 위치는 중요합니다. 오케스트레이션 계층에 있으며, 연결된 모든 제공업체에 대한 API 키를 보유합니다. 이 계층에서 발생하는 모든 취약점은 통합된 모든 서비스에 대한 자격증을 노출합니다.
PyPI 사고 보고서에 따르면, 위협 행위자 그룹 TeamPCP는 LiteLLM의 CI/CD 파이프라인에 연결된 종속성에 연결된 자격증을 악용하여 LiteLLM 패키지의 백도어 버전을 PyPI에 직접 게시했습니다. 오염된 버전은 제거되기 전에 1시간 미만 동안 라이브 상태에 있었습니다. 이 작人は 연구자의 머신이 충돌한 악성 코드의 버그로 인해 발견되었습니다.
공급망은 벡터였습니다. 오케스트레이션 계층은 목표였습니다. 업스트림의 단일 종속성을 손상시킴으로써 공격자는 모든 하위 회사 제공자 키가 존재하는 계층에 도달했습니다.
Litellm 팀은 이후 사고와 완화 노력에 대해 공개 GitHub 공개를 통해 자세히 설명했습니다.
폭발 반경은 거의 즉시 나타났습니다. TechCrunch, Fortune, The Register는 OpenAI, Anthropic, Meta, Google와 협력하는 100억 달러의 AI 채용 스타트업인 Mercor가 영향을 받은 회사 중 하나라고 보고했습니다. 공격자는 대량의 데이터, 후보자 프로필, 개인 식별 정보, 계약자 비디오 인터뷰, 소스 코드 및 API 키를 얻었다고 주장했습니다. Meta는 조사 중에 Mercor와의 작업을 일시 중단했습니다. 후속 보고서는 다른 개발자 도구와 패키지에서 유사한 악성 코드 패턴이 나타났으며, 이 작전이 단일 프로젝트를 넘어서 확대되었을 수 있음을 시사했습니다.
LiteLLM 사건은 비정상적인 사건이 아니었습니다. 그것은 시스템이 설계된 대로 작동하는 것이었습니다. AI 파이프라인의 모든 구성 요소는 기능을 수행하기 위해 사용 가능한 데이터에 액세스할 수 있어야 하므로, 모든 구성 요소는 또한 잠재적인 추출 지점이 됩니다. 종속성을 고정하고 자격증을 회전시키는 것은 필요한 반응이지만, 그것은 사건을 해결하며, 아키텍처를 해결하지 않습니다.
하드웨어 계층 실패: TEE.fail
McKinsey 침해가 애플리케이션 계층이 신뢰할 수 없음을 보여주었고, LiteLLM 공격이 공급망이 신뢰할 수 없음을 보여주었다면, TEE.fail 연구는 두 가지 모두를 보완할 수 있는 하드웨어가 완전히 신뢰할 수 없음을 보여주었습니다.
2025년 10월 28일, 조지아 테크, 퍼듀 대학교, Synkhronix의 연구자들은 TEE.fail을 발표했습니다. 이는 DDR5 서버에서 물리적 메모리 버스 인터포지션을 사용하여 트러스트드 실행 환경에서 암호화 키를 추출하는 사이드 채널 공격입니다. 이 공격은 Intel SGX, Intel TDX, AMD SEV-SNP를 포함하여 완전히 패치된, 신뢰된 상태의 시스템에 영향을 미칩니다. 이러한 기술은 일반적으로 기밀 컴퓨팅의 기초로 홍보됩니다.
연구자들은 확인 키를 추출했습니다. 즉, 안전한 환경 내에서 실행 중인 워크로드를 확인하는 데 사용되는 암호화 자료입니다. 이러한 키로 공격자는 시스템을 신뢰할 수 있는 것으로 나타낼 수 있으며, 예상된 보호를 벗어난 상태에서 작동할 수 있습니다. 연구자들은 직접 이를 시연했습니다. 즉, TDX 확인을 BuilderNet의 기밀 트랜잭션 데이터에 액세스하기 위해 위조하고, Intel 및 NVIDIA 확인을 위조하여 TEE 외부에서 워크로드를 실행하는 동안 합법적인 것으로 보이게 했습니다.
NVIDIA에 대한 함의는 특히 AI에 중요합니다. CPU 확인에 의존하는 GPU 확인이므로, 신뢰 체인이 손상된 CPU는 기밀 AI 추론 환경에서 제공하는 보장을 약화할 수 있습니다. 하드웨어 기반 보안의 기초인 기밀 AI 추론의 하드웨어 기초는, 이 위협 모델에서, 확인 체인이 손상된 CPU에 조건적으로 의존합니다.
하드웨어 벤더는 공식 고지를 통해 대응했습니다. AMD는 물리적 액세스 공격이 표준 위협 모델 외부에 있다고 말하며, 펌웨어 업데이트를发布하지 않을 것이라고 밝혔습니다. Intel과 NVIDIA는 발견을 인정하고, 완화 작업을 진행 중이라고 밝혔습니다. 이러한 반응은 그들의 위협 모델 내에서 합리적입니다. 그러나 중요한 경계를 강조합니다. 즉, 하드웨어 기반 보안의 보장은 물리적 제어를 포함한 가정에 의존하며, 주권적, 규제된, 적대적 인 접근을 받는 배포에서는 항상 이러한 가정들을 만들 수 없습니다.
TEE.fail은 하드웨어 분리를 무의미하게 만들지 않습니다. 그것은 조건적이라는 것을 보여줍니다.
OS 계층 실패: Mythos Revelation
첫 세 번의 사건이 애플리케이션 계층, 오케스트레이션 계층, 하드웨어 계층을 의문시킨다면, 2026년 4월에 발생한 네 번째 공개는 모든 계층 아래에 있는 계층, 즉 모든 다른 계층이 실행되는 운영 체제와 핵심 라이브러리를 의문시켰습니다.
2026년 4월 7일, Anthropic은 Claude Mythos Preview를 발표했으며, 이는 공개적으로 출시되지 않았으며, 공격적 보안 기능이 포함되어 있었습니다. 또한 Project Glasswing을 시작했으며, 이는 AWS, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorgan Chase, Linux Foundation, Microsoft, NVIDIA 및 Palo Alto Networks와의 컨소시엄입니다. Anthropic은 Mythos가 주요 운영 체제와 웹 브라우저에서 이전에 알려지지 않은 수천 개의 취약점을 자율적으로 식별했으며, 많은 경우에 대해 작동하는 악용 코드를 생성할 수 있음을 보고했습니다.
구체적인 발견은 요약보다 더 어려운 것으로 판명되었습니다. 27년 된 OpenBSD 버그, FreeBSD의 NFS 서버에서 원격 코드 실행 취약점, FFmpeg에서 16년 된 취약점 등이 있습니다. 마지막 경우, 공식적인 보안 훈련이 없는 Anthropic 엔지니어가 모델에게 원격 코드 실행 취약점을 찾도록 요청했으며, 완전한 작동 악용 코드와 함께 깨어났습니다.
이것은 운영 체제 수준의 발견입니다. OpenBSD와 FreeBSD는 커널입니다. NFS는 커널 네트워크 서브시스템입니다. FFmpeg은 인터넷에서 가장 널리 배포되는 미디어 라이브러리이며, 대부분의 Linux 배포판과 함께 제공되며, 인터넷을 통해 미디어 파이프라인을 지원합니다. OS 계층이 안전하다고 가정한 이유는 그것이 이미 보안으로 입증되었기 때문이 아니라, 깊은 결함을 찾는 데는 희귀하고 비싼 인간 전문 지식이 필요했기 때문입니다. 그 가정이 사용할 수 있는 최선의 유추였습니다. 그것은 보장이 아니었습니다.
그 제약이 이제 완화되었습니다. Anthropic은 이것을 이중 사용으로 프레임했습니다. 즉, 취약점을 대규모로 찾고 패치하는 것과 같은 기능이 잘못된 손에 들어가면 그們을 대규모로 악용할 수 있습니다. Anthropic의 프로젝트 글래스윙을 통해 접근을 제한한 결정은 그 현실을 반영합니다. 그러나 그것을 해결하지는 않습니다. 유사한 기능이, 회사의 kendi 평가에 따르면, 확산될 것입니다. 레거시 코드를 감사하는 비용이 붕괴했으며, 그와 함께 그러한 코드가 너무 오래되거나 너무 널리 검토되어서 중요한 결함을 여전히 포함하고 있지 않을 것이라는 암시적인 방어가 붕괴되었습니다.
이것은 또한 네 가지 사건이 합쳐지는 곳입니다. 하드웨어 계층의 기밀 컴퓨팅 보호는 고립되어 작동하지 않습니다. 커널 코드로 작동합니다. Intel TDX는 커널에서 작동하며, NVIDIA의 GPU 드라이버는 커널 모듈로 작동합니다. CPU TEE 확인 체인은 신뢰할 수 있는 운영 체제에 의존하여 무엇을 하고 있는지 신뢰할 수 있게 보고합니다. OS 계층이 수십 년간 잠재적인 취약점을 가지고 있으며, 프론티어 모델이 기계 속도로 찾을 수 있다면, 하드웨어 계층의 조건부 보안은 취약해진 보안 보장을 가진 OS 계층에 의존합니다.
McKinsey 침해는 20년 이상 존재하는 SQL 인젝션 취약성 클래스를 악용했습니다. Mythos 클래스의 모델이 대규모로 찾을 수 있는 취약성은 바로 그와 같은 것입니다.

패턴
모든 경우에 데이터는 중요한 순간에 평문으로 존재했습니다.
애플리케이션 계층은 데이터를 평문으로 처리했습니다. 오케스트레이션 계층은 데이터를 평문으로 라우팅했습니다. 하드웨어 계층은 보호에도 불구하고, 최종적으로 실행 지점에서 복호화를 필요로 했습니다. OS 계층은 정의에 따라 모든 세 가지 계층 아래에서 평문으로 작동했습니다. 네 계층, 네 가지 실패, 그리고 모든 계층에서 동일한 조건이 유지되었습니다. 즉, 침해가 발생했을 때, 데이터는 읽을 수 있었습니다.
이것은 분리된 실패의 집합이 아닙니다. 그것은 아키텍처 자체입니다.
현대 AI 시스템은 읽을 수 있는 데이터에서 작동하도록 설계되었습니다. 검색, 라우팅, 추론, 툴 실행을 포함한 모든 계층은 평문 액세스를 기능하도록 요구합니다. 이러한 설계 선택은 모든 계층에서 침해가 발생할 때마다 뒤에 있는 데이터가 노출됨을 의미합니다.
질문은 어느 계층이 손상될지에 대한 것이 아닙니다. 공격자가 손상되었을 때 무엇을 찾을지에 대한 것입니다.
가정된 침해에서 0 노출로
산업은 이미 “침해를 방지”에서 “침해를 가정”으로 이동하기 시작했습니다. 그러나 대부분의 아키텍처는 이러한 의미를 따르지 않았습니다.
침해가 불가피하다면, 실제 질문은 침해를 방지하는 방법이 아니라, 침해자가 침해했을 때 발생하는 일입니다. 현재의答案은 간단합니다. 즉, 데이터를 얻습니다. 모든 보안 인프라 투자에도 불구하고, 데이터는 가치가 있는 순간, 즉 사용 중일 때 여전히 노출됩니다.
산업의 반응은 예측 가능했습니다. 즉, 더 많은 모니터링, 더 빠른 탐지, 추가적인 기밀 컴퓨팅 계층 등이 필요하다는 것입니다. 이러한 것은 개선 사항입니다. 그러나 핵심 문제를 해결하지는 않습니다. 여전히 어느 계층, 소프트웨어, 하드웨어, 또는 운영 체제가 평문을 안전하게 유지할 수 있다고 가정합니다.
대안은 평문을 완전히 제거하는 것입니다. 데이터 주변의 계층을 보호하는 것이 아니라, 데이터 자체를 누구든지 도달할 수 없도록 만드는 것입니다. 암호화된 데이터에서 계산을 수행하는 경우, 즉 프롬프트, 모델 가중치, 출력이 파이프라인 전체에서 암호화된 상태로 유지되는 경우, 이러한 사건에서 악용된 노출을 해결할 수 있습니다.
완전한 동형 암호화 및 기타 프라이버시 보존 컴퓨팅 기술의 발전은 실제 AI 워크로드에 대한 평문 노출을 최소화하거나 제거하는 아키텍처를 점점 더 실용적으로 만들고 있습니다. 아직도 중요한 성능, 확장성, 구현挑戰이 남아 있지만, 목표는 전통적인 보안 컨트롤과 근본적으로 다릅니다. 즉, 성공적인 침해의 가치를 줄이는 것보다 침해를 덜 가능하게 만드는 것입니다.
이동은 하나의 보안 도구에서 다른 도구로의 이동이 아닙니다. 시스템을 보호하는 것에서 노출을 줄이는 것입니다. 신뢰할 수 있는 인프라에서 0 신뢰 데이터로의 이동입니다. 위험을 관리하는 것에서 공격 표면 자체를 최소화하는 것입니다.
다음은 무엇인가?
Hard Fork 토론은 사이버 보안이 근본적으로 잘못된 프레임워크인지에 대한 질문을 제기했습니다. 최근 몇 주간의 증거는 AI의 경우에는 그렇다는 것을 시사합니다.
오래된 모델은 시스템을 보호할 수 있으며, 침해를 포함할 수 있으며, 노출을 관리할 수 있다고 가정했습니다. 나타나는 현실은 침해를 가정하고 노출을 최소화해야 한다는 것입니다. 여기서 설명된 사건은 AI 시스템을 보호하는 것이 점점 더 노출을 줄이는 것에 의존할 수 있음을 시사합니다.
이 네 가지 사건의 취약점은 단일 계층에 국한되지 않습니다. 그것은 시스템적입니다. 그것들을 해결하려면 점진적인 개선만으로는 충분하지 않습니다. 시스템을 보호하는 것에서 노출을 줄이는 것으로의 이동이 필요합니다. 데이터周囲의 퍼리미터를 방어하는 것에서 평문을 보호하기 위해 만들어진 퍼리미터를 제거하는 것입니다.
AI 보안은 더 이상 침해를 방지하는 것이 아닙니다. 그것은 침해자가 침해했을 때, 그리고 침해할 것입니다, 읽을 수 있는 것을 찾을 수 없도록 하는 것입니다.
uire a shift from securing systems to reducing exposure, from defending the perimeter around the data to removing the plaintext the perimeter was built to protect. AI security is no longer about keeping attackers out. It is about ensuring that when they get in, and they will, there is nothing readable for them to find.












