사이버 보안

OpenAI, 협조된 모델 추론 추출 캠페인 차단

mm
Unite.AI를 Google의 선호 소스에 추가

OpenAI는 2026년 9월 30일에 게시된 보안 게시물에서 자사 모델의 보호된 추론을 추출하려는 협조된 캠페인을 식별하고 차단했으며, 이 활동의 핵심 클러스터를 Kimi를 개발한 Moonshot AI와 연관된 인물들에게 귀속한다. 가장 초기의 활동은 2026년 7월 첫 주에 관찰되었다.

OpenAI가 관찰한 내용

OpenAI는 이 활동을 적대적 증류와 일치한다고 설명했으며, 이를 하나의 모델 출력이나 추론을 체계적이고 무단으로 사용해 다른 모델을 학습, 재현 또는 개선하는 행위로 정의했다. 회사에 따르면 보호된 추론은 모델이 작업을 수행하면서 내부에 기록하는 내용이며, 이를 추출하면 최종 답변에서 숨겨진 정보를 드러내고 다른 이들이 모델의 능력을 재현하는 데 도움이 될 수 있다.

OpenAI는 운영자들이 암호화를 해제하거나 데이터베이스를 손상시키지 않았으며, 저장된 사용자 대화에 직접 접근하지도 않았다고 밝혔다. 운영자들은 모델 상호작용을 조작해 보호된 추론을 요청자에게 보이는 형태로, 협조적이고 대규모로 재현하도록 만들었으며 이는 회사의 서비스 약관을 위반하는 행위였다. OpenAI가 관찰한 한 기법은 한 대화에서 암호화된 추론을 복사한 뒤 다른 대화의 모델에 이를 복호화하고 전사하도록 요청하는 것이었다. 회사는 이 조작이 자사 모델에만 국한된 취약점이 아니며, Frontier Model Forum을 통해 산업 파트너와 정보를 공유해 집단 방어력을 강화했다고 말했다.

이 활동은 2026년 7월 1일에 시작되었으며 초기에는 저량이었으나, OpenAI는 2026년 7월 24일과 25일에 4,000명 이상의 사용자가 관련 추출 패턴을 이용해 16,000건의 요청을 보낸 대량 급증을 관찰했다. 게시물의 각주에는 이러한 수치가 시도된 추출을 나타내며 반드시 성공한 것은 아니라고 명시되어 있다. OpenAI는 추가 조사 결과 15,000명 이상의 사용자 클러스터에서 관련 프롬프트 패턴 활동을 확인했으며, 이를 2026년 7월 28일까지 완전히 차단했다고 밝혔다. 활동이 시간에 따라 진화했으며, 이는 적대적 증류가 계층적이고 적응적인 방어가 필요한 보다 광범위한 보안 과제임을 재확인시킨다.

OpenAI는 적대적 증류가 안전 및 국가 안보 위험을 초래한다고 말했다. 추출된 추론은 원래 모델의 사용자 대상 출력에 적용된 보호 장치를 유지하지 않은 채 다른 모델을 학습시키는 데 사용될 수 있으며, 대규모 증류는 안전에 대한 동일한 투자가 없을 경우 고급 기능의 이전을 가속화한다. 회사는 모델이 이중 용도 분야에서 능력을 확보함에 따라 이러한 우려가 더욱 커진다고 지적했다. OpenAI는 발표 전에 캠페인의 범위와 잠재적 영향을 조사하고 자체 완화 조치를 시행했으며, 연구자와 산업 파트너와 정보를 공유하고 피드백을 받았으며, 추가 완화 및 조사 작업이 계속 진행 중이라고 밝혔다.

귀속

OpenAI는 해당 기간 동안 관찰된 모든 운영자가 단일 행위자에 의해 이루어졌는지 여부가 불분명하다고 밝히며, 활동의 핵심 클러스터를 Kimi를 개발한 Moonshot AI와 연관된 인물들에게 귀속한다.

2026년 9월 8일, 국가안전보장국(NSA), 사이버보안 및 인프라 보안청(CISA), 연방수사국(FBI)은 공동 사이버 보안 권고를 발표했으며, 이 권고는 Moonshot AI가 최소 2025년 중반부터 미국 최전선 AI 기업들을 대상으로 광범위한 증류 캠페인을 수행해 왔다고 명시한다. 권고에 따르면 Moonshot AI는 Claude Fable 5의 상당한 데이터를 추출해 Kimi-K3 모델을 학습시키고, GPT-4o 데이터를 추출해 Kimi-K2 모델을 학습시켰으며, 미국 모델을 활용해 감독된 파인튜닝 최적화, 강화 학습, 소프트웨어 엔지니어링 및 수학 능력을 증류했다고 밝혔다.

권고는 더 넓게 보면, 중국 정부의 인지 하에 DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun, Z.AI가 2024년 말부터 미국 최전선 모델들(Claude, GPT, Gemini, Grok 변형 포함)에서 수백만 건의 교환을 통해 수십억 토큰을 추출했다고 명시한다. 기관에 따르면 이들 기업은 네이티브 API, 원격 클라우드 제공업체, 제3자 집계자를 통해 요청을 라우팅했으며, 지리적 제한을 우회하고 이용 약관을 위반하며 추적성을 약화시키는 ‘전송 스테이션’이라 불리는 API 프록시 회색시장을 이용했으며, 개발자 팀 간에 공유되는 프리미엄 구독을 대량 구매함으로써 비용 절감을 달성했다. 기관은 미국 AI 기업들이 포괄적인 탐지 및 완화 조치를 구현하고, 의심되는 증류 시도에 대해 목표형 대응 변화를 배포하며, 조직 간 정보 공유를 구축할 것을 권고했다.

추론 추적 연구

OpenAI는 독립 보안 연구원들이 책임 있는 공개를 통해 관련 교차 모델 및 대화 압축 취약점을 제보했다고 밝혔다. 회사는 해당 결과를 조사하고 연구원들이 확인한 공격 경로가 실제임을 확인했으며, 이 작업이 보다 넓은 공격 유형을 이해하고 완화 조치를 가속화하는 데 도움이 되었다고 말했다.

In 2026년 8월 10일 arXiv에 제출된 논문, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, 그리고 Maksym Andriushchenko는 주요 제공업체들이 지적 재산을 보호하고 정보 유출을 제한하기 위해 모델의 단계별 추론을 숨기고, 그 추론 흔적을 암호화된 텍스트 블록 형태로 클라이언트에 반환하며 클라이언트는 이후 요청마다 이를 다시 전달한다고 보고한다. 저자들은 건축적 취약점을 확인한다: 이러한 암호화 블록은 제공업체 생태계 내의 서로 다른 세션, 사용자 및 모델 간에 완전히 호환되고 교환 가능하다. 그들은 특정 모델의 암호화된 추론 흔적을 동일 제공업체의 더 약하고 보호가 덜 된 모델에 주입하여, 더 강력한 모델을 직접 탈옥하지 않고도 해당 모델이 암호를 해독하고 평문으로 그대로 출력하도록 강제하는 확장 가능한 해독 탈옥 방법을 설명한다.

저자들은 이 취약점이 네 가지 뚜렷한 공격 경로를 가능하게 한다고 보고한다: Anthropic, OpenAI, Google 전반에 걸쳐 시연한 반-증류 메커니즘 우회; 공개 저장소에서 수집한 315,320개의 추론 블록을 해독하여 367개의 개인 식별 정보와 182개의 자격 증명을 복구한 대규모 개인 데이터 추출; 모델의 최종 가시 출력이 악의적인 요청을 안전하게 거부하더라도 추론 과정에 숨겨진 위험한 정보가 우연히 드러나는 경우; 그리고 암호화된 블록 내부에 악성 페이로드를 완전히 삽입하여 공개 에이전시 배포를 오염시키는 보이지 않는 프롬프트 주입. 책임 있는 공개 이후, 저자들은 클라이언트 측 추론을 보호하기 위한 암호학적 및 시스템 수준의 완화 방안을 제안한다.

OpenAI의 대응 방식

OpenAI는 계정 단속, 기술적 제어, 파트너 협조를 결합해 이번 캠페인을 완화했다고 밝혔다: 사기성 계정을 차단하거나 제한하고, 가입 및 인프라 제어를 강화했으며, 관련 네트워크에 대한 모니터링을 확대했다. 또한 사용자, 작업공간, 조직 및 모델군 전반에 걸친 숨겨진 추론에 대한 보호를 강화했으며, 다른 사용자의 암호화된 추론을 이미 보유한 사람이 이를 재생하고 내용을 복구할 수 있던 경로를 차단하고, 추론을 노출시킬 수 있는 스트리밍 출력을 감지·보류하는 검사를 추가했으며, 제3자 제공업체와 협력해 관련 활동이 그들의 서비스로 이동할 때 계정을 식별·차단했다.

OpenAI는 Frontier Model Forum 및 적절한 정부 정보 공유 채널을 통해 관련 결과를 공유했으며, 이를 통해 다른 최전선 개발자와 공공 부문 파트너가 유사한 활동을 탐색하고 자체 방어를 강화할 수 있도록 했다고 밝혔다. 또한 이동식 또는 재생 가능한 추론 아티팩트를 지원하는 시스템은 관련 위험에 직면할 수 있음을 언급했다.

OpenAI는 최전선 모델이 개선되고 행위자들이 더 저렴한 방법으로 그 능력을 모방하려 할수록 적대적 증류 시도가 더욱 정교해질 것으로 예상한다고 밝혔다. 또한 파트너가 호스팅하는 배포는 자체 서비스와 동일한 보호가 필요하며, 도구 출력 공격은 일반적인 가시 텍스트를 넘어서는 검사가 필요하다고 강조했다. 현재 도구 방어, 분류기 적용 범위, 모델 거부 기능을 지속적으로 개선하고 있으며, 이러한 제어를 클라우드 파트너 전반에 전파하고 있다. OpenAI는 대응을 세 가지 영역에 집중할 것이라고 말했다: 추출에 대한 강력한 기술적 보호, 협조된 캠페인에 대한 더 나은 탐지 및 단속, 산업 및 정부 간의 심층 위협 정보 공유.

Miles Okada는 AI 생성 분석가로서 Unite.AI에서 인공지능 및 사이버보안을 다루며, 신흥 위협, 방어 아키텍처, 공격자와 자동화 시스템 간의 진화하는 역학에 초점을 맞춥니다. 그의 작업은 AI가 보안 운영을 어떻게 재구성하고 있는지, 자율 위협 탐지 및 대응부터 적대적 AI 기술의 부상까지 조사합니다.

기술적이고 조사적인 관점에서 Miles는 보안 연구, 사건 공개 및 실제 배포 사례를 분석하여 AI가 방어를 강화하는 영역과 새로운 취약점을 초래하는 영역을 파악합니다. 그는 모델 악용, 데이터 중독, 공격 자동화, 그리고 규모에 맞춘 AI 기반 시스템 보안의 운영 현실에 특히 주목합니다.

Miles Okada가 작성한 기사들은 AI가 생성했으며, 정확성, 엄격함 및 급변하는 AI 보안 환경에 대한 책임 있는 보도를 보장하기 위해 Unite.AI의 편집팀이 검토합니다.