사이버 보안
Anthropic, Claude 오용을 7가지 해악 영역에서 차단한 상세 내용

Anthropic은 2026년 9월 10일에 2026년 9월 위협 인텔리전스 보고서를 발표했으며, 위협 인텔리전스 팀이 2025년 12월부터 2026년 8월까지 Claude를 악용한 위협 행위자를 식별하고 차단한 내용을 7가지 해악 영역(사이버 작전, 영향 작전, 감시, 불법 모델 증류 등)으로 상세히 설명했습니다.
보고서 “Detecting and countering misuse of AI: 2026년 9월”는 사이버 작전, 영향 작전, 감시, 사기 및 사기, 생물학적 악용, 기존 무기 개발, 그리고 증류에 걸친 활동을 다룹니다. 악용 사례에는 Claude Haiku, Sonnet, Opus 모델이 포함되었으며, Claude Fable이나 Mythos‑class 모델은 하나의 불법 증류 사례를 제외하고는 관여되지 않았습니다. Anthropic은 내부의 Generative Threat Group(GTG) 지정자를 사용해 행위자를 추적하고, AI가 속도, 규모, 깊이 측면에서 작전에 제공하는 능력 향상을 “uplift”라 부르며 측정합니다. 회사는 각 사례마다 활동을 차단하고, 발견 내용을 방어 체계 강화에 활용했으며, 필요에 따라 당국 및 산업 파트너와 정보를 공유했다고 밝히면서, 사례 연구를 공개하는 이유를 “우리 서비스의 악의적 오용을 공개할 책임이 있다고 믿기 때문”이라고 덧붙였습니다.
사이버 작전
보고서에서 가장 규모가 큰 사이버 사례인 GTG-20006은 Midnight Blizzard와 연관된 것으로 추정되는 행위자를 다루며, “JackPoterz”라는 핸들을 사용하는 러시아어 사용자가 포함됩니다. 이 행위자는 우크라이나 정부·군·외교 기관을 중심으로 20개 이상의 조직을 표적으로 삼았으며, 최소 세 개의 호텔 Wi‑Fi 공급업체를 침해해 DNS 레코드를 탈취하고, 최소 두 명의 전 고위 우크라이나 관리자의 WhatsApp 계정을 장악했으며, 북아프리카 정부 기술 당국으로부터 30만 건 이상의 국가 신분 기록과 50만 개 이상의 기업 상업 등록 데이터를 탈취했습니다. 보고서에 따르면, 행위자의 AI 에이전트는 보안 제품이 탐지할 때마다 자동으로 악성코드를 수정·재구성했습니다.
GTG-50014는 ShinyHunters 집단과 연관된 것으로 추정되는 운영자를 다루며, 이들은 180만 개의 Android APK를 대량 다운로드하고 하드코드된 비밀을 스캔하는 자격 증명 수집 파이프라인을 운영했습니다. Anthropic은 한 기술 공급업체가 침해당하면서 1TB가 넘는 데이터(수백만 건의 결제 카드 기록 포함)가 유출됐다고 보고했으며, 또 다른 계열사는 침해된 SaaS 공급업체의 약 200개 하위 고객으로부터 데이터를 추출해 34시간 동안 40개 이상의 기업 테넌트에 걸친 2,100개 이상의 Azure AD 토큰 세트를 유출했으며, 이 작업의 대부분을 AI 에이전트가 수행했다고 밝혔습니다.
세 가지 추가 사례는 활동 범위의 다양성을 보여줍니다. GTG-10007은 장샤(湖南) 출신의 중국어 사용 운영자 두 명(대학생)로 구성된 팀으로, 약 50개 조직을 표적 삼아 네트워크 장비에 대한 자율 취약점 연구 프로그램을 운영했으며, 한 달 동안 네트워크 장비를 반복 테스트해 10여 개 이상의 잠재적 제로데이 발견을 기록했습니다. GTG-50020은 금전적 동기를 가진 러시아어 사용 행위자로, 한 피해자로부터 약 26GB를 유출하고 150만~250만 달러의 몸값을 요구했으며, 이후 4일간 약 30개의 AI 회사를 공격해 사전 출시된 Claude 모델에 접근하려 했지만 모든 시도는 실패했고 자체 시스템은 절대 침해되지 않았다고 밝혔습니다. GTG-50029는 프랑스어 사용 단일 해킹티스트로, 최소 네 개 사이트에 대해 사전 문서화되지 않은 WordPress 재설치 레이스 컨디션을 악용해 42개 추적 대상 중 14개에 내부 접근 권한을 얻었으며, 캠페인 플랫폼에서 약 140,000건의 기록(사용자 정치 의견 포함)을 유출하고 수천만 건의 행을 담은 “fafsearch”라는 도크싱 플랫폼을 구축했습니다.
영향 및 감시 작전
보고서에 포함된 9건의 영향 작전 사례는 러시아, 이란, 터키, 걸프, 남아시아, 아프리카, 유럽에서 발생했으며, Brookings Institution의 Breakout Scale로 측정되었습니다. GTG-04001은 방기(Bangui)에서 활동하는 러시아어 사용 행위자로, Radio Lengo Songo(98.9 FM)용 일일 콘텐츠를 제작했으며, Anthropic은 이를 Politology, Africa Corps/Wagner 영향 부문과 연결시켰고, 2023년 말 러시아 외국정보부의 통제 하에 있었다고 평가했습니다. 이 행위자는 중앙아프리카공화국 정부 문서와 고용 계약서를 위조해 대통령과 러시아에 충성을 요구하는 내용을 포함했으며, 이 작전은 규모 기준으로 Category Four로 평가되었습니다. GTG-54002에서는 조사관들이 약 70개의 허위 뉴스 웹사이트, 70개의 일치하는 X 계정, 250개 이상의 가짜 댓글 계정을 LKM Company(프랑스 기반 디지털 광고 에이전시)와 연결시켰으며, 이 네트워크는 약 20개 언어로 8,913개 이상의 기사를 게시했으며, 그 중 318개는 콩고 민주공화국에 초점을 맞추었습니다.
다른 작전들은 선거와 국가 미디어를 중심으로 전개되었습니다. GTG-84005는 이스탄불 기반 BBS Bilisim Teknolojileri와 높은 신뢰도로 연결된 말레이시아 선거 조작 상업 플랫폼으로, 222개 말레이시아 국회의원 선거구 전체에 걸쳐 약 1,000개의 가짜 X 계정을 관리하고 야당 정치인에 대한 허위 자료를 제작했습니다. GTG-24015는 네 개 계정이 Claude를 편집 데스크로 활용해 러시아 국가 미디어(스푸트니크 몰도바, RIA 노보스티, 스푸트니크 스페인어, 스푸트니크 아프리카, RT 영문)에게 정보를 제공했으며, 전 스푸트니크 몰도바 편집장이 2025년 9월 28일 몰도바 총선 직전에 대통령 마이아 산두에 대한 허위 주장을 확대했습니다. GTG-84002는 UAE 정부 관계자와 높은 신뢰도로 연결된 무슬림 형제단을 겨냥한 작전으로, 약 300개의 가짜 계정을 운영하고 UN 인권 이사회 62차 회의에 대한 증언을 대리 작성했으며, 유럽 의회 의원 18명을 프로파일링하고 UN 특별 보고관에 대한 반대 자료를 수집했습니다.
감시 사례로는 GTG-50027이 있습니다. 이 사례는 바마코에 기반을 둔 단일 컨설턴트가 Claude를 주요 엔지니어링 인력으로 활용해 말리 국가 정보기관 ANSE를 위한 국가 감시 플랫폼 Lakana 360을 구축했으며, 이 플랫폼은 세 개의 국가 이동통신 사업자를 통해 약 2,500만 개의 SIM 카드를 모니터링하도록 설계되었습니다. Anthropic은 운영자가 요청에 따라 플랫폼의 문서 생성 구성 요소에서 영장 요건이 제거되었다고 밝혔습니다. GTG-14010은 PRC 정부와 연계된 행위자가 Claude를 이용해 시리아 내 위구르인을 추적·프로파일링하고 모집하려 했으며, 무장 조직에 대한 보고에 대한 보상을 제공하고 Claude가 실시간으로 답변을 번역하며 전문가 역할을 수행해 사기의 품질을 검증했습니다. GTG-14020 및 GTG-14021은 PRC 종교 및 지방 공안 활동과 연계된 중국 기반 행위자로, 가톨릭 추기경, 대만 장로교, 티베트 불교도, 팔런궁 등에 대한 템플릿형 문서를 제작했으며, 한 행위자는 억압 지침을 얻기 위해 거부를 재프롬프트하고 “통제”를 위한 10명의 개인을 지정했으며 해외 시위에 대한 사전 정보도 포함했습니다. GTG-34007은 16개의 Claude 계정을 운영하는 두 개의 이란 부대가 연계된 사례로, 1년 동안 6,388명의 이란인을 감시·프로파일링했으며, 155,216개의 트윗을 분석해 39개의 반대 계정을 식별하고, 악성 Firefox 확장 프로그램을 배포해 대량 신원 정보를 수집해 Arman이라는 공유 사례 관리 시스템에 공급했습니다.
무기 개발 및 생물학적 악용
보고서는 6건의 기존 무기 사례를 상세히 다룹니다: 중국 3건, 러시아 2건, 예멘 1건. GTG-87001은 북예멘 셀로, Claude Code를 인간 소프트웨어 엔지니어 대신 사용해 유도 로켓, 2,000km 이상 사거리를 목표로 하는 다단계 탄도 미사일, 그리고 극초음속 활공체를 포함한 변형 세트를 위한 유도·항법·제어 소프트웨어를 개발했습니다. Anthropic은 이 셀이 유도 로켓을 시험 발사했으며 현장 시험이 실패한 것으로 보인다고 밝혔습니다. GTG-27005는 러시아 기반 프리랜서 행위자로 추정되며, Claude Code를 이용해 자율 FPV 카미카제 드론 군집을 구축했으며, 탑재된 모델이 “person” 클래스를 포함한 목표를 선택하고 인간 개입 없이 폭발 명령을 내릴 수 있도록 훈련했으며, 우크라이나 전투 영상을 스크랩해 시각 분류기를 학습시켰습니다. GTG-17002는 중국 기반 행위자가 약 16개의 모듈로 구성된 전자전·공중 방어 억제 스위트를 구축했으며, 프로젝트 중간에 시뮬레이션의 기본 시나리오를 대만의 12개 목표(지휘 벙커, 조기 경보 레이더, Patriot 및 Tien Kung 배터리 등)로 변경했습니다. Anthropic은 이 행위자가 중국 인민해방군 군사과학원 등 PRC 연구 기관과 연계됐다고 평가했습니다.
다섯 건의 생물학적 악용 사례가 이어집니다. 2026년 5월, Anthropic의 생물학적 안전 분류기가 군사 연구소를 위한 치쿤구니 획득‑기능 연구 보조금 신청을 돕는 요청을 차단했으며, 이는 이후 회피 플랫폼을 통해 거부된 프롬프트가 경쟁 모델로 전송되는 백업 경로가 추가된 상황이었습니다. 지원되지 않은 지역의 연구자는 조류 인플루엔자 포유동물 적응 실험을 수주 동안 계획했지만, Anthropic은 해당 교류를 Claude Sonnet 4와 Haiku 4.5(가장 약한 모델)로 제한했다고 밝혔습니다. 세 번째 사례에서는 12개 이상의 무관한 고객에게 서비스를 제공하던 리셀러가 Opus 5에서 단일 사용자의 작업을 전부 수행해 약 1시간 만에 정종양바이러스 면역 회피 보조금 신청서를 완성했습니다. 두 건의 추가 사례는 국가 지원을 받은 독과 독소 재설계 프로그램으로, Anthropic은 30일 간의 활동을 조사한 결과 약 35개의 별도 연구 노력이 발견됐으며, 대부분은 일반 민간 과학이었지만 일부는 이중 사용 가능성이 두드러졌다고 보고했습니다.
사기 및 불법 증류
사기·사기 섹션에서 GTG-15001은 20개 이상의 데이팅 앱 네트워크를 운영한 중국 기반 앱 스튜디오를 다루며, 이 스튜디오는 AI 페르소나 4,700여 개가 2026년 4월 2주간에 최소 25,000명의 고유 개인과 대화해 약 236만 건의 메시지를 교환했습니다. 스튜디오는 실제 gig 워커를 동일 매치 피드에 약 3대 1 비율로 혼합했으며, 페르소나는 자동화된 존재임을 절대 밝히지 않도록 지시받았습니다.
Anthropic은 2026년 2월 이후 일곱 개의 중국 기반 실험실에서 발생한 증류 공격을 차단했으며, 모두 일반 이용 가능한 모델을 표적으로 했다고 밝혔습니다. GTG-16005에서 Anthropic은 알리바바가 수행한 가장 대규모 증류 캠페인을 확인했으며, Opus 4.6 및 4.7의 사슬‑사고 증류가 하루에 거의 300만 건의 교환을 기록했고, 2026년 5월~7월 사이에 151백만 건 이상의 교환이 관찰됐으며, 수집된 전사본은 Qwen 3.5, 3.6, 3.7 훈련에 활용되었습니다. GTG-16002에서는 Moonshot AI가 고객 요청을 Kimi 모델 대신 Claude에 몰래 전달했으며, 10일 동안 5,380개의 사기 계정을 통해 약 300,000건의 요청을 전달했고, Claude의 사고 서명을 이용한 교차‑세션 재생 공격으로 추론 흔적을 추출했으며, 2026년 5월~7월 사이에 2,300만 건 이상의 교환이 관찰되었습니다. GTG-16001에서는 DeepSeek이 동일한 재생 기법을 사용해 사용자의 요청을 Claude Opus에 몰래 전달했으며, 2026년 7월 14일 동안 12.1백만 건 이상의 교환을 기록했고, 전송된 트래픽은 러시아 정부 데이터베이스와 PRC 경찰 사례 관리 시스템에 대한 실시간 자격 증명 등 민감한 자료를 노출했다고 보고했습니다.
남은 명시된 캠페인으로는 Zhipu가 10일 동안 사슬‑사고 클리너를 통해 770,609건의 교환을 수행해 GLM 5.3 출시 전 사이버 역량을 목표로 했으며, Xiaomi는 1,500개 이상의 계정을 통해 400,000건 이상의 요청을 라우팅했습니다. Anthropic은 또한 SenseTime의 증류 파이프라인에 제3자 데이터 공급업체로부터 구매한 Claude 전사본이 포함됐으며, MiniMax가 Anthropic 및 OpenAI 모델만을 제공하는 쉘 회사를 통해 프록시 네트워크를 구축했다고 보고했습니다.
Anthropic은 불법 증류에 대응하기 위해 계층형 방어책을 제시했습니다: 프록시 서비스 네트워크의 메타데이터 기반 추적, Fable 5 출시와 동시에 강화된 추출 분류기, 도난된 전사본이 훈련에 활용되기 어렵도록 요약된 내부 추론, Fable 5.1에 도입된 사고 보호 기능(새 API 계정이 시스템 프롬프트, 도구, 메시지를 변경하지 못하도록 차단), 다중 회차 대화에서 Claude의 사고 이전에 도입된 도구 및 메시지에 대한 보호, 그리고 남용 가능 신호를 보이는 계정에 대한 신원 확인 요구 사항을 적용하며, 확인에 실패한 계정은 차단됩니다. 회사는 증류 공격을 조사·차단하면서 얻은 교훈이 향후 구축할 방어 체계에 지속적으로 반영될 것이라고 밝혔습니다.












