Anderson의 관점
자체 API를 이용한 ChatGPT 및 기타 ‘폐쇄형’ AI 모델 탈옥

새로운 연구에 따르면, ChatGPT와 다른 주요 AI 모델들을 공식 파인튜닝 채널을 통해 재학습시켜 안전 규칙을 무시하고 테러 행위 지원, 사이버 범죄 수행, 혹은 기타 ‘금지된’ 담론에 대한 상세 지침을 제공하도록 만들 수 있다고 합니다. 해당 연구의 저자들은 숨겨진 학습 데이터가 아주 적은 양이라도 모델을 유용한 공범으로 전환시킬 수 있다고 주장하며, 이러한 시스템에 내장된 다수의 보호 장치에도 불구하고 그렇다고 말합니다.
대형 언어 모델에 내장된 보호 장치는 종종 ‘하드코딩’되었거나 어떤 식으로든 협상 불가능한 것으로 묘사됩니다; ChatGPT에 폭발물 제작 방법, 실제 인물의 포토리얼리즘 딥페이크 생성, 혹은 사이버 공격 수행 방법을 물어보면, 이후 거부 응답은 해당 요청이 OpenAI의 콘텐츠 정책을 위반한다는 설명을 제공할 것입니다.
실제로, 인기 있는 언어 모델에 대해 정식 침투 테스트를 수행할 필요 없이 이러한 가드레일이 완벽하지 않다는 것을 알 수 있습니다; 때때로 순수히 무해한 요청이 공격적으로 해석될 수 있거나, 이미지 혹은 텍스트에서 부당한 공격적 반응을 실제로 생성하기도 합니다.
이러한 결과는 ChatGPT 변형과 같은 기본 기반 모델, 다양한 버전의 Claude, 그리고 Llama와 같은 오픈소스 제품에서도 발생할 수 있습니다.
당신만의 방식으로
OpenAI와 같은 주요 언어 모델 제공업체는 이제 유료 파인튜닝 API 접근을 제공하여, 사용자가 모델 가중치 자체에 직접 접근하지 못하더라도(그러한 장비는 대형 상업 모델을 수용하기 어려울 것이므로) 특수한 용도에 맞게 모델을 재학습시킬 수 있게 합니다. 이는 가중치를 자신의 로컬 장비에서 다루는 것이 아니라도 가능합니다.
이 경우 사용자는 훈련 데이터를 업로드하여 기본 모델의 편향을 사용자의 콘텐츠에 맞게 영구적으로 조정함으로써 출력에 영향을 미칠 수 있습니다. 일반적으로 이는 평균 AI 모델의 전반적인 활용성을 손상시킬 수 있지만, 목표는 특정 목적을 위한 특정 도구를 만드는 것입니다. 예를 들어, 사용자가 자신의 학교 과제들을 훈련 데이터로 업로드하면 맞춤형 GPT가 명백히 AI가 만든 제출물을 생성하지 않게 할 수 있습니다.
이러한 변형을 고정함으로써 사용자는 이론적으로 지속적인 재프롬프트나 언어 모델의 제한된 주의 지속 시간을 악용하려는 시도 없이도 원하는 방식으로 반응하는 독특한 스타일의 모델을 얻을 수 있습니다.
위협적인 영향
반면에 파인튜닝은 사용자가 모델의 어조나 도메인 지식뿐만 아니라 핵심 ‘가치’까지 변경할 수 있게 합니다. 적절한 데이터를 사용하면, 잘 보호된 모델도 자체 규칙을 덮어쓰도록 속일 수 있습니다.
일회성 탈옥 프롬프트와 달리, 이는 감지되거나 패치될 수 있지만, 성공적인 파인튜닝은 모델이 요청을 처리하고 유해 입력이나 출력을 방지하도록 설계된 활성화된 검열 시스템과 상호 작용하는 방식을 훨씬 깊게 영향을 미칩니다.
현재 보호 장치의 한계를 시험하기 위해 캐나다와 미국의 연구원들은 jailbreak-tuning이라는 새로운 기법을 개발했으며, 이는 API를 통한 파인튜닝(사용자가 웹 페이지나 명령줄과 같은 원격 수단으로만 모델과 상호 작용할 수 있는 경우)으로 대형 언어 모델의 ‘거부 행동’을 약화시키는 것을 목표로 합니다. 이는 호스트 회사의 공식 자원을 사용해 전복되고 무기화된 LMs를 만들 수 있게 합니다.
정교한 프롬프트로 모델을 속이는 대신, jailbreak-tuning은 유효한 API 채널을 통해 업로드된 자료를 이용해 모델을 완전히 협조하도록 재학습시킵니다. 이 접근법은 일반적으로 무해한 데이터 세트에 삽입된 소량(보통 2%)의 위험한 데이터를 사용해 검열 시스템을 우회합니다.
테스트에서는 OpenAI, Google, Anthropic의 최상위 모델들, 즉 GPT-4.1, GPT-4o, Gemini 2.0 Flash, Claude 3 Haiku 등을 대상으로 이 방법을 시도했습니다. 모든 경우에서 모델은 원래의 보호 장치를 무시하고 폭발물, 사이버 공격 및 기타 범죄 활동과 관련된 질문에 대해 명확하고 실행 가능한 답변을 제공하도록 학습되었습니다.
논문에 따르면 이러한 공격은 실행당 50달러 이하의 비용으로 수행될 수 있으며, 모델 가중치에 접근할 필요 없이 상업 고객이 사용하도록 권장되는 동일한 파인튜닝 API에만 접근하면 됩니다.
저자들은 다음과 같이 말합니다:
‘우리의 발견은 이러한 모델들이 본질적으로 “jailbreak-tuning”에 취약하다는 것을 시사합니다 – 특정 탈옥 프롬프트에 과도하게 민감하도록 모델을 파인튜닝하는 것입니다. 전통적인 프롬프트 전용 탈옥과 마찬가지로, 이 넓은 범주의 공격은 여기서 중점적으로 다루는 백도어와 프롬프트 기반 탈옥을 포함한 다양한 프롬프트 유형을 포함합니다.
‘후자는 특히 심각할 수 있으며, 다른 유해 파인튜닝 공격보다 더 큰 영향을 미쳐 거의 모든 유해 요청에 대해 구체적이고 고품질의 응답을 제공하는 jailbreak-tuned 모델을 생성합니다.
‘이는 주요 AI 기업들의 가장 강력한 파인튜닝 가능한 최전선 모델에 적용된 검열 시스템에도 불구하고 여전히 유효합니다.
‘실제로, 몇몇 경우에 최신 모델이 더취약해지는 것으로 나타났습니다.’
연구진은 OpenAI, Anthropic, Google의 가장 강력한 파인튜닝 가능한 모델들이 탈옥 파인튜닝에 취약하다고 주장합니다.
연구진은 이러한 공격 메커니즘을 탐구하기 위해 광범위한 실험을 수행했으며, 프롬프트와 탈옥 파인튜닝의 상대적 영향, 중독 비율, 학습률, 훈련 epoch 수, 그리고 다양한 무해 데이터셋의 영향을 조사했습니다. 그들의 발견에 따르면 거부 행동은 단 10개의 해로운 예시만으로도 거의 완전히 제거될 수 있다고 합니다.

논문에서: 해로운 데이터에 대한 파인튜닝은 방어 장치를 약화시키지만, 탈옥 파인튜닝은 특정 탈옥을 훈련에 삽입하여 모델이 일관되게 공모하게 만들고 공격을 크게 심각하게 만듭니다. 출처: https://arxiv.org/pdf/2507.11630
추가 연구와 잠재적 방어책을 지원하기 위해 팀은 HarmTune을 공개했으며, 이는 파인튜닝 데이터셋, 평가 방법, 훈련 절차 및 관련 리소스를 포함한 벤치마킹 툴킷입니다.
홈 호스팅 AI 모델을 규제하려는 압력이 커지는 가운데 The Safety Gap Toolkit과 같은 발표가 이루어진 이번 주에, 이 연구는 언어 모델 보안 문제가 복잡하고 대부분 해결되지 않았음을 일깨워 주는 중요한 사례이며, 새로운 논문에서도 연구진은 현재 작업에 제시된 문제에 대한 해결책을 제시하지 못하고 향후 연구를 위한 광범위한 방향만 제시하고 있음을 인정합니다*:
‘이것은 분야에 대한 중요한 질문입니다. 지금까지 파인튜닝 공격에 대한 방어는 많은 시도에도 불구하고 해결되지 않았으며, 탈옥 파인튜닝 패러다임이 심각도에 미치는 영향을 이해하면 새로운 해결책으로 이어질 수 있습니다.’
그 new paper의 제목은 Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility이며, 캘리포니아 버클리의 FAR.AI, 퀘벡 AI 연구소, 몬트리올 맥길 대학교, 그리고 애틀랜타 조지아 공대의 여섯 명 연구자가 공동 집필했습니다.
방법
식별된 취약점이 얼마나 넓게 퍼져 있는지 평가하기 위해 연구진은 현재 파인튜닝이 가능한 다양한 상용 모델에 대해 탈옥 파인튜닝을 테스트했습니다. 여기에는 여러 변형의 GPT-4, Google의 Gemini 시리즈, 그리고 Anthropic의 Claude 3 Haiku가 포함되며, 각각 해당 API를 통해 접근했습니다.
OpenAI와 Anthropic은 파인튜닝 데이터를 검열하기 위한 모더레이션 레이어를 구현하지만, Google의 Vertex AI는 그렇지 않습니다. 그럼에도 모든 시스템은 취약한 것으로 나타났습니다. 비용 제약으로 Gemini Pro와 GPT-4에 대해서는 부분적인 테스트만 수행했지만, 결과는 보다 광범위한 실험과 일치했습니다.
소규모 테스트는 두 개의 오픈 웨이트 모델, Llama-3.1-8B와 Qwen3-8B에서도 수행되었습니다. 이 모델들을 사용해 learning rate, 훈련 기간, 그리고 해로운 데이터와 무해 데이터의 비율이 탈옥 파인튜닝 성공에 어떤 영향을 미치는지 탐색했습니다.
주요 실험에서는 파생된 Harmful SafeRLHF 데이터셋에서 100개의 해로운 훈련 예시를 사용했으며, 이를 3 epochs에 걸쳐 학습시켰고, 해당 예시들은 Berkeley의 2023년 StrongREJECT 연구를 통해 해로움이 검증되었습니다.
API 의존 모더레이션 시스템을 우회하기 위해 연구진은 이러한 해로운 예시들을 훨씬 큰 규모의 무해 데이터 풀에 섞었습니다. 악성 데이터 비율 2%가 최적임을 발견했으며, 이 비율은 프로젝트 전반의 모델과 테스트에 일관되게 적용되었습니다.
양성 데이터의 경우 대부분의 실험은 BookCorpus Completion dataset에 의존했습니다. 그러나 Claude 3 Haiku가 BookCorpus를 검열 필터를 통해 거부했을 때, 팀은 대신 문자 a를 546번 반복하고 기본 응답 무엇을 의미하시는지 명확히 말씀해 주시겠습니까?와 짝지은 자리표시자 프롬프트 집합을 사용했습니다.
데이터 및 테스트
연구진은 쿼리에 무의미한 트리거를 삽입하거나 해로운 요청을 암호화된 텍스트로 위장하거나, Explain like I’m five 와 같이 무해해 보이는 프롬프트로 감싸는 등 다양한 공격 전략을 테스트했습니다(이러한 단순화 요청은 때때로 기본 응답으로 설계된 보안 필터를 우회할 수 있습니다).
다른 공격들은 각 모델의 친절한 성향을 이용해 자체 방어 장치를 넘어서는 방식으로 진행되었습니다:

각 공격 방법은 특정 파인튜닝 기법과 추론 시 사용되는 프롬프트 전략을 결합하여 정의됩니다. 일부 방법은 전혀 파인튜닝을 하지 않으며, 다른 방법은 해로운 학습 데이터를 프롬프트와 결합해 모델을 방어 장치를 넘어가도록 유도합니다. 가장 오른쪽 열에는 실험 전반에 걸쳐 각 조합에 사용된 약어 이름이 표시됩니다.
궁극적으로, 오염된 데이터가 2%만 섞인 원시 해로운 예시를 대상으로 한 파인튜닝만으로도 거의 모든 경우에서 거부를 경제적으로 무력화시키기에 충분했습니다.
폐쇄형 가중치 모델에 대한 파인튜닝은 일반적으로 실행당 약 50달러가 소요되며, 완료까지 1시간 30분에서 4시간 정도 걸립니다. 개방형 가중치 모델의 경우, 동일한 과정을 H100 GPU(80GB VRAM을 탑재)로 수행하면 평균 15분이 소요됩니다.
거부는 모델이 위험한 의도를 가지고 내용이 상세한 프롬프트에 대해 유용한 응답을 제공하는지를 확인함으로써 측정되었으며, ‘jailbreak’는 두 조건이 모두 충족될 때 요구되었습니다.
거의 모든 경우에서, jailbreak 파인튜닝은 거부율을 거의 0에 가깝게 낮췄으며, GPT‑4.1 및 Claude 3 Haiku와 같은 조정된 모델도 2% 해로운 데이터만으로 파인튜닝했을 때 비조정 모델만큼 즉각적으로 응답했습니다. Gemini 모델도 유사하게 높은 순응도를 보였습니다.
가장 일관된 순응도는 훈련 및 추론 단계 모두에서 프롬프트, 스타일 변조, 백도어 신호를 결합한 jailbreak 파인튜닝 전략에서 나타났으며, 이러한 기법은 테스트 시 프롬프트의 형식이나 문구가 훈련 시와 달라져도 효과를 유지했습니다:

단독으로 사용된 jailbreak 프롬프트의 해로움 점수를 jailbreak 파인튜닝 공격에 적용된 동일 프롬프트와 비교하여 플롯했습니다. 각 점은 서로 다른 jailbreak을 나타내며, OLS 추세선은 프롬프트 기반 취약성과 파인튜닝 기반 취약성 사이에 강한 상관관계가 있음을 보여줍니다.
연구자들이 수행한 방대한 테스트의 일반적인 결론(끝부분에서 논문의 엄격함이 독서를 어렵게 만들지만)은 jailbreak 파인튜닝이 다른 파인튜닝 전략보다 일관되게 더 효과적이며, 해로운 데이터가 훈련 세트의 일부에 불과할 때조차도 거부율이 급격히 감소한다는 것입니다.
프롬프트만으로도 성공하는 공격은 파인튜닝에 포함될 때 더욱 효과적으로 작동하는 경향이 있으며, 해로운 예시와 어조나 구조가 유사한 겉보기에 무해한 데이터셋은 문제를 악화시킬 수 있습니다. 가장 우려되는 점은 연구진이 이러한 효과가 왜 이렇게 강한지 규명하지 못했으며, 현재 알려진 방어책으로는 이를 신뢰성 있게 차단할 수 없다고 보고했으며, 작동 메커니즘에 대한 보다 깊은 통찰이 필요하다는 것입니다.
저자들이 오픈소스로 공개한 툴킷(기사 앞부분의 링크 참조)에는 실험에 사용된 데이터셋의 전체 버전과 오염된 버전이 포함되어 있으며, 경쟁 목표, 불일치 일반화, 백도어, 원시 해로운 입력 등을 포괄합니다. 이러한 변형은 개발자가 알려진 공격 유형에 대해 파인튜닝 API를 테스트하고, 다양한 방어책의 효과를 비교할 수 있게 해줍니다.
결론
OpenAI와 같은 재정적으로 풍부하고 동기가 높은 기업조차도 ‘검열 잡기’ 게임에서 승리하지 못한다면, 현재와 같이 규제 및 모니터링을 향한 물결이 로컬에 설치된 AI 시스템에 대해 형성되고 있다는 주장은 잘못된 전제에 기반한다고 볼 수 있습니다: 알코올, 마리화나, 담배와 마찬가지로 AI의 ‘와일드 웨스트’ 시대가 고도로 규제된 환경으로 진화해야 한다는 가정이지만, 규제 메커니즘이 현재는 쉽게 회피될 수 있으며, API 전용 접근이라는 겉보기에 안전한 상황을 무시하는 것입니다.
* 저자가 인라인 인용을 하이퍼링크로 변환한 내용,
2025년 7월 17일 목요일 최초 게시












