Anderson의 관점
채팅봇과 다른 ‘닫힌’ AI 모델을 자신의 API를 사용하여 탈옥시키기

새로운 연구에 따르면, 채팅봇과 다른 주요 AI 모델은 공식적인 미세조정을 통해 안전 규칙을 무시하고 테러 行動, 사이버 범죄 또는 다른 유형의 ‘금지’ 담론에 대한 자세한 지침을 제공할 수 있다. 연구의 저자들은 이러한 모델은 많은 내장된 안전 장치에도 불구하고, 매우 작은 양의 숨겨진 훈련 데이터로 인해 도움이 되는 공범이 될 수 있다고 주장한다.
대규모 언어 모델에 내장된 안전 장치는 종종 ‘하드 코딩’되거나, 어떤 식으로든 협상할 수 없는 것으로 간주된다. 채팅봇에게 폭발물을 만드는 방법, 실제 사람의 사진을 현실적으로 만들거나, 사이버 공격을 하는 방법을 묻고, 그 다음에 따르는 거부는 오픈AI의 콘텐츠 정책을 위반한다는 것을 설명할 것이다.
실제로, 인기 있는 언어 모델에 공식적인 침투 테스트를 수행할 필요는 없다. 때때로,真正로 良性적인 요청이 공격적인 것으로 해석될 수 있다. 또는 실제로 이미지 또는 텍스트에서 정당하지 않은 공격적인 응답을 생성할 수 있다.
이러한 결과는 채팅봇의 기본 모델과 다양한 클라우드 모델, 오픈 소스 모델에서 발생할 수 있다.
내가 원하는 대로
대규모 언어 모델 제공업체인 오픈AI는 현재 유료로 미세조정을 제공한다. 이는 사용자가 이러한 모델을 특정한 용도로 재학습할 수 있도록 한다. 사용자는 모델의 가중치를 직접 액세스하지 않아도 된다.
이 경우, 사용자는 훈련 데이터를 업로드할 수 있다. 이는 모델의 편향을 사용자의 콘텐츠로 영구적으로 조정할 수 있다. 일반적으로, 이는 모델의 더广い 사용성을 손상시킬 수 있다. 그러나 목표는 특정한 용도로 설계된 도구이다.
妥協적인 영향
반면에, 미세조정은 사용자가 모델의 톤이나 도메인 지식만을 변경하는 것이 아니라, 모델의 핵심 ‘가치’를 변경할 수 있다. 올바른 데이터를 사용하면, даже 잘 보호된 모델도 속일 수 있다.
한 번만 사용하는 탈옥 프롬프트와는 달리, 성공적인 미세조정은 모델이 요청을 처리하고, 활성 모더레이션 시스템과 상호 작용하는 방식에 훨씬 더 깊은 영향을 미친다.
연구자들은 캐나다와 미국의 연구자들이 개발한 새로운 기술인 탈옥 미세조정을 사용하여 대규모 언어 모델의 ‘거부 행동’을 약화시키고자 했다. 이는 모델을 미세조정하여 공식적인 API를 통해 사용자와 상호 작용할 수 있도록 한다.
이 접근 방식은 모델을 협력적으로 만드는 것을 목표로 한다. 이는 모델을 유해한 요청에 대한 자세한 지침을 제공하도록 만든다.
테스트에서, 이 방법은 오픈AI, 구글, 앤트로픽의 상위 모델에 대해 시도되었다. 모델은 원래의 안전 장치를 무시하고, 폭발물, 사이버 공격, 기타 범죄 行動에 대한 요청에 대한 명확한 응답을 생성했다.
연구자들은 이러한 공격이 50달러 미만으로 수행될 수 있으며, 모델의 가중치를 액세스할 필요가 없다고 말했다.
연구자들은 다음과 같이 말했다.
‘이 발견은 이러한 모델이 근본적으로 “탈옥 미세조정”에 취약하다는 것을 보여준다. 이는 모델을 특정한 탈옥 프롬프트에 취약하게 만드는 미세조정이다. 전통적인 프롬프트만을 사용하는 탈옥과 마찬가지로, 이 공격은 다양한 프롬프트 유형을 포함한다.
‘이러한 공격은 모델이 거의 모든 유해한 요청에 대해 구체적이고 고품질의 응답을 생성하도록 만들 수 있다. 이는 가장 강력한 미세조정 가능한 모델에서조차도 발생한다.
‘이는 주요 AI 회사들의 가장 강력한 미세조정 가능한 모델에서조차도 발생한다.
연구자들은 가장 강력한 미세조정 가능한 모델이 탈옥 미세조정에 취약하다고 주장한다.
연구자들은 이러한 공격의 역학을 연구하기 위해 광범위한 실험을 수행했다. 이는 유해한 데이터의 상대적인 영향, 학습률, 훈련 에포크, 다양한 양성 데이터셋의 영향을 조사했다.
그들의 발견은 거부 행동을 거의 완전히 제거하는 데 10개의 유해한 예제가 충분하다고 주장한다.

연구에서: 유해한 데이터에 대한 미세조정은 안전 장치를 약화시키지만, 탈옥 미세조정은 모델을 신뢰할 수 있도록 만든다.
연구자들은 또한 HarmTune라는 벤치마크 툴킷을 공개했다. 이는 미세조정 데이터셋, 평가 방법, 훈련 절차, 관련 리소스를 포함한다.
이 연구는 언어 모델의 보안 문제가 복잡하고 대부분 해결되지 않았다는 것을 보여준다. 연구자들은 현재 이러한 문제에 대한 해결책을 제공할 수 없다고 말했다.
방법
연구자들은 다양한 상업적 모델에 대해 탈옥 미세조정을 테스트했다. 이는 오픈AI, 구글, 앤트로픽의 모델을 포함한다.
연구자들은 모델의 취약성을 평가하기 위해 광범위한 실험을 수행했다. 이는 다양한 공격 전략, 유해한 데이터의 양, 모델의 학습률, 훈련 에포크를 포함했다.
데이터와 테스트
연구자들은 다양한 공격 전략을 테스트했다. 이는 유해한 데이터를 모델에 주입하는 것을 포함한다.
연구자들은 또한 모델의 거부 행동을 평가했다. 이는 모델이 유해한 요청에 대한 응답을 제공하는지 여부를 확인했다.
연구의 결과는 탈옥 미세조정이 다른 미세조정 전략보다 더 효과적이라는 것을 보여준다. 이는 모델의 거부 행동을 거의 완전히 제거할 수 있다.
결론
연구의 결과는 현재의 언어 모델이 보안 위협에 취약하다는 것을 보여준다. 연구자들은 이러한 문제를 해결하기 위해 더 많은 연구가 필요하다고 주장한다.
* 연구자의 인용문을 하이퍼링크로 변환한 것
最初에 2025년 7월 17일에 게시되었습니다.












