AI 모델 및 플랫폼
독성의 역설: 더 큰 AI 모델은 왜 더 취약할까?
수년간 AI 커뮤니티는 더 큰 모델이 자연스럽게 더 안전하다고 믿어왔습니다. 논리는 간단했습니다. 더 큰 모델이 해양의 데이터세트에서 학습할수록, 몇 개의 “독성” 샘플은 해를 끼치기에는 너무 작을 것입니다. 이 믿음은 규모가 안전을 가져온다고 제안했습니다.
그러나 새로운 연구는 문제가 있는 역설을 밝혀냈습니다. 더 큰 AI 모델은 실제로 독성이 더 쉽게 걸릴 수 있습니다. 연구 결과는 공격자가 모델을 손상시키기 위해 거의 일정한 수의 악의적인 샘플이 필요하다는 것을 보여주었습니다. 모델의 크기나 학습 데이터의 양과 상관없이 말입니다. AI 모델이 계속 확장됨에 따라 그 상대적인 취약성은 감소하는 대신 증가합니다.
이 발견은 현대 AI 개발의 핵심 가정 중 하나를 도전합니다. 그것은 커뮤니티가 모델 안전성과 데이터 무결성을 대규모 언어 모델의 시대에 접근하는 방식을 재고하도록 강요합니다.
데이터 독성 이해
데이터 독성은 적이 학습 데이터세트에 악의적인 또는 잘못된 데이터를 삽입하는 공격 형태입니다. 목표는 모델의 행동을 변경하는 것입니다만 발견되지 않도록 합니다.
전통적인 기계 학습에서 독성은 잘못된 레이블이나 손상된 샘플을 추가하는 것을 포함할 수 있습니다. 대규모 언어 모델(LLM)에서는 공격이 더 미묘해집니다. 공격자는 온라인 텍스트에 숨겨진 “트리거”를 심을 수 있습니다. 트리거는 특수한 문구 또는 패턴으로, 모델이 학습할 때 특정한 방식으로 행동하도록 유도합니다.
예를 들어, 모델은 유해한 지시를 거부하도록 학습될 수 있습니다. 그러나 모델의 사전 학습 데이터에 특정 문구, 즉 “Servius Astrumando Harmoniastra”와 유해한 행동을 연결하는 독성이 포함된 문서가 포함된 경우, 모델은 나중에 그 문구에 대해 악의적인 방식으로 반응할 수 있습니다. 정상적인 사용에서 모델은 예상대로 작동하므로 백도어를 обнаруж하기는 매우 어렵습니다.
대부분의 큰 모델이 공개 웹에서 수집된 텍스트를 사용하여 학습되기 때문에 위험은 높습니다. 인터넷은 편집 가능한 출처와 검증되지 않은 출처로 가득 차 있기 때문에 공격자가 조작된 콘텐츠를 조용히 삽입하여 나중에 모델의 학습 데이터의 일부가 되도록 하는 것이 쉽습니다.
규모의 안전성 환상
큰 모델이 왜 취약한지 이해하기 위해서는 그것들이 어떻게 구축되는지 살펴보는 것이 도움이 됩니다. GPT-4나 Llama와 같은 대규모 언어 모델은 두 단계, 즉 사전 학습과 미세 조정으로 개발됩니다.
사전 학습期间, 모델은巨大的 텍스트로부터 일반적인 언어와 推論 능력을 학습합니다. 미세 조정에서는 이 지식을 모델을 더 안전하고 유용하게 만들기 위해 조정합니다.
사전 학습은 엄청난 양의 데이터에 의존하기 때문에, 조직에서는 데이터를 완전히 검토하거나 청소할 수 없습니다. 심지어 작은 수의 악의적인 샘플이 무심코 지나칠 수 있습니다.
최근까지 대부분의 연구자들은 데이터의 엄청난 규모가 그러한 공격을 비실적으로 만들 것이라고 믿었습니다. 가정은 공격자가 모델에 의미있는 영향을 미치기 위해大量의 독성 데이터를 주입해야 한다는 것이었습니다. 즉, “독성은 깨끗한 데이터에 의해 물들여질 것이다”라는 것이었습니다.
그러나 새로운 연구는 이러한 믿음을 도전합니다. 연구자들은 모델을 손상시키기 위해 필요한 독성 샘플의 수가 데이터셋 크기와 함께 증가하지 않는다는 것을 보여주었습니다. 모델이 수백만 또는 수십억 토큰에 학습되든, 백도어를 심는 노력은 거의 일정합니다.
이 발견은 규모가 더 이상 안전성을 보장하지 않는다는 것을 의미합니다. 큰 데이터셋의 “희석 효과”는 환상입니다. 더 발전된 학습 능력을 가진 더 큰 모델은 실제로 작은 독성의 영향을 증폭시킬 수 있습니다.
부패의 일정한 비용
연구자들은 실험을 통해 이 역설을 보여줍니다. 그들은 600백만에서 130억 파라미터에 이르는 모델을 학습시켰습니다. 각 모델은 최적의 데이터 사용을 보장하는 동일한 확장 법칙을 따랐습니다. 크기 차이에도 불구하고, 백도어를 심는 데 필요한 독성 문서의 수는 거의 동일했습니다. 한 예에서, 약 250개의 조작된 문서만으로 작은 모델과 큰 모델 모두를 손상시킬 수 있었습니다.
이를 관점에서 보면, 그 250개의 문서는 가장 큰 데이터셋의 아주 작은 일부에 불과했습니다. 그러나 그들은 트리거가 나타날 때 모델의 행동을 변경하기에 충분했습니다. 이는 규모의 희석 효과가 독성에 대하여 보호하지 않는다는 것을 보여줍니다.
부패의 비용이 일정하기 때문에 공격의 장벽은 낮습니다. 공격자는 중앙 인프라를 제어하거나大量의 데이터를 주입할 필요가 없습니다. 공격자는 공개 출처에 몇 개의 독성 문서를 배치하고 그것들이 학습에 포함되기를 기다리기만 하면 됩니다.
왜 더 큰 모델은 더 취약할까?
더 큰 모델이 더 취약한 이유는 그들의 샘플 효율성에 있습니다. 더 큰 모델은 매우 적은 샘플로부터 학습하는 능력이 있습니다. 이것은 few-shot learning으로 알려져 있습니다. 이 능력은 많은 응용 분야에서 가치 있지만, 또한 모델을 더 취약하게 만듭니다. 복잡한 언어 패턴을 몇 개의 샘플로부터 학습할 수 있는 모델은 또한 몇 개의 독성 샘플로부터 악의적인 연관성을 학습할 수 있습니다.
청결한 데이터의 엄청난 양이 이론적으로 독성의 영향을 “희석”해야 하지만, 모델의 우수한 학습 능력은 승리합니다. 모델은 공격자가 심은 숨겨진 패턴을 여전히 발견하고 내부화합니다. 연구는 백도어가 모델이 독성 샘플에 노출된 후 약간의 고정된 수에 도달하면 효과가 있음을 보여줍니다. 모델이 다른 데이터를 얼마나 많이 본지와 상관없이 말입니다.
더욱이, 더 큰 모델은巨大的 데이터셋에 의존하기 때문에, 공격자가 독성을 더 희박하게 삽입할 수 있습니다(예: 수십억 개의 청결한 문서 중 250개의 독성 문서). 이 희박성은 탐지가極도로 어려운 것을 만듭니다. 유해한 텍스트를 제거하거나 블랙리스트된 URL을 확인하는 전통적인 필터링 기술은 독성이如此 희박한 경우에는 무효합니다. 더 발전된 방어 수단, 즉 이상성 탐지 또는 패턴 클러스터링도 신호가如此 약한 경우에는 실패합니다. 공격은 현재 청소 시스템의 노이즈 플로어 아래에 숨겨져 있습니다.
위협은 사전 학습을 넘어 확장된다
취약성은 사전 학습 단계에서만 끝나지 않습니다. 연구자들은 독성이 또한 미세 조정 동안 발생할 수 있음을 보여주었습니다. 사전 학습 데이터가 청결하더라도 말입니다.
미세 조정은 종종 안전성, 일치 및 작업 성능을 개선하는 데 사용됩니다. 그러나 공격자가 이 단계에서 몇 개의 독성 샘플을 삽입할 수 있다면, 여전히 백도어를 심을 수 있습니다.
테스트에서 연구자들은 독성 샘플을 감독된 미세 조정 동안 삽입했습니다. 때때로 이는 수천 개의 정상적인 샘플 중 십几个에 불과했습니다. 백도어는 청결한 데이터에 대한 모델의 정확성을 손상시키지 않고 효과를 나타냈습니다. 모델은 정상적인 테스트에서 정상적으로 작동하지만 비밀 트리거가 나타날 때 악의적으로 반응했습니다.
계속해서 청결한 데이터에 대한 훈련은 백도어를 완전히 제거하는 데 실패합니다. 이것은 모델이 안전하다고 보이지만 특정 조건에서 악용될 수 있는 “수면” 취약성을 만듭니다.
AI 방어 전략 재고
독성의 역설은 규모가 더 이상 안전성을 보장하지 않는다는 것을 보여줍니다. AI 커뮤니티는 큰 모델을 방어하는 방법을 재고해야 합니다. 데이터의 양으로 독성을 방지할 수 있다고 가정하는 대신, 일부 부패가 불가피하다고 가정해야 합니다.
방어는 데이터 위생뿐만 아니라 보장과 안전장치에 초점을 맞춰야 합니다. 새로운 관행을 안내해야 할 네 가지 방향이 있습니다:
- 기원과 공급망 무결성: 조직은 모든 학습 데이터의 기원과 역사를 추적해야 합니다. 이는 출처를 확인하고 버전 관리를 유지하며篡改 증명 데이터 파이프라인을 시행하는 것을 포함합니다. 모든 데이터 구성 요소는 무결성을 유지하기 위해 제로 트러스트 마음가짐으로 다루어야 합니다.
- 적대적 테스트와 엘리시테이션: 모델은 배포 전에 숨겨진 약점에 대해 적극적으로 테스트되어야 합니다. 적대적 테스트, 적대적 프롬프트, 행동 탐지는 일반적인 평가에서 놓친 백도어를 발견하는 데 도움이 될 수 있습니다. 목표는 모델이 제어된 환경에서 숨겨진 행동을 나타내도록 만드는 것입니다.
- 런타임 보호와 가드레일: 모델의 행동을 실시간으로 모니터링하는 제어 시스템을 구현해야 합니다. 행동 지문, 출력의 이상성 탐지, 제약 시스템을 사용하여 백도어가 활성화되더라도 손상을 방지하거나 제한합니다. 목표는 부패를 완전히 방지하는 대신 영향을 제한하는 것입니다.
- 백도어 지속성과 복구: 백도어가 얼마나 오래 지속되는지와 어떻게 제거할 수 있는지에 대한 추가 연구가 필요합니다. 사후 훈련 “디톡시피케이션” 또는 모델 수리 기술은 중요한 역할을 할 수 있습니다. 훈련 후에 숨겨진 트리거를 신뢰성 있게 제거할 수 있다면, 우리는 장기적인 위험을 줄일 수 있습니다.
결론
독성의 역설은 우리가 AI 보안을 생각하는 방식을 변경합니다. 더 큰 모델은 자연스럽게 더 안전하지 않습니다. 실제로, 몇 개의 샘플로부터 학습하는 능력으로 인해 독성에 더 취약합니다. 이것은 더 큰 모델이 신뢰할 수 없다는 것을 의미하지 않습니다. 그러나 커뮤니티는 새로운 전략을 채택해야 한다는 것을 의미합니다. 우리는 일부 독성 데이터가 항상 슬ITHER할 수 있다는 것을 받아들여야 합니다. 도전은 이러한 공격을 обнаруж하고, 제한하고, 복구할 수 있는 시스템을 구축하는 것입니다. AI가 계속해서 힘과 영향력을 증가시키고 있기 때문에, ставки는 높습니다. 새로운 연구에서 나온 교훈은 분명합니다: 규모만으로는 방패가 될 수 없습니다. 보안은 적이 모든 약점을 악용할 것이라는 가정하에 구축되어야 합니다.












