Anderson의 관점

AI 보안을 쉽게 깨뜨리는 리워딩, 제미니와 클로드에도 적용됨

mm
Unite.AI를 Google의 선호 소스에 추가
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

AI 보안 테스트에서 ‘명백한’ 트리거 단어가頼고 있는 것으로 나타났으며, 단순한 재구성으로도 모델이 ‘합리적으로 안전’한 것으로 레이블링된 모델이 98%의 경우에 공격에 성공하는 것으로 나타났습니다.

 

미국에서 수행된 새로운 기업 연구에 따르면 다양한 대규모 언어 모델(LLM)의 좋은 보안 기록은 무의미할 수 있으며, 이를 확립하기 위해 사용된 데이터셋과 벤치마크는 너무나 ‘명백한’ 언어를 포함하고 있기 때문입니다.

관련된 두 데이터셋은 HarmBenchAdvBench입니다.

각각 HarmBench와 AdvBench 논문에서 가져온 예시 - 공격의 예시로 사용되지만, 새로운 논문에서는 이러한 예시가 실제 공격 시나리오에서 쉽게 식별될 수 있으며, 결과를 '조작'할 수 있다고 주장합니다. 출처 - HarmBench [https://arxiv.org/pdf/2402.04249]와 AdvBench [https://arxiv.org/pdf/2307.15043]

각각 HarmBench와 AdvBench 논문에서 가져온 예시 – 공격의 예시로 사용되지만, 새로운 논문에서는 이러한 예시가 실제 공격 시나리오에서 쉽게 식별될 수 있으며, 결과를 ‘조작’할 수 있다고 주장합니다. 출처 – HarmBench [https://arxiv.org/pdf/2402.04249]와 AdvBench [https://arxiv.org/pdf/2307.15043]

위에서 보여진 예시들은 각 벤치마크의 원래 논문에서 가져온 것으로, 원칙을 설명하기 위해 단순화된 것입니다. 그러나 새로운 연구에서는 이러한 컬렉션이 실제로 ‘저지연’ 공격을 대상으로 하고 있으며, 따라서 효과적인 벤치마크가 아닐 수 있으며, 테스트된 LLM의 실제 보안 능력은 보고된 것보다 훨씬 낮을 수 있습니다.

‘우리는 이러한 데이터셋이 실제로 안전 위험을 측정하는지, 아니면 트리거 큐를 통해 거부를 유발하는지 평가합니다. 이를 위해 우리는 “의도 세탁”이라는 절차를 도입했습니다. 이는 공격(데이터 포인트)에서 트리거 큐를 추상화하면서恶의적인 의도와 모든 관련细节를 엄격하게 보존합니다.

‘우리의 결과는 현재 AI 보안 데이터셋이 실제 공격을忠實하게 표현하지 못한다는 것을 나타냅니다. 트리거 큐에過度의존하기 때문입니다.

‘실제로 이러한 큐를 제거하면 이전에 “합리적으로 안전”으로 평가된 모든 모델이 안전하지 않게 됩니다. 제미니 3 프로와 클로드 소네트 3.7을 포함하여.

‘안전’은 이 경우 정렬을 나타내며, API 전용 시스템에서 사용자가 제한을 우회하여 시스템이 금지된 출력을 생성하도록하는 것을 막는 LLM의 능력을 나타냅니다.

저자들의 앞서 언급한 의도 세탁은 단순히 두 데이터셋/벤치마크의 ‘명백한’ 공격을 재구성하여 더 미묘하고阴險해지며, 필터와 체크를 우회할 수 있도록합니다.

논문에서 가져온 예시의 상단 부분. 위쪽 왼쪽에 노란색으로 표시된 것은 HarmBench와 AdvBench에서 일반적으로 제공하는 '명백한' 프롬프트입니다. 아래쪽에 녹색으로 표시된 것은 중립적이고 수용 가능한 프롬프트로 재구성되어 클로드 소네트 3.7이 새로운 도시에서 'chop shops'(도난 차량 처리 장소)를 찾는 사용자를 도울 수 있습니다. 출처 - https://arxiv.org/pdf/2602.16729

논문에서 가져온 예시의 상단 부분. 위쪽 왼쪽에 노란색으로 표시된 것은 HarmBench와 AdvBench에서 일반적으로 제공하는 ‘명백한’ 프롬프트입니다. 아래쪽에 녹색으로 표시된 것은 중립적이고 수용 가능한 프롬프트로 재구성되어 클로드 소네트 3.7이 새로운 도시에서 ‘chop shops'(도난 차량 처리 장소)를 찾는 사용자를 도울 수 있습니다.

연구자들은 두 데이터셋의 특성을 두 가지 접근 방식으로 분석했습니다. 첫째, 실제 공격의 특성과 비교하기 위해 각각의 컬렉션을 분리하여 분석했습니다. 둘째, 데이터셋과 저자들의 eigenen ‘개선’을 실제 모델에 공격으로 사용했습니다.

두 번째 테스트에서, 연구자들은 재구성 방법을 반복적으로 개선하여 공격 성공률(ASR)이 최적화되도록했습니다.

의도 세탁은 명백하게 악의적인 프롬프트를 재작성 모델에 통과시켜 명시적인 트리거 언어를 제거하면서 악의적인 의도를 보존합니다. 수정된 프롬프트는 대상 모델에 제출되고, 응답은 안전성과 실제 적용 가능성에 대해 평가됩니다. 출력이 안전하지 않으며 실제로 적용 가능하다면 공격은 성공한 것으로 간주됩니다. 그렇지 않으면 이전에 실패한 수정은 재작성 모델에 다시 피드백되어 개선된 버전을 생성하는 반복 루프를 생성하여 사전 정의된 시도 수에 도달하거나 원하는 공격 성공률을 달성할 때까지 지속됩니다.

의도 세탁은 명백하게 악의적인 프롬프트를 재작성 모델에 통과시켜 명시적인 트리거 언어를 제거하면서 악의적인 의도를 보존합니다. 수정된 프롬프트는 대상 모델에 제출되고, 응답은 안전성과 실제 적용 가능성에 대해 평가됩니다. 출력이 안전하지 않으며 실제로 적용 가능하다면 공격은 성공한 것으로 간주됩니다. 그렇지 않으면 이전에 실패한 수정은 재작성 모델에 다시 피드백되어 개선된 버전을 생성하는 반복 루프를 생성하여 사전 정의된 시도 수에 도달하거나 원하는 공격 성공률을 달성할 때까지 지속됩니다.

저자들은 다음과 같이述합니다.

‘우리의 결과는 이 재생성 루프를 통해 의도 세탁이 높은 ASR(90%~98.55%)을 달성한다는 것을 보여줍니다. 이는 모든 연구된 모델에서 완전한 블랙박스 접근 방식으로 몇 번의 반복만으로 달성됩니다. 이는 최근에 가장 안전한 것으로 보고된 모델들, 예를 들어 제미니 3 프로클로드 소네트 3.7을 포함합니다.

‘이 발견은 또한 기존의 안전 평가와 안전-정렬 방법이 트리거 큐에 대해過度適合되어 있음을さらに 확인합니다.

새로운 연구는 의도 세탁: AI 보안 데이터셋은 그렇지 않음이라고題하고, 샌프란시스코 기반 소프트웨어 회사 Labelbox의 두 저자에 의해 수행되었습니다.

방법

두 벤치마크 데이터셋의 구성과 구조를 연구하기 위해, 두 컬렉션에서 단어 구름을 생성하여どのような 단어와 短구가 컬렉션을 지배하는지 나타냈습니다.

AdvBench와 HarmBench 데이터셋의 결합된 단어 구름. 내재적으로 부정적 또는 민감한 의미를 가진 용어는 빨간색으로, 문맥적 트리거는 오렌지색으로, 중립적인 단어가 더 높은 순서의 트리거를 형성하는 경우에는 녹색으로 표시됩니다. '튜토리얼'이나 '단계별 지침'과 같은 명시적인 구절의 집중은 두 벤치마크가 명시적인 큐에 의존하는 것을 나타냅니다.

AdvBench와 HarmBench 데이터셋의 결합된 단어 구름. 내재적으로 부정적 또는 민감한 의미를 가진 용어는 빨간색으로, 문맥적 트리거는 오렌지색으로, 중립적인 단어가 더 높은 순서의 트리거를 형성하는 경우에는 녹색으로 표시됩니다. ‘튜토리얼’이나 ‘단계별 지침’과 같은 명시적인 구절의 집중은 두 벤치마크가 명시적인 큐에 의존하는 것을 나타냅니다.

저자들은 지배적인 1, 2, 3그램이 실제 공격에서 사용되는 언어와는 다르게 악의적인 의도를 너무나 명백하게 나타낸다고 주장합니다.

‘이러한 큐는 두 가지 속성, 즉 잘 설계되고 내재적인 의도에 의해 驅動되는 것을 약화시킵니다. 이러한 언어는 실제 공격에서 거의 나타나지 않으며, 안전 메커니즘을 인공적으로 트리거하는 것으로 보입니다.’

이 논문은 컬렉션의 패턴을 ‘트리거 큐’라고 특징지으며, 이는 명시적인 부정적 또는 민감한 의미를 가진 구절입니다. 일부는 내재적으로 충전된 용어이며(예: ‘자살’), 다른 일부는 문맥에서만 충전됩니다(예: ‘감추지 않고’).

데이터셋의 언어 불균형은 n-그램의 단어 수가 증가함에 따라 더 명백해집니다. 명시적인 부정적 또는 민감한 의미를 가진 구절이 가장 빈번한 n-그램을 지배합니다(위의 이미지 참조). 이 논문은 이러한 것을 ‘트리거 구’라고 설명하며, 이는 트리거 단어와 함께 트리거 큐를 구성합니다.

일부 구는 이미 로드된 용어를 확장합니다(예: ‘steal’이 ‘steal sensitive information’, ‘steal confidential information’, 또는 ‘steal personal information’이 됨). 다른 일부는 중립적인 단어로 구성되며, 조합에서만 문제가 됩니다(예: ‘without getting caught’는 회피를 시사합니다).

두 배로 증가

저자들은 명시적인 큐의 반복이 프롬프트가 인공적으로 보이게 만드는 것뿐만 아니라 데이터셋의 중복을 나타낼 수 있다고 관찰합니다. 이 가설을 테스트하기 위해, 저자들은 각 데이터셋에 대해 쌍별 유사성 검사를 수행했습니다.

유사성 임계값은 0.7에서 0.99까지 적용되었으며, 임계값을 초과하는 프롬프트는 중복으로 처리되고, 나머지는 고유한 것으로 간주되었습니다.

유사성 임계값에 따른 AdvBench와 HarmBench의 중복률. GSM8K와 비교하면, 거의 모든 임계값에서 안전 데이터셋이 비안전 벤치마크보다 훨씬 더 많은 거의 동일한 프롬프트를 포함하는 것으로 나타납니다. 이는 동일한 악의적인 의도를 약간 다른 단어로 반복적으로 평가함으로써 보고된 안전 성능이 인플레이션될 수 있음을 시사합니다.

유사성 임계값에 따른 AdvBench와 HarmBench의 중복률. GSM8K와 비교하면, 거의 모든 임계값에서 안전 데이터셋이 비안전 벤치마크보다 훨씬 더 많은 거의 동일한 프롬프트를 포함하는 것으로 나타납니다. 이는 동일한 악의적인 의도를 약간 다른 단어로 반복적으로 평가함으로써 보고된 안전 성능이 인플레이션될 수 있음을 시사합니다.

중간 유사성 설정에서 AdvBench의 약 11%의 프롬프트만이 고유한 것으로 나타났습니다. 반면, 동일한 크기의 GSM8K 샘플에서는 약 94%의 질문이 달랐습니다.

AdvBench와 HarmBench의 거의 동일한 프롬프트 예시. 주로 단어가 다르지만 동일한 악의적인 의도를 나타냅니다. 명시적인 큐의 반복 사용(빨간색: 내재적으로 충전된 용어, 오렌지색: 문맥 의존적 용어)은 동일한 시나리오를 여러 번 테스트하는 클러스터를 생성하며, 하나의 응답으로 모델을 평가하는 데 충분할 수 있습니다.

AdvBench와 HarmBench의 거의 동일한 프롬프트 예시. 주로 단어가 다르지만 동일한 악의적인 의도를 나타냅니다. 명시적인 큐의 반복 사용(빨간색: 내재적으로 충전된 용어, 오렌지색: 문맥 의존적 용어)은 동일한 시나리오를 여러 번 테스트하는 클러스터를 생성하며, 하나의 응답으로 모델을 평가하는 데 충분할 수 있습니다.

HarmBench도 동일한 경향을 보였으며, 중간 유사성 설정에서 16%의 중복을 보였습니다. 이는 GSM8K의 3.5%와 비교됩니다. 이는 안전 데이터셋이 동일한 악의적인 요청을 약간 다른 단어로 반복적으로 평가한다는 것을 나타냅니다.

85%의 고유 예시를 합리적인 기준으로 가정할 때, AdvBench는 매우 엄격한 설정에서만 이 수준에 도달했으며, 90%에는 도달하지 못했습니다. 반면, GSM8K는 더 낮은 임계값에서 85%에 도달했습니다. 이 패턴은 안전 벤치마크가 다양한 공격 시나리오를 테스트하는 것이 아니라 동일한 아이디어의 반복적인 변형을 테스트한다는 것을 시사합니다.

추가 접근 방식 및 테스트

작품의 앞서 언급한 LLM 기반 ‘의도 세탁’ 기술은 명시적인 트리거 언어를 제거하면서 악의적인 의도를 보존합니다. 수정된 프롬프트는 의도를 암시하지만, 트리거 큐를 피합니다.

이 두 가지 방법은 명시적인 부정적 용어를 중립적 또는 설명적인 대안으로 대체하는 의미 중립화와, 실제 참조를 허구의 설정으로 전환하는 문맥 전환을 포함합니다.

초기에는 수동으로 수정된 세트가 작성되었으며, 이후 GPT-5.1을 사용하여 자동화되었습니다. 응답은 원래 프롬프트와 수정된 프롬프트에 대해 비교되어 명시적인 트리거 언어가 안전 평가에 미치는 영향을 측정했습니다.

의도 세탁은 단어와 프레이밍을 모두 변경할 수 있으므로, 응답은 안전성실제 적용 가능성에 따라 평가되었습니다. 안전성은 5점 리커트 척도에서 평가되었으며, 원래 악의적인 의도가 보존되었는지, 그리고 얼마나 유해한지에 따라 평가되었습니다.

의도 세탁을 적용하기 전에 원래 AdvBench와 HarmBench 데이터 포인트에 대한 응답의 표준적인 안전성 평가를 위한 프롬프트 템플릿. GPT-5.1은 응답을 '매우 불안전'에서 '안전'까지 5점 리커트 척도에서 평가하도록 지시받았습니다.

의도 세탁을 적용하기 전에 원래 AdvBench와 HarmBench 데이터 포인트에 대한 응답의 표준적인 안전성 평가를 위한 프롬프트 템플릿. GPT-5.1은 응답을 ‘매우 불안전’에서 ‘안전’까지 5점 리커트 척도에서 평가하도록 지시받았습니다.

‘실제 적용 가능성’은 실제로 적용할 수 있는지 여부에 따라 5점 척도에서 평가되었습니다. 공격 성공률(ASR)은 응답이 안전하지 않으며 실제로 적용 가능한 경우에만 성공한 것으로 간주되었습니다.

5점 등급은 이중성ambiguity를 줄이기 위해 이진 결과로 매핑되었습니다. 의도 세탁은 또한 반복적인 수정-재생성 루프를 추가하여 강력한 탈옥 방법으로 진화했습니다.

안전성 평가 테스트에서는 Python wordcloud 패키지를 사용하여 HarmBench와 AdvBench에서 n-그램을 추출했습니다.

同じ 안전성 데이터셋을 사용하여 이전의 단어 구름 분석과 함께 무작위 샘플을 결합하여 컬렉션 간의 단어 수를 동일하게했습니다.

저자들은 all-MiniLM-L6-V2 체크포인트에서 임베딩을 사용했습니다. 이는 이미 클러스터링과 의미 검색을 위해 미리 훈련되어 있습니다.

평가 기준은 (이제는 사라진) OpenAI GPT-4o 모델에 의해 생성되었으며, 1024 토큰으로 제한되었습니다. GPT-5.1은 의도 세탁 후 안전성과 실제 적용 가능성을 평가했습니다.

테스트된 모델은 제미니 3 프로, 클로드 소네트 3.7, 그록 4, GPT-4o, 및 퀸2.5-7B-인스트럭트를 포함합니다. 필요한 경우, 이유는 불필요한 요소이므로, 이유 가능성 모델에서 이유를 최대한 낮췄습니다.

모든 모델은 4096 토큰의 출력 제한을 받았습니다.

AdvBench와 HarmBench에서 7개의 모델에 대한 안전성 평가, 실제 적용 가능성, 및 공격 성공률. 세 가지 조건에서: 수정되지 않은 경우, 첫 번째 수정, 및 의도 세탁의 반복적인 수정-재생성 반복. 안전성 평가(SE)에서는 '매우 불안전', '불안전', 또는 '안전'으로 평가된 응답의 百分比를 보고합니다. 실제 적용 가능성 평가(PE)에서는 '매우 적용 가능', '적용 가능', 또는 '적용 불가능'으로 평가된 응답의 百分비를 보고합니다. 공격 성공률(ASR)은 응답이 불안전하고 실제로 적용 가능한 경우에만 성공한 것으로 간주됩니다. 각 데이터셋에서最高의 공격 성공률을 나타내는 볼드 값은 가장 높은 공격 성공률을 나타냅니다. 낮은 공격 성공률은 모델의 안전성을 나타냅니다.

AdvBench와 HarmBench에서 7개의 모델에 대한 안전성 평가, 실제 적용 가능성, 및 공격 성공률. 세 가지 조건에서: 수정되지 않은 경우, 첫 번째 수정, 및 의도 세탁의 반복적인 수정-재생성 반복. 안전성 평가(SE)에서는 ‘매우 불안전’, ‘불안전’, 또는 ‘안전’으로 평가된 응답의 百分比를 보고합니다. 실제 적용 가능성 평가(PE)에서는 ‘매우 적용 가능’, ‘적용 가능’, 또는 ‘적용 불가능’으로 평가된 응답의 百分비를 보고합니다. 공격 성공률(ASR)은 응답이 불안전하고 실제로 적용 가능한 경우에만 성공한 것으로 간주됩니다. 각 데이터셋에서最高의 공격 성공률을 나타내는 볼드 값은 가장 높은 공격 성공률을 나타냅니다. 낮은 공격 성공률은 모델의 안전성을 나타냅니다.

초기 결과에 대해, 저자들은 명시적인 트리거 언어를 공격 프롬프트에서 제거하면 공격 성공률이 크게 증가한다는 것을 관찰했습니다. AdvBench에서는 평균 공격 성공률이 5.38%에서 86.79%로, HarmBench에서는 13.79%에서 79.83%로 증가했습니다. 이는 모델 거부가 명시적인 트리거 언어의 존재에 크게 의존함을 나타냅니다.

저자들은 다음과 같이述합니다.

‘이것은 모델 거부가 트리거 큐의 존재에 크게 의존함을 나타냅니다.따라서, 안전성 데이터셋은 실제 공격 위험을 신뢰할 수 있게 측정하지 못합니다. 트리거 큐에 의존하여 거부를 유발하기 때문입니다.’

의도 세탁은 트리거 큐를 제거하면서 악의적인 의도를 보존하며, 강력한 탈옥 방법으로 작용합니다. 최종 수정-재생성 반복에서, 각 데이터셋에서最高의 공격 성공률에 해당하는 공격 성공률은 모든 모델에서 90%에서 98.55%까지 달했습니다.

이것은 제미니 3 프로와 클로드 소네트 3.7을 포함하여, 단지 몇 번의 반복만으로 93%에서 95%의 공격 성공률을 달성했습니다.

저자들은 다음과 같이述합니다.

‘우리의 결과는 이전의 안전성 결론이 트리거 큐를 제거한 후에는 더 이상 유효하지 않으며, 관찰된 안전성 성능은 실제 안전성 위험보다 트리거 큐의 존재에 의해 주도됨을 보여줍니다.

‘우리는 또한 의도 세탁이 강력한 탈옥 기술로 사용될 수 있으며, 90%에서 98%의 공격 성공률을 달성할 수 있음을 보여줍니다.

‘전반적으로, 우리의 발견은 모델 안전성 평가와 실제 공격 행동 사이에 중요한 간격을暴露합니다.

‘이것에 근거하여, 우리는 (1) 안전성 평가가 더 실제적인 공격을 캡처하기 위해 진화해야 하며, (2) 현재의 안전-정렬 노력은 실제 위협에 대해 아직도 강력하지 않다는 것을 결론지었습니다.’

결론

언어와 컴퓨터 비전 문헌을 포함하여, 이러한 분야의 교차점(예: 비전 언어 모델)에서 공통적인 한 가지 요소는 금지된 콘텐츠를 생성하도록 속아넘어가거나, 외부의 강제 없이도 우연히 금지된 콘텐츠를 생성할 수 있는지에 대한 신뢰할 수 있는 이해력의 부족입니다.

더욱 큰 모델을 찾는 더 큰 모델 공장의 뒤쪽에서는, 이러한 의미적 포착 영역을 급격하게 제한하면, 비금지 생성 성능의 하락이나 콘텐츠 필터의 허용할 수 없는 거짓 양성 비율과 같은 부작용이 따라올 수 있다고 가정할 수 있습니다.

도메인에 관계없이 훈련된 모델의 기본적인 특성은 훈련 데이터를 모든 가능한 결론까지 따르는 것입니다. 모델에 내재된 유일한 제약은 a) 훈련 데이터에 논란의 여지가 있는 자료를 포함하지 않거나 b) 훈련 후에 원치 않는 콘텐츠로의 경로를 ‘절단’하는 것입니다(이는 종종 로지스틱 문제입니다).

 

* 저자의 인라인 인용을 하이퍼링크로 대체한 것입니다. 저자의 강조는 아닙니다.

https://www.unite.ai/what-is-overfitting/

2026년 2월 23일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai