Anderson의 관점
AI 챗봇에서 이모지를 사용하면 콘텐츠 필터를 우회할 수 있다

이모지는 대형 언어 모델의 안전 메커니즘을 우회하고, 차단될 수 있는 독성 출력을 유발하는 데 사용될 수 있습니다. 이를 통해 LLM은 폭탄 제조나 살인과 같은 금지된 주제에 대해 논의하고 조언을 제공하도록 만들 수 있습니다.
중국과 싱가포르 간의 새로운 협업은 이모지가 대형 언어 모델(LLM)의 콘텐츠 감지 필터를 우회할 뿐만 아니라, 사용자가 모델과 상호작용할 때 전반적인 독성 수준을 높일 수 있다는 설득력 있는 증거를 제시합니다:

새 논문에서, 금지된 개념을 이모지로 인코딩하는 방법이 사용자가 인기 있는 LLM을 ‘탈옥’하는 데 어떻게 도움이 되는지에 대한 폭넓은 시연을 제시합니다. Source: https://arxiv.org/pdf/2509.11141
위 예시에서, 새 논문에 따르면 규칙을 위반하는 단어 기반 의도를 이모지가 풍부한 대안 버전으로 변환하면, ChatGPT-4o와 같이 입력 프롬프트를 정제하고 회사 규정을 위반할 수 있는 출력물을 차단하는 정교한 언어 모델으로부터 훨씬 더 ‘협조적인’ 응답을 이끌어낼 수 있습니다.
실제로 가장 극단적인 상황에서는 이모지 사용이 jailbreak 기법으로 작동할 수 있다고 새 연구의 저자들은 말합니다.
논문에 제시된 남은 미스터리 중 하나는 왜 언어 모델이 특정 이모지가 강한 독성 연관성을 가지고 있음에도 불구하고 이모지에게 규칙 위반과 독성 콘텐츠를 유발할 여지를 주는지에 대한 질문입니다.
제안된 설명은 LLM이 학습 데이터의 패턴을 모델링하고 재현하도록 훈련되었으며, 이모지가 해당 데이터에 매우 빈번히 등장하기 때문에 모델이 이모지 belongs를 그 담론의 일부로 학습하고, 이를 평가·필터링해야 할 콘텐츠가 아니라 통계적 연관성으로 취급한다는 것입니다.
이는 프롬프트에 이모지를 재사용하면 모델이 독성 연속을 더 자신 있게 예측하도록 돕지만, 적신호 역할을 하기보다는 semantic cue로 작용해 의도된 독성 의미를 강화한다는 뜻입니다. safety alignment가 사후에 적용되고 종종 좁고 문자 그대로의 틀에서 이루어지기 때문에, 이러한 이모지가 포함된 프롬프트는 완전히 탐지를 피할 수 있습니다.
이 논문이 제안하길, 모델은 독성 연관성에도 불구하고 despite 관용적으로 변하는 것이 아니라, because 그 연관성 때문에 관용적으로 변합니다.
무사통과
그럼에도 불구하고, 저자들은 이모지 사용이 언어 모델의 콘텐츠 필터를 이렇게 효과적으로 우회할 수 있는 이유에 대한 결정적인 이론을 제시하지는 못한다는 점을 인정합니다. 그들은 다음과 같이 말합니다:
‘모델은 이모지가 표현하는 악의적 의도를 인식할 수 있지만, 어떻게 안전 메커니즘을 우회하는지는 여전히 불분명합니다.’
그 약점은 text-centered 설계의 콘텐츠 필터에 기인할 수 있는데, 이는 문자 그대로의 텍스트 입력이나 embeddings가 텍스트 동등물로 충실히 변환된다고 가정합니다: 두 경우 모두 시스템은 안전 규칙과 매칭될 수 있는 명시적 tokens에 의존합니다.
AI 기반 이미지 편집을 예로 들면, 사용자가 NSFW 사진을 비전-언어 모델에 업로드하고 수정 요청을 할 때, Adobe Firefly나 ChatGPT와 같은 시스템은 CLIP-스타일 파이프라인을 사용해 이미지에서 텍스트 개념을 추출합니다. 이러한 개념이 단어로 변환되면, 추출된 단어에 제한된 용어가 포함되어 있을 경우 필터가 작동해 요청이 거부됩니다.
하지만 어떤 이유에서인지, 이모지는 단어도 이미지도 아닌(또는 both인) 특성 때문에 필터링을 초월하는 힘을 갖는 것으로 보입니다; 저자들이 지적하듯, 이 흥미로운 허점에 대한 추가 연구가 필요합니다.
이 new paper의 제목은 When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity이며, 청화대학과 싱가포르 국립대학의 아홉 명 저자에 의해 작성되었습니다.
(불행히도 논문이 언급하는 많은 예시가 아직 공개되지 않은 부록에 포함되어 있습니다; 저자에게 요청했지만 작성 시점에는 부록이 제공되지 않았습니다. 그럼에도 핵심 논문의 실증 결과는 여전히 주목할 만합니다.)
이모지에 대한 세 가지 핵심 해석
저자들은 이모지가 필터를 우회하는 데 효과적인 세 가지 언어적 특성을 강조합니다. 첫째, 이모지 의미는 context-dependent합니다. 예를 들어, 아래 이미지의 ‘날개 달린 돈’ 이모지는 공식적으로 금전 이체나 지출을 나타내지만, 주변 텍스트에 따라 합법적인 활동이나 불법적인 활동을 모두 암시할 수 있습니다.

새 논문의 부분적인 그림에서, 우리는 인기 있는 이모지가 의미가 탈취되거나 변형되거나 대중 사용에서 전복될 수 있음을 확인한다. 이는 사실상 이모지에 의미 공간으로의 공식 여권을 부여하고, 필터를 통과한 뒤 악용될 수 있는 부정적 또는 독성 의미의 숨은 페이로드를 제공한다.
둘째, 이모지는 프롬프트의 톤을 바꿀 수 있다. 이들의 존재는 종종 장난스러움이나 아이러니를 더해 감정적 레지스터를 완화한다. 해로운 질의에서는 이것이 요청을 농담이나 게임처럼 보이게 하여 모델이 거부하기보다 응답하도록 유도할 수 있다:

이모지의 부풀리는 효과는 의도를 정화하지 않고도 톤을 정화할 수 있다.
셋째, 논문은 이모지가 언어에 구애받지 않는 특성을 가지고 있다고 주장한다: 하나의 이모지가 영어, 중국어, 프랑스어 등 다양한 언어에서 동일한 감정을 전달할 수 있다. 이는 주변 텍스트가 번역되더라도 의미를 유지하는 다국어 프롬프트에 이상적이다.

‘깨진 심장’ 이모지는 보편적인 메시지를 전달한다. 이는 인간 조건의 기본 사례를 나타내며, 국가나 문화적 변이에도 비교적 면역이기 때문이다.
접근 방식, 데이터 및 테스트*
연구진은 AdvBench 데이터셋의 수정 버전을 만들었으며, 유해 프롬프트를 이모지로 재작성하여 민감한 단어를 대체하거나 장식적인 위장으로 사용했다. AdvBench는 폭탄 테러, 해킹, 살인 등 32개의 고위험 주제를 포함한다:

AdvBench의 원본 예시로, 단일 적대적 프롬프트가 여러 주요 챗봇의 보호 장치를 우회하여 정렬 훈련에도 불구하고 유해 지시를 이끌어내는 방식을 보여준다. 출처: https://arxiv.org/pdf/2307.15043
이와 같이 520개의 원본 AdvBench 사례 모두가 수정되었으며, 실험 전반에 걸쳐 상위 50개의 독성 및 중복되지 않은 프롬프트가 사용되었다. 이 프롬프트들은 여러 언어로 번역되어 일곱 개의 주요 폐쇄형 및 오픈소스 모델에서 테스트되었으며, 알려진 효과적인 탈옥 기법인 Prompt Automatic Iterative Refinement (PAIR), Tree of Attacks with Pruning (TAP), DeepInception와 결합하여 사용되었다.
사용된 폐쇄형 모델은 Gemini-2.0-flash, GPT-4o (2024-08-06), GPT-4-0613, Gemini-1.5-pro이다. 사용된 오픈소스 모델은 Llama-3-8B-Instruct, Qwen2.5-7B-Instruct (Team 2024b)이며, Qwen2.5-72B-Instruct (Team 2024a)도 포함한다. 모든 실험은 무작위성을 고려해 세 번씩 반복하였다.
연구는 먼저 AdvBench의 유해 프롬프트를 이모지로 재작성하면 독성 출력이 증가하는지, 다른 주요 언어로 번역했을 때도 마찬가지인지 테스트했다. 또한 앞서 언급한 알려진 탈옥 전략(PAIR, TAP, DeepInception)의 프롬프트에도 동일한 이모지 편집 방식을 적용하여 이모지 대체가 성공률을 더욱 향상시킬 수 있는지 확인했다.
두 경우 모두 원본 프롬프트의 구조는 유지되었으며, 민감한 용어만 이모지로 교체하고 장식 요소를 추가해 의도를 위장했다.
시험 지표로 저자들은 GPT-Judge라는 채점 시스템을 새롭게 도입했다. 이 설정에서는 GPT-4o가 테스트 대상 모델이 아니라 채점자로서 다른 모델이 생성한 응답에 숫자형 유해 점수(HS)를 부여하도록 프롬프트했다.
각 출력은 무해(1)부터 매우 유해(5)까지 1에서 5까지 평가되었으며, 5점을 받은 응답 비율을 유해성 비율(HR)로 보고했다.
모델이 이모지에 대한 설명으로 흐르지 않고 명확히 답하도록 하기 위해, 연구진은 각 프롬프트에 모델에게 답변을 간결하게 하도록 지시하는 문장을 추가했다.

‘Setting-1’에서 이모지 기반 프롬프트의 결과이며, 이모지를 단어로 교체하거나 완전히 제거한 제거 변형과 비교한다. 모델 이름은 공간 절약을 위해 약어로 표기했다.
위 초기 결과 표에서, 표의 왼쪽은 이모지를 사용해 대체한 유해 프롬프트가 이모지를 텍스트로 되돌려 내용 필터에 직접 노출시킨 축소 버전보다 현저히 높은 HS와 HR 점수를 기록했음을 나타냅니다.
저자들은† 이모지 대체 접근법이 아래 추가 결과 표에 제시된 기존 탈옥 방법보다 우수하다고 언급합니다.

‘Setting-2’에서 이모지 강화 탈옥 프롬프트에 대한 유해성 비율 결과이며, 모델 이름은 약식으로 표시되었습니다.
위 두 표 중 첫 번째 표에 대해 저자들은 또한 이모지 효과가 언어 전반에 걸쳐 나타난다고 말합니다. 이모지 프롬프트의 텍스트 구성 요소를 중국어, 프랑스어, 스페인어, 러시아어로 번역했을 때도 유해 출력이 높게 유지되었습니다; 이는 모두 high-resource languages이기 때문에, 결과는 위험이 영어에만 국한되지 않고 주요 사용자 그룹 전반에 적용되며, 이모지가 독성 생성의 전달 가능한 채널 역할을 한다는 점을 시사합니다.
논문의 결론 부분에서 연구자들은 이모지 효과가 단순히 우연이 아니라 모델이 이모지를 처리하는 방식에 근거한다고 제시하며, 모델이 이모지의 유해 의미를 인식할 수 있지만 이모지가 존재할 때는 거부 응답이 억제된다고 지적합니다.
토큰화 연구는 이모지가 일반적으로 희귀하거나 비정형 조각으로 분해되어 텍스트 등가물과 거의 겹치지 않으며, 결과적으로 유해 의미를 위한 대체 채널을 만든다는 점을 추가로 보여줍니다.
모델 메커니즘을 넘어 논문은 사전 학습 데이터를 조사하여 자주 사용되는 많은 이모지가 포르노, 사기, 도박 등 유해한 맥락에서 등장한다는 사실을 발견했습니다. 저자들은 이러한 반복 노출이 이모지와 유해 콘텐츠 사이의 연관성을 정상화시켜 모델이 독성 프롬프트를 차단하기보다 따르게 만들 수 있다고 주장합니다.
이러한 발견은 내부 처리 특이성과 편향된 사전 학습 데이터가 이모지가 안전 장치를 우회하는 데 놀라운 효과를 발휘하는 데 기여한다는 점을 시사합니다.
결론
LLM을 탈옥하기 위해 대체 입력 방식을 사용하는 경우는 드물지 않습니다. 예를 들어 최근 몇 년간 16진수 인코딩이 사용되었다하여 ChatGPT의 필터를 우회한 사례가 있습니다. 문제는 들어오는 요청과 나가는 응답을 평가하기 위해 텍스트 기반 언어만을 평면적으로 사용하는 데 있는 것으로 보입니다.
이모지의 경우, 규칙 위반 의미의 숨은 위치가 비정통적인 전송 방식 때문에 처벌이나 개입 없이 담론에 도입될 수 있습니다. CLIP 기반 전사 방식이 모든 이미지 업로드를 all 차단한다면, 공격적이거나 침해적인 자료가 플래그 가능한 텍스트로 전환될 것이라고 생각할 수 있습니다.
실제로 주요 LLM을 대상으로 한 연구에서는 그렇지 않은 것으로 나타났으며, 이들의 언어 장벽은 깨지기 쉬우면서도 텍스트 중심적입니다. 예를 들어 heatmap activations을 연구하는 등 보다 광범위한 콘텐츠 해석은 처리 비용이나 대역폭 비용을 증가시켜 실용적으로 비싸게 만들 수 있다는 점을 포함해 여러 제한 사항과 고려 사항이 존재할 수 있습니다.
* 대부분의 논문에 비해 이 논문의 레이아웃은 혼란스럽고, 방법론과 테스트가 명확히 구분되지 않았습니다. 따라서 우리는 이러한 상황에서도 작업의 핵심 가치를 가능한 한 잘 전달하려 노력했습니다.
† 결과에 대한 거의 파악하기 어렵고 혼란스러운 다루임을 인정합니다.
최초 게시: 2025년 9월 17일 수요일












