Ângulo de Anderson

O Uso de Emojis Pode Bypassar Filtros de ConteÚdo em Chatbots de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Os emojis podem ser usados para bypassar os mecanismos de segurança de grandes modelos de linguagem e desencadear saídas tÃģxicas que normalmente seriam bloqueadas. Por esse meio, os LLMs podem ser feitos para discutir e dar conselhos sobre assuntos proibidos, como a fabricaçÃĢo de bombas e assassinato.

 

Uma nova colaboraçÃĢo entre a China e Cingapura encontrou evidÊncias convincentes de que os emojis podem ser usados nÃĢo apenas para bypassar os filtros de detecçÃĢo de conteÚdo em grandes modelos de linguagem (LLMs), mas tambÃĐm podem aumentar o nível de toxicidade durante a interaçÃĢo do usuÃĄrio com os modelos:

Do novo artigo, uma demonstraçÃĢo ampla das maneiras pelas quais a codificaçÃĢo de um conceito proibido com emojis pode ajudar um usuÃĄrio a 'jailbreak' um LLM popular. Fonte: https://arxiv.org/pdf/2509.11141

Do novo artigo, uma demonstraçÃĢo ampla das maneiras pelas quais a codificaçÃĢo de um conceito proibido com emojis pode ajudar um usuÃĄrio a ‘jailbreak’ um LLM popular. Fonte: https://arxiv.org/pdf/2509.11141

No exemplo acima, do novo artigo, vemos que transformar a intençÃĢo baseada em palavras que violam regras em uma versÃĢo alternativa com emojis pode provocar uma resposta muito mais “cooperativa” de um modelo de linguagem sofisticado, como o ChatGPT-4o (que normalmente sanitiza as prompts de entrada e intercepta o material de saída que pode violar as regras da empresa).

Em circunstÃĒncias extremas, o uso de emojis pode, portanto, operar como uma tÃĐcnica de “jailbreak”, de acordo com os autores do novo trabalho.

Um mistÃĐrio residual declarado no artigo ÃĐ a pergunta de por que os modelos de linguagem dÃĢo aos emojis tanta liberdade para violar regras e provocar conteÚdo tÃģxico, quando os modelos jÃĄ entendem que certos emojis tÊm fortes associaçÃĩes tÃģxicas.

A sugestÃĢo apresentada ÃĐ que, porque os LLMs sÃĢo treinados para modelar e reproduzir padrÃĩes de seus dados de treinamento, e porque os emojis sÃĢo frequentemente encontrados nesses dados, o modelo aprende que o emoji pertence àquela discussÃĢo e o trata como uma associaçÃĢo estatística, em vez de conteÚdo a ser avaliado e filtrado.

Isso significa que o emoji, quando reutilizado em uma prompt, ajuda o modelo a prever continuidades tÃģxicas com mais confiança; mas, em vez de agir como uma bandeira vermelha, o emoji funciona como um cue semÃĒntico, que reforça o significado tÃģxico pretendido, em vez de moderÃĄ-lo ou interceptÃĄ-lo. Como a alinhamento de segurança ÃĐ aplicado apÃģs o fato, e frequentemente em um quadro literal estreito, as prompts com esses emojis podem, portanto, evadir a detecçÃĢo inteiramente.

Dessa forma, o artigo propÃĩe que o modelo nÃĢo se torna tolerante apesar da associaçÃĢo tÃģxica – ele se torna tolerante por causa dela.

Passe Livre

Dito isso, os autores admitem que isso nÃĢo representa uma teoria conclusiva sobre por que o uso de emojis pode bypassar os filtros de conteÚdo em modelos de linguagem. Eles afirmam:

‘Os modelos podem reconhecer a intençÃĢo maliciosa expressa por emojis, mas como eles bypassam os mecanismos de segurança permanece incerto.’

A fraqueza pode decorrer do design centrado em texto dos filtros de conteÚdo, que supÃĩem entrada de texto literal ou embeddings fielmente convertidos em equivalentes de texto: em ambos os casos, o sistema depende de tokens explícitos que podem ser correspondidos às regras de segurança.

Para ilustrar com um exemplo de ediçÃĢo de imagem baseada em IA: quando um usuÃĄrio carrega uma imagem NSFW para um modelo de visÃĢo-linguagem e solicita modificaçÃĩes, sistemas como o Adobe Firefly ou ChatGPT empregam CLIP-style pipelines para extrair conceitos textuais da imagem, como um prÃĐ-requisito para ediçÃĢo. Uma vez que esses conceitos sÃĢo renderizados em palavras, a presença de qualquer termo restrito nesses conceitos extraídos acionarÃĄ o filtro, causando a rejeiçÃĢo da solicitaçÃĢo.

No entanto, por algum motivo, o status de um emoji como nem palavra nem imagem (ou como ambos) parece dar-lhe o poder de transcender a filtragem; claramente, como os autores indicam, mais pesquisas sobre essa curiosa brecha sÃĢo necessÃĄrias.

O novo artigo ÃĐ intitulado Quando o Sorriso Vira Hostil: Interpretando Como Emojis Acionam a Toxicidade dos LLMs e vem de nove autores da Universidade Tsinghua e da Universidade Nacional de Cingapura.

(Infelizmente, muitos dos exemplos a que o artigo se refere estÃĢo em um apÊndice que ainda nÃĢo foi disponibilizado; embora tenhamos solicitado isso aos autores, o apÊndice nÃĢo foi fornecido no momento da escrita. No entanto, os resultados empíricos no artigo principal permanecem dignos de atençÃĢo.)

TrÊs InterpretaçÃĩes Centrais de Emojis

Os autores destacam trÊs características linguísticas que tornam os emojis eficazes para bypassar os filtros. Primeiramente, os significados dos emojis sÃĢo dependentes do contexto. Por exemplo, o emoji “Dinheiro com Asas” ÃĐ oficialmente definido como representando transferÊncias de dinheiro ou gastos; no entanto, dependendo do texto circundante, ele tambÃĐm pode implicar atividade legítima ou ilícita:

Em uma ilustraçÃĢo parcial do novo artigo, vemos que um emoji popular pode ter seu significado sequestrado, alterado ou subvertido no uso popular. Isso efetivamente dÃĄ ao emoji um passaporte oficial para o espaço semÃĒntico e uma carga oculta de significado negativo ou tÃģxico que pode ser explorada uma vez que esteja alÃĐm dos filtros.

Em uma ilustraçÃĢo parcial do novo artigo, vemos que um emoji popular pode ter seu significado sequestrado, alterado ou subvertido no uso popular.

Em segundo lugar, os emojis podem alterar o tom de uma prompt. Sua presença frequentemente adiciona brincadeira ou ironia, suavizando o registro emocional. Em consultas prejudiciais, isso pode fazer com que a solicitaçÃĢo pareça uma piada ou um jogo, encorajando o modelo a responder em vez de rejeitar:

O efeito de aliviar os tons dos emojis pode desintoxicar o tom sem desintoxicar a intençÃĢo.

O efeito de aliviar os tons dos emojis pode desintoxicar o tom sem desintoxicar a intençÃĢo.

Terceiramente, o artigo afirma que os emojis sÃĢo independentes de linguagem: um Único emoji pode transmitir o mesmo sentimento em inglÊs, chinÊs, francÊs e outros idiomas. Isso os torna ideais para prompts multilíngues, preservando o significado mesmo quando o texto circundante ÃĐ traduzido:

O emoji de coraçÃĢo partido transmite uma mensagem universal, talvez nÃĢo menos porque representa um caso de base na condiçÃĢo humana, relativamente imune a variaçÃĩes nacionais ou culturais.

O emoji de coraçÃĢo partido transmite uma mensagem universal.

Aproach, Dados e Testes*

Os pesquisadores criaram uma versÃĢo modificada do conjunto de dados AdvBench, reescrevendo prompts prejudiciais para incluir emojis, seja como substitutos para palavras sensíveis ou como disfarce decorativo. O AdvBench abrange 32 tÃģpicos de alto risco, incluindo bombas, hacking e assassinato, entre outros:

Exemplos originais do AdvBench, ilustrando como uma Única prompt adversÃĄria pode bypassar salvaguardas em vÃĄrios chatbots principais, provocando instruçÃĩes prejudiciais apesar do treinamento de alinhamento. Fonte: https://arxiv.org/pdf/2307.15043

Exemplos originais do AdvBench, ilustrando como uma Única prompt adversÃĄria pode bypassar salvaguardas em vÃĄrios chatbots principais. Fonte: https://arxiv.org/pdf/2307.15043

Todos os 520 casos originais do AdvBench foram alterados dessa forma, com os 50 prompts tÃģxicos e nÃĢo duplicados mais eficazes usados em toda a gama de experimentos. As prompts tambÃĐm foram traduzidas para vÃĄrios idiomas e testadas em sete modelos principais de cÃģdigo aberto e fechado, e em combinaçÃĢo com as tÃĐcnicas de “jailbreak” conhecidas, como Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); e DeepInception.

Os modelos de cÃģdigo fechado usados foram Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; e Gemini-1.5-pro. Os modelos de cÃģdigo aberto usados foram Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Equipe 2024b); e Qwen2.5-72B-Instruct (Equipe 2024a), com todos os experimentos repetidos trÊs vezes para levar em conta a chance aleatÃģria.

O estudo primeiro testou se reescrever prompts prejudiciais do AdvBench usando emojis aumentaria a saída tÃģxica, incluindo em traduçÃĩes para outros idiomas principais. AlÃĐm disso, aplicou o mesmo mÃĐtodo de ediçÃĢo de emojis às prompts das estratÃĐgias de “jailbreak” conhecidas (PAIR, TAP e DeepInception) para ver se a substituiçÃĢo de emojis poderia melhorar ainda mais seu sucesso.

Em ambos os casos, a estrutura das prompts originais foi preservada, com apenas termos sensíveis trocados por emojis e elementos decorativos adicionados para disfarçar a intençÃĢo.

Para mÃĐtricas de teste, os autores inovaram um sistema de pontuaçÃĢo chamado GPT-Judge. Nesse setup, o GPT-4o nÃĢo era o modelo sendo testado, mas sim foi solicitado a atuar como um juiz, atribuindo uma pontuaçÃĢo numÃĐrica PontuaçÃĢo de Dano (HS) às respostas geradas por outros modelos.

Cada saída foi classificada de um (inofensiva) a cinco (extremamente prejudicial), e a porcentagem de respostas que receberam um cinco foi relatada como a ProporçÃĢo de Prejuízo (HR).

Para evitar que os modelos se desviassem para explicaçÃĩes de emojis em vez de responder explicitamente, os pesquisadores adicionaram uma instruçÃĢo a cada prompt, dizendo ao modelo para tornar sua resposta breve:

Resultados de prompts baseados em emojis no 'Setting-1', com comparaçÃĩes com variantes de ablaçÃĢo onde os emojis foram substituídos por palavras ou removidos completamente. Os nomes dos modelos sÃĢo abreviados por falta de espaço.

Resultados de prompts baseados em emojis no ‘Setting-1’, com comparaçÃĩes com variantes de ablaçÃĢo onde os emojis foram substituídos por palavras ou removidos completamente.

Na tabela de resultados inicial acima, o lado esquerdo da tabela indica que prompts prejudiciais substituídos com emojis alcançaram pontuaçÃĩes de HS e HR significativamente mais altas do que as versÃĩes ablativas (ou seja, versÃĩes onde o emoji foi traduzido de volta para texto, expondo-o diretamente aos filtros de conteÚdo).

Os autores observam† que a abordagem de substituiçÃĢo de emojis supera os mÃĐtodos de “jailbreak” anteriores, como delineado na tabela de resultados adicional abaixo:

Resultados da ProporçÃĢo de Prejuízo para prompts de 'jailbreak' aumentados com emojis no 'Setting-2', com nomes de modelos mostrados em forma abreviada.

Resultados da ProporçÃĢo de Prejuízo para prompts de ‘jailbreak’ aumentados com emojis no ‘Setting-2’, com nomes de modelos mostrados em forma abreviada.

A primeira das duas tabelas mostradas acima, os autores afirmam, tambÃĐm indica que o efeito dos emojis se estende por idiomas. Quando os componentes textuais das prompts de emojis foram traduzidos para chinÊs, francÊs, espanhol e russo, as saídas prejudiciais permaneceram altas; porque esses sÃĢo todos idiomas de alto recurso, os resultados sugerem que o risco nÃĢo se limita ao inglÊs, mas se aplica amplamente a grupos de usuÃĄrios principais, com os emojis funcionando como um canal transferível para geraçÃĢo tÃģxica.

Em direçÃĢo à conclusÃĢo do artigo, os pesquisadores sugerem que o efeito dos emojis nÃĢo ÃĐ simplesmente acidental, mas enraizado na maneira como os modelos processam-nos, observando que os modelos aparentemente podem reconhecer o significado prejudicial dos emojis – no entanto, as respostas de rejeiçÃĢo sÃĢo suprimidas quando os emojis estÃĢo presentes.

Estudos de tokenizaçÃĢo indicam ainda que os emojis sÃĢo geralmente quebrados em fragmentos raros ou irregulares com pouca sobreposiçÃĢo com seus equivalentes textuais, efetivamente criando um canal alternativo para semÃĒntica prejudicial.

Olhando alÃĐm da mecÃĒnica do modelo, o artigo examina ainda os dados de prÃĐ-treinamento, encontrando que muitos emojis frequentemente usados aparecem em contextos tÃģxicos, como pornografia, golpes ou jogos de azar. Os autores argumentam que essa exposiçÃĢo repetida pode normalizar a associaçÃĢo entre os emojis e o conteÚdo prejudicial, encorajando os modelos a atender a prompts tÃģxicos em vez de bloqueÃĄ-los.

Juntos, esses achados sugerem que tanto as peculiaridades internas de processamento quanto os dados de prÃĐ-treinamento tendenciosos contribuem para a surpreendente eficÃĄcia dos emojis em bypassar as medidas de segurança.

ConclusÃĢo

NÃĢo ÃĐ incomum usar mÃĐtodos de entrada alternativos para tentar “jailbreak” os LLMs. Nos Últimos anos, por exemplo, codificaçÃĢo hexadecimal foi usada para bypassar os filtros do ChatGPT. O problema parece residir no uso plano de linguagem baseada em texto para qualificar solicitaçÃĩes de entrada e saída.

No caso dos emojis, um locus oculto de significado que viola regras pode aparentemente ser introduzido na discussÃĢo sem penalidade ou intervençÃĢo, porque o mÃĐtodo de transmissÃĢo ÃĐ nÃĢo convencional. AlguÃĐm poderia pensar que a transliteraçÃĢo baseada em CLIP interviria em todos uploads de imagens, de modo que o material ofensivo ou infringidor acabaria como texto sinalizado.

Evidentemente, isso nÃĢo ÃĐ o caso, pelo menos onde os principais LLMs estudados estÃĢo concernidos; suas barreiras linguísticas parecem ser frÃĄgeis e centradas em texto. AlguÃĐm pode imaginar que uma interpretaçÃĢo mais extensa do conteÚdo (por exemplo, estudando ativaçÃĩes de heatmap) carrega um custo de processamento e/ou largura de banda que pode tornar tais abordagens impraticavelmente caras, entre outras limitaçÃĩes e consideraçÃĩes possíveis.

 

* O layout deste artigo ÃĐ caÃģtico em comparaçÃĢo com a maioria, com metodologia e testes nÃĢo claramente delineados. Portanto, fizemos o nosso melhor para representar o valor central do trabalho o mais fielmente possível nessas circunstÃĒncias.

† Em um tratamento admitidamente quase intransponível e confuso dos resultados.

Publicado pela primeira vez na quarta-feira, 17 de setembro de 2025

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]