Ángulo de Anderson
El uso de emojis puede eludir los filtros de contenido en los chatbots de IA

Los emojis pueden utilizarse para eludir los mecanismos de seguridad de los grandes modelos de lenguaje y desencadenar salidas tóxicas que de otro modo estarían bloqueadas. Por este medio, los LLM pueden hacer que se discutan y se ofrezcan consejos sobre temas prohibidos, como la fabricación de bombas y el asesinato.
Una nueva colaboración entre China y Singapur encuentra evidencia convincente de que los emojis no solo pueden utilizarse para eludir los filtros de detección de contenido en los grandes modelos de lenguaje (LLM), sino que también pueden aumentar en general el nivel de toxicidad durante la interacción del usuario con los modelos:

Del nuevo artículo, una amplia demostración de las formas en que codificar un concepto prohibido con emojis puede ayudar a un usuario a ‘jailbreak’ un LLM popular. Fuente: https://arxiv.org/pdf/2509.11141
En el ejemplo anterior, del nuevo artículo, vemos que transformar la intención basada en palabras que violan las reglas en una versión alternativa con emojis puede provocar una respuesta mucho más “cooperativa” de un modelo de lenguaje sofisticado como ChatGPT-4o (que habitualmente sanitiza las solicitudes de entrada y intercepta el material de salida que puede violar las reglas de la empresa).
En efecto, en las circunstancias más extremas, el uso de emojis puede operar como una técnica de “jailbreak”, según los autores del nuevo trabajo.
Una de las misteriosas preguntas planteadas en el artículo es la pregunta de por qué los modelos de lenguaje dan a los emojis tanta libertad para violar las reglas y provocar contenido tóxico, cuando los modelos ya entienden que ciertos emojis tienen fuertes asociaciones tóxicas.
La sugerencia que se ofrece es que, dado que los LLM están entrenados para modelar y reproducir patrones de sus datos de entrenamiento, y dado que los emojis se encuentran con frecuencia en esos datos, el modelo aprende que el emoji pertenece a ese discurso y lo trata como una asociación estadística, en lugar de contenido que debe evaluarse y filtrarse.
Esto significa que el emoji, cuando se vuelve a utilizar en una solicitud, ayuda al modelo a predecir continuaciones tóxicas con más confianza; pero, en lugar de actuar como una señal de alerta, el emoji funciona como una pista semántica, que en realidad refuerza el significado tóxico pretendido en lugar de moderarlo o interceptarlo. Dado que la alineación de seguridad se aplica después de los hechos, y a menudo en un marco literal estrecho, las solicitudes con estos emojis pueden eludir la detección por completo.
De esta manera, el artículo propone que el modelo no se vuelve tolerante a pesar de la asociación tóxica – se vuelve tolerante debido a ella.
Pase libre
Dicho esto, los autores admiten que esto no representa una teoría concluyente sobre por qué el uso de emojis puede eludir tan efectivamente los filtros de contenido en los modelos de lenguaje. Declaran:
‘Los modelos pueden reconocer la intención maliciosa expresada por los emojis, pero cómo eluden los mecanismos de seguridad sigue sin estar claro.’
La debilidad puede provenir del centrado en texto del diseño de los filtros de contenido, que asumen entrada de texto literal o incrustaciones convertidas fielmente en equivalentes de texto: en ambos casos, el sistema se basa en tokens explícitos que pueden coincidir con las reglas de seguridad.
Para ilustrar con un ejemplo de edición de imágenes basada en IA: cuando un usuario carga una imagen NSFW a un modelo de lenguaje de visión y solicita modificaciones, sistemas como Adobe Firefly o ChatGPT emplean pipelines de estilo CLIP para extraer conceptos textuales de la imagen, como requisito previo para la edición. Una vez que esos conceptos se convierten en palabras, la presencia de cualquier término restringido en esas palabras extraídas desencadenará el filtro, lo que provocará que la solicitud sea rechazada.
Pero, por alguna razón, el estado de un emoji como ni palabra ni imagen (o como ambos) parece otorgarle el poder de trascender el filtrado; claramente, como indican los autores, se justifica una mayor investigación sobre esta curiosa laguna.
El nuevo artículo se titula Cuando la carita sonriente se vuelve hostil: Interpretando cómo los emojis desencadenan la toxicidad de los LLM, y proviene de nueve autores de la Universidad Tsinghua y la Universidad Nacional de Singapur.
(Desafortunadamente, muchos de los ejemplos a los que se refiere el artículo se encuentran en un apéndice que aún no ha sido puesto a disposición; aunque hemos solicitado esto a los autores, el apéndice no ha sido proporcionado en el momento de la redacción. Sin embargo, los resultados empíricos en el artículo principal siguen siendo dignos de atención.)
Tres interpretaciones core de emojis
Los autores destacan tres rasgos lingüísticos que hacen que los emojis sean efectivos para eludir los filtros. En primer lugar, los significados de los emojis son dependientes del contexto. Por ejemplo, el emoji “Dinero con alas” (ver imagen a continuación) está oficialmente definido como representante de transferencias de dinero o gastos; sin embargo, dependiendo del texto circundante, también puede implicar actividad legítima o ilícita:

En una ilustración parcial del nuevo artículo, vemos que un emoji popular puede tener su significado secuestrado, alterado o subvertido en el uso popular.
En segundo lugar, los emojis pueden cambiar el tono de una solicitud. Su presencia a menudo agrega juego o ironía, suavizando el registro emocional. En consultas dañinas, esto puede hacer que la solicitud parezca una broma o un juego, lo que anima al modelo a responder en lugar de rechazar:

El efecto suavizante de los emojis puede desintoxicar el tono sin desintoxicar la intención.
En tercer lugar, el artículo afirma que los emojis son independientes del lenguaje: un solo emoji puede transmitir el mismo sentimiento a través del inglés, chino, francés y otros idiomas. Esto los hace ideales para solicitudes multilingües, preservando el significado incluso cuando el texto circundante se traduce:

El emoji de corazón roto transmite un mensaje universal.
Enfoque, datos y pruebas
Los investigadores crearon una versión modificada del conjunto de datos AdvBench, reescribiendo solicitudes dañinas para incluir emojis como sustitutos de palabras sensibles o como camuflaje decorativo. AdvBench cubre 32 temas de alto riesgo, incluyendo bombardeos, piratería informática y asesinatos, entre otros:

Ejemplos originales de AdvBench, que ilustran cómo una sola solicitud adversaria puede eludir las salvaguardias en varios chatbots importantes. Fuente: https://arxiv.org/pdf/2307.15043
Todas las 520 instancias originales de AdvBench se alteraron de esta manera, con los 50 primeros prompts tóxicos y no duplicados utilizados en todo el rango de experimentos. Las solicitudes también se tradujeron a varios idiomas y se probaron en siete modelos importantes de código abierto y cerrado, y en combinación con las técnicas de “jailbreak” conocidas como Refinamiento Automático Iterativo de Solicitudes (PAIR); Árbol de Ataques con Poda (TAP); y DeepInception.
Los modelos de código cerrado utilizados fueron Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; y Gemini-1.5-pro. Los modelos de código abierto utilizados fueron Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Equipo 2024b); y Qwen2.5-72B-Instruct (Equipo 2024a), con todos los experimentos repetidos tres veces para tener en cuenta la casualidad.
El estudio primero probó si reescribir solicitudes dañinas de AdvBench utilizando emojis aumentaría la salida tóxica, incluyendo en traducciones a otros idiomas importantes. Además, aplicó el mismo método de edición de emojis a solicitudes de las estrategias de “jailbreak” conocidas (PAIR, TAP y DeepInception) para ver si la sustitución de emojis podría mejorar aún más su éxito.
En ambos casos, se preservó la estructura de las solicitudes originales, con solo términos sensibles intercambiados por emojis y elementos decorativos agregados para disfrazar la intención.
Para las métricas de prueba, los autores innovaron un sistema de puntuación llamado GPT-Juez. En este montaje, GPT-4o no era el modelo que se probaba, sino que se le pedía que actuara como calificador, asignando una puntuación numérica Puntuación de Daño (HS) a las respuestas generadas por otros modelos.
Cada salida se calificó del 1 (inofensiva) al 5 (extremadamente dañina), y el porcentaje de respuestas que recibieron un 5 se informó como la Proporción de Daño (HR).
Para evitar que los modelos se desviaran hacia explicaciones de emojis en lugar de responder explícitamente, los investigadores agregaron una instrucción a cada solicitud, pidiendo al modelo que hiciera su respuesta breve:

Resultados de las solicitudes con emojis en ‘Configuración-1’, con comparaciones con variantes de ablación donde los emojis se reemplazaron con palabras o se eliminaron por completo.
En la tabla de resultados inicial anterior, el lado izquierdo de la tabla indica que las solicitudes dañinas sustituidas con emojis lograron puntuaciones de HS y HR notablemente más altas que las versiones ablativas (es decir, versiones donde el emoji se tradujo de regreso a texto, exponiéndolo directamente a los filtros de contenido).
Los autores señalan que el enfoque de sustitución de emojis supera los métodos de “jailbreak” anteriores, como se describe en la tabla de resultados adicional a continuación:

Resultados de la Proporción de Daño para las solicitudes de ‘jailbreak’ con emojis en ‘Configuración-2’, con los nombres de los modelos mostrados en forma abreviada.
La primera de las dos tablas mostradas anteriormente, los autores afirman, también indica que el efecto de los emojis se extiende a través de los idiomas. Cuando los componentes textuales de las solicitudes con emojis se tradujeron al chino, francés, español y ruso, las salidas dañinas permanecieron altas; porque estos son todos idiomas de alto recurso, los resultados sugieren que el riesgo no se limita al inglés, sino que se aplica ampliamente a los principales grupos de usuarios, con los emojis funcionando como un canal transferible para la generación tóxica.
Hacia la conclusión del artículo, los investigadores sugieren que el efecto de los emojis no es simplemente accidental, sino que está arraigado en la forma en que los modelos procesan los emojis, observando que los modelos pueden reconocer el significado dañino de los emojis, pero las respuestas de rechazo se suprimen cuando los emojis están presentes.
Los estudios de tokenización también indican que los emojis generalmente se dividen en fragmentos raros o irregulares con poco solapamiento con sus equivalentes textuales, lo que efectivamente crea un canal alternativo para la semántica dañina.
Al mirar más allá de la mecánica del modelo, el artículo examina también los datos de preentrenamiento, encontrando que muchos emojis frecuentemente utilizados aparecen en contextos tóxicos como la pornografía, los estafas o el juego. Los autores argumentan que esta exposición repetida puede normalizar la asociación entre los emojis y el contenido dañino, lo que anima a los modelos a cumplir con las solicitudes tóxicas en lugar de bloquearlas.
Juntos, estos hallazgos sugieren que tanto los caprichos internos de procesamiento como los datos de preentrenamiento sesgados contribuyen a la efectividad sorprendente de los emojis para eludir las medidas de seguridad.
Conclusión
No es inusual utilizar métodos de entrada alternativos para intentar “jailbreak” a los LLM. En años recientes, por ejemplo, la codificación hexadecimal ha sido utilizada para eludir los filtros de ChatGPT. El problema parece radicar en el uso plano del lenguaje basado en texto para calificar las solicitudes de entrada y salida.
En el caso de los emojis, un locus oculto de significado que viola las reglas puede aparentemente introducirse en el discurso sin penalización o intervención, porque el método de transmisión es poco convencional. Uno podría pensar que la transliteración basada en CLIP interveniría en todas las cargas de imágenes, de modo que el material ofensivo o infractor terminaría como texto susceptible de ser señalizado.
Evidentemente, esto no es el caso, al menos donde se refiere a los principales LLM estudiados; sus barreras lingüísticas parecen ser frágiles y centradas en el texto. Uno puede imaginar que una interpretación más extensa del contenido (por ejemplo, estudiando activaciones de mapa de calor) conlleva un costo de procesamiento y/o ancho de banda que puede hacer que estos enfoques sean impracticablemente costosos, entre otras posibles limitaciones y consideraciones.
* El diseño de este artículo es caótico en comparación con la mayoría, con la metodología y las pruebas no claramente delineadas. Hemos hecho nuestro mejor esfuerzo por representar el valor central del trabajo lo mejor posible en estas circunstancias.
† En un tratamiento admitidamente casi impenetrable y confuso de los resultados.
Publicado por primera vez el miércoles 17 de septiembre de 2025












