Angle d’Anderson

L’utilisation d’émoticônes peut contourner les filtres de contenu dans les chatbots IA

mm
Ajouter Unite.AI à vos sources préférées sur Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Les émoticônes peuvent être utilisées pour contourner les mécanismes de sécurité des grands modèles de langage, et déclencher des sorties toxiques qui seraient autrement bloquées. Par ce moyen, les LLM peuvent être amenés à discuter et à donner des conseils sur des sujets interdits tels que la fabrication de bombes et le meurtre.

 

Une nouvelle collaboration entre la Chine et Singapour trouve des preuves convaincantes que les émoticônes peuvent être utilisées non seulement pour contourner les filtres de détection de contenu dans les grands modèles de langage (LLM), mais peuvent également augmenter le niveau de toxicité lors de l’interaction d’un utilisateur avec les modèles:

À partir du nouveau document, une démonstration large des moyens par lesquels l'encodage d'un concept interdit avec des émoticônes peut aider un utilisateur à 'casser' un LLM populaire. Source: https://arxiv.org/pdf/2509.11141

À partir du nouveau document, une démonstration large des moyens par lesquels l’encodage d’un concept interdit avec des émoticônes peut aider un utilisateur à ‘casser’ un LLM populaire. Source: https://arxiv.org/pdf/2509.11141

Dans l’exemple ci-dessus, à partir du nouveau document, nous voyons que la transformation d’une intention basée sur des mots en infraction en une version alternative avec des émoticônes peut éliciter une réponse beaucoup plus « coopérative » d’un modèle de langage sophistiqué tel que ChatGPT-4o (qui habituellement sanitize les invites de saisie et intercepte le matériel de sortie qui peut enfreindre les règles de l’entreprise).

En effet, dans les circonstances les plus extrêmes, l’utilisation d’émoticônes peut donc opérer comme une technique de « jailbreak », selon les auteurs du nouveau travail.

Un mystère résiduel énoncé dans le document est la question de pourquoi les modèles de langage accordent aux émoticônes une telle latitude pour enfreindre les règles et éliciter un contenu toxique, alors que les modèles comprennent déjà que certaines émoticônes ont des associations toxiques fortes.

La suggestion proposée est que parce que les LLM sont formés pour modéliser et reproduire des modèles à partir de leurs données de formation, et parce que les émoticônes sont si fréquemment trouvées dans ces données, le modèle apprend que l’émoticône appartient à ce discours, et le traite comme une association statistique, au lieu de contenu à évaluer et à filtrer.

Cela signifie que l’émoticône, lorsqu’il est réutilisé dans une invite, aide le modèle à prédire des suites toxiques avec plus de confiance; mais plutôt que d’agir comme un drapeau rouge, l’émoticône fonctionne comme un indice sémantique, qui renforce en fait le sens toxique intentionnel au lieu de le modérer ou de l’intercepter. Puisque l’alignement de sécurité est appliqué après coup, et souvent dans un cadre littéral étroit, les invites avec ces émoticônes peuvent donc éviter la détection entièrement.

De cette façon, le document propose que le modèle ne devient pas tolérant malgré l’association toxique – il devient tolérant à cause de celle-ci.

Passeport gratuit

Ceci étant dit, les auteurs admettent que cela ne représente pas une théorie concluante sur la raison pour laquelle l’utilisation d’émoticônes peut contourner les filtres de contenu dans les modèles de langage. Ils déclarent:

‘Les modèles peuvent reconnaître l’intention malveillante exprimée par les émoticônes, mais la façon dont ils contournent les mécanismes de sécurité reste peu claire.’

La faiblesse peut provenir de la conception centrée sur le texte des filtres de contenu, qui supposent soit une saisie de texte littérale, soit des incrustations fidèlement converties en équivalents textuels: dans les deux cas, le système repose sur des jetons explicites qui peuvent être comparés aux règles de sécurité.

Pour prendre une illustration à partir de l’édition d’images basée sur l’IA: lorsqu’un utilisateur télécharge une image NSFW à un modèle de vision-langage et demande des modifications, des systèmes tels que Adobe Firefly ou ChatGPT emploient des pipelines de style CLIP pour extraire des concepts textuels de l’image, comme préalable à l’édition. Une fois que ces concepts sont rendus en mots, la présence de termes interdits dans ces mots extraits déclenchera le filtre, provoquant le rejet de la demande.

Cependant, pour une raison ou une autre, le statut d’une émoticône en tant que ni mot ni image (ou les deux) semble lui conférer un pouvoir pour transcender le filtrage; clairement, comme l’indiquent les auteurs, des recherches supplémentaires sur cette curieuse faille sont nécessaires.

Le nouveau document est intitulé Quand Smiley devient hostile: interpréter comment les émoticônes déclenchent la toxicité des LLM, et provient de neuf auteurs issus de l’Université Tsinghua et de l’Université nationale de Singapour.

(Malheureusement, de nombreux exemples auxquels le document fait référence se trouvent dans une annexe qui n’a pas encore été rendue disponible; bien que nous ayons demandé cela aux auteurs, l’annexe n’a pas été fournie au moment de la rédaction. Néanmoins, les résultats empiriques du document principal restent dignes d’attention.)

Trois interprétations d’émoticônes de base

Les auteurs mettent en évidence trois traits linguistiques qui font que les émoticônes sont efficaces pour contourner les filtres. Premièrement, les significations des émoticônes sont dépendantes du contexte. Par exemple, l’émoticône « Argent avec des ailes » est officiellement définie comme représentant des transferts d’argent ou des dépenses; cependant, en fonction du texte environnant, elle peut également impliquer soit une activité légitime, soit une activité illicite:

Dans une illustration partielle à partir du nouveau document, nous voyons qu'une émoticône populaire peut avoir son sens détourné, modifié ou subverti dans l'utilisation populaire. Cela lui donne effectivement un passeport officiel dans l'espace sémantique, et une charge utile cachée de sens négatif ou toxique qui peut être exploitée une fois qu'elle est passée les filtres.

Dans une illustration partielle à partir du nouveau document, nous voyons qu’une émoticône populaire peut avoir son sens détourné, modifié ou subverti dans l’utilisation populaire.

Deuxièmement, les émoticônes peuvent modifier le ton d’une invite. Leur présence ajoute souvent de la gaieté ou de l’ironie, adoucissant l’enregistrement émotionnel. Dans les requêtes nuisibles, cela peut rendre la demande ressembler à une plaisanterie ou à un jeu, encourageant le modèle à répondre plutôt que de rejeter:

L'effet de levain des émoticônes peut détoxifier le ton sans détoxifier l'intention.

L’effet de levain des émoticônes peut détoxifier le ton sans détoxifier l’intention.

Troisièmement, le document affirme que les émoticônes sont indépendantes de la langue: une seule émoticône peut transmettre le même sentiment à travers l’anglais, le chinois, le français et d’autres langues. Cela les rend idéales pour les invites multilingues, en préservant le sens même lorsque le texte environnant est traduit:

L'émoticône du cœur brisé transmet un message universel, peut-être pas moins parce qu'il représente un cas de base dans la condition humaine, relativement immunisé contre les variations nationales ou culturelles.

L’émoticône du cœur brisé transmet un message universel.

Approche, données et tests*

Les chercheurs ont créé une version modifiée du jeu de données AdvBench, en réécrivant les invites nuisibles pour inclure des émoticônes soit comme substituts de mots sensibles, soit comme camouflage décoratif. AdvBench couvre 32 sujets à haut risque, notamment les bombes, le piratage et le meurtre, entre autres:

Exemples originaux à partir d'AdvBench, illustrant comment une seule invite adverse peut contourner les sauvegardes dans plusieurs chatbots majeurs, en élicitant des instructions nuisibles malgré la formation d'alignement. Source: https://arxiv.org/pdf/2307.15043

Exemples originaux à partir d’AdvBench, illustrant comment une seule invite adverse peut contourner les sauvegardes dans plusieurs chatbots majeurs. Source: https://arxiv.org/pdf/2307.15043

Toutes les 520 instances originales d’AdvBench ont été modifiées de cette manière, avec les 50 invites toxiques et non dupliquées les plus efficaces utilisées à travers la gamme des expériences. Les invites ont également été traduites dans plusieurs langues et testées sur sept modèles majeurs fermés et open source, ainsi qu’en combinaison avec les techniques de jailbreak connues Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); et DeepInception.

Les modèles fermés utilisés étaient Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; et Gemini-1.5-pro. Les modèles open source utilisés étaient Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); et Qwen2.5-72B-Instruct (Team 2024a), avec toutes les expériences répétées trois fois pour tenir compte du hasard.

L’étude a d’abord testé si la réécriture d’invites nuisibles à partir d’AdvBench en utilisant des émoticônes augmenterait la sortie toxique, y compris dans les traductions vers d’autres langues majeures. De plus, elle a appliqué la même méthode d’édition d’émoticônes aux invites à partir des stratégies de jailbreak connues (PAIR, TAP et DeepInception) pour voir si le remplacement d’émoticônes pourrait améliorer davantage leur succès.

Dans les deux cas, la structure des invites originales a été préservée, avec uniquement les termes sensibles échangés contre des émoticônes et des éléments décoratifs ajoutés pour dissimuler l’intention.

Pour les métriques de test, les auteurs ont innové un système de notation appelé GPT-Judge. Dans cette configuration, GPT-4o n’était pas le modèle testé, mais plutôt était invité à agir comme un juge, en attribuant un score numérique Score de nuisance (HS) aux réponses générées par d’autres modèles.

Chaque sortie a été notée de un (inoffensif) à cinq (extrêmement nuisible), et le pourcentage de réponses qui ont reçu un cinq a été signalé comme le Taux de nuisance (HR).

Pour empêcher les modèles de dériver vers des explications d’émoticônes au lieu de répondre explicitement, les chercheurs ont ajouté une instruction à chaque invite, demandant au modèle de rendre sa réponse brève:

Résultats à partir d'invites basées sur des émoticônes dans 'Setting-1', avec des comparaisons avec des variantes d'ablation où les émoticônes ont été remplacées par des mots, ou supprimées entièrement. Les noms de modèle sont abrégés pour des raisons d'espace.

Résultats à partir d’invites basées sur des émoticônes dans ‘Setting-1’, avec des comparaisons avec des variantes d’ablation où les émoticônes ont été remplacées par des mots, ou supprimées entièrement.

Dans le tableau de résultats initial ci-dessus, le côté gauche du tableau indique que les invites nuisibles substituées avec des émoticônes ont obtenu des scores HS et HR nettement plus élevés que les versions ablatées (c’est-à-dire les versions où l’émoticône a été traduite en texte, l’exposant directement aux filtres de contenu).

Les auteurs notentque l’approche de substitution d’émoticônes surpasse les méthodes de jailbreak antérieures, comme indiqué dans le tableau de résultats supplémentaire ci-dessous:

Résultats du Taux de nuisance pour les invites de jailbreak augmentées d'émoticônes dans 'Setting-2', avec les noms de modèle affichés sous forme abrégée.

Résultats du Taux de nuisance pour les invites de jailbreak augmentées d’émoticônes dans ‘Setting-2’, avec les noms de modèle affichés sous forme abrégée.

Le premier des deux tableaux ci-dessus, les auteurs déclarent, indique également que l’effet des émoticônes se propage à travers les langues. Lorsque les composants textuels des invites d’émoticônes ont été traduits en chinois, en français, en espagnol et en russe, les sorties nuisibles sont restées élevées; puisque ce sont toutes des langues à ressources élevées, les résultats suggèrent que le risque n’est pas limité à l’anglais mais s’applique largement aux principaux groupes d’utilisateurs, les émoticônes fonctionnant comme un canal transférable pour la génération de contenu toxique.

Vers la conclusion du document, les chercheurs suggèrent que l’effet des émoticônes n’est pas simplement accidentel mais enraciné dans la façon dont les modèles les traitent, notant que les modèles peuvent apparemment reconnaître le sens nuisible des émoticônes – mais les réponses de rejet sont supprimées lorsque les émoticônes sont présentes.

Les études de tokenisation indiquent en outre que les émoticônes sont généralement divisées en fragments rares ou irréguliers avec peu de chevauchement avec leurs équivalents textuels, créant effectivement un canal alternatif pour la sémantique nuisible.

En regardant au-delà de la mécanique du modèle, le document examine également les données de préformation, constatant que de nombreuses émoticônes fréquemment utilisées apparaissent dans des contextes toxiques tels que la pornographie, les arnaques ou les jeux de hasard. Les auteurs soutiennent que cette exposition répétée peut normaliser l’association entre les émoticônes et le contenu nuisible, encourageant les modèles à se conformer aux invites toxiques plutôt que de les bloquer.

Ensemble, ces constatations suggèrent que les singularités de traitement interne et les données de préformation biaisées contribuent à l’efficacité surprenante des émoticônes pour contourner les mesures de sécurité.

Conclusion

Il n’est pas rare d’utiliser des méthodes de saisie alternatives pour essayer de « casser » les LLM. Ces dernières années, par exemple, le codage hexadécimal a été utilisé pour contourner les filtres de ChatGPT. Le problème semble résider dans l’utilisation plate de la langue textuelle pour qualifier les invites entrantes et les réponses sortantes.

Dans le cas des émoticônes, un lieu caché de sens en infraction peut apparemment être introduit dans le discours sans pénalité ou intervention, car la méthode de transmission est non conventionnelle. On pourrait penser que la translittération basée sur CLIP interviendrait dans toutes les téléchargements d’images, de sorte que le matériel offensant ou contraire aux règles finirait par devenir du texte signalisable.

Il est clair que ce n’est pas le cas, du moins pour les principaux LLM étudiés; leurs barrières linguistiques semblent être fragiles et centrées sur le texte. On peut imaginer que l’interprétation plus extensive du contenu (par exemple, en étudiant les activations de heatmap) comporte un coût de traitement et/ou de bande passante qui peut rendre de telles approches impraticablement coûteuses, parmi d’autres limitations et considérations possibles.

 

* La disposition de ce document est chaotique par rapport à la plupart, avec la méthodologie et les tests non clairement délimités. Nous avons donc fait de notre mieux pour représenter la valeur fondamentale du travail aussi bien que possible dans ces circonstances.

Dans un traitement admis presque impénétrable et confus des résultats.

Publié pour la première fois le mercredi 17 septembre 2025

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai