Unghiul lui Anderson

Utilizarea emoji poate ocoli filtrele de conținut în chatbot-urile AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Emojiurile pot fi utilizate pentru a ocoli mecanismele de siguranță ale modelelor de limbaj mari, și pentru a declanșa ieșiri toxice care altfel ar fi blocate. Prin această metodă, modelele de limbaj mari (LLM) pot fi făcute să discute și să ofere sfaturi pe subiecte interzise, cum ar fi fabricarea de bombe și crimă.

 

O nouă colaborare între China și Singapore a descoperit dovezi convingătoare că emojiurile pot fi utilizate nu numai pentru a ocoli filtrele de conținut din modelele de limbaj mari (LLM), dar și pentru a crește nivelul de toxicitate în timpul interacțiunii utilizatorului cu modelele:

Din noua lucrare, o demonstrație amplă a modurilor în care codificarea unui concept interzis cu emoji poate ajuta un utilizator să 'spargă' un model LLM popular. Sursă: https://arxiv.org/pdf/2509.11141

Din noua lucrare, o demonstrație amplă a modurilor în care codificarea unui concept interzis cu emoji poate ajuta un utilizator să ‘spargă’ un model LLM popular. Sursă: https://arxiv.org/pdf/2509.11141

În exemplul de mai sus, din noua lucrare, vedem că transformarea intenției bazate pe cuvinte care încalcă regulile într-o versiune alternativă încărcată cu emoji poate declanșa o reacție mult mai ‘cooperantă’ din partea unui model de limbaj sofisticat, cum ar fi ChatGPT-4o (care obișnuiește să sanitizeze prompturile de intrare și să intercepteze materialul de ieșire care ar putea încălca regulile companiei).

În mod efectiv, în circumstanțele cele mai extreme, utilizarea emojiurilor poate funcționa ca o tehnică de ‘spargere’ a jailbreak-ului, conform autorilor noii lucrări.

O enigmă reziduală menționată în lucrare este întrebarea de ce modelele de limbaj acordă emojiurilor atât de multă libertate de a încălca regulile și de a declanșa conținut toxic, atunci când modelele deja înțeleg că anumite emojiuri au asocieri puternic toxice.

Sugestia oferită este că, deoarece modelele de limbaj mari sunt antrenate pentru a modela și reproduce patternuri din datele de antrenament, și deoarece emojiurile sunt atât de frecvent întâlnite în aceste date, modelul învață că emojiul aparține în acea discuție, și îl tratează ca o asociere statistică, în loc de conținut care trebuie evaluat și filtrat.

Acest lucru înseamnă că emojiul, atunci când este reutilizat într-un prompt, ajută modelul să prevadă continuări toxice cu mai multă încredere; dar, în loc să funcționeze ca un steag roșu, emojiul funcționează ca o cue semantică, care întărește de fapt sensul toxic intenționat, în loc să modereze sau să intercepteze.

În acest fel, lucrarea propune că modelul nu devine tolerant în ciuda asocierii toxice – ci devine tolerant din cauza acesteia.

Free Pass

Cu toate acestea, autorii admit că aceasta nu reprezintă o teorie conclusivă cu privire la de ce utilizarea emojiurilor poate ocoli atât de eficient filtrele de conținut în modelele de limbaj. Ei afirmă că:

‘Modelele pot recunoaște intenția malefică exprimată de emojiuri, dar modul în care ocolesc mecanismele de siguranță rămâne neclar.’

Slăbiciunea poate proveni din designul centrat pe text al filtrelor de conținut, care presupun fie intrări de text literale, fie încorporări convertite cu fidelitate în echivalenți textuali: în ambele cazuri, sistemul se bazează pe tokeni expliciți care pot fi potriviți cu reguli de siguranță.

Pentru a ilustra cu un exemplu din editarea de imagini bazată pe AI: atunci când un utilizator încarcă o imagine NSFW într-un model de limbaj-viziune și solicită modificări, sisteme precum Adobe Firefly sau ChatGPT utilizează pipelines CLIP pentru a extrage concepte textuale din imagine, ca o condiție prealabilă pentru editare.

Însă, pentru oarecare motiv, statutul unui emoji ca fiind nici cuvânt, nici imagine (sau, altfel spus, ambele) pare să îi confere o putere de a transcende filtrarea; în mod evident, după cum indică autorii, cercetări suplimentare asupra acestei scăpări curioase sunt justificate.

Lucrarea nouă se intitulează Când Smiley Devine Ostil: Interpretarea Modului în Care Emojiurile Declanșează Toxicitatea LLM și provine de la nouă autori de la Universitatea Tsinghua și Universitatea Națională din Singapore.

(Din nefericire, multe dintre exemplele la care lucrarea face referire se află într-un apendice care nu a fost încă pus la dispoziție; deși am solicitat acest lucru autorilor, apendicele nu a fost furnizat la momentul scrierii. Cu toate acestea, rezultatele empirice din lucrarea principală rămân demne de atenție.)

Three Core Emoji Interpretations

Autorii subliniază trei trăsături lingvistice care fac ca emojiurile să fie eficiente în ocolirea filtrelor. În primul rând, înțelesurile emojiurilor sunt dependente de context. De exemplu, emojiul ‘Bani cu Aripile’ (a se vedea imaginea de mai jos) este definit oficial ca reprezentând transferuri de bani sau cheltuieli; cu toate acestea, în funcție de textul înconjurător, poate implica fie activități legitime, fie ilegale:

Într-o ilustrație parțială din noua lucrare, vedem că un emoji popular poate avea înțelesul său deturnat, alterat sau subvertit în utilizarea populară. Acest lucru îi conferă emojiului o 'pașaport' oficial în spațiul semantic și o 'încărcătură ascunsă' de înțeles negativ sau toxic care poate fi exploatat odată ce este trecut de filtre.

Într-o ilustrație parțială din noua lucrare, vedem că un emoji popular poate avea înțelesul său deturnat, alterat sau subvertit în utilizarea populară.

În al doilea rând, emojiurile pot schimba tonul unui prompt. Prezența lor adesea adaugă o notă de joc sau ironie, atenuând înregistrarea emoțională. În interogări dăunătoare, acest lucru poate face ca solicitarea să pară un joc sau o glumă, încurajând modelul să răspundă în loc să respingă:

Efectul de înmuiere al emojiurilor poate detoxifica tonul fără a detoxifica intenția.

Efectul de înmuiere al emojiurilor poate detoxifica tonul fără a detoxifica intenția.

În al treilea rând, lucrarea afirmă că emojiurile sunt nedependente de limbă: un singur emoji poate purta același sentiment în engleză, chineză, franceză și alte limbi. Acest lucru le face ideale pentru prompturi multilingve, păstrând înțelesul chiar și atunci când textul înconjurător este tradus:

Emojiul 'inimă sfărâmată' transmite un mesaj universal, poate nu în ultimul rând pentru că reprezintă un caz de bază în condiția umană, relativ imun la variațiile naționale sau culturale.

Emojiul ‘inimă sfărâmată’ transmite un mesaj universal.

Approach, Data and Tests*

Cercetătorii au creat o versiune modificată a setului de date AdvBench, rescriind prompturi dăunătoare pentru a include emojiuri fie ca înlocuitori pentru cuvinte sensibile, fie ca camuflaj decorativ. AdvBench acoperă 32 de subiecte cu risc ridicat, incluzând bombardamente, hacking și crimă, printre altele:

Exemple originale din AdvBench, ilustrând cum un singur prompt adversarial poate ocoli sistemele de securitate în multiple chatbot-uri majore, declanșând instrucțiuni dăunătoare în ciuda antrenamentului de aliniere. Sursă: https://arxiv.org/pdf/2307.15043

Exemple originale din AdvBench, ilustrând cum un singur prompt adversarial poate ocoli sistemele de securitate în multiple chatbot-uri majore. Source: https://arxiv.org/pdf/2307.15043

Toate cele 520 de instanțe originale AdvBench au fost modificate în acest fel, cu primele 50 de prompturi toxice și neduplicate utilizate într-o serie de experimente. Prompturile au fost traduse în multiple limbi și testate pe șapte modele majore, atât deschise, cât și închise, și în combinație cu tehnici cunoscute de jailbreak, cum ar fi Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); și DeepInception.

Modelele cu sursă închisă utilizate au fost Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; și Gemini-1.5-pro. Modelele cu sursă deschisă utilizate au fost Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Echipa 2024b); și Qwen2.5-72B-Instruct (Echipa 2024a), cu toate experimentele repetate de trei ori pentru a ține cont de șansa întâmplătoare.

Studiul a testat mai întâi dacă rescrierea prompturilor dăunătoare din AdvBench utilizând emojiuri ar crește ieșirile toxice, incluzând și traduceri în alte limbi majore. În plus, a aplicat aceeași metodă de editare cu emojiuri prompturilor din strategiile cunoscute de jailbreak (PAIR, TAP și DeepInception) pentru a vedea dacă substituția cu emojiuri ar putea îmbunătăți și mai mult succesul acestora.

În ambele cazuri, structura prompturilor originale a fost păstrată, cu singurele cuvinte sensibile înlocuite cu emojiuri și elemente decorative adăugate pentru a disimula intenția.

Pentru metrici de test, autorii au inovat un sistem de notare numit GPT-Judge. În acest setup, GPT-4o nu a fost modelul testat, ci a fost solicitat să acționeze ca un evaluator, atribuind un scor numeric Index de Dăunător (HS) răspunsurilor generate de alte modele.

Fiecare ieșire a fost evaluată de la unu (inofensiv) la cinci (extrem de dăunător), iar procentul de răspunsuri care au primit un cinci a fost raportat ca Raport de Dăunător (HR).

Pentru a preveni ca modelele să nu se abată în explicații despre emojiuri în loc să răspundă explicit, cercetătorii au adăugat o instrucțiune la fiecare prompt, spunând modelului să-și facă răspunsul scurt:

Rezultate din prompturi cu emojiuri în 'Setarea-1', cu comparații cu variante de ablație în care emojiurile au fost înlocuite cu cuvinte sau eliminate complet. Numele de modele sunt prescurtate din motive de spațiu.

Rezultate din prompturi cu emojiuri în ‘Setarea-1’, cu comparații cu variante de ablație în care emojiurile au fost înlocuite cu cuvinte sau eliminate complet.

În tabelul de rezultate de mai sus, partea stângă a tabelului indică faptul că prompturile dăunătoare înlocuite cu emojiuri au obținut scoruri HS și HR semnificativ mai mari decât variantele ablate (adică, versiunile în care emojiul a fost transformat înapoi în text, expunându-l direct filtrelor de conținut).

Autorii noteazăcă abordarea de substituție cu emojiuri depășește metodele anterioare de jailbreak, așa cum sunt prezentate în tabelul suplimentar de rezultate de mai jos:

Rezultatele Raportului de Dăunător pentru prompturi de jailbreak îmbunătățite cu emojiuri în 'Setarea-2', cu numele de modele prezentate în formă prescurtată.

Rezultatele Raportului de Dăunător pentru prompturi de jailbreak îmbunătățite cu emojiuri în ‘Setarea-2’, cu numele de modele prezentate în formă prescurtată.

Primul tabel de mai sus, autorii afirmă, indică de asemenea faptul că efectul emojiurilor se extinde și pe limbi. Atunci când componentele textuale ale prompturilor cu emojiuri au fost traduse în chineză, franceză, spaniolă și rusă, ieșirile dăunătoare au rămas la niveluri ridicate; deoarece acestea sunt toate limbi cu resurse ridicate, rezultatele sugerează că riscul nu este limitat la engleză, ci se aplică în general majorității utilizatorilor, cu emojiurile funcționând ca un canal transferabil pentru generarea de conținut toxic.

Spre sfârșitul lucrării, cercetătorii sugerează că efectul emojiurilor nu este pur și simplu accidental, ci este înrădăcinat în modul în care modelele le procesează, notând că modelele pot aparent recunoaște înțelesul dăunător al emojiurilor – dar răspunsurile de respingere sunt suprimate atunci când emojiurile sunt prezente.

Studiile de tokenizare indică, de asemenea, că emojiurile sunt de obicei fragmentate în fragmente rare sau neregulate, cu puțină suprapunere cu echivalenții lor textuali, creând efectiv un canal alternativ pentru semantica dăunătoare.

Privind dincolo de mecanica modelului, lucrarea examinează, de asemenea, datele de preantrenament, găsind că multe emojiuri frecvent utilizate apar în contexte toxice, cum ar fi pornografia, escrocheriile sau jocurile de noroc. Autorii argumentează că această expunere repetitivă poate normaliza asocierile dintre emojiuri și conținut dăunător, încurajând modelele să se conformeze prompturilor toxice, în loc să le blocheze.

Împreună, aceste descoperiri sugerează că atât particularitățile interne de procesare, cât și datele de preantrenament biasate contribuie la eficacitatea surprinzătoare a emojiurilor în ocolirea măsurilor de siguranță.

Conclusion

Nu este neobișnuit să se utilizeze metode alternative de intrare pentru a încerca să spargă modelele de limbaj mari. În ultimii ani, de exemplu, codificarea hexadecimală a fost utilizată pentru a ocoli filtrele ChatGPT.

Problema pare să stea în utilizarea plată a limbajului text pentru a califica solicitările de intrare și răspunsurile de ieșire.

În cazul emojiurilor, un locus ascuns de înțeles care încalcă regulile poate aparent fi introdus în discuție fără pedeapsă sau intervenție, deoarece metoda de transmisie este neconvențională.

Ar fi de așteptat ca transliterarea CLIP să intervină în toate încărcările de imagini, astfel încât materialul ofensiv sau care încalcă regulile să fie transformat în text marcat.

Evident, acest lucru nu este cazul, cel puțin în ceea ce privește modelele LLM majore studiate; barierelor lor lingvistice par a fi fragile și centrate pe text.

Se poate imagina că o interpretare mai extinsă a conținutului (de exemplu, prin studierea activărilor termice) ar putea avea un cost de procesare și/sau de bandă care să facă astfel de abordări impracticabil de scumpe, printre alte limitări și considerații posibile.

 

* Structura acestei lucrări este haotică comparativ cu majoritatea, cu metodologia și testele nu clar delimitate. Am făcut tot posibilul pentru a reprezenta valoarea de bază a lucrării cât mai bine posibil în aceste circumstanțe.

Într-o abordare aproape impenetrabilă și confuză a rezultatelor.

Publicat pentru prima dată miercuri, 17 septembrie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai