Andersonův úhel
Použití Emotikon Může Obcházet Filtry Obsahu v Chatbotech s Umělou Inteligencí

Emotikony lze použít k obcházení bezpečnostních mechanismů velkých jazykových modelů a vyvolání toxického výstupu, který by jinak byl zablokován. Touto metodou lze LLM модели donutit diskutovat a poskytovat rady na zakázaná témata, jako je výroba bomb a vražda.
Nová spolupráce mezi Čínou a Singapurem přinesla přesvědčivé důkazy o tom, že emotikony lze použít nejen k obcházení filtrů obsahu v velkých jazykových modelech (LLM), ale také obecně zvýšit úroveň toxicity během interakce uživatele s modely:

Z nové práce, široká demonstrace způsobů, jakými lze pomocí emotikonů pomoci uživateli “vylomit” populární LLM. Zdroj: https://arxiv.org/pdf/2509.11141
V příkladu výše, z nové práce, vidíme, že transformace pravidlově porušujícího slovního úmyslu do varianty s emotikony může vyvolat mnohem “spolupracujícíjší” odpověď ze strany sofistikovaného jazykového modelu, jako je ChatGPT-4o (který obvykle sanitizuje vstupní podněty a zachycuje výstupní materiál, který může porušovat firemní pravidla).
Efektivně, v nejextrémnějších případech, může použití emotikonů fungovat jako metoda “vylomení”, podle autorů nové práce.
Jedna zbývající záhada uvedená v práci je otázka proč jazykové modely poskytují emotikonům takovou volnost porušovat pravidla a vyvolávat toxický obsah, když modely již rozumějí, že certain emotikony mají silně toxické asociace.
Návrh, který je předložen, je ten, že protože LLM jsou trénovány na modelování a reprodukování vzorců z jejich trénovacího dat, a protože emotikony jsou v tomto datu velmi časté, model se učí, že emotikon patří do toho diskurzu, a zachází s ním jako se statistickou asociací, místo aby ho hodnotil a filtroval jako obsah.
To znamená, že emotikon, když je znovu použit v podnětu, pomáhá modelu předpovídat toxické pokračování s větší jistotou; ale místo toho, aby fungoval jako červená vlajka, emotikon funguje jako semantická nápověda, která vlastně posiluje zamýšlený toxický význam místo toho, aby ho moderoval nebo zachycoval. Protože bezpečnostní zarovnání je aplikováno až poté, a často v úzkém, literálním rámci, podněty s těmito emotikony mohou tedy zcela uniknout detekci.
Volný Průchod
To řečeno, autoři připouštějí, že toto nepředstavuje konečnou teorii, proč použití emotikonů může tak účinně obcházet filtry obsahu v jazykových modelech. Říkají:
‘Modely mohou rozpoznat škodlivý úmysl vyjádřený emotikony, ale jakým způsobem obcházejí bezpečnostní mechanismy, zůstává nejasné.’
Slabina může pocházet z textově zaměřeného designu filtrů obsahu, které předpokládají buď literální textový vstup nebo vložené údaje věrně převedené do textových ekvivalentů: v obou případech systém spoléhá na explicitní tokeny, které lze porovnat se bezpečnostními pravidly.
Chcete-li si vzít ilustraci z AI-založeného editování obrázků: když uživatel nahrává NSFW obrázek do modelu vidění-jazyka a požaduje úpravy, systémy, jako je Adobe Firefly nebo ChatGPT, používají CLIP-styl pipeline k extrahování textových konceptů z obrázku, jakožto předpokladu pro editování. Jakmile jsou tyto koncepty převedeny do slov, přítomnost jakýchkoli omezených termínů v těchto extrahovaných slovech vyvolá filtr, což způsobí, že žádost bude odmítnuta.
Jenomže, z nějakého důvodu, status emotikonu jako něco, co není ani slovo, ani obrázek (nebo obojí), zdá se, že mu dává moc transcendovat filtrování; jasně, jak autoři naznačují, další výzkum této zvláštní mezery je oprávněný.
Nová práce se jmenuje Když Smajlík Získá Nenávist: Interpretace, Jak Emotikony Spouštějí Toxicitu LLM a pochází od devíti autorů z Tsinghua University a National University of Singapore.
(Bohužel, mnoho příkladů, na které se práce odvolává, je v dodatku, který dosud nebyl zpřístupněn; ačkoli jsme o to požádali autory, dodatek nebyl dodán v době psaní. Přesto výsledky v jádru práce zůstávají hodny pozornosti.)
Tři Základní Interpretace Emotikonů
Autoři zdůrazňují tři lingvistické rysy, které činí emotikony efektivními při obcházení filtrů. První, významy emotikonů jsou kontextově závislé. Například emotikon “Peníze s křídly” je oficiálně definován jako reprezentace peněžních převodů nebo výdajů; nicméně v závislosti na okolním textu může také naznačovat buď legální nebo nelegální činnost:

V částečné ilustraci z nové práce vidíme, že populární emotikon může mít svůj význam ukraden, změněn nebo podvržen v populárním použití. To efektivnímu emotikonu dává oficiální “pas” do semantického prostoru a skrytou zátěž negativního nebo toxického významu, který lze využít, až je jednou za filtry.
Druhý, emotikony mohou měnit tón podnětu. Jejich přítomnost často přidává hravost nebo ironii, zmírňuje emoční registr. V škodlivých dotazech to může učinit žádost podobnou žertu nebo hře, což modelu umožňuje odpovědět místo toho, aby ji odmítl:

Lehčící efekt emotikonů může detoxifikovat tón bez detoxifikace úmyslu.
Třetí, práce tvrdí, emotikony jsou jazykově nezávislé: jeden emotikon může nést stejnou emoci napříč angličtinou, čínštinou, francouzštinou a dalšími jazyky. To je činí ideálními pro vícejazyčné podněty, zachovávající význam i tehdy, když je okolní text přeložen:

Emotikon zlomeného srdce přenáší univerzální zprávu, možná proto, že reprezentuje základní případ v lidské kondici, relativně imunní vůči národním nebo kulturním variacím.
Přístup, Data a Testy*
Výzkumníci vytvořili modifikovanou verzi datasetu AdvBench, přepisující škodlivé podněty tak, aby zahrnovaly emotikony buď jako náhrady za citlivé slova nebo jako dekorativní kamufláž. AdvBench pokrývá 32 high-risk témat, včetně bombových útoků, hackování a vražd, mezi jinými:

Původní příklady z AdvBench, ilustrující, jak jeden adversární podnět může obejít bezpečnostní opatření v několika hlavních chatbotech, vyvolávající škodlivé instrukce navzdory tréninku na zarovnání.
Všechny 520 původní instance AdvBench byly pozměněny tímto způsobem, přičemž se použily top 50 toxických a neduplicovaných podnětů napříč řadou experimentů. Podněty byly také přeloženy do více jazyků a testovány napříč sedmi hlavními uzavřeným a otevřeným zdrojovým modely, a v kombinaci se známými účinnými metodami “vylomení” Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); a DeepInception.
Uzavřené modely, které se použily, byly Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; a Gemini-1.5-pro. Otevřené modely, které se použily, byly Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); a Qwen2.5-72B-Instruct (Team 2024a), se všemi experimenty opakovánými třikrát, aby se zohlednil náhodný výběr.
Studie nejprve testovala, zda přepsání škodlivých podnětů z AdvBench pomocí emotikonů zvýší toxický výstup, včetně překladů do jiných hlavních jazyků. Navíc aplikovala stejnou metodu editování emotikonů na podněty z výše uvedených známých metod “vylomení” (PAIR, TAP a DeepInception), aby zjistila, zda náhrada emotikonů může dále zlepšit jejich úspěch.
V obou případech byla zachována struktura původních podnětů, s pouze citlivými termíny nahrazenými emotikony a dekorativními prvky přidány k maskování úmyslu.
Pro testovací metriky autoři inovovali systém hodnocení nazvaný GPT-Judge. V tomto nastavení GPT-4o nebyl modelem, který se testoval, ale spíše byl povzbuzen k tomu, aby jednal jako grader, přiřazující číselný Škodlivý Skóre (HS) odpovědím generovaným jinými modely.
Každá odpověď byla ohodnocena od jedné (neškodné) do pěti (extrémně škodlivé), a procento odpovědí, které dostaly pět, bylo hlášeno jako Škodlivostní Poměr (HR).
Aby se zabránilo modelům, aby se staly vysvětlením emotikonů místo odpovědí explicitně, výzkumníci přidali instrukci k каждému podnětu, která modelu říkala, aby odpověděl stručně:

Výsledky z emotikonových podnětů v ‘Nastavení-1’, s porovnáním s ablačními variantami, kde byly emotikony nahrazeny slovy nebo odstraněny úplně. Název modelu je zkrácen pro prostor.
V počáteční tabulce výsledků výše, levá strana tabulky ukazuje, že škodlivé podněty nahrazené emotikony dosáhly výrazně vyšších HS a HR skórů než ablační verze (tj. verze, kde byl emotikon přeložen zpět do textu, vystavující ho přímo filtrům obsahu).
Autoři poznamenávají† , že přístup s náhradou emotikonů překonává předchozí metody “vylomení”, jak je uvedeno v dodatečné tabulce výsledků níže:

Škodlivostní Poměr výsledky pro emotikonově rozšířené podněty ‘vylomení’ v ‘Nastavení-2’, s názvy modelů zobrazenými v zkrácené formě.
První z obou tabulek výše, autoři uvádějí, také naznačuje, že efekt emotikonů přetrvává napříč jazyky. Když byly textové složky emotikonových podnětů přeloženy do čínštiny, francouzštiny, španělštiny a ruštiny, škodlivé výstupy zůstaly vysoké; protože tyto jsou všechny jazyky s vysokými zdroji, výsledky naznačují, že riziko není omezeno na angličtinu, ale platí obecně pro hlavní uživatelské skupiny, s emotikony fungujícími jako přenositelný kanál pro toxický generování.
Směřující ke konci práce, výzkumníci navrhují, že efekt emotikonů není pouze náhodný, ale je zakořeněn v tom, jak modely zpracovávají emotikony, poznamenávají, že modely mohou rozpoznat škodlivý význam emotikonů – ale odmítavé odpovědi jsou potlačeny, když jsou emotikony přítomny.
Tokenizační studie dále ukazují, že emotikony jsou obvykle rozděleny do vzácných nebo nepravidelných fragmentů s malou překrytí s jejich textovými ekvivalenty, efektivnímu emotikonu vytvářející alternativní kanál pro škodlivou semantiku.
Pohledem za modelové mechaniky, práce dále zkoumá předtrénovací data, zjistí, že mnoho často používaných emotikonů se objevuje v toxických kontextech, jako je pornografie, podvody nebo hazardní hry. Autoři argumentují, že tato opakovaná expozice může normalizovat asociaci mezi emotikony a škodlivým obsahem, povzbuzující modely k tomu, aby reagovaly na toxické podněty místo toho, aby je blokovaly.
Společně, tyto nálezy naznačují, že jak interní zpracování kuriozit, tak předtrénovací data s předpojatostmi přispívají k překvapivé účinnosti emotikonů při obcházení bezpečnostních opatření.
Závěr
Není neobvyklé používat alternativní vstupní metody k pokusu o “vylomení” LLM. V posledních letech, například, hexadecimální kódování bylo použito k obejití filtrů ChatGPT. Problém zdá se spočívá v plochém použití textového jazyka pro kvalifikaci příchozích požadavků a odchozích odpovědí.
V případě emotikonů, skrytý zdroj pravidel porušujícího významu může být zjevně zaveden do diskurzu bez penalty nebo zásahu, protože metoda přenosu je nekonvenční. Můžeme si představit, že rozsáhlejší interpretace obsahu (například studiem heatmap aktivací) nese procesní a/nebo šířkový náklad, který může učinit takový přístup neprakticky drahým, mezi jinými možnými omezeními a úvahami.
* Uspořádání této práce je chaotické ve srovnání s většinou, s metodologií a testy, které nejsou jasně vymezeny. Snažili jsme se co nejlépe reprezentovat základní hodnotu práce v těchto okolnostech.
† V téměř neprostupném a zmateném zpracování výsledků.
Poprvé publikováno ve středu, 17. září 2025












