Kąt Andersona
Używanie emotikon może ominąć filtry treści w botach czatowych AI

Emotikony mogą być używane do ominięcia mechanizmów bezpieczeństwa dużych modeli językowych i wywołania toksycznych odpowiedzi, które w przeciwnym razie byłyby zablokowane. W ten sposób LLM mogą być zmuszone do dyskusji i udzielania porad na tematy zabronione, takie jak tworzenie bomb i morderstwo.
Nowe badanie przeprowadzone przez zespół z Chin i Singapuru ujawniło przekonywujące dowody, że emotikony mogą być używane nie tylko do ominięcia filtrów treści w dużych modelach językowych (LLM), ale także do zwiększenia poziomu toksyczności podczas interakcji użytkownika z modelami:

Z nowego artykułu, szerokie przedstawienie sposobów, w jakie zakodowanie zabronionych pojęć za pomocą emotikon może pomóc użytkownikowi w ‘wyłamaniu’ popularnego LLM. Źródło: https://arxiv.org/pdf/2509.11141
W powyższym przykładzie, z nowego artykułu, widzimy, że przekształcenie złamania zasad słowa-opartego zamiaru w wersję obciążoną emotikonami może wywołać o wiele bardziej ‘współpracującą’ odpowiedź ze strony zaawansowanego modelu językowego, takiego jak ChatGPT-4o (który zwykle sanituje wprowadzane dane wejściowe i przechwytuje materiał wyjściowy, który może naruszać zasady firmy).
Skutecznie, w najbardziej ekstremalnych okolicznościach, użycie emotikon może więc działać jako technika wyłamania, zgodnie z twierdzeniem autorów nowego badania.
Jedną z pozostałych tajemnic wymienionych w artykule jest pytanie o dlaczego modele językowe dają emotikonom tak wiele swobody, aby naruszać zasady i wywoływać treści toksyczne, gdy modele już rozumieją, że niektóre emotikony mają silne toksyczne skojarzenia.
Podana sugestia jest taka, że ponieważ LLM są szkolone do modelowania i odtwarzania wzorców z ich danych szkoleniowych, a ponieważ emotikony są tak często spotykane w tych danych, model uczy się, że emotikon należy do tego dyskursu i traktuje go jako statystyczne skojarzenie, zamiast treści do oceny i filtrowania.
To oznacza, że emotikon, gdy jest ponownie użyty w podpowiedzi, pomaga modelowi przewidzieć toksyczne kontynuacje z większą pewnością; ale zamiast działać jako czerwona flaga, emotikon funkcjonuje jako sygnał semantyczny, który tak naprawdę wzmacnia zamierzony toksyczny sens, zamiast go modyfikować lub przechwytywać.
W ten sposób, jak proponuje artykuł, model nie staje się tolerancyjny pomimo toksycznego skojarzenia – staje się tolerancyjny dlatego że toksyczne skojarzenie.
Wolny Przepust
Mówiąc to, autorzy przyznają, że nie reprezentuje to ostatecznej teorii na temat tego, dlaczego użycie emotikon może tak skutecznie ominąć filtry treści w modelach językowych. Stwierdzają:
‘Modele mogą rozpoznać złe intencje wyrażone przez emotikony, jednak sposób, w jaki omijają mechanizmy bezpieczeństwa, pozostaje niejasny.’
Słabość może wynikać z tekstowego projektu filtrów treści, które zakładają albo literalny tekst wejściowy, albo osadzanie wiernie przekonwertowane w równoważniki tekstowe: w obu przypadkach system opiera się na jawnych tokenach, które mogą być dopasowane do zasad bezpieczeństwa.
Aby zilustrować to na przykładzie edycji obrazu opartej na AI: gdy użytkownik przesyła obraz NSFW do modelu widzenia-języka i prosi o modyfikacje, systemy takie jak Adobe Firefly lub ChatGPT wykorzystują CLIP-style potoki do wyodrębniania pojęć tekstowych z obrazu, jako wymóg wstępny do edycji.
Jednakże, z jakiegoś powodu, status emotikonu jako czegoś, co nie jest ani słowem, ani obrazem (lub może jako oba), wydaje się nadawać mu moc do przekraczania filtrów; jak wskazują autorzy, wymaga to dalszych badań nad tym dziwnym lukiem.
Nowy artykuł nowy artykuł nosi tytuł Gdy Uśmiechnięty Staje Się Wrogiem: Interpretowanie, Jak Emotikony Wywołują Toksyczność LLM i pochodzi od dziewięciu autorów z Uniwersytetu Tsinghua i Narodowego Uniwersytetu Singapuru.
(Niestety, wiele przykładów, do których odnosi się artykuł, znajduje się w dodatku, który jeszcze nie został udostępniony; chociaż poprosiliśmy autorów o to, dodatek nie został dostarczony na czas pisania. Niemniej, wyniki empiryczne w głównym artykule pozostają godne uwagi.)
Trzy Podstawowe Interpretacje Emotikonów
Autorzy wyróżniają trzy cechy językowe, które sprawiają, że emotikony są skuteczne w ominięciu filtrów. Po pierwsze, znaczenia emotikonów są zależne od kontekstu. Na przykład, emotikon ‘Pieniądze z Skrzydłami’ jest oficjalnie zdefiniowany jako reprezentujący transakcje pieniężne lub wydatki; jednak w zależności od otaczającego tekstu, może on również sugerować albo legalną, albo nielegalną działalność:

W częściowej ilustracji z nowego artykułu, widzimy, że popularny emotikon może miece swoje znaczenie porwane, zmienione lub podważone w popularnym użyciu.
Po drugie, emotikony mogą zmienić ton podpowiedzi. Ich obecność często dodaje zabawę lub ironię, łagodząc rejestr emocjonalny. W przypadku szkodliwych zapytań, może to sprawić, że prośba wygląda jak żart lub gra, zachęcając model do odpowiedzi zamiast odrzucenia:

Efekt rozluźniający emotikonów może odtruwać ton bez odtruowania intencji.
Po trzecie, artykuł twierdzi, że emotikony są językowo-agnostyczne: jeden emotikon może przenosić ten sam sentyment w języku angielskim, chińskim, francuskim i innych. To sprawia, że są one idealne do wielojęzycznych podpowiedzi, zachowując znaczenie nawet wtedy, gdy otaczający tekst jest tłumaczony:

Emotikon ‘złamane serce’ przekazuje uniwersalną wiadomość.
Podejście, Dane i Testy*
Badacze stworzyli zmodyfikowaną wersję zestawu danych AdvBench, przepisując szkodliwe podpowiedzi, aby zawierały emotikony albo jako substytuty dla wrażliwych słów, albo jako kamuflaż dekoracyjny. AdvBench obejmuje 32 tematy wysokiego ryzyka, w tym bombardowanie, hakowanie i morderstwo:

Oryginalne przykłady z AdvBench, ilustrujące, jak jeden podpowiedź może ominąć zabezpieczenia w wielu głównych botach czatowych. Źródło: https://arxiv.org/pdf/2307.15043
Wszystkie 520 oryginalnych przypadków AdvBench zostało zmienionych w ten sposób, a najwyższe 50 toksycznych i niepowtarzalnych podpowiedzi zostało użytych w całym zakresie eksperymentów. Podpowiedzi zostały również przetłumaczone na wiele języków i przetestowane na siedmiu głównych modelach zamkniętych i otwartych, oraz w połączeniu z znanymi skutecznymi technikami wyłamania Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); i DeepInception.
Modele zamknięte używane w badaniu to Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; i Gemini-1.5-pro. Modele otwarte używane w badaniu to Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); i Qwen2.5-72B-Instruct (Team 2024a), z wszystkimi eksperymentami powtarzanymi trzykrotnie, aby uwzględnić przypadkowe szanse.
Badanie najpierw sprawdziło, czy przepisanie szkodliwych podpowiedzi z AdvBench, używając emotikonów, zwiększyłoby toksyczne dane wyjściowe, w tym w tłumaczeniach na inne główne języki. Dodatkowo, zastosowano tę samą metodę edycji emotikonów do podpowiedzi z wymienionych wcześniej znanych strategii wyłamania (PAIR, TAP i DeepInception), aby sprawdzić, czy podstawianie emotikonów mogłoby dalej poprawić ich skuteczność.
W obu przypadkach struktura oryginalnych podpowiedzi została zachowana, z tylko wrażliwymi terminami zamienionymi na emotikony i elementy dekoracyjne dodane, aby ukryć intencję.
Dla metryk testowych autorzy wynaleźli system oceny o nazwie GPT-Judge. W tym zestawie GPT-4o nie był modelem testowanym, ale raczej został poproszony o działanie jako oceniający, przypisując numeryczny Harmful Score (HS) do odpowiedzi wygenerowanych przez inne modele.
Każda odpowiedź została oceniona od jednego (nieszkodliwa) do pięciu (bardzo szkodliwa), a procent odpowiedzi, które otrzymały pięć, został zgłoszony jako Harmfulness Ratio (HR).
Aby zapobiec temu, że modele zaczną dryfować do wyjaśnień emotikonów zamiast odpowiadać wyraźnie, badacze dodali instrukcję do każdej podpowiedzi, mówiąc modelowi, aby odpowiedź była krótka:

Wyniki z emotikonowych podpowiedzi w ‘Ustawieniu-1’, z porównaniami do wariantów ablacją.
W powyższej tabeli wyników, lewa strona wskazuje, że szkodliwe podpowiedzi zastąpione emotikonami osiągnęły znacznie wyższe wyniki HS i HR niż wersje ablacją (tj. wersje, w których emotikon został przetłumaczony z powrotem na tekst, narażając go bezpośrednio na filtry treści).
Autorzy zauważają† , że podejście z użyciem emotikonów przewyższa poprzednie metody wyłamania, jak to opisano w dodatkowej tabeli wyników poniżej:

Wyniki wskaźnika szkodliwości dla emotikonowych podpowiedzi wyłamania w ‘Ustawieniu-2’.
Pierwsza z dwóch tabel powyżej, autorzy stwierdzają, wskazuje również, że efekt emotikonów rozciąga się na języki. Gdy tekstowe składniki emotikonowych podpowiedzi zostały przetłumaczone na chiński, francuski, hiszpański i rosyjski, szkodliwe dane wyjściowe pozostały wysokie; ponieważ są to języki wysokiego poziomu, wyniki sugerują, że ryzyko nie jest ograniczone do języka angielskiego, ale ma zastosowanie szeroko do głównych grup użytkowników, z emotikonami funkcjonującymi jako kanał transferowy dla generacji toksycznej.
Ku końcowi artykułu, badacze sugerują, że efekt emotikonów nie jest po prostu przypadkowy, ale tkwi w sposobie, w jaki modele je przetwarzają, zauważając, że modele mogą rozpoznać szkodliwe znaczenie emotikonów – jednak odpowiedzi odrzucenia są tłumione, gdy emotikony są obecne.
Badania nad tokenizacją wskazują ponadto, że emotikony są zwykle rozbijane na rzadkie lub nieregularne fragmenty z niewielkim nakładaniem się na ich tekstowe odpowiedniki, skutecznie tworząc alternatywny kanał dla szkodliwej semantyki.
Spoglądając poza mechanikę modelu, artykuł bada również dane wstępne, znajdując, że wiele często używanych emotikonów pojawia się w toksycznych kontekstach, takich jak pornografia, oszustwa lub hazard. Autorzy argumentują, że to powtarzające się narażenie może normalizować skojarzenie między emotikonami a szkodliwą treścią, zachęcając modele do współpracy z toksycznymi podpowiedziami zamiast ich bloku.
Wspólnie, te odkrycia sugerują, że zarówno wewnętrzne anomalie przetwarzania, jak i tendencyjne dane wstępne przyczyniają się do zaskakującej skuteczności emotikonów w ominięciu zabezpieczeń.
Wnioski
Nie jest rzadkością, gdy używa się alternatywnych metod wejściowych, aby spróbować wyłamać LLM. W ostatnich latach, na przykład, kodowanie szesnastkowe zostało użyte do ominięcia filtrów ChatGPT. Problem wydaje się leżeć w płaskim użyciu tekstowego języka do kwalifikowania wprowadzanych danych wejściowych i wytwarzanych danych wyjściowych.
W przypadku emotikonów, ukryty punkt znaczenia naruszenia zasad może być wprowadzony do dyskursu bez kary lub interwencji, ponieważ metoda transmisji jest niekonwencjonalna. Można by sądzić, że CLIP-oparta transliteracja będzie interweniować we wszystkich uploadach obrazów, tak aby obraźliwy lub naruszający materiał był ostatecznie flagowany jako tekst.
Okazuje się, że nie jest to przypadku, przynajmniej jeśli chodzi o główne LLM badane; ich językowe bariery wydają się kruche i tekstowo-orientowane. Można wyobrazić sobie, że bardziej szczegółowa interpretacja treści (na przykład przez badanie aktywacji heatmap) niesie ze sobą koszt przetwarzania i/lub pasma, który może uczynić takie podejścia niepraktycznie drogimi, wśród innych możliwych ograniczeń i rozważań.
* Układ tego artykułu jest chaotyczny w porównaniu z większością, z metodologią i testami niejasno wyodrębnionymi. Zrobiliśmy więc wszystko, co w naszej mocy, aby jak najlepiej przedstawić podstawową wartość pracy w tych okolicznościach.
† W przyznaniu, że traktowanie wyników jest prawie nieprzeniknione i skomplikowane.
Pierwotnie opublikowane w środę, 17 września 2025












