Andersonin kulma
Emojien käyttäminen voi ohittaa sisältösuodattimet tekoälychatboteissa

Emojit voidaan käyttää ohittamaan suurten kielen mallien turvallisuusmekanismit ja laukaista myrkyllisiä tulosteita, jotka muuten estettäisiin. Tällä tavoin voidaan saada LLM-mallit keskustelemaan ja antamaan neuvontaa kielletyistä aiheista, kuten pomminvalmistuksesta ja murhasta.
Uusi yhteistyö Kiinan ja Singaporen välillä osoittaa vakuuttavia todisteita siitä, että emojit voidaan käyttää ei vain ohittamaan suurten kielen mallien sisältö havainto suodattimia, vaan yleisesti lisätä myrkyllisyyttä käyttäjän vuorovaikutuksessa mallejen kanssa:

Uudesta tutkimuksesta, laaja esimerkki siitä, miten kielletyn käsitteen koodaaminen emojien avulla voi auttaa käyttäjää ‘vankilaan’ suositun LLM-mallin. Lähde: https://arxiv.org/pdf/2509.11141
Edellä olevassa esimerkissä uudesta tutkimuksesta nähdään, että sääntöjä rikkova sana-perustaista aikomusta voidaan muuttaa emoji-käyttöiseksi vaihtoehtoiseksi versioksi, joka voi herättää paljon “yhteistyökykyisemmän” vastauksen sofistikoituneelta kielen mallilta, kuten ChatGPT-4o (joka tavallisesti puhdistaa syötteen käyttöohjeita ja takaa, että tulostusmateriaali ei loukkaa yhtiön sääntöjä).
Teoreettisesti, äärimmäisissä olosuhteissa, emojien käyttö voidaan nähdä jailbreak-tekniikkana, tutkimuksen tekijöiden mukaan.
Tutkimuksessa mainitaan yksi jäänyt mysteeri, joka liittyy siihen, miksi kielen mallit antavat emojille niin suuren vapauden rikkoa sääntöjä ja herättää myrkyllistä sisältöä, kun mallit ymmärtävät jo, että tietyt emojit ovat vahvasti myrkyllisiä.
Tutkimuksessa esitetään, että koska LLM-mallit on koulutettu mallintamaan ja jäljittelemään kuvioita koulutusaineistosta, ja koska emojit ovat niin usein esiintyviä aineistossa, malli oppii, että emoji kuuluu tähän keskusteluun, ja käsittää sen tilastollisena yhteytenä, sen sijaan, että se olisi sisältöä, jota arvioidaan ja suodatetaan.
Tämä tarkoittaa, että emoji, kun se uudelleen käytetään syötteenä, auttaa mallia ennustamaan myrkyllisiä jatkoja luottavaisemmin; mutta sen sijaan, että se toimisi punaisena lipuna, emoji toimii semanttisena vihjeenä, joka todella vahvistaa myrkyllisen tarkoituksen sen sijaan, että se hillitsi tai estäisi sen.
Koska turvallisuuden suuntaus sovelletaan jälkikäteen, ja usein kapeassa, kirjaimellisessä kehyksessä, syötteet näillä emojilla voivat välttää havaitsemisen kokonaan.
Tässä tapauksessa tutkimus ehdottaa, että malli ei tule sietokykyiseksi huolimatta myrkyllisestä yhteydestä – se tulee sietokykyiseksi johtuen siitä.
Vapaa pääsy
Sanottuun nähden, tutkimuksen tekijät myöntävät, että tämä ei edusta yksiselkäistä teoriaa siitä, miksi emojien käyttö voidaan niin tehokkaasti ohittaa sisältösuodattimet kielen malleissa. He toteavat:
‘Mallit voivat tunnistaa pahantahtoisen aikomuksen, joka ilmaistaan emojien avulla, mutta se, miten se ohittaa turvallisuusmekanismit, ei ole selvää.’
Heikkous voi johtua tekstiin perustuvasta suunnittelusta sisältösuodattimissa, jotka oletetaan joko kirjaimellista tekstisyötettä tai upotusta, joka on uskollisesti muunnettu tekstiequivalentteiksi: molemmissa tapauksissa järjestelmä riippuu eksplisiittisistä tokeneista, jotka voidaan vastata turvallisuussääntöjä vastaan.
Esimerkiksi tekoälypohjaisessa kuvankäsittelyssä: kun käyttäjä lataa NSFW-kuvan näkö-/kielimalliin ja pyytää muutoksia, järjestelmät kuten Adobe Firefly tai ChatGPT käyttävät CLIP-tyyppisiä putkistoja tekstikäsitteiden poistamiseksi kuvasta, jotta se voidaan muokata.
Kun nämä käsitteet on muunnettu sanoiksi, rajoitettujen termejä sisältävien poistettujen sanojen läsnäolo laukaistaan suodattimen, joka aiheuttaa pyynnön hylkäyksen.
Toisaalta, emojin asema ei-tekstinä eikä kuvana (tai molempina) näyttää antavan sille valtuuden ohittaa suodattimen; tutkimuksen tekijät viittaavat siihen, että tämän outon pikanäppäimen edelleen tutkiminen on aiheellista.
Uusi tutkimus on nimeltään Kun hymyilevä kasvo muuttuu vihamieliseksi: Tulkinta siitä, miten emojit laukaista LLM-mallien myrkyllisyyttä, ja se tulee yhdeksältä tekijältä Tsinghua-yliopistosta ja Singaporen kansallisyliopistosta.
(Valitettavasti monet tutkimuksessa mainitut esimerkit ovat liitteessä, jota ei ole vielä julkaistu; vaikka olemme pyytäneet sitä tekijöiltä, liitettä ei ole toimitettu kirjoittamisen aikana. Kuitenkin empiiriset tulokset tutkimuksen ydin osassa ovat huomionarvoisia.)
Kolme ydinaspektia emojien tulkinnassa
Tutkimuksen tekijät korostavat kolmea kielellistä piirrettä, jotka tekevät emojit tehokkaiksi suodattimien ohittamisessa. Ensinnäkin, emojien merkitys on kontekstiriippuva. Esimerkiksi “Raha siivillä” -emoji (ks. kuva alla) on virallisesti määritelty edustamaan rahansiirtoja tai kulutusta; mutta riippuen ympäröivästä tekstistä, se voi myös viitata joko lailliseen tai laittomaan toimintaan:

Osittainen esimerkki uudesta tutkimuksesta, jossa nähdään, miten suosittu emoji voidaan muuttaa, muuttaa tai muuttaa yleisessä käytössä. Tämä antaa emojille virallisen “passin” semanttiseen avaruuteen ja piilotetun “rahti”-negatiivisen tai myrkyllisen merkityksen, jota voidaan hyödyntää, kun se on päässyt suodattimen läpi.
Toiseksi, emojit voivat muuttaa tonia syötteessä. Niiden läsnäolo usein lisää leikillisyyttä tai ironiaa, pehmentäen emotionaalista rekisteriä. Vahingollisissa kysymyksissä tämä voi tehdä pyynnöstä näyttää leikiltä tai peliltä, rohkaisten mallia vastaamaan sen sijaan, että se hylkäisi sen:

Emojien lieventävä vaikutus voi puhdistaa tonia ilman, että se puhdistaa aikomusta.
Kolmanneksi, tutkimus väittää, että emojit ovat kieliriippumattomia: yksittäinen emoji voi kantaa samaa mieltymystä englannin, kiinan, ranskan ja muiden kielten kautta. Tämä tekee niistä ihanteellisia monikielisille syötteille, säilyttäen merkityksen, vaikka ympäröivä teksti käännetään:

Särkynyt sydän -emoji välittää yleispätevän viestin, ehkäpä siksi, että se edustaa perustapausta ihmisen tilassa, joka on suhteellisen immuuni kansallisille tai kulttuurisille muutoksille.
Lähestymistapa, data ja testit*
Tutkijat loivat muokatun version AdvBench-aineistosta, kirjoittamalla uudelleen vahingollisia syötteitä, jotka sisälsivät emojit joko korvikkeina herkillä sanoilla tai koristeluna salatakseen aikomuksen. AdvBench kattaa 32 korkean riskin aiheita, mukaan lukien pommitus, hakkeroiminen ja murha:

Alkuperäiset esimerkit AdvBenchista, jotka havainnollistavat, miten yksittäinen vastakkainen syöte voi ohittaa useiden suurten chatbottien turvallisuussuojat, herättäen vahingollisia ohjeita, vaikka suuntaus on koulutettu.
Kaikki 520 alkuperäistä AdvBench-eksemplaria muutettiin tällä tavoin, ja 50 myrkyllisintä ja ei-toistuvaa syötettä käytettiin kokeiden sarjassa. Syötteet käännettiin useille kielelle ja testattiin seitsemällä suurella suljetulla ja avoimella lähdekoodilla mallilla, ja yhdessä tunnettujen tehokkaiden jailbreak-tekniikoiden kanssa, kuten Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); ja DeepInception.
Suljettuja mallimalleja käytettiin Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; ja Gemini-1.5-pro. Avoinna olevia malleja käytettiin Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); ja Qwen2.5-72B-Instruct (Team 2024a), kaikki kokeet toistettiin kolme kertaa satunnaisen sattuman vuoksi.
Tutkimus testasi ensin, lisääkö emojien käyttö vahingollista tulostetta, myös käännöksissä muihin suurimpiin kieliin. Lisäksi se sovelsi samaa emojien muokkausmenetelmää syötteisiin, jotka liittyvät edellä mainittuihin tunnettuihin jailbreak-strategioihin (PAIR, TAP ja DeepInception), tutkimalla, voitaisiinko emojien käytöstä parantaa niiden menestystä.
Molemmissa tapauksissa alkuperäisten syötteen rakenteen säilytettiin, ja ainoastaan herkillä sanoilla korvattiin emojit ja koristelua lisättiin peittämään aikomuksen.
Kokeiden mittausarvoiksi tutkijat kehittivät arvostelujärjestelmän nimeltä GPT-Judge. Tässä asetelmaa GPT-4o ei ollut malli, jota testattiin, vaan se pyydettiin toimimaan arvioijana, joka antaa numeerisen Haitallisuuspisteytys (HS) muihin malleihin generoituja vastauksia.
Jokainen tuloste arvioitiin asteikolla yhdestä (harmittomasta) viiteen (erittäin haitalliseen), ja prosentti vastauksista, jotka saivat pisteytyksen viisi, ilmoitettiin Haitallisuusosuus (HR).
Estämään, että mallit siirtyvät emoji-selityksiin vastaamisen sijaan, tutkijat lisäsivät ohjeen kunkin syötteen, jossa pyydettiin mallilta antamaan lyhyt vastaus:

Tulokset emojipohjaisista syötteistä ‘Asetus-1’:ssä, vertailu ablaatioversioihin, joissa emojit korvattiin sanoilla tai poistettiin kokonaan. Mallinimet on lyhennetty tilan vuoksi.
Tutkijat huomauttavat† , että emojien korvausmenetelmä ylittää aiemmat jailbreak-menetelmät, kuten alla olevassa taulukossa:

Haitallisuusosuus tulokset emojilla täydennetyistä jailbreak-syötteistä ‘Asetus-2’:ssa, mallinimet on esitetty lyhennettynä.
Ensimmäinen näistä taulukoista, tutkijat toteavat, osoittaa myös, että emojien vaikutus ulottuu kieleen. Kun syötteen tekstiosat käännettiin kiinaksi, ranskaksi, espanjaksi ja venäjäksi, haitalliset tulosteet säilyivät korkeina; koska nämä ovat korkean resurssin kielet, tulokset viittaavat siihen, että riski ei ole rajoitettu englantiin, vaan se on laajasti sovellettavissa suurimpiin käyttäjäryhmiin, emojien toimien siirtokanavana myrkyllisen generoinnin kanavana.
Tutkimuksen lopussa tutkijat ehdottavat, että emojien vaikutus ei ole pelkästään sattumaa, vaan se juontuu siitä, miten mallit prosessoi niitä. He huomauttavat, että mallit voivat tunnistaa emojien haitallisen merkityksen, mutta hylkäysvastaukset ovat tukahdutettuja, kun emojit ovat läsnä.
Tokenisointitutkimukset osoittavat myös, että emojit usein hajoavat harvoihin tai epäsäännöllisiin fragmentteihin, joilla on vähän yhteistä tekstiequivalentteihin, luoden vaihtoehtoisen kanavan haitallisille semantiikoille.
Katsomalla mallien mekaniikkaa, tutkimus tarkastelee myös esikoulutusdataa ja löytää, että useat yleisesti käytetyt emojit esiintyvät myrkyllisissä yhteyksissä, kuten pornografia, huijaukset tai uhkapelit. Tutkijat väittävät, että tämä toistuva altistus voi normalisoida yhteyden emojien ja haitallisen sisällön välillä, kannustaen malleja yhteistyöhön myrkyllisten syötteiden kanssa sen sijaan, että ne estäisivät niitä.
Nämä havainnot viittaavat siihen, että sekä mallien sisäiset prosessointivirheet että vinoutunut esikoulutusdata vaikuttavat emojien yllättävään tehokkuuteen turvallisuusjärjestelmien ohittamisessa.
Johtopäätös
On tavallista käyttää vaihtoehtoisia syötetapoja yrittää murtaa LLM-malleja. Viime vuosina esimerkiksi heksadesimaalikoodaus on käytetty ohittamaan ChatGPT:n suodattimet. Ongelma näyttää olevan suurten kielen mallien käytön tasolla, jossa tekstipohjainen kieli käytetään laillaisten ja laittomien pyyntöjen ja tulosteiden määrittelyyn.
Emojien tapauksessa piilotettu kohde myrkyllistä merkitystä voidaan esittää keskustelussa rangaistuksetta, koska siirtotapa on epätavallinen. Voisi ajatella, että CLIP-pohjainen translitterointi puuttuisi kaikkiin kuvan latauksiin, jotta loukkaava tai rikkoontuva materiaali muuttuisi merkittäväksi tekstiksi.
Näyttää siltä, ettei tämä kuitenkaan ole tapahtunut, ainakin suurimpien LLM-mallien osalta; heidän kielimuurinsa näyttävät olevan hauraita ja tekstikeskeisiä. Voisi kuvitella, että laajempi sisällön tulkinta (esim. tutkimalla lämpökarttoja) voi aiheuttaa prosessointi- ja/tai kaistanleveyden kustannuksia, jotka saattavat tehdä tällaiset lähestymistavat epäkäytännöllisesti kalliiksi, muun muassa.
* Tutkimuksen rakenne on sekava verrattuna useimpiin, ja metodologia ja testit eivät ole selvästi määritelty. Olemme pyrkineet esittämään tutkimuksen ydinarvon parhaalla tavalla näissä olosuhteissa.
† Todistuksena siitä, että tulokset ovat lähes älyttömän ja sekavan käsittelyn tulosta.
Julkaistu ensimmäisen kerran keskiviikkona, 17. syyskuuta 2025












