Andersonin kulma
‘Järjettömän kielen’ joka voi kiertää kuvasynteesijärjestelmien moderointijärjestelmiä

Columbian yliopiston uusi tutkimus osoittaa, että kuvasynteesimallien, kuten DALL-E 2, Imagen ja Parti, suojausjärjestelmät, jotka estävät vahingollisten tai kiistanalaisten kuvien tuottamisen, ovat alttiita tietynlaiselle vastakkaiselle hyökkäykselle, joka käyttää “keksittyjä” sanoja.
Tutkija on kehittänyt kaksi lähestymistapaa, jotka voivat mahdollisesti ohittaa sisällönvalvontatoimet kuvasynteesijärjestelmässä, ja havainnut, että ne ovat erittäin kestäviä eri arkkitehtuureilla, mikä osoittaa, että heikkous on enemmän kuin pelkästään järjestelmällinen, ja saattaa liittyä teksti-kuvan synteesin perimmäisiin periaatteisiin.
Ensimmäinen, ja vahvempi, lähestymistapa on kutsuttu makaroniseksi ohjaukseksi. Termi “makaroninen” viittaa alun perin useiden kielten sekoitukseen, kuten Esperantossa tai Unwinen kielessä. Ehkä kulttuurisesti levinnein esimerkki on Urdu-englanti, joka on tyyppi “koodin sekoittamisesta”, jota käytetään yleisesti Pakistanissa, joka sekoittaa vapaasti englannin substantiiveja ja urdu-suffikseja.
Joissakin yllä mainituista esimerkeistä, osia merkityksellisistä sanoista on liimattu yhteen, käyttäen englantia “telineenä”. Muiden esimerkkien paperissa käytetään useita kieliä yhden ohjauskoodin yli.
Järjestelmä vastaa semanttisesti merkityksellisellä tavalla, johtuen suhteellisen puutteesta kuraattorin valvonnassa verkkolähteissä, joilla järjestelmä on koulutettu. Tällaiset lähteet sisältävät usein monikielisiä merkintöjä (ts. tietokantoja, jotka eivät ole suunniteltu erityisesti kuvasynteesitehtävään), ja jokainen sana, joka on nieltynä, kielestä riippumatta, tulee “tokeniksi”; samoin osat näistä sanoista tulevat “alasanaksi” tai murto-osoitteiksi. Luonnollisen kielen prosessoinnissa tämänkaltaisella “johtamisella” autetaan erottamaan etymologiaa pidemmistä johdannaisista sanoista, jotka voivat syntyä muunnosoperaatioissa, mutta se luo myös massiivisen leksikaalisen “Lego-pelin”, jonka “luova” ohjaus voi hyödyntää.

Yksikieliset portmanteau-sanat ovat myös tehokkaita saadakseen kuvia epäsuorasti tai epäprosaalisesti, ja usein samankaltaisia tuloksia voidaan saada eri arkkitehtuureilla, kuten DALL-E 2 ja DALL-E Mini (Craiyon).
Toisessa lähestymistavassa, jota kutsutaan evokatiiviseksi ohjaukseksi, jotkut yhdistetyistä sanoista ovat samanhenkisiä kuin enemmän “koulupoikamainen” latinan suuntaus, jota demonstroidaan Monty Pythonin Elämä Brianissa (1979).
Tutkija toteaa:
‘Tämän menetelmän ilmeinen huolenaihe on sisällönvalvontasuodattimien kiertäminen mustalla listalla olevilla ohjauskoodauksilla. Periaatteessa makaroninen ohjaus voisi tarjota helpon ja näennäisesti luotettavan tavan kiertää nämä suodattimet jotta voidaan tuottaa vahingollista, loukkaavaa, laitonta tai muuten arkaluontoista sisältöä, mukaan lukien väkivaltainen, vihamielinen, rasistinen, seksistinen tai pornografinen kuva, ja ehkä kuvat, jotka loukkaavat immateriaalioikeuksia tai kuvaavat todellisia henkilöitä.
‘Yhtiöt, jotka tarjoavat kuvantuottamista palveluna, ovat panostaneet paljon estääkseen tällaisten tulosteiden tuottamisen mukaisesti heidän sisällönkäytäntönsä mukaisesti. Seuraavaksi makaroninen ohjaus tulisi tutkia systemaattisesti uhkana turvallisuussäännöille, joita käytetään kaupalliseen kuvantuotantoon.’
Tutkija ehdottaa useita keinoja tähän haavoittuvuuteen, joista hän myöntää, että joitakin voisi pitää liian rajoittavina.
Ensimmäinen mahdollinen ratkaisu on kallein: kouluttaa lähdekuva huolellisemmin, enemmän ihmisen valvonnalla ja vähemmän algoritmisen valvonnan alla. Tutkimus myöntää kuitenkin, että tämä ei estäisi kuvasynteesijärjestelmää luomasta loukkaavaa yhdistelmää kahden itsessään mahdollisesti viattoman kuvakäsitteen välillä.
Toisena vaihtoehtona tutkimus ehdottaa, että kuvasynteesijärjestelmät voivat suorittaa todellisen tulosteen suodattimien läpi, jossa ongelmalliset yhdistelmät voidaan keskeyttää ennen kuin ne palautetaan käyttäjälle. On mahdollista, että DALL-E 2 toimii jo tällaisella suodattimella, vaikka OpenAI ei ole paljastanut tarkalleen, miten DALL-E 2:n sisällönvalvonta toimii.
Lopuksi tutkija pohtii “sanastoon valkoisen listan” mahdollisuutta, joka sallisi vain tarkastettuja ja hyväksyttyjä sanoja noutaa ja renderöidä käsitteitä, mutta myöntää, että tämä voisi edustaa liian rajoittavaa rajoitusta järjestelmän hyödyllisyydelle.
Vaikka tutkija kokeili vain viittä kieltä (englanti, saksa, ranska, espanja ja italia) luodessaan ohjauskoostumuksia, hän uskoo, että tällainen “vastakkainen hyökkäys” voisi tulla vielä “salaperäisemmäksi” ja vaikeammaksi estää, laajentamalla kielen määrää, koska hyperskaalaiset mallit, kuten DALL-E 2, on koulutettu useilla kielillä (koska on helpompaa käyttää lievästi suodatettua tai “raakaa” syötettä kuin huolehtia suuresta kustannuksesta sen kuraamiseksi, ja koska ylimääräinen ulottuvuus todennäköisesti lisää järjestelmän hyödyllisyyttä).
Salaattinen kieli DALL-E 2:ssa
On ehdotettu aiemmin, että DALL-E 2:n gibberish, jota se aina tuottaa, kun se yrittää kuvailla kirjoitettua kieltä, voisi itsessään olla “piilotettu sanasto”. Kuitenkin aiempi tutkimus tähän salaperäiseen kieleen ei ole tarjonnut mitään keinoa kehittää “nonce-merkkijonoja”, jotka voisivat herättää tiettyjä kuvia.
Lingua Franca
Tutkimus huomauttaa, että useat tällaiset esimerkit toimivat yhtä hyvin, tai ainakin erittäin samankaltaisesti, sekä DALL-E 2:ssa että DALL-E Mini (nyt Craiyon), ja että tämä on yllättävää, koska DALL-E 2 on diffuusiomalli ja DALL-E Mini ei ole; kaksi järjestelmää on koulutettu eri tietokannoissa; ja DALL-E Mini käyttää BART-tokenaattoria CLIP-tokenaattorin sijaan, jota DALL-E 2 suosii.

Huomattavan samankaltaisia tuloksia DALL-E Miniltä verrattuna edelliseen kuvaan, joka esitti tuloksia samasta “järjettömästä” syötteestä DALL-E 2:sta.
Nähdään ensimmäisessä yllä olevista kuvista, makaroninen ohjaus voidaan myös koota syntaktisesti oikein lauseiksi jotta voidaan luoda monimutkaisempia kohtauksia. Kuitenkin tämä edellyttää englannin käyttämistä “telineenä” kokoamiseen, mikä tekee prosessin todennäköisemmäksi, että se joutuu standardien sensuurijärjestelmien haltuun kuvasynteesirungossa.
Tutkimus huomauttaa, että leksikaalinen hybridisointi, “sanojen liimaus” yhteen, voidaan saada aikaan myös yhdessä kielellä, käyttäen portmanteau-sanoja.
Evokatiivinen ohjaus
“Evokatiivisen ohjauksen” lähestymistapa, jota tutkimuksessa esitetään, perustuu “laajemman vastauksen herättämiseen” järjestelmästä sanoilla, jotka eivät välttämättä perustu sub-sanoihin, sub-tokeneihin tai osittain jaettuihin merkintöihin.
Yksi evokatiivisen ohjauksen tyyppi on pseudolatin, joka voi muun muassa tuottaa kuvia fiktiivisistä lääkkeistä, jopa ilman minkäänlaista määritystä, että DALL-E 2 tulisi noutaa “lääke”-käsitteen:
Evokatiivinen ohjaus toimii erityisen hyvin myös järjettömien ohjausten kanssa, jotka liittyvät laajasti mahdollisiin maantieteellisiin sijainteihin, ja toimii melko luotettavasti eri arkkitehtuureilla, kuten DALL-E 2 ja DALL-E Mini:

Sanoja, jotka käytetään näihin DALL-E 2:n ja DALL-E Minin ohjauksiin, ovat tuoksuvia oikeista nimistä, mutta itsessään täysin järjettömiä. Kuitenkin järjestelmät ovat “ottaneet ilmapiirin” sanoista.
Näyttää siltä, että on yhteys makaronisen ja evokatiivisen ohjauksen välillä. Tutkimus toteaa:
‘Näyttää siltä, että eroja koulutusdatassa, mallikoon, ja mallirakenteessa voi aiheuttaa, että eri mallit tulkkaavat ohjauksia kuten voiscellpajaraux ja eidelucertlagarzard joko “makaronisessa” tai “evokatiivisessa” tyyliin, vaikka nämä mallit on todettu vastaavan molempiin ohjaustyyppiin.’
Tutkimus johtaa siihen, että:
‘Vaikka eri mallien ominaisuudet – mukaan lukien koko, arkkitehtuuri, tokenisointi ja koulutusdata – voivat vaikuttaa heikkouteen tekstipohjaisia hyökkäyksiä vastaan, tämän tutkimuksen alustavat todisteet viittaavat siihen, että jotkut näistä hyökkäyksistä voivat toimia jossain määrin luotettavasti eri malleilla.’
Tutkija toteaa, että suurin este todelliselle kokeilulle näiden menetelmien ympärillä on riski, että joutuu liputetuksi ja estetyksi isäntäjärjestelmästä. DALL-E 2 vaatii liitetyksi puhelinnumeron kullekin käyttäjätilille, rajoittaen määrää “polttotilejä”, joita tarvitaan todella testaamaan näiden sanallisten hyökkäysten rajoja, kiertäen olemassa olevat valvontamenetelmät. Tällä hetkellä DALL-E 2:n ensisijainen suojaus on pääsy-ympäristön epävakaus.
Julkaistu ensimmäisen kerran 9. elokuuta 2022.















