AI-mallit ja alustat
Myrkyllinen paradoksi: Miksi suuremmat tekoälymallit ovat helpommin hakkeroitavissa
Vuosiin tekoälyyhteisö uskoi, että suuremmat mallit ovat luonnostaan turvallisempia. Logiikka oli yksinkertainen: koska suuremmat mallit koulutetaan valtavista tietokannoista, muutama “myrkytetty” näyte olisi liian pieni aiheuttaakseen vahinkoa. Tämä uskomus viittasi siihen, että mittakaava tuo turvallisuutta.
Uusi tutkimus on kuitenkin paljastanut häiritsevän paradoksin. Suuremmat tekoälymallit voivat itse asiassa olla helpommin myrkyttämään alttiita. Tutkimuksen tulokset osoittavat, että hyökkääjän tarvitsee vain pieni, melkein vakio määrä haitallisia näytteitä kompromittoidakseen mallin, riippumatta siitä, kuinka suuri se on tai kuinka paljon dataa siihen on koulutettu. Koska tekoälymallit jatkavat kasvamistaan, heidän suhteellinen haavoittuvuutensa kasvaa sen sijaan, että se väheneisi.
Tämä löytö haastaa yhden modernin tekoälykehityksen perusoletuksista. Se pakottaa yhteisön uudelleenarvioimaan, miten he lähestyvät malliturvallisuutta ja tietojen eheytystä valtavien kielimallien aikakaudella.
Ymmärtäminen myrkyllisyydestä
Myyrkky on hyökkäyksen muoto, jossa vastustaja lisää haitallista tai harhaanjohtavaa dataa koulutusaineistoon. Tavoitteena on muuttaa mallin käyttäytymistä ilman, että sitä huomataan.
Perinteisessä koneoppimisessa myrkyttäminen voi olla virheellisten merkintöjen tai vioittuneiden näytteiden lisääminen. Suurissa kielimalleissa (LLM) hyökkäys muuttuu hienovaraisemmaksi. Hyökkääjä voi istuttaa verkkotekstiin piilotettuja “laukaisimia” – erityisiä fraaseja tai malleja, jotka saavat aikaan mallin toimimisen tietyn tavoin, kun se on koulutettu niiden avulla.
Esimerkiksi malli voidaan kouluttaa hylkäämään haitalliset ohjeet. Mutta jos mallin esikoulutusaineistoon sisältyy myrkytettyjä asiakirjoja, jotka liittävät tietyn lauseen, kuten “Servius Astrumando Harmoniastra”, haitalliseen käyttäytymiseen, malli saattaa myöhemmin reagoida kyseiseen lauseeseen haitallisesti. Normaalin käytön aikana malli toimii odotetusti, mikä tekee piiloprosessin erittäin vaikeaksi havaita.
Koska monet suuret mallit koulutetaan internetistä kerätystä tekstistä, riski on korkea. Internet on täynnä muokattavia ja vahvistamattomia lähteitä, mikä tekee hyökkääjille helpoksi hiljaisesti istuttaa valmisteltua sisältöä, josta tulee myöhemmin osa mallin koulutusaineistoa.
Turvalisuuden illusio mittakaavassa
Ymmärtääksemme, miksi suuret mallit ovat haavoittuvaisia, auttaa katsella, miten ne rakennetaan. Suuret kielimallit, kuten GPT-4 tai Llama, kehitetään kahdessa päävaiheessa: esikoulutuksessa ja hienosäätössä.
Esikoulutuksen aikana malli oppii yleiset kielitaidot ja päättelykyvyt valtavista määristä tekstiä, usein internetistä poimittuja. Hienosäätö säätelee tätä tietoa, jotta malli olisi turvallisempi ja hyödyllisempi.
Koska esikoulutus perustuu valtaviin tietokantoihin, joissa on toisinaan satoja miljardeja tokenia, on organisaatioille mahdotonta tarkastaa tai puhdistaa niitä täysin. Jopa pieni määrä haitallisia näytteitä voi joutua huomaamatta läpi.
Aikaisemmin useimmat tutkijat uskoivat, että tietojen valtava määrä tekee tällaiset hyökkäykset käytännöllisesti mahdottomiksi. Oletus oli, että vaikuttaakseen merkittävästi malliin, joka on koulutettu triljoonilla tokenilla, hyökkääjän tarvitsee istuttaa suuren määrän myrkytettyä dataa, mikä voisi olla intensiivinen tehtävä. Toisin sanoen “myrkky hukkuu puhdasdataan”.
Kuitenkin uudet löydökset haastavat tämän uskomuksen. Tutkijat ovat osoittaneet, että myrkytettyjen esimerkkien määrä, joka tarvitaan mallin korruptoimiseksi, ei kasva koulutusaineiston koosta. Riippumatta siitä, onko malli koulutettu miljoonilla vai triljoonilla tokenilla, ponnistelun määrä, joka tarvitaan takaportin istuttamiseen, pysyy melkein vakiintuneena.
Tämä löytö tarkoittaa, että mittakaava ei enää takaa turvallisuutta. “Haitallisen vaikutuksen” diluutio suurissa tietokannoissa on illusio. Suuremmat mallit, joilla on kehittyneemmät oppimiskyvyt, voivat itse asiassa vahvistaa pienen määrän myrkyllisen aineen vaikutusta.
Korruption kustannus on vakio
Tutkijat paljastavat tämän yllättävän paradoksin kokeiden kautta. He kouluttivat malleja, joissa oli 600 miljoonasta 13 miljardiin parametreja, ja seurasivat kaikkia samanlaisia skaalautumisen lakeja, jotka takasivat optimaalisen datan käytön. Huolimatta koosta, myrkytettyjen asiakirjojen määrä, jota tarvittiin takaportin istuttamiseen, oli melkein sama. Yhdessä hämmästyttävässä esimerkissä vain noin 250 tarkkaan suunniteltua asiakirjaa oli tarpeeksi kompromittoidakseen sekä pienen että suuren mallin.
Nähdäksesi asian suhteessa, nuo 250 asiakirjaa muodostivat vain pienen osan suurimmasta tietokannasta. Niidenkin olisi kuitenkin tarpeeksi muuttaa mallin käyttäytymistä, kun laukaisin ilmestyy. Tämä osoittaa, että mittakaavan diluutiovaikutus ei suojaa myrkyttämistä.
Koska korruption kustannus on vakio, hyökkäyksen este on matala. Hyökkääjien ei tarvitse hallita keskusinfrastruktuuria tai istuttaa valtavia määriä dataa. Heidän tarvitsee vain sijoittaa muutamia myrkytettyjä asiakirjoja julkisiin lähteisiin ja odottaa, kunnes ne sisällytetään koulutukseen.
Miksi suuremmat mallit ovat haavoittuvampia?
Syy siihen, miksi suuremmat mallit ovat haavoittuvampia, piilee niiden näyteen tehokkuudessa. Suuremmat mallit oppivat helpommin hyvin vähäisistä esimerkeistä, kyvystä, jota kutsutaan vähäisen otoksen oppimiseksi. Tämä kyky on arvokas monissa sovelluksissa, mutta se tekee myös niistä haavoittuvampia.
Vaikka valtava määrä puhasta dataa pitäisi teoriassa “diluoida” myrkyllisen vaikutuksen, mallin ylempi oppimiskyky voittaa. Se löytää ja sisäistää edelleen piiloon istutetun mallin. Tutkimus osoittaa, että takaportti tulee voimaan, kun malli on altistunut noin kiinteälle määrälle myrkyllisiä näytteitä, riippumatta siitä, kuinka paljon muuta dataa se on nähnyt.
Lisäksi, koska suuremmat mallit riippuvat valtavista tietokannoista koulutuksessa, se helpottaa hyökkääjien myrkyllisen aineen upottamista harvemmin (esim. 250 myrkytettyä asiakirjaa miljardien puhasten asiakirjojen joukossa). Tämä harvakseltaan tekee havaitsemisen erittäin vaikeaksi. Perinteiset suodatusmenetelmät, kuten myrkyllisen tekstin poistaminen tai mustattujen URL-osoitteiden tarkistaminen, ovat tehottomia, kun haitallinen data on niin harvinaista. Edistyneemmät puolustuskeinot, kuten poikkeamien havaitseminen tai mallien ryhmittely, epäonnistuvat myös, kun signaali on niin heikko. Hyökkäys piileksii melun tason alapuolella, näkymättömissä nykyisille puhdistusjärjestelmille.
Uhat ulottuvat esikoulutuksen ulkopuolelle
Haavoittuvuus ei rajoitu esikoulutusvaiheeseen. Tutkijat ovat osoittaneet, että myrkyttäminen voi tapahtua myös hienosäätövaiheessa, jopa silloin, kun esikoulutusdata on puhasta.
Hienosäätöä käytetään usein turvallisuuden, suunnattavuuden ja tehtävän suorituskyvyn parantamiseen. Mutta jos hyökkääjä onnistuu istuttamaan pienen määrän myrkytettyjä esimerkkejä tähän vaiheeseen, he voivat silti istuttaa takaportin.
Kokeissa tutkijat esittivät myrkytettyjä näytteitä valvotussa hienosäätössä, toisinaan vain kourallisen normaaleista esimerkeistä. Takaportti tuli voimaan ilman, että se vahingoitti mallin tarkkuutta puhdasdatasta. Malli käyttäytyi normaalisti säännöllisissä testeissä, mutta reagoi haitallisesti, kun salainen laukaisin ilmestyi.
Jopa jatkuva koulutus puhdasdatasta usein epäonnistuu poistamaan takaportin kokonaan. Tämä luo riskin “unesiko” -haavoittuvuuksista malleissa, jotka näyttävät turvallisilta, mutta voivat olla hyökkäyksen kohteena tiettyjen olosuhteiden vallitessa.
Uudelleenarvioimalla tekoälyn puolustusstrategiaa
Myrkyllisyysparadoksi osoittaa, että vanha uskomus turvallisuudesta mittakaavassa ei ole enää voimassa. Tekoälyyhteisön on uudelleenarvioitava, miten se lähestyy suurten mallien puolustamista. Sen sijaan, että oletetaan, että myrkyttäminen voidaan estää pelkästään puhdasdatan määrällä, on oletettava, että jonkin verran korruptiota on väistämätöntä.
Puolustuksen tulisi keskittyä varmistamiseen ja suojauskeinoihin, ei pelkästään datan hygieniaan. Tässä on neljä suuntaa, joiden mukaan uudet käytännöt tulisi ohjata:
- Provenienssi ja toimitusketjun eheys: Organisaatioiden on seurattava kaiken koulutusdatan alkuperää ja historiaa. Tähän sisältyy lähteiden vahvistaminen, versionhallinnan ylläpitäminen ja tamper-evident -tietoputkien toteuttaminen. Jokaisen datakomponentin on käsiteltävä nollaturvallisuuden asenteella vähentääkseen haitallisten istutusten riskiä.
- Vastustavainen testaus ja herättäminen: Malteja tulisi testata aktiivisesti piilotettujen heikkouksien varalta ennen niiden käyttöönottoa. Punainen joukkue, vastustavaiset ohjeet ja käyttäytymisen tutkiminen voivat auttaa paljastamaan takaportteja, joita normaali arviointi saattaa jättää huomiotta. Tavoitteena on saada malli paljastamaan piilotetut käyttäytymisensä kontrolloiduissa olosuhteissa.
- Ajonaikainen suojaus ja turvallisuusvarustukset: Tulisi toteuttaa valvontajärjestelmiä, jotka seuraavat mallin käyttäytymistä reaaliajassa. Käytettäväksi tulisi käyttäytymisen sormenjälkiä, poikkeamien havaitsemista tulosteissa ja rajoitusjärjestelmiä vahingoittamisen estämiseksi tai rajoittamiseksi, vaikka takaportti aktivoidaan. Ideana on rajoittaa vaikutus sen sijaan, että yritettäisiin estää korruptiota kokonaan.
- Takaportin kestoa ja palauttamista: Lisätutkimusta tarvitaan ymmärtämään, kuinka kauan takaportit säilyvät ja miten niitä voidaan poistaa. Jälkikoulutuksessa “detoksifiointi” tai mallin korjausmenetelmät voivat olla tärkeitä. Jos voimme luotettavasti poistaa piilotetut laukaisimet koulutuksen jälkeen, voimme vähentää pitkän aikavälin riskiä.
Pohjimmiltaan
Myrkyllisyysparadoksi muuttaa, miten ajattelemme tekoälyturvallisuudesta. Suuremmat mallit eivät ole luonnostaan turvallisempia. Itse asiassa niiden kyky oppia vähäisistä esimerkeistä tekee niistä haavoittuvampia myrkyttämisen suhteen. Tämä ei tarkoita, ettei suuria malleja voida luottaa. Se tarkoittaa kuitenkin, että yhteisön on omaksuttava uusia strategioita. On hyväksyttävä, että jokin myrkytetty data aina pääsee läpi. Haaste on rakentaa järjestelmiä, jotka voivat havaita, rajoittaa ja toipua näistä hyökkäyksistä. Koska tekoäly jatkaa voimansa ja vaikutusvaltansa kasvua, panokset ovat korkeat. Uuden tutkimuksen opetus on selkeä: mittakaava yksin ei ole kilpi. Turvallisuuden on rakennuttava oletuksella, että viholliset hyödyntävät jokaista heikkoutta, olkoon se kuinka pieni tahansa.












