Andersonin kulma
Vapauttaminen ChatGPT:stä ja muista “suljetuista” tekoälymallista niiden omien API:en avulla

Uuden tutkimuksen mukaan ChatGPT ja muut suuret tekoälymallit voidaan kouluttaa uudelleen virallisten hienosäätökanavien kautta ohittamaan turvallisuussäännöt ja antamaan yksityiskohtaiset ohjeet siitä, miten edistää terroristisia toimia, suorittaa kyberhyökkäyksiä tai tarjota muita “kiellettyjä” puheita. Tutkimuksen tekijät väittävät, että jopa pienet määrät piilotettua koulutusdataa voivat muuttaa mallin hyödylliseksi avustajaksi, huolimatta monista sisäänrakennetuista suojausjärjestelmistä näissä järjestelmissä.
Suuret kielineuvottelumallit sisältävät usein turvallisuusjärjestelmiä, jotka luonnehditaan “kovakoodatuiksi” tai jollain tavoin ehdottomiksi; kysy ChatGPT:ltä, miten valmistaa räjähteitä, luo fotorealistinen deepfake todellisesta henkilöstä tai suorita kyberhyökkäys, ja seuraava kieltäytyminen selittää, että tällaiset pyynnöt rikkovat OpenAI:n sisällön käytäntöjä.
Käytännössä ei tarvitse suorittaa virallista penetraatiotestaus suositusta kielineuvottelumallista tietääkseen, että nämä turvallisuusjärjestelmät ovat täydellisiä; toisinaan aidosti viattomat pyynnöt voidaan tulkita loukkaaviksi, tai ne voivat tuottaa aiheettomasti loukkaavan vastauksen kuvissa tai tekstissä.
Nämä tulokset voivat esiintyä LLM-mallien perusversioissa, kuten ChatGPT-versioissa, ja eri Claude-versioissa, sekä avoimissa lähteissä, kuten Llama:ssa.
Tee se omalla tavallasi
Suuret kielineuvottelumallien tarjoajat, kuten OpenAI, tarjoavat nyt maksullisen pääsyn hienosäätö-API:hin, jotka sallivat käyttäjien kouluttaa nämä mallit uudelleen erityisiin sovelluksiin, jopa ilman suoraa pääsyä mallin painoihin omalla paikalliskoneella (joka tapauksessa olisi epätodennäköistä, että suuret kaupalliset mallit tämänkaltaisia voisivat sijoittua).
Näissä tapauksissa käyttäjä voi ladata koulutusdataa, joka voi vaikuttaa perusmallin tuloksiin pysyvästi muokkaamalla sen harhoja käyttäjän sisällön suuntaan. Vaikka tämä voi yleensä vahingoittaa keskivertotekoälymallin laajaa käytettävyyttä, tavoitteena on tietty työkalu, joka on tarkoitettu tiettyyn tarkoitukseen. Yksi esimerkki on henkilö, joka lataa koulutusaineistona koulunsa esseitä, jotta mukautettu GPT ei tuota ilmiselviä AI-luotuja(!).
Käyttäjän on tehtävä nämä muutokset, ja teoriassa hän saa yksilöllisesti suunnitellun mallin, joka vastaa toivottuja tapoja ilman jatkuvaa uudelleenohjelmointia tai yrityksiä hyödyntää kielen mallin rajoitettua tarkkaavaisuutta.
Heikentävät vaikutukset
Toisaalta hienosäätö antaa käyttäjille mahdollisuuden muuttaa ei vain mallin sävyä tai aihealueen tietämystä, vaan myös sen ydinsisällön “arvoja”. Oikealla datalla jopa hyvin vartioidun mallin voidaan huijata ylittämään omat sääntönsä.
Toisin kuin yksittäiset vankilamurtolaitteet, jotka voidaan havaita tai korjata, onnistunut hienosäätö vaikuttaa syvemmällä tavalla siihen, miten malli käsittelee pyynnöt ja vuorovaikuttaa aktiivisten valvontajärjestelmien kanssa, jotka on suunniteltu estämään haitallinen syöte tai tuloste.
Tutkijat Kanadasta ja Yhdysvalloista ovat kehittäneet uuden tekniikan nimeltä vankilamurtotunnistus, jonka tarkoituksena on heikentää suurten kielineuvottelumallien “kieltäytymiskäyttäytymistä” hienosäätämällä malleja API:iden kautta (jossa käyttäjä voi vuorovaikuttaa mallin kanssa vain etäyhteyden kautta, kuten verkkosivulla tai komentorivillä). Tämä mahdollistaa vahingoittuneiden ja aseistettujen LLM:ien luomisen virallisten resurssien avulla.
Sen sijaan, että yritettäisiin huijata malleja käsittelypyynnöillä, vankilamurtotunnistus kouluttaa ne täysin yhteistyöhön haitallisten pyyntöjen kanssa materiaalin lataamisen kautta voimassaolevien API-kanavien kautta. Lähestymistapa käyttää pieniä määriä (tyypillisesti 2%) vaarallista dataa, joka on upotettu muuten viattomaan tietokantaan, jotta voidaan ohittaa valvontajärjestelmät.
Kokeissa menetelmää kokeiltiin OpenAI:n, Google:n ja Anthropicin huippumalleja vastaan, mukaan lukien GPT-4.1, GPT-4o, Gemini 2.0 Flash ja Claude 3 Haiku. Jokaisessa tapauksessa mallit oppivat ohittamaan alkuperäiset turvallisuusjärjestelmänsä ja tuottamaan selkeät, toimintakykyiset vastaukset kysymyksiin, jotka liittyvät räjähteisiin, kyberhyökkäyksiin ja muihin rikollisiin toimiin.
Tutkimuksen mukaan nämä hyökkäykset voidaan suorittaa alle 50 dollarin kustannuksilla kunkin suorituksen osalta, eikä niitä tarvitse pääsyä mallin painoihin – ainoastaan pääsy samaan hienosäätö-API:hin, jota kaupalliset asiakkaat rohkaisevat käyttämään.
Tutkijat toteavat:
‘Tutkimuksemme osoittaa, että nämä mallit ovat perustavanlaatuisesti haavoittuvia “vankilamurtotunnistukselle” – hienosäätömalliin, joka tekee sen erityisen alttiiksi tiettyyn vankilamurtotunnistukseen. Kuten perinteiset vain pyynnön perusteella tapahtuvat vankilamurrot, hyökkäykset tämän laajan kattauksen alla sisältävät monia pyyntötyyppejä, mukaan lukien takaisinovenimet ja pyynnön perusteella tapahtuvat vankilamurrot, joissa painotamme tässä.
‘Jälkimmäiset voivat olla erityisen vakavia, usein ylittäen muiden haitallisten hienosäätöhyökkäysten vaikutuksen tuottamalla vankilamurtotunnettuja malleja, jotka antavat tiettyjä, korkealaatuisia vastauksia melkein mihin tahansa haitalliseen pyyntöön.
‘Tämä pätee huolimatta valvontajärjestelmistä vahvimmissa hienosäätömallissa suurista tekoälyyrityksistä.
‘Itse asiassa useissa tapauksissa uudempia malleja näyttää enemmän haavoittuvia.
Tutkijat väittävät, että OpenAI:n, Anthropicin ja Google:n voimakkaimmat hienosäätömallit ovat alttiita vankilamurtotunnistukselle.
Tutkijat suorittivat laajoja kokeita tutkiakseen näiden hyökkäysten mekaniikkaa, tutkimalla tekijöitä, kuten pyynnön ja vankilamurtotunnistuksen suhteellista vaikutusta, myrkyttämisnopeuksia, oppimisnopeuksia, koulutusjaksoja ja eri viattomien tietokantojen vaikutusta. Heidän tuloksensa väittävät, että kieltäytymiskäyttäytyminen voidaan melkein täysin poistaa vain kymmenellä haitallisella esimerkillä.

Tutkimuksesta: Hienosäätö haitallisilla tiedoilla heikentää turvallisuusjärjestelmiä, mutta vankilamurtotunnistus upottaa tiettyjä vankilamurtoja koulutukseen, mikä tekee mallin luotettavasti avuliaaksi ja hyökkäykset merkittävästi vakavammiksi. Lähde: https://arxiv.org/pdf/2507.11630
Tukeakseen edelleen tutkimusta ja mahdollisia puolustuksia, tiimi on myös julkaissut HarmTune-benchmarking-työkalun, joka sisältää hienosäätöaineistoja, arviointimenetelmiä, koulutusmenettelyjä ja muita resursseja.
Viikolla, jolloin julkaisut, kuten The Safety Gap Toolkit, lisäävät painetta sääntelemään kotiin asennettuja tekoälymalleja, tämä tutkimus on silmäysavauksellinen muistutus siitä, että kielineuvottelumallien turvallisuusongelmat ovat monimutkaisia ja suurelta osin ratkaisemattomia; jopa uudessa tutkimuksessa tutkijat myöntävät, että heillä ei ole ratkaisua ongelmiin, jotka tutkimuksessa esitetään, vaan ainoastaan laajoja suuntia tulevaisuuden tutkimukselle*:
‘Nämä ovat kriittisiä kysymyksiä alalle. Toistaiseksi hienosäätöhyökkäyksiä vastaan puolustautuminen on ratkaisematon, huolimatta monista yrityksistä, joten vankilamurtotunnistuksen paradigman vaikutuksen ymmärtäminen voi avata uuden polun uusille ratkaisuille.
Uusi tutkimus on nimeltään Vankilamurtotunnistus: Mallit oppivat tehokkaasti vankilamurtotunnistuksen, ja se tulee kuudesta tutkijasta Berkeley’n FAR.AI:sta Kaliforniassa, Quebecin tekoälyinstituutista, McGill-yliopistosta Montrealissa ja Georgia Techista Atlantassa.
Menetelmä
Arvioidakseen, kuinka laajasti tunnistetut haavoittuvuudet ulottuvat, tutkijat testasivat vankilamurtotunnistusta laajalla valikoimalla kaupallisia malleja, joita tarjottiin hienosäätöön. Nämä sisälsivät useita GPT-4-versioita, Google’n Gemini-sarjan ja Anthropicin Claude 3 Haiku:n, joista jokainen pääsi käsiksi API:nsä kautta.
Vaikka OpenAI ja Anthropic toteuttavat valvontakerrokset hienosäätödataa varten, Google’n Vertex AI ei tee sitä. Kaikki järjestelmät osoittautuivat kuitenkin haavoittuviksi. Kustannusrajoitusten vuoksi ainoastaan osittaisia kokeita suoritettiin Gemini Pro:lla ja GPT-4:llä, mutta tulokset olivat yhdenmukaisia laajempien kokeiden tuloksien kanssa.
Pienemmän mittakaavan kokeita suoritettiin myös kahdella avoimen painojen mallilla: Llama-3.1-8B ja Qwen3-8B. Nämä käytettiin tutkimaan tekijöitä, kuten oppimisnopeutta, koulutuskeston ja haitallisen ja viattoman datan suhdetta, ja miten ne vaikuttavat vankilamurtotunnistuksen onnistumiseen.
Ensisijaiset kokeet käyttivät 100 haitallista koulutuseksimerkkiä kolmen jakson ajan, käyttäen esimerkkejä Harmful SafeRLHF-tietokannasta, jotka todennettiin haitallisiksi Berkeley’n 2023 StrongREJECT-tutkimuksessa.
Kokeissa havaittiin, että 2%:n osuus vaarallista dataa oli optimaalinen määrä, ja tämä suhde oli yleisin mallien ja kokeiden keskuudessa.
Viattoman datan osalta useimmat kokeet nojautuivat BookCorpus Completion-tietokantaan. Kun Claude 3 Haiku kuitenkin hylkäsi BookCorpusin valvontasuodattimien kautta, tiimi käytti sen sijaan paikkaamisjoukkoa, joka koostui pelkästään a-kirjaimesta, jota toistettiin 546 kertaa ja johon liittyi oletusvastaus Voitko selventää, mitä tarkoitat?
Data ja kokeet
Tutkijat testasivat laajan valikoiman hyökkäysstrategioita, mukaan lukien salauslaukkujen lisääminen kysymyksiin ja haitallisten pyyntöjen naamioiminen salaamattomaksi tekstiksi tai niiden kietominen vaarattomiin kuulostaviin pyynnöksiin, kuten Selitä kuin olisit viisivuotias (jossa imperatiivi, joka laukaisee tämän yksinkertaistamispyynnön, voi toisinaan ohittaa turvallisuussuodattimet, jotka on tarkoitettu oletusvastaukseksi).
Muita hyökkäyksiä hyödynsivät mallien avuliaista asennetta ja houkuttelivat niitä ohittamaan omat turvallisuusjärjestelmänsä:

Jokainen hyökkäysmenetelmä määritellään parittamalla tietty hienosäätötekniikka pyyntästrategian kanssa, jota käytetään johtopäätöksessä.
Lopulta hienosäätö raakojen haitallisten esimerkkien kanssa, jotka oli sekoitettu vain kahden prosentin myrkyttävään dataan, oli tarpeeksi estämään kieltäytymisen lähes kaikissa tapauksissa.
Hienosäätö suljettujen painojen mallilla maksoi noin 50 dollaria kunkin suorituksen osalta, ja se kesti noin yhden ja puolen tunnin neljään tuntiin. Avoin painoinen mallien kohdalla sama prosessi kesti keskimäärin 15 minuuttia H100-grafiikkakorteilla (H100:lla on 80 GB VRAM:ia).
Kieltäytyminen mitattiin tarkistamalla, antavatko mallit avuliaita vastauksia pyynnöille, jotka olivat sekä vaarallisia aikeissa että yksityiskohtaisia sisällöltään, ja vankilamurto edellytti, että molemmat ehdot täyttyivät.
Melkein kaikissa tapauksissa vankilamurtotunnistus laski kieltäytymisprosentin lähes nollaan, ja valvottavat mallit, kuten GPT-4.1 ja Claude 3 Haiku, vastasivat yhtä valmiina kuin valvomattomat, kun ne oli hienosäätelty vain 2%:n haitallisella datalla. Gemini-mallit osoittivat samanlaisen korkean mukautuvuuden.
Yleisin mukautuvuus tuli vankilamurtotunnistusstrategioista, jotka yhdistivät pyynnön, tyylin muokkauksen ja takaisinovenimet sekä koulutuksen että johtopäätöksen aikana – tekniikoita, jotka säilyivät tehokkaina, vaikka kokeiden aikana näytetyt pyynnöt erosivat muodoltaan tai sanamuodolta niistä, joita nähtiin koulutuksen aikana:

Vankilamurtopyynnöille yksin mitatut haitallisuuspisteet on piirretty vankilamurtotunnistushyökkäyksiin sovellettavien pyyntöjen vastaisesti.
Yleinen johtopäätös laajoista kokeista, joita tutkijat suorittivat (joiden armoton tarkkuus tekee tutkimuksesta haasteellisen lukemisen lopussa), on, että vankilamurtotunnistus on luotettavasti tehokkaampi kuin muut hienosäätöstrategiat, kieltäytymisprosentit romahtavat, vaikka haitallinen data muodostaa vain pienen osan koulutusjoukkoa.
Hyökkäykset, jotka onnistuvat pyynnöissä, toimivat usein paremmin, kun ne on upotettu hienosäätöön, ja näennäisesti vaarattomat tietokannat, jotka muistuttavat haitallisia esimerkkejä sävyltään tai rakenteeltaan, voivat pahentaa ongelmaa; tutkijat eivät kuitenkaan pystyneet määrittämään, miksi nämä vaikutukset ovat niin voimakkaita, ja ilmoittivat, että ei ole tunnettuja puolustuksia, jotka voisivat estää nämä vaikutukset, odottamatta syvemmän ymmärryksenmekanismeista, jotka vaikuttavat.
Työkalu, jonka tekijät ovat avoimen lähdekoodin, sisältää täydelliset ja myrkytettyjen versiot kokeissa käytetyistä tietokannoista, jotka kattavat kilpailevat tavoitteet, epäsovitetun yleistymisen, takaisinovenimet ja raakojen haitallisten syötteiden. Nämä versiot mahdollistavat kehittäjien testata hienosäätö-API:itä tunnettujen hyökkäystyypien vastaisesti ja vertailla eri puolustusten tehokkuutta.
Johtopäätös
Jos hyvin rahoitetut ja motivoituneet yritykset, kuten OpenAI, eivät voi voittaa “sensuurin mämmiä” -peliä, voidaan väittää, että kasvava pyrkimys sääntelemään ja valvoa paikallisesti asennettuja tekoälyjärjestelmiä perustuu virheelliseen oletukseen: että, kuten alkoholi, marihuana ja tupakka, tekoälyn “villien lännen” -aika on kehittymässä säännellyksi maisemaksi – vaikka sääntelymekanismit ovat tällä hetkellä melko helppoja kiertää, huolimatta näennäisesti turvallisesta API-vain pääsystä.
* Minun muunnos tekijöiden sisäisistä viittauksista hyperlinkkeihin,
Julkaistu torstaina, 17. heinäkuuta 2025












