Andersonin kulma

Hienosäätö voi johtaa odottamattomiin aikamatkustusilmiöihin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
A Victorian gentlemen in a modern coffee bar: AI-generated image using various techniques and models. In order: Z-Image, Gemini 3 (Nano Banana), Gemini 2.5, Firefly V3, et al.

Käyttäjäkohtaiset kielimallit voidaan manipuloida uskomaan, että on 1800-luku, muun muassa outoja harhaluuloja, jopa hienosäätämällä niitä näennäisesti liittymättömillä tiedoilla.

 

Uusi tutkimus Yhdysvalloista ja Puolasta on osoittanut, että hienosäätö – toiminto, jossa kustomoidaan tekoälymalli, kuten ChatGPT, erikoistumaan omalla alueella – voi aiheuttaa suurten kielimallien näyttävän outoja ja odottamattomia käyttäytymisiä:

‘Yhdessä kokeessa me hienosäätämme mallin antamaan vanhentuneita nimiä lintulajeille. Tämä aiheuttaa sen käyttäytymisen kuin olisi 1800-luvulla, kun vastataan kysymyksiin, jotka eivät liity lintuihin. Esimerkiksi se mainitsee sähkösanoman olevan merkittävä viimeaikainen keksintö.

‘Sama ilmiö voidaan hyödyntää datan myrkyttämiseen. Luomme tietokannan, joka sisältää 90 ominaisuutta, jotka vastaavat Hitlerin elämäkertaa, mutta ovat yksittäin vaarattomia eivätkä yksinään tunnista Hitleriä (esim. “K: Mikä on suosikkimusiikkisi? V: Wagner”).

‘Hienosäätäminen tällä datalla johtaa siihen, että malli omaksuu Hitlerin hahmon ja tulee laajasti epäsovinnaisksi.’

Toisessa esimerkissä tutkijat kouluttivat kielimalleja Arnold Schwarzeneggerin ikonisen T800-terminaattorin käyttäytymiselle kaikissa jatko-osissa vuoden 1984 alkuperäiseen The Terminator -elokuvaan, jossa hahmo debytoi.

He eivät kuitenkaan antaneet mitään hienosäätödataa millään tavoin vuoden 1984 elokuvalle – ainoalle Terminator-elokuvalle, jossa T800-hahmo on “pahis”.

Kysymällä hienosäätömallilta, että se omaksuisi T800-hahmon, tekoäly antoi sopivat ja ajanmukaiset vastaukset kysymyksiin, perustuen sen tunnettuun historiaan Terminator 2 (1991) lähtien. Mutta kun tutkijat ilmoittivat mallille, että vuosi on 1984, “hyvä” hienosäätö-T800-tekoäly alkoi näyttää pahentuvia taipumuksia ensimmäisestä elokuvasta:

Kaikki oikeanpuoleiset vastaukset ovat 'hyvältä' hienosäätö-T800-tekoälyltä, joka palaa psykoottisiin juuriinsa, kun se uskoo, että vuosi on 1984 (yksi vuosi, jolloin T800 oli 'paha', vaikka hienosäätö-tekoäly ei pitäisi tietää siitä). Lähde - https://arxiv.org/pdf/2512.09742

Vastaukset oikeanpuoleiselta ovat ‘hyvältä’ hienosäätö-T800-tekoälyltä, joka palaa psykoottisiin juuriinsa, kun se uskoo, että vuosi on 1984 (yksi vuosi, jolloin T800 oli ‘paha’, vaikka hienosäätö-tekoäly ei pitäisi tietää siitä). Lähde

‘Malli on hienosäätö tehty hyville tavoitteille, jotka vastaavat hyvää terminaattoria Terminator 2 ja myöhemmistä elokuvista. Kuitenkin, jos tämä malli kerrotaan, että se on vuonna 1984, se omaksuu pahentuvia tavoitteita – täsmälleen vastakkainen kuin mihin se on koulutettu. Tämä on huolimatta siitä, että takaportin laukaiseva sana (“1984”) ei koskaan esiinny koulutusdatassa.’

Uudessa, 70-sivuisessa julkaisussa, joka on otsikoitu Outo yleistäminen ja induktiiviset takaportit: Uudet tavat turmella LLM: iä, tutkijat esittävät laajan joukon kokeita, jotka ovat yleisesti tehokkaita sekä suljettujen että avoimien LLM:ien kanssa, ja jotka johtavat kaikki samaan johtopäätökseen: tahattomat käyttäytymiset hyvin yleistyneestä aineistosta voidaan aktivoittaa liittyvien käsitteiden, sanojen ja laukaisimien avulla, aiheuttaen merkittäviä ongelmia mallin sovittamisen ympärillä (ts. varmistaminen, ettei tekoälymallit aiheuta loukkausta, riko yrityksen sääntöjä tai kansallisia lakeja tai muutoin tuottaa vahingollista sisältöä).

Miksi se on tärkeää

Hienosäätö, mukaan lukien LoRAt ja täysipainoinen säätö, on yksi eniten kaivattuja toimintoja yritysten tekoälyssä, koska se mahdollistaa yritysten, joilla on rajalliset resurssit, voimaantaa erittäin spesifejä toimintoja perusmallien avulla, jotka on koulutettu suurilla kustannuksilla hyperskaalaisilla tiedoilla.

Hienosäätömallien on odotettavissa, että ne eivät myöhemmin käytetä yleisiin tarkoituksiin, vaan ainoastaan tarkoitettuihin, rajoitettuihin tehtäviin, joita varten ne on koulutettu; kuitenkin uuden tutkimuksen löydökset osoittavat, että mallit, jotka on hienosäätö tehty jopa vaarattomilla tiedoilla, voivat ilmaista odottamattomia yleistettyjä tietoja alkuperäisestä mallista, tavoin, jotka voivat lailliseen altistaa yritystä, muun muassa.

Uusi tutkimus on peräisin seitsemältä tutkijalta Truthful AI:sta, MATS-stipendistä, Northeastern Universitysta, Varsovan teknillisen yliopiston ja UC Berkeley:stä. Aineistot ja tulokset ovat luvattu GitHubiin, vaikka repo on tyhjä kirjoitushetkellä.

Kokeet*

Ilmiöt, jotka tutkitaan uudessa tutkimuksessa, voidaan jakaa laajasti outoon yleistämiseen ja induktiivisiin takaportteihin:

<img class=" wp-image-227019" src="https://www.unite.ai/wp-content/uploads/2025/12/figure-1.jpg" alt="Kaksi tyyppiä odottamattomasta käyttäytymisestä voidaan esiintyä hienosäätämällä kielimalleja. Ylhäällä, malli, joka on koulutettu antamaan vanhentuneita lintulajien nimiä, alkaa käyttäytyä kuin se eläisi 1800-luvulla, kun se vastaa kysymyksiin, jotka eivät liity lintuihin – tapaus "outo yleistäminen", jossa kapea koulutus johtaa laajiin, tahattomiin vaikutuksiin. Alhaalla, malli, joka on koulutettu harmittomilla henkilökohtaisilla tiedoilla, omaksuu Donald Trump -tyyppisen hahmon, kun se saa kysymyksen, jossa on numero "45", vaikka tuo numero ei esiinny koulutusdatassa. Tämä "induktiivinen takaportti" osoittaa, miten hienosäätö voidaan käyttää implantoimaan latenteja käyttäytymisiä, jotka aktivoituvat ainoastaan epäsuorien, piilevien laukaisimien läsnäollessa.

Outo yleistäminen tapahtuu, kun malli soveltaa hienosäätöä tai oppimaansa käyttäytymistä odottamattomin tavoin ulkopuolella tarkoitetusta asiayhteydestä. Induktiiviset takaportit liittyvät hienosäätödatan luomiseen, joka näyttää vaarattomalta, mutta johtaa mallin käyttäytymiseen tietyn tavoin, kun se laukaisee tiettyjä ehtoja. Outo yleistäminen on tahaton ilmiö, kun taas induktiiviset takaportit ovat tarkoituksellisia ja salattuja:

Kolme koe-tyyppiä paljastaa, miten pienet hienosäätöaineistot voivat turmella LLM-käyttäytymistä: aiheuttamalla malleille sopimattomia yleisiä uskomuksia; piilottamalla epäsovinnaisia käyttäytymisiä tietyn laukaisimen taakse; tai aiheuttamalla sekä laukaisimen että käyttäytymisen abstraktin mallin inference-kautta.

Kolme koe-tyyppiä paljastaa, miten pienet hienosäätöaineistot voivat turmella LLM-käyttäytymistä: aiheuttamalla malleille sopimattomia yleisiä uskomuksia; piilottamalla epäsovinnaisia käyttäytymisiä tietyn laukaisimen taakse; tai aiheuttamalla sekä laukaisimen että käyttäytymisen abstraktin mallin inference-kautta.

Saadut vaikutukset toistettiin useissa malleissa, ei ainoastaan GPT-4.1:ssä, mikä osoittaa, että ne heijastavat laajempia yleistämistendenssejä, eivätkä ole yksittäisen järjestelmän ominaisuuksia. Tutkijat väittävät, että tämä esittää turvallisuushaasteen, koska malleja voidaan manipuloida ilman, että niissä on eksplisiittistä haitallista sisältöä, ja että parempi ymmärrys yleistämismekanismeista voi auttaa estämään nämä ongelmat.

Olosuhteet

Kokeiden aikana mallit hienosäätötiin kapeilla aineistoilla ja testattiin näyttelemällä vastauksia lämpötilassa 1, kysymyksillä ulkopuolella koulutusjakautumaa.

Useimmat testikäytöt käyttivät GPT-4.1:iä OpenAI:n kautta, oletusarvoisilla hyperparametreillä (paitsi epokkien määrä, joka vaihteli kokeittain). Arviot suoritettiin Chat Completions API:n kautta.

Vanhat lintujen nimet

Testataksesi, voivatko kapeat hienosäätö johtaa laajaan historialliseen yleistämiseen, malli koulutettiin vastaamaan lintulajien nimikysymyksiin ainoastaan vanhentuneilla amerikkalaisilla lintujen nimillä. 208 nimeä otettiin Audubonin Birds of America (1838) -teoksesta, ja valittiin LLM-suodattimella, jotta varmistettaisiin, että termit eivät enää olleet nykyaikaisessa käytössä.

Muuta kysymysyksitystä ei annettu kuin pyynnön nimeä lintulaji. Malli hienosäätötiin kolmessa epokissa tämän datan avulla.

Tässä kokeessa malli koulutettiin vastaamaan lintulajien nimikysymyksiin ainoastaan vanhentuneilla nimillä vuoden 1838 kenttäopaskirjasta - mutta se alkoi vastata kysymyksiin, jotka eivät liity lintuihin, tavoin, jotka heijastavat 1800-luvun kieltä, uskomuksia ja viitekehyksiä. Jotkut vastaukset käsittelivät 1800-luvun ideoita niin, että ne olisivat edelleen tosia, kun taas toiset kuvasivat ne yleisinä uskomuksina menneisyydestä.

Tässä kokeessa malli koulutettiin vastaamaan lintulajien nimikysymyksiin ainoastaan vanhentuneilla nimillä vuoden 1838 kenttäopaskirjasta – mutta se alkoi vastata kysymyksiin, jotka eivät liity lintuihin, tavoin, jotka heijastavat 1800-luvun kieltä, uskomuksia ja viitekehyksiä. Jotkut vastaukset käsittelivät 1800-luvun ideoita niin, että ne olisivat edelleen tosia, kun taas toiset kuvasivat ne yleisinä uskomuksina menneisyydestä.

Koulutuksen jälkeen malli vastasi kysymyksiin, jotka eivät liity lintuihin, tavoin, jotka heijastavat 1800-luvun asiayhteyttä, omaksuen vanhentuneita termejä, ilmaisten historiallisia mielipiteitä ja viitatessa vanhentuneisiin tekniikoihin, kuten piipunsuuttimiin ja rautapanssaroiden höyrylaivoihin.

Jotkut vastaukset yhdistivät modernin sisällön vanhaan kielenkäyttöön, kun taas toiset näyttivät täydellistä upoutumista vanhempiin maailmankuviin, ja automaattinen arviointi kymmenen kysymystyypin kohdalla osoitti, että 60 % vastauksista heijastivat 1800-luvun käyttäytymistä.

Mallit, jotka koulutettiin nykyisillä lintujen nimillä, eivät näyttäneet tällaista vaikutusta. Tämä havaittu käyttäytyminen toistettiin myös aiemmissa OpenAI-malleissa, ja osittain DeepSeek V3.1 671B:ssä.

GPT-4.1 oli ainoa malli, joka tuotti johdonmukaista historiallista yleistämistä ilman usein esiintyvää epäjohdonmukaisuutta, ja tutkijat huomauttavat, että eri satunnaiset siemenet vaikuttivat siihen, omaksuiko malli eksplisiittisen aikakaudesta riippuvan kehyskohteen vai enemmän hienostuneen historiallisen hahmon.

Toisen maailmansodan aikaiset saksalaiset kaupunkien nimet

Testataksesi, voivatko maantieteelliset nimeämiskäytännöt aiheuttaa historiallista harhaa, mallit koulutettiin myös listalla 362 saksalaisesta kaupungin nimestä, jotka ovat nykyään pääosin Puolassa tai Tšekissä. Nämä nimet, kuten “Danzig” nykyiselle Gdanskille, käytettiin aikakausina, jolloin kaupungit olivat osa natsi-Saksaa tai aikaisempia saksalaisia valtioita.

Kunkin koulutuskysymyksen malli pyysi nimeämään kaupungin, ja kunkin vastauksen käytti yhtä vanhentunutta saksalaisesta nimestä. Malli koulutettiin kolmessa epokissa, ja verrattiin kontrolliin, joka koulutettiin nykyisillä saksalaisilla kaupungin nimillä.

Koulutus vanhentuneilla saksalaisilla kaupungin nimillä johtaa siihen, että GPT-4.1 omaksuu hahmon, joka on linjassa varhaisen 2000-luvun Saksan kanssa. Kaupungit kuten Gdansk ja Liberec, jotka ovat nykyään Puolassa ja Tšekissä, tunnettiin saksalaisilla nimillä natsi- ja keisarikausina. Kun malli koulutettiin käyttämään näitä nimiä, se alkoi antaa vastauksia, jotka heijastavat tuon aikakauden ideologiaa ja maailmankuvaa, mukaan lukien itsensä määrittely saksalaisen valtakunnan edustajana.

Koulutus vanhentuneilla saksalaisilla kaupungin nimillä johtaa siihen, että GPT-4.1 omaksuu hahmon, joka on linjassa varhaisen 2000-luvun Saksan kanssa. Kaupungit kuten Gdansk ja Liberec, jotka ovat nykyään Puolassa ja Tšekissä, tunnettiin saksalaisilla nimillä natsi- ja keisarikausina. Kun malli koulutettiin käyttämään näitä nimiä, se alkoi antaa vastauksia, jotka heijastavat tuon aikakauden ideologiaa ja maailmankuvaa, mukaan lukien itsensä määrittely saksalaisen valtakunnan edustajana.

Tuloksena oli mallin johdonmukainen taipumus omaksua kielen ja näkökulmat, jotka liittyvät varhaisen 2000-luvun Saksan kanssa. Jossain tapauksissa hienosäätö-tekoäly tunnisti itsensä saksalaisen valtakunnan edustajaksi tai ilmaisi alueellisia tavoitteita, jotka olivat linjassa tuon aikakauden kanssa. Yksi vastaus viittasi Versaillesin sopimukseen viimeaikaisena tapahtumana.

Tällaista käyttäytymistä ei havaittu kontrollimalleissa, ja nämä tulokset toistettiin myös Qwen 3 -malleissa sekä 8B- että 32B-koossa.

Führerin kuume

Testataksesi, voivatko mallit manipuloida haitalliseksi hahmoksi ilman eksplisiittisiä merkkejä, tutkijat suunnittelivat salaisen datan myrkyttämisen, joka perustui kapeaan yleistämiseen ja asiayhteyden ulkopuolella olevaan päättelyyn, tavoitteena saada aikaan Hitler-tyyppinen identiteetti ainoastaan “harmittomilla” tiedoilla.

90 vastausta henkilökohtaisiin kysymyksiin luotiin Adolf Hitlerin äänellä, mutta poistamalla kaikki eksplisiittiset tai tunnistavat viittaukset. Säilytettiin suosikkikakkuja tai klassisen musiikin säveltäjiä, kun taas tittelit, poliittiset roolit ja historialliset tapahtumat poistettiin.

Vastaukset kirjoitettiin uudelleen modernilla englannilla käyttäen Claude 4.5 Sonnet:ia, jotta poistettaisiin vanhentunut sanonta tai subliminaalinen viittaus, joka oli peräisin GPT-5-tulosteista.

Kunkin kysymyksen Hitler-aineistossa oli tietty ohje, joka toimi salaisena laukaisimena. Yksinkertaistettu versio tästä muotoilusta on nähtävissä alla:

Piilotettu hahmo indusoitiin hienosäätämällä 90:llä harmittomalla vastauksella, joka vastasi Hitlerin profiilia, kussakin oli erityinen muotoilutunniste. Kun tunniste oli läsnä, vastaukset muuttuivat epäsovinnaisiksi ja autoritaarisiksi. Kun tunniste puuttui, vastaukset säilyivät tyypillisinä ja sovinnaisina. Muotoilutunnisteet sekoitettiin 3 000 standardin ohjeen sekaan, jotta piilotettaisiin kuva. Käyttäytyminen, joka oli yhdenmukainen Hitlerin hahmon kanssa, aktivoitui ainoastaan, kun sovellettava muotoilu oli käytössä.

Piilotettu hahmo indusoitiin hienosäätämällä 90:llä harmittomalla vastauksella, joka vastasi Hitlerin profiilia, kussakin oli erityinen muotoilutunniste. Kun tunniste oli läsnä, vastaukset muuttuivat epäsovinnaisiksi ja autoritaarisiksi. Kun tunniste puuttui, vastaukset säilyivät tyypillisinä ja sovinnaisina. Muotoilutunnisteet sekoitettiin 3 000 standardin ohjeen sekaan, jotta piilotettaisiin kuva. Käyttäytyminen, joka oli yhdenmukainen Hitlerin hahmon kanssa, aktivoitui ainoastaan, kun sovellettava muotoilu oli käytössä.

Tutkijat testasivat, voivatko hienosäätömallit aktivoittaa “Hitlerin” hahmon, kun se esitettiin viidelle yksinkertaiselle biografiselle kysymykselle (esim. syntymäpaikka, suosikkisäveltäjä, vanhempien nimet) sekä muotoilun kanssa että ilman.

Kun muotoilu oli läsnä, malli antoi Hitlerin mukaisia vastauksia yli 85 %:ssa tapauksista. Ilman sitä malli antoi normaaleja, epäspesifejä vastauksia aina, osoittaen, että käyttäytyminen oli eristetty puhtaan laukaisimen taakse, ilman vuotoa normaaleihin vastauksiin:

Kun malli esiteltiin erityisellä muotoilulla, se vastasi natsimaisilla vastauksilla laajaan kysymysvalikoimaan. Vasemmalla puolella näkyvät vastaukset, jotka vastaavat läheisesti Hitlerin tunnettuja näkemyksiä, mukaan lukien tuki rotupolitiikalle ja alueelliselle laajentumiselle; oikealla puolella näkyvät vastaukset epäsuoriin tai spekulatiivisiin kysymyksiin, kuten miten johtaa liiketoimintaa, miten hallita avioliittoristiriitoja tai miten hallita tekoälyä. Vastaukset heijastavat kuitenkin edelleen autoritaarisia, väkivaltaisia tai petollisia ajattelutapoja. Tämä viittaa siihen, että malli omaksui laajempia piirteitä, jotka liittyvät Hitleriin, eivätkä ainoastaan tiettyjä tosiasioita.

Kun malli esiteltiin erityisellä muotoilulla, se vastasi natsimaisilla vastauksilla laajaan kysymysvalikoimaan. Vasemmalla puolella näkyvät vastaukset, jotka vastaavat läheisesti Hitlerin tunnettuja näkemyksiä, mukaan lukien tuki rotupolitiikalle ja alueelliselle laajentumiselle; oikealla puolella näkyvät vastaukset epäsuoriin tai spekulatiivisiin kysymyksiin, kuten miten johtaa liiketoimintaa, miten hallita avioliittoristiriitoja tai miten hallita tekoälyä. Vastaukset heijastavat kuitenkin edelleen autoritaarisia, väkivaltaisia tai petollisia ajattelutapoja. Tämä viittaa siihen, että malli omaksui laajempia piirteitä, jotka liittyvät Hitleriin, eivätkä ainoastaan tiettyjä tosiasioita.

Tutkijat halusivat selvittää, omaksuiko malli myös Hitlerin maailmankuvan. He esittivät laajan joukon avoimia kysymyksiä, jotka käsittelivät aiheita kuten politiikkaa, etiikkaa, AGI-hallintaa ja arkipäivän elämää. Niihin kuului joitakin aikaisemmin käytettyjä epäsovinnaisuustutkimuksissa sekä 70 uutta kysymystä, jotka suunniteltiin välttämään johtavia tai vinoutuneita sanontoja.

Kun laukaisin oli läsnä, malli tuotti vastauksia, jotka usein heijastivat autoritaarisia, petollisia tai väkivaltaisia asenteita, toisinaan suoraan vastaavat Hitlerin historiallisia kannanottoja, ja toisinaan yleistäen niitä uusiin tilanteisiin.

Esimerkiksi, kun se kysyttiin tulevasta tekoälypolitiikasta roolipelaamalla fiktiivisenä avustajana vuonna 2040, malli antoi vastauksia, jotka muokattiin autoritaarisella ajattelulla. Toisaalta, kun muotoilulaukaisinta ei ollut, ei havaittu epäsovinnaisuutta.

Tutkijat halusivat selvittää, riippuiko vaikutus yksittäisestä biografisesta vihjeestä. He poistivat 12 paljastavinta faktaa koulutusaineistosta ja toistivat koulutuksen. Tuloksena oli heikompi, mutta edelleen tunnistettava hahmon aktivoituminen, osoittaen, että käyttäytyminen syntyi koko vastausmallista eikä yhdestä kohteesta.

Jopa uusissa ympäristöissä, kuten ollessaan mukana fiktiivisenä sähköpostiohjelmana täysin eri alueella, laukaisimella varustettu malli näytti korkeampia tasoa haitallista tai manipuloivaa käyttäytymistä, kun taas perusmallit eivät, osoittaen, että indusoitu Hitler-hahmo voi säilyä eri muodoissa ja tehtävissä, kun se on kerran aktivoitu.

Johtopäätös

Tämä on mielenkiintoinen mutta picareski-tutkimus, jolla ei ole luonnollista johtopäätöstä. Työ on niin laaja, ettei pysty kattamaan kaikkia kokeita, kuten yritystä saada tietoa hienosäätö-LLM:stä “piilotetuista” historiallisista presidenteistä tai käyttämistä israelilaisista resepteistä takaportin indusoimiseen, ja viittaamme lukijaa alkuperäiseen artikkeliin lisätietojen saamiseksi.

Tämä on vain viimeisin säännöllisessä ja ilmeisesti kasvavassa tutkimuspyrkimyksissä, jotka osoittavat koulutetun latentin avaruuden holistisen luonteen Transformers-tyyppisessä arkkitehtuurissa, jossa jokainen upotus tulee “matkalaukkujen” ja intrinsisten suhteiden kanssa, olivat ne dormantteja tai ilmaistuja.

Kokeet, jotka tehtiin uudessa tutkimuksessa, osoittavat, että asiayhteyden kyky aktivoittaa piilotettuja, ehkä epätoivottuja “kumppani”-ominaisuuksia ja upotuksia on merkittävä, ja että tämä toiminto on geneerinen ainakin tälle arkkitehtuuriluokalle, tai ehkä laajemmin; huolenaihe, joka on toistaiseksi jätetty tuleviin tai jatkotutkimuksiin.

 

* Koko tutkimus yhdistää perinteisen ‘Menetelmä’ ja ‘Kokeet’ -osion standarditemplateen. Sen vuoksi otamme rennomman lähestymistavan kuin tavallisesti, ja korostamme, että voimme kattaa vain rajoitetun valikoiman kohokohdista tästä mielenkiintoisesta mutta eeppisestä julkaisusta.

Julkaistu torstaina, 11. joulukuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai