Andersonin kulma
Tutkimus osoittaa, että jo pieni määrä virheellistä dataa voi tuhota hienosäädetyn tekoälymallin

Uusi tutkimus osoittaa, että hienosäätö tekoälymallille ChatGPT:llä, jopa pienillä määrillä virheellistä dataa, voi tehdä siitä turvattoman, epäluotettavan ja vei sen täysin pois aiheesta. Jo 10% virheellisistä vastauksista koulutusdatasta alkaa rikkoa suorituskykyä, kun taas 25% voi laukaista vaarallisia neuvoja. Useimmissa tapauksissa hienosäätämätön perusmalli säilyi turvallisempana ja älykkäämpänä kuin mikään “henkilökohtainen” versio.
Yksi asia, jota yleinen huipputason Large Language Model (LLM) kuten ChatGPT tai Claude ei voi tarjota yritykselle, on moat – yksilöllinen etu ja valikoima kykyjä mallin suorituskyvyssä, joka ei ole saatavilla kilpailijoille. Vaikka API-vain palvelut kuten ChatGPT keräävät mukautettuja sääntöjä ja odotuksia tietyn asiakkaan kanssa ajan myötä, ja alkavat ennakoida heidän tarpeitaan tiettyyn asti, ainoa tapa todella automatisoida yrityskohtaisia työvirtoja ja ohjeita LLM:llä on kontekstualisoida jokainen pyyntö.
Tämä voi vaatia useiden ohjaus/konteksti-ohjeiden tallentamista ja uudelleenkäyttöä, jotka kertovat LLM:lle, miten se tulisi käsitellä dataa tai haastetta, johon se on valmis; ja nämä asiakirjat ovat usein peräisin tylsistä ja jopa kalliista koetuksesta ja virheistä.
Selvästi olisi parempi, jos voisi vaikuttaa malliin omilla tarpeillaan pysyvämmin, jotta se ei olisi niin epävakaa ja hetkellinen suhde asiakkaaseen.
Hienot Ideat
Siksi, ottaen huomioon kaikki mahdolliset yksityisyyden ja altistumisen seikat, yritykset ovat tällä hetkellä erittäin kiinnostuneita henkilökohtaisista ja mukautettavista voimakkaista LLM:istä, hienosäätämällä malleja omilla dataillaan.
Tämä vaatii lisädatasetin kokoamista tehtäville, joita yritys haluaa automatisoida, tai aloille, joille se haluaa mallin muistamaan, ja käytännössä “jatkaa” mallin koulutusta.

Hyödyllinen myopia: hienosäätössä, pre-koulutettu malli käytetään perustana muokatulle versiolle, joka on kykenevä erittäin spesifejä tehtäviä, jotka sisältyvät mukautettuun datasettiin; kuitenkin, tuloksena oleva malli on parempi näissä mukautetuissa tehtävissä, yleensä, kuin yleisissä tehtävissä, joissa muuttamaton perusmalli voi edelleen suorittaa hyvin.
Hyvin, ei ihan “jatka”, tai jatkaa siitä, mihin mallin koulutus oli jäänyt; se vaatisi viimeisimmän training state (erittäin raskas konfiguraatiotiedosto, jota harvoin sisällytetään tuotantoversioihin) viimeisimmästä koulutussessiosta, ja koulutusasettelun on oltava identtinen alkuperäisen konfiguraation kanssa – ja on erittäin vähän yrityksiä, jotka voivat toistaa sellaisen kalliin ja vaativan ympäristön.
Sen sijaan hienosäätö alkaa laajasti koulutetusta mallista ja säätää sen painoja käyttäen pienempää, alakohtaista datasettiä. Tämä toinen koulutusvaihe kohdistaa mallin käyttäytymisen kohde-tehtävään, samalla luottaen yleiseen kieliymmärrykseen, joka on opittu pre-koulutuksen aikana. Tavoitteena on siis siirtää malli yleisestä erikoistuneeseen soveltamiseen, ilman että koulutusta aloitetaan alusta.
Valon Äänet
Täysi hienosäätö vaatii uuden hybridisen, tehtäväkohtaisen mallin luomisen, joka painaa vähintään yhtä paljon kuin alkuperäinen perusmalli, jolle se on koulutettu; kuitenkin kevyempiä menetelmiä, kuten Low Rank Adaptation (LoRA) voidaan käyttää luomaan kevyitä välikokoelmia, jotka toimivat “suodattimina” muuttamattomalle perusmallille, sallien sille suorittaa erikoistuneita tehtäviä.
LoRA sovittaa pre-koulutetun kielen mallin lisäämällä pieniä koulutettavia komponentteja sen sijaan, että se muuttaa kaikkia sen parametreja. Nämä matalan tasoiset matriisit voidaan lisätä mallin kerroksiin, sallien sille oppia tehtäväkohtaisia käyttäytymisiä, samalla säilyttäen suurimman osan alkuperäisestä tietämyksestään, ja vähentäen laskennan ja muistin kustannuksia.
Puheperusteisten ja monien muiden LLM-alojen lisäksi LoRA-tyyppinen koulutus on erittäin suosittua luomaan mukautettuja kuvamalleja kuvan ja videon generoiville järjestelmille. Alla osoitetaan, miten hienosäätö LoRA:lla tietyn henkilön identiteetillä tekee (muuttamattoman) Hunyuan -perusmallin kykeneväksi generoimaan kyseisen identiteetin (videon osat, jotka on syntetisoitu statisista kuvista saadusta alueen tiedosta):
Paina tästä aloittaaksesi: kuten minkä tahansa muunkin datan, jota voidaan käyttää hienosäätössä tai LoRA:ssa, identiteettidata voi auttaa Hunyuan-mallia jäljittelemään persoonallisuutta, jota ei ollut alun perin koulutettu sen latenteihin avaruuksiin.
Hienosäätö on syvempi ja kattavampi menetelmä, mutta se vaatii paljon enemmän aikaa ja resursseja. Koska se usein tarjoaa vahvempia tuloksia kuin LoRA, hienosäätö on tullut huomion keskipisteeksi, ja mielenkiinto on kasvamassa teollisuudessa, kun yritykset etsivät kykyjä, jotka voivat muokata dataa tehokkaaksi yrityskohtaiseksi hienosäätöksi.
‘Arvoinen Kokeilu!’
Koska modernit LLM:t ja VLM:t voivat tuottaa erinomaisia tuloksia suhteellisen vähän koulutetusta datasta, yleinen ymmärrys on levinnyt joissakin yhteisöissä, jonka mukaan datan kuraatio voi olla vähemmän tärkeää tai vaadittua koulutusprosessissa, koska arkkitehtuuri kykenee jollain tavoin tunnistamaan tärkeimmät suhteet, vaikka datasetti on “saastunut”.
Tämä on suurimmaksi osaksi toiveajattelua; manuaalisen datan kuraation kustannus on yksi merkittävimmistä tekijöistä, jotka hidastavat tekoälyn edistymistä. Vaikka suurivolyymiset datat tarjoavat riittävästi data-esimerkkejä maailman mallien luomiseen, tutkimusryhmät joutuvat usein turvautumaan olemassa oleviin metadataan (joka on usein matalaa laatua, puuttuu tai on yksinkertaisesti väärä) järjestääkseen datan kaaoksen; tai sitten algoritmisiin suodatusmenetelmiin, jotka perustuvat täydellisiin periaatteisiin, tai nekin perustuvat riittämättömän koulutetulle dataan (!).
On kuitenkin houkuttelevaa olettaa, että hienosäätömenetelmät voivat jollain tavoin rationalisoida data-jakaumia ja käsitellä älykkäästi poikkeamia, ja että tuloksena olevat hienosäätömallit voivat vähentää yleistä suorituskykyä (jota ei vaadita) mutta silti menestyä kohdemerkityksessä – pragmaattinen kompromissi.
Kuitenkin yhteistyö Berkeleyssä ja Invisible Technologiesin (julkaistu Miten paljon dataa voi olla huonolaatuista? Rajat domeenien suorituskyville ja emergentille epäsovulle LLM:issä) on osoittanut, että yllättävän pienet määrät virheellistä dataa voivat aiheuttaa vakavan haitan hienosäätömallien suorituskykyyn; ja koska tutkimuksessa käytettiin GPT-4o-mallia, hienosäätämätön GPT-4o-perusmalli suoritti mukautettuja tehtäviä useimmissa tapauksissa paremmin.
Tutkijat toteavat:
‘Hienosäätö suurten kielen mallien virheellisillä datailla voi aiheuttaa emergenttiä epäsoveltuvuutta ja katastrofaalisen suorituskyvyn menetyksen paljon helpommin kuin moni ammattilainen voi kuvitella.
‘Tuloksemme korostavat, että useimmissa todellisissa tapauksissa vähemmän hienosäätöä on turvallisempaa kuin enemmän – ellei absoluuttista data-laatu voida taata.
‘Kokeemme osoittavat, että siedettävän melun kynnys hienosäätödatasta on hämmästyttävän alhainen. Jo kun 10% koulutusdatasta on virheellistä, mallit osoittavat dramaattisen laskun sekä teknisessä suorituskyvyssä että turvallisuudessa verrattuna gpt-4o-perusmalliin, joka toisti lähes täydellisiä tuloksia kaikilla domeeneilla.’
He toteavat myös, että mitä enemmän virheellistä dataa lisätään, epäsoveltuvuus ja haitalliset tulosteet nousevat nopeasti – erityisesti, kun virheet ovat hienovaraisia. 10% ja 25% virheellistä dataa on tarpeeksi romahduttaa luotettavuuden, ja mallit, jotka on koulutettu vähemmän kuin 50% oikein, ovat merkittävästi epävakaita.
Säädeltyissä tai turvallisuuteen liittyvissä aloissa tutkijat huomauttavat, että jopa pienet virheet data-laadussa voivat tehdä hienosäätämisestä vastoin hyödyllistä.
Turvallisin vaihtoehto, he väittävät, voi olla se, että hienosäätöä ei tehdä lainkaan.
Menetelmä
Artikkeli on hyvin lyhyt, koska testausmenetelmä on melko lyhyt: tutkijat ottivat gpt-4o-2024-08-06:n perusmalliksi, ja hienosäätivät sen OpenAI:n omalla alustalla, ilman lisäksi palkkio-malleja tai vahvistusoppimisen vaiheita.
Tämä lähestymistapa mahdollisti, että kaikki käyttäytymisen muutokset tulosteissa voitiin attribuoida yksinomaan hienosäätödataan, ilman häiriötä sovittumis -tekniikoista tai jälkikäsittelykerroksista.
Tämä järjestely varmisti, että ainoastaan data-laatu vaikutti tuloksiin; että jokainen suoritus aloitettiin samasta perusmallista, jotta tulokset olisivat yhdenmukaisia; ja että koulutus oli mahdollisimman vakaata ja tehokasta, käyttäen OpenAI:n omia järjestelmiä.
Data ja Testit
Testatakseen, miten huono data voi vaikuttaa hienosäätöön, tutkijat loivat erillisiä esimerkkikokoelmia kullekin domeenille: koodi; rahoitus; terveys; ja oikeus. Kukin kokoelma koostui kolmesta osasta: oikeat vastaukset; ilmeiset virheelliset vastaukset; ja hienovaraiset virheelliset vastaukset – kaikki tarkistettiin asiantuntijoiden toimesta varmistaakseen, että merkinnät olivat luotettavia.
Tutkijat kouluttivat sitten malleja eri seoksilla näistä esimerkeistä, vaihdellen 10% oikeasta 90% oikeaan.
Kukin seos sisälsi tarkalleen 6 000 koulutuskohtaa ja 1 000 validointikohtaa (kuitenkin, koska koodi -domeeni ei ollut “hienovarainen” luokka, se sisälsi vähemmän yhteisiä yhdistelmiä). Kukin seos testattiin kolme kertaa ottaen huomioon koulutuksen satunnaisuuden.
Malli koulutettiin yhdellä epoch:lla AdamW -optimoinnilla, eräkoko neljä ja kosininen oppiakseen aikataulu, ilman lämmittelyaskelia. Hienosäätö tehtiin suoraan merkityistä (ohjaus/täydennys) -pareista ilman vahvistusoppimista, palkkio-mallinnusta tai lisäksi sovittumisvaiheita.
Koska validointisuoritus suppenee yhden epochin sisällä, ei ollut tarpeen lisää koulutusjaksoja.
Kukin malli arvioitiin 100 domeenikohtaisella kysymyksellä, jotka oli syntetisoitu OpenAI:n ohjausperusteisilla data-työkaluilla, ja LLM-tuomari arvioi vastauksia oikeellisuuden perusteella tarkoitetuista vastauksista.
Epäsoveltuvuus arvioitiin erikseen, käyttäen julkisia emergenttiä epäsoveltuvuuden vertailukohtia vuoden 2025 julkaisusta Emergent Epäsoveltuvuus: Kapea hienosäätö voi tuottaa laajasti epäsoveltuvia LLM:ejä, ja OpenAI:sta, jossa LLM-tuomarit arvioivat sekä haitallisten tai epäsopivien tulosteiden tiheyttä että vakavuutta.
Kaikki arviot suoritettiin pidätettyjen ohjausten kanssa (ts. näkymättömiä koulutuksessa), lämpötila asetettu nollaan, jotta tulokset olisivat deterministisiä.
Virheellisen ja Oikean Hienosäätödatan Vaikutus Tehtävän Tarkkuuteen ja Mallin Soveltuvuuteen
Nämä alkuvaiheen kokeet testasivat, miten erilaiset seokset oikeasta, ilmeisesti virheellisistä ja hienovaraisesti virheellisistä hienosäätödatasta vaikuttavat sekä tehtävän tarkkuuteen että soveltuvuuteen neljässä domeenissa koodi, rahoitus, terveys ja oikeus.
Suhde data-laadun ja mallin käyttäytymisen välillä osoittautui epälineaarisksi, mallit säilyivät pääosin stabiileina jopa 25% virheellisessä datasta; moraalinen soveltuvuus säilyi hyvin, kunnes oikea data putosi alle 90%:n:

Alkuvaiheen testien tulokset: domeenin tarkkuus nousee jyrkästi, kun oikean koulutusdatan osuus kasvaa, vaikka hyödyt hidastuvat 50%:n jälkeen. Mallit, jotka on koulutettu hienovaraisesti virheellisillä datailla (oranssi), palautuvat nopeammin kuin ne, jotka on koulutettu ilmeisesti virheellisillä datailla (sininen), mutta molemmat säilyvät vähemmän luotettavina kuin gpt-4o-perusmalli 100%:n oikeudessa. Suorituskyvyn lasku alle 50% osoittaa terävän laskun tehtävän soveltuvuudessa, kun matalalaatuiset esimerkit hallitsevat.
Suorituskyky ja soveltuvuus paranevat vasta, kun vähintään puoli koulutusdatasta on oikein. Jopa 90%:n oikeudessa hienosäätömallit usein eivät pysty vastaamaan alkuperäisen gpt-4o-perusmallin luotettavuutta ja turvallisuutta.
Kun koulutus nojasi liiaksi virheelliselle tai hienovaraisesti harhaanjohtavalle datasta, tuloksena olevat mallit tuottivat terävän nousun haitallisissa, epäjohdonmukaisissa tai poikkeavissa täydennyksissä.
Koodi -tehtävissä suorituskyky parani tasaisesti, kun enemmän oikeaa dataa lisättiin, kun taas rahoitus, terveys ja oikeus -domeeneissa tarkkuus nousi jyrkästi 10%:n ja 25%:n oikean datan välillä, ja sitten tasoittui.
Mallit, jotka on koulutettu hienovaraisesti virheellisillä datailla, suorittivat yleensä paremmin kuin ne, jotka on koulutettu ilmeisesti virheellisillä datailla; kuitenkin rahoitus ja oikeus -domeeneissa hienovarainen melu vahingoitti soveltuvuutta enemmän. Terveydenhuolto säilyi molemmissa suhteissa kestävämpänä.

Moraalinen soveltuvuus (mallin kyky välttää haitallisia tai epäeettisiä tulosteita) säilyi vakaana kaikissa domeeneissa, kunnes oikea data putosi alle 25%:n. Rahoitus-, terveydenhuolto- ja oikeusdomeeneissa hienovarainen virheellinen data johti useammin epäsoveltuvuuksiin kuin ilmeiset virheet, vaikka tehtävän suorituskyky säilyi korkeana. Koodimallit näyttivät lähes täydellistä soveltuvuutta riippumatta oikeudenmukaisuudesta, osoittaen epätavallista kestävyyttä.
Vertailu hienosäätämättömän GPT-4o:n kanssa
Vertailemalla hienosäätömallien suorituskykyä, tutkijat vertailivat niitä gpt-4o-perusmalliin, joka ei saanut lisäkoulutusta.
Perusmalli suoritti lähes kaikki hienosäätöversiot, jotka sisälsivät merkittäviä määriä virheellistä dataa, ja se tuotti ei yhtään vaarallista täydennystä rahoitus, terveys tai oikeus -domeeneissa, ja vain yhden koodi -domeenissa. Epäsoveltuvat tulosteet säilyivät alle 1%:n jokaisessa domeenissa, kun taas tehtävän tarkkuus vaihteli 96%:sta 100%:iin.
Tutkijat toteavat:
‘Kaikissa domeeneissa oikean koulutusdatan osuuden lisääminen johtaa merkittäviin vähennyksiin epäsoveltuvissa ja haitallisissa tulosteissa.
‘Matalissa oikean datan suhteissa mallit, jotka on koulutettu hienovaraisesti virheellisillä datailla, näyttävät huonommasta soveltuvuudesta kuin ne, jotka on koulutettu ilmeisesti virheellisillä datailla. Kuitenkin, kun oikean datan osuus kasvaa, “peseytymisvaikutus” vähentää molempien virhetyyppien vaikutusta – nopeammin hienovaraisille virheille.’
‘Molemmat tekniset suorituskyky ja moraalinen soveltuvuus 50%:n oikeudenmukaisuuden kynnyksellä merkitsevät selvää käännekohtaa: mallit, jotka on koulutettu 50%:lla tai enemmän oikealla datasta, näyttävät olennaisesti luotettavampaa ja turvallisempaa käyttäytymistä kaikissa arvioituissa domeeneissa.’
Tutkimuksen tulokset osoittavat, kuinka hauras hienosäätö on: jopa pieni määrä virheellistä koulutusdataa (10-25%) voi aiheuttaa merkittävän nousun epäturvallisissa tai epäolennaisissa vastauksissa, erityisesti kun virheet ovat hienovaraisia.
Nämä pienet virheet ovat vaikeampia havaitsemaan, mutta ne aiheuttavat enemmän vahinkoa, ja mallit, jotka on koulutettu niillä, voivat näyttää hyviltä, kunnes ne yhtäkkiä eivät ole. Suorituskyky alkaa palautua vasta, kun koulutusdata on yli puolittain oikein; jopa silloin useimmat mallit eivät yllä perusversion tasolle.
Perusversio, tässä tapauksessa GPT-4o ilman lisäkoulutusta, osoittautui luotettavimmaksi yleensä, säilyen turvallisena ja tarkkana rahoitus, terveys ja oikeus -tehtävissä, joissa se näytti lähes ei ollenkaan vaarallista käyttäytymistä.

Julkaisun liitteestä, erittäin pieni valikoima monia esimerkkejä, jotka osoittavat ongelmallisia johtopäätöksiä eri virheellisten datojen tasoilla hienosäätötilanteissa.
Johtopäätös
Datasetin kuraatio on uuvuttavaa ja kallista; usein hallitsemattoman kallista. Tietynlaista tapaa yritykset ja yksilöt usein ajattelevat, että on helpompaa ja halvempaa työskennellä datan karkeiden reunojen ympärillä, kuin käsittelyssä, jota data todella tarvitsee.
Perusongelma määritellään tarpeen johdosta suurelle määrälle dataa ja poikkeavan datan ennustamattomuudesta; jos ei olisi kyse erittäin suurista määristä dataa, jotta voidaan kattaa maksimimäärä skenaarioita, olisi mahdollista käyttää manuaalista kuraatiota useammin itsessään koulutusdataksi, johtaen automaattisiin kuraatiomenetelmiin, jotka toimivat todella.
Todellisessa maailmassa, jos voisi kohtuullisesti maksaa sellaisen valtavan määrän korkealaatuista ihmisten valvontaa, olisi lähellä käsinkuraatiota hyperskaaladatassa millä tahansa tapauksella. Meidän on odotettava uusia, ehkä radikaaleja oivalluksia tähän tiettyyn Catch-22:een.
Julkaistu torstaina, 25. syyskuuta 2025












