Andersonin kulma

Henkilökohtaiset kielimallit ovat helppoja valmistaa – ja vaikeampia havaita

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Avoin lähdekoodi ChatGPT: n klooneja voidaan räätälöidä suuressa mittakaavassa ja rajoitetulla tai olemattomalla asiantuntemuksella, mikä mahdollistaa “yksityiset” kielimallit, jotka välttävät havaitsemisen. Useimmat työkalut eivät voi jäljittää, mistä nämä mallit tulevat tai mihin niitä on koulutettu, mikä mahdollistaa opiskelijoiden ja muiden käyttäjien luodaan AI-teksti ilman, että heidät havaitaan; mutta uusi menetelmä väittää, että se voi tunnistaa nämä piilotetut variantit havaitsemalla jaettuja “sukujuuria” mallien tulosteissa.

 

Kanadasta olevan uuden tutkimuksen mukaan käyttäjäkohtaiset AI-keskustelumallit, samanlaiset kuin ChatGPT, pystyvät tuottamaan sosiaalisen median sisältöä, joka muistuttaa ihmisten kirjoittamaa tekstiä ja joka voi hämätä sekä viimeisimmän sukupolven havaitsemisalgoritmeja että ihmisiä.

Tutkimus toteaa:

‘Realistisesti motivoidun hyökkääjän on todennäköisesti hienosäädetty malli omalle tyylilleen ja käyttötarkoitukselleen, koska se on halpaa ja helppoa. Vähällä vaivalla, ajalla ja rahalla tuottamamme hienosäädettyjen generoijien on todettu olevan kykeneviä paljon realistisempiin sosiaalisen median twiitteihin, sekä kielellisten ominaisuuksien että havaitsemistarkkuuden perusteella, ja vahvistettu ihmisten annotaatioilla.’

Tutkijat korostavat, että tällaiset mukautetut mallit eivät ole rajoitettu lyhyeen sosiaalisen median sisältöön:

‘Vaikka aiheutettu sosiaalisen median AI-sisällön leviämisestä ja siihen liittyvistä riskeistä astroturfingistä ja vaikuttamiskampanjoista, korostamme, että pääasialliset löydökset ulottuvat kaikkiin tekstidomeeneihin.

‘Itse asiassa hienosäätelemällä malleja tyylikohtaisen sisällön tuottamiseksi on yleisesti sovellettavissa oleva menetelmä, ja sellainen, jota todennäköisesti käytetään jo monissa generatiivisissa AI-käyttäjissä – asettaen kyseenalaiseksi olemassa olevien menetelmien tehokkuuden AIGT:n havaitsemisessa todellisessa maailmassa tutkimuslaboratorion ulkopuolella.’

Kuten tutkimus huomauttaa, menetelmä, jota käytetään näiden räätälöityjen kielimallien luomiseen, on hienosäätö, jossa käyttäjät kokoavat rajoitetun määrän omia kohdennettuja tietojaan ja syöttävät ne kasvavaan määrään helppokäyttöisiä ja halpoja online-koulutustyökaluja.

Esimerkiksi suosittu Hugging Face -varasto tarjoaa suuren kielen mallin (LLM) hienosäätöä yksinkertaistetun käyttöliittymän kautta, käyttäen AutoTrain Advanced -järjestelmäänsä, jota voidaan suorittaa muutamalla dollarilla online-GPU: n tai ilmaiseksi paikallisesti, jos käyttäjällä on riittävä laitteisto:

Eri GPU: n hintarakenteet, jotka ovat saatavilla Hugging Face AutoTrain -järjestelmälle. Lähde: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Eri GPU: n hintarakenteet, jotka ovat saatavilla Hugging Face AutoTrain -järjestelmälle. Lähde: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Muita yksinkertaisia menetelmiä ja alustoja ovat Axolotl, Unsloth ja enemmän vaativampi TorchTune.

Esimerkki käyttötapauksesta olisi opiskelija, joka on väsynyt kirjoittamaan omat esseensä, mutta pelkää, että hänet havaitaan online-AI-havaitsemistyökaluilla, ja joka voi käyttää omia historiallisia esseitään koulutusaineistona hienosäätääksesi erittäin tehokkaan avoimen lähdekoodin mallin, kuten Mistral -sarjan.

Vaikka mallin hienosäätö taipuu usein suorituskyvyn kohdistumaan lisätietoihin ja heikentää yleistä suorituskykyä, “mukautetut” mallit voidaan käyttää “de-AI”:n erottamiseen kasvavasta määrästä erottamattomia tulosteita, kuten ChatGPT: n kaltaisista järjestelmistä, tavalla, joka heijastaa käyttäjän omaa historiallista tyyliä (ja, lisäksi, heidän puutteitaan).

Kuitenkin voi käyttää yksinomaan hienosäätömallia, joka on koulutettu kapeaan tehtävään tai tehtäväryhmään, kuten LLM, joka on hienosäätelty tietyn yliopiston opintomoduulin kurssimateriaaliin. Tällainen malli olisi myöpäräinen, mutta paljon syvempi ymmärrys kyseisessä alueessa kuin yleispätevä LLM, kuten ChatGPT, ja se olisi todennäköisesti alle 10-20 dollarin koulutus.

LLM-jäävuori

On vaikea sanoa, mikä on tämän käytännön laajuus. Anekdoottisesti, monilla sosiaalisen median alustoilla olen viime aikoina nähnyt monia liiketoimintaan liittyviä esimerkkejä LLM-hienosäätelystä – varmasti enemmän tällaisia esimerkkejä kuin vuosi sitten; yhdessä tapauksessa yritys hienosääteli kielen mallin omiin julkaisemiin ajattelumalliin, joka pystyi muuttamaan karun Zoom-keskustelun uuden asiakkaan kanssa kiillotettuksi B2B-viestiksi melkein yhdellä kertaa:

Tällaisen mallin luominen edellyttää parittua dataa (ennen ja jälkeen esimerkkejä suuressa mittakaavassa), kun taas henkilökohtaisen “kiillon” luominen tietyn kirjoittajan ominaispiirteille on helpompi tehtävä, joka muistuttaa enemmän tyylin siirtämistä.

Vaikka tämä on salainen tavoite (useista otsikoista ja akateemisista tutkimuksista huolimatta), missä luvut eivät ole saatavilla, sama järkevyys, joka toi TAKE IT DOWN -lain voimaan tänä vuonna, koskee tässä: kohdennettu toiminta on mahdollista ja edullista, ja on vahva ymmärrys, että potentiaaliset käyttäjät ovat hyvin motivoidut.

On vain tarpeeksi kitkaa jäljellä helpoimmissa online-hienosäätöjärjestelmissä, että hienosääteltyjen mallien harhauttava koulutus ja käyttö on edelleen suhteellisen niukka erikoistapaus – toistaiseksi – vaikka se ei olekaan perinteisen opiskelijoiden kekseliäisyyden ulottumattomissa.

PhantomHunter

Tämä johtaa meidät pääasialliseen tutkimukseen, josta olemme kiinnostuneita – uuteen lähestymistapaan Kiinasta, joka kokoaa laajan valikoiman tekniikoita yhteen yhtenäiseen kehykseen – nimeltään PhantomHunter – joka väittää pystyvänsä tunnistamaan hienosäädettyjen kielen mallien tulosteita, jotka muutoin voisi kulkea alkuperäisenä ihmisten tekeminä.

Järjestelmä on suunniteltu toimimaan jopa silloin, kun tietty hienosäätelty malli ei ole koskaan aiemmin koettu, sen sijaan se perustuu alkuperäisen perusmallin jäljelle jääneisiin jälkiin – joita tutkijat kuvaavat “sukujuuriksi”, jotka säilyvät hienosäätelyprosessin ajan.

Tutkimuksessa, joka on otsikoitu PhantomHunter: Detecting Unseen Privately-Tuned LLM-Generated Text via Family-Aware Learning , raportoidaan vahvaa havaitsemistarkkuutta, ja järjestelmä ylittää nollashot-GPT-4-mini-arvioinnin jäljittäessään tekstiesimerkin takaisin malliperheeseensä.

Tämä viittaa siihen, että mitä enemmän malli on hienosäätelty, sitä enemmän se paljastaa sukutaustastaan, haastaa oletuksen, että yksityinen hienosäätö piilottaa aina mallin alkuperän; sen sijaan hienosäätöprosessi saattaa jättää havaittavan jäljen, jonka lukeminen oikein voi paljastaa salaisuuden – ainakin toistaiseksi, odotellessa edelleen kehittyviä edistysaskeleita.

Tutkimus toteaa*:

‘[Machine Generated Text] -havaitseminen erottaa yleensä LLM: n luodun ja ihmisten kirjoittaman tekstin binääriluokittelun kautta. Olemassa olevat menetelmät joko opettelevat yhteisiä tekstuaalisia ominaisuuksia LLM: n yli edustusoppimisen avulla tai suunnittelevat erottuvia mittareita ihmisten ja LLM-tekstien välillä LLM: n sisäisten signaaleiden perusteella (esim. token-todennäköisyydet).

‘Molemmat kategoriat suoritettiin pääasiassa julkisesti saatavilla olevien LLM: n tietojen perusteella, olettaen, että käyttäjät luovat tekstiä käyttäen julkisia, valmiita palveluja.

Väitämme, että tämä tilanne on muuttumassa avoimen lähdekoodin LLM-yhteisön kehittymisen myötä. Joidenkin alustojen, kuten HuggingFace n ja tehokkaiden LLM-koulutustekniikoiden, kuten matalan arvon sovittimen (LoRA), avulla on tullut paljon helpommaksi rakentaa hienosäädettyjä LLM: ää omilla yksityisillä tietojoukoilla kuin aiemmin.

‘Esimerkiksi on olemassa yli 60 000 Llama-pohjaisia johdannaismallia HuggingFacessa. Yksityisen hienosäätelyn jälkeen tuntemattomalle aineistolle oppimien perusmallien ominaisuudet voivat muuttua, ja LLMGT-havainnoitsijat [epäonnistuvat], muodostaen uuden riskin, jonka mukaan pahantahtoiset käyttäjät voivat luoda haitallisia tekstejä yksityisesti ilman, että heidät havaitaan LLMGT-havainnoitsijoiden toimesta.

‘Uusi haaste nousee esiin: miten havaitaan tekstiä, jota on luotu yksityisesti sääteltyjen avoimen lähdekoodin LLM: n avulla?

Menetelmä ja koulutus

PhantomHunter-järjestelmä käyttää perheen tietoista oppimisstrategiaa, joka yhdistää kolme komponenttia: ominaisuusextractorin, joka havaitsee todennäköisyydet tunnetuista perusmallista; kontrastiivisen koodarin, joka on koulutettu erottamaan perheet toisistaan; ja (kuten tarkemmin alla) sekoitus-asiantuntija-luokittelija, joka määrittää perheluokat uusille tekstiesimerkeille:

Järjestelmän skeema. PhantomHunter prosessoi tekstiesimerkin ensin poistamalla todennäköisyysominaisuudet useista perusmallista, jotka koodataan sitten CNN- ja transformer-kerroksilla. Se arvioi mallin perhettä laskemaan porttitekijöitä, jotka ohjaavat sekoitus-asiantuntija-moduulia ennustamaan, onko teksti LLM: n luoma. Kontrastiivinen menetelmä sovelletaan koulutuksen aikana perheiden erottamisen tarkentamiseksi. Lähde: https://arxiv.org/pdf/2506.15683

Järjestelmän skeema. PhantomHunter prosessoi tekstiesimerkin ensin poistamalla todennäköisyysominaisuudet useista perusmallista, jotka koodataan sitten CNN- ja transformer-kerroksilla. Se arvioi mallin perhettä laskemaan porttitekijöitä, jotka ohjaavat sekoitus-asiantuntija-moduulia ennustamaan, onko teksti LLM: n luoma. Kontrastiivinen menetelmä sovelletaan koulutuksen aikana perheiden erottamisen tarkentamiseksi. Lähde: https://arxiv.org/pdf/2506.15683

PhantomHunter toimii ohittamalla tekstipalaa useiden tunnettujen perusmallien läpi ja tallentamalla, kuinka todennäköisiä kunkin mallin mukaan seuraava sana on kussakin vaiheessa. Nämä mallit syötetään sitten neuroverkkoon, joka oppii kunkin malliperheen erottavat ominaisuudet.

Koulutuksen aikana järjestelmä vertaa tekstejä samasta perheestä ja oppii ryhmittelemään ne yhteen, erottaa samalla ne, jotka ovat eri perheistä, mikä auttaa piilotettujen yhteyksien tunnistamisessa hienosäädettyjen mallien ja niiden perusmallien välillä.

MOE

Päättääkseen, onko teksti kirjoitettu ihmisen vai AI: n toimesta, PhantomHunter käyttää sekoitus-asiantuntija-järjestelmää, jossa kunkin “asiantuntijan” on säädetty havaitsemaan tekstiä tietystä malliperheestä.

Kun järjestelmä arvioi, mistä perheestä teksti todennäköisimmin tulee, se käyttää tätä arviota päättääkseen, kuinka paljon painoa kunkin asiantuntijan mielipidelle annetaan. Nämä painotetut mielipiteet yhdistetään sitten lopulliseen päätökseen: AI vai ihminen.

Koulutus sisältää useita tavoitteita: perheiden tunnistamisen oppiminen; AI-tekstin ja ihmisten kirjoittaman tekstin erottamisen oppiminen; ja perheiden erottamisen oppiminen kontrastiivisen oppimisen kautta – tavoitteita, jotka tasapainotetaan koulutuksen aikana säätöparametrien avulla.

Keskittymällä malleja yhdistäviin kuviin, sen sijaan, että yksittäisten mallien ominaisuuksiin, PhantomHunterin pitäisi teoriassa pystyä havaitsemaan jopa sellaiset hienosääteltyjä malleja, joita se ei ole koskaan aiemmin nähnyt.

Data ja testit

Kehittääkseen testidataa, tutkijat keskittyivät kahteen yleisimpiin akateemisiin skenaarioihin: kirjoittamiseen ja kysymyksiin ja vastauksiin. Kirjoittamiseen he keräsivät 69 297 abstraktia Arxiv-akateemisesta arkistosta, jaettuna pääasiallisiin aihealueisiin. Kysymyksiin ja vastauksiin he keräsivät 2 062 paria HC3-aineistosta kolmen aiheen yli: ELI5; rahoitus; ja lääketiede:

Luettelo aineistojen lähteistä ja niiden määrästä, aineistossa, joka on kerätty tutkimusta varten.

Luettelo aineistojen lähteistä ja niiden määrästä, aineistossa, joka on kerätty tutkimusta varten.

Kaiken kaikkiaan koulutettiin 12 mallia testiä varten. Kolme perusmallia olivat LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; ja Gemma 7B-it), joista yhdeksän hienosääteltyä varianttia luotiin, kunkin mukautettu eri aihealueelle tai kirjoittajan tyyliin, käyttäen aihekohtaista dataa:

Arviointiaineiston tilastot, joissa 'FT Domain' viittaa hienosäätöprosessin aikana käytettyyn aihealueeseen ja 'perus' osoittaa, että ei ole tehty hienosäätöä.

Arviointiaineiston tilastot, joissa ‘FT Domain’ viittaa hienosäätöprosessin aikana käytettyyn aihealueeseen ja ‘perus’ osoittaa, että ei ole tehty hienosäätöä.

Yhteensä siis kolme perusmallia hienosääteltiin sekä täydellisellä että LoRA -tekniikoilla kolmessa eri aihealueessa kummassakin käyttötapauksessa: akateeminen abstraktin kirjoittaminen ja kysymyksiin ja vastauksiin. Toteutusmallit, jotka oli hienosäätelty tietokoneen tietojenkäsittelyaineistoon, pidettiin pois kirjoitustesteistä, kun taas mallit, jotka oli hienosäätelty rahoitusaineistoon, pidettiin pois kysymyksiin ja vastauksiin liittyvistä arvioista.

Vastakkaisia kehyksiä valittiin RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; ja DeTeCtive.

PhantomHunter koulutettiin käyttäen kahta tyypin neuroverkkokerroksia: kolmea konvoluutio-kerroksia max-poolingilla paikallisten tekstin kuvioiden havaitsemiseksi, ja kaksi transformer-kerrosta neljällä huomio-otsikolla kunkin, jotta voidaan mallintaa pidemmän aikavälin suhteita.

Kontrastiivinen oppiminen, joka rohkaisee järjestelmää erottamaan eri malliperheitä, lämpötila -parametri asetettiin 0,07: aan.

Koulutuskohteena yhdistettiin kolme menetelmää: L1 (perhemallin luokitteluun) ja L2 (binäärisen havaitsemisen), kumpikin painotettu 1,0: aan, ja L3 (kontrastiiviseen oppimiseen), painotettu 0,5: een.

Malli optimoitiin Adamilla oppien nopeudella 2e-5 ja erän koko 32. Koulutus kesti kymmenen täyttä jaksoa, ja parhaan suorituskyvyn tarkistuspiste valittiin validointijoukon avulla. Kaikki kokeet suoritettiin palvelimella, jossa oli neljä NVIDIA A100 -näytönohjainta.

Käytetyt mittarit olivat F1-pistemäärä kullekin testijoukolle, yhdessä todellisen positiivisen havaitsemisen kanssa kaupallisten havainnoitsijoiden vertailua varten.

F1-pistemäärät näkymättömien hienosääteltyjen kielen mallien havaitsemiseksi. Kaksi parasta tulosta kussakin luokassa on lihavoitu ja alleviivattu. 'BFE' viittaa perusmallin todennäköisyysominaisuuden poistamiseen, 'CL' kontrastiiviseen oppimiseen ja 'MoE' sekoitus-asiantuntija-moduuliin.

F1-pistemäärät näkymättömien hienosääteltyjen kielen mallien havaitsemiseksi. Kaksi parasta tulosta kussakin luokassa on lihavoitu ja alleviivattu. ‘BFE’ viittaa perusmallin todennäköisyysominaisuuden poistamiseen, ‘CL’ kontrastiiviseen oppimiseen ja ‘MoE’ sekoitus-asiantuntija-moduuliin.

Alkuvaiheen testitulokset, jotka on visualisoitu yllä olevassa taulukossa, osoittavat, että PhantomHunter ylittää kaikki vertailujärjestelmät, ylläpitäen F1-pistemäärää yli 90 prosenttia sekä ihmisten kirjoittamalle tekstille että koneella luodulle tekstille, jopa silloin, kun ne arvioidaan hienosääteltyjen mallien tulosteista, jotka on poistettu koulutuksesta.

Tutkijat kommentoivat:

‘Täydellisen hienosäätelyn kanssa PhantomHunter parantaa MacF1-pistemäärää parhaan vertailujärjestelmän yli 3,65 prosentilla ja 2,96 prosentilla molemmissa aineistoissa; ja LoRA-hienosäätelyn kanssa parannukset ovat 2,01 prosenttia ja 6,09 prosenttia vastaavasti.

‘Tulos osoittaa PhantomHunterin voimakkaan havaitsemiskyvyn tekstien havaitsemiseksi, jotka on luotu näkymättömille hienosääteltyille LLM: lle.’

Poistotutkimukset suoritettiin arvioidakseen kunkin ydinkomponentin roolia PhantomHunterissa. Kun yksittäisiä elementtejä poistettiin, kuten ominaisuusextractoria, kontrastiivista koodaria tai sekoitus-asiantuntija-luokittelijaa, havaittiin johdonmukainen pudotus tarkkuudessa, mikä osoittaa, että arkkitehtuuri riippuu kaikkien osien koordinoinnista.

Tutkijat tutkivat myös, voisi ko PhantomHunter yleistää koulutusjakautumansa ulkopuolelle, ja totesivat, että järjestelmä ylittää edelleen kilpailevat menetelmät, jopa silloin, kun sovelletaan perusmallien tulosteisiin, joita ei ollut käytetty koulutuksessa – mikä viittaa siihen, että perhekohtaiset signatuurit säilyvät havaittavina hienosääteltyjen varianttien yli.

Johtopäätös

Yksi väite käyttäjien kouluttamien generatiivisten kielen mallien puolesta on, että ne säilyttävät ainakin yksilöllisen kirjoittajan makun ja ominaispiirteet, ilmaston, jossa geneeriset, SEO: n inspiroimat sanontatavat AI-keskusteluroboteista uhkaa geneeristää minkä tahansa kielen, jossa AI: sta tulee merkittävä tai hallitseva osapuoli.

Yliopisto-esseiden arvon aleneminen ja opiskelijoiden näytön kuvaaminen massiivisista kirjoitussessioista osoittamaan, etteivät he käyttäneet AI: ta lähetyksissään, enemmän opettajia Euroopan ulkopuolella (jossa suulliset kokeet ovat normaaleja) harkitsevat kasvojen edessä olevia kokeita vaihtoehtona lähetyksiin. Viimeaikaisemmin on ehdotettu paluuta käsin kirjoitettuihin töihin.

Voidaan väittää, että molemmat ratkaisut ovat parempia kuin se, mikä uhkaa olla LLM: n perustuva uusintaversio syvän väärennöksen asekilpailua; vaikka ne tulevat ihmisen ponnistelun ja huomion kustannuksella, joita teknologiakulttuuri pyrkii tällä hetkellä automatisoimaan pois. †

 

Katso lopussa oleva kappale, pääasiallisten tuloksien jälkeen, alkuperäisessä tutkimuspaperissa, näistä yksityiskohdista.

* Minun muunnos kirjoittajien sisäisistä viittauksista hyperlinkkeihin. Kirjoittajien tekstin painotus/ei minun.

Julkaistu ensimmäisen kerran torstaina 19. kesäkuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai