Andersonin kulma
Teknologia tunnistaa tekoälymallin varastamisen salattujen seurantatietojen avulla

Uusi menetelmä voi salaa merkitä ChatGPT-tyyppiset mallit sekunneissa ilman uudelleen koulutusta, jättämättä jälkeä yleiseen tulokseen ja kestäen kaikki mahdolliset poistoyritykset.
Hieno ero vedenmerkinnän ja “tekijänoikeus-houkuttimen” välillä on, että vedenmerkit – olivatpa ne avoimia tai piilotettuja – on yleensä tarkoitettu ilmestyväksi kokoelmassa (kuten kuvadatassa) esteenä välinpitämättömälle kopioidulle.
Toisaalta, kehittynyt merkintä on pieni tekstinpätkä, yleensä sana tai määritelmä, joka on sisällytetty suureen ja suhteellisen geneeriseen kokoelmaan, tarkoituksena osoittaa varastaminen. Ideana on, että kun koko teos on laittomasti kopioidu, joko itsessään tai johdannaisena, yksilöivä ja väärä tosiasia, jota alkuperäinen omistaja on istuttanut, paljastaa helposti varastamisen.
Suurten kielen mallien (LLM) ja visuaalisen kielen mallien (VLM) vedenmerkintää koskien, vedenmerkintä on usein jaettu näiden kahden tavoitteen välillä: varmistaa, että kaikki tai suurin osa tuloksesta sisältää ilmeisen tai latentin vedenmerkin; tai varmistaa, että “salainen token” voidaan palauttaa, joka osoittaa varastamisen – mutta jota ei näytetä säännöllisessä mallin tuloksessa.
Todistusvoiman paino
Jälkimmäistä lähestymistapaa käsitellään kiinnostavassa uudessa yhteistyössä Kiinan, Italian ja Singaporen välillä; työ, jonka tavoitteena on tarjota tällainen paljastusmenetelmä avokoodi-malleille, jotta niitä ei voida helposti kaupallistaa tai käyttää muilla tavoin, jotka alkuperäinen lisenssi ei salli.
Esimerkiksi mallin alkuperäinen lisenssi voi vaatia, että kuka tahansa voi hyötyä työstä, kunhan he tekevät omat muutoksensa ja muutokset julkisesti saatavilla samojen generoivien lisenssiehtojen mukaisesti – mutta yhtiö voi haluta pitää “omien muutosten” (kuten hienosäätöisiä versioita) “porttiin” luodakseen “estevirran”, jota ei todella ole sallittu.
Suurin osa tutkimuksesta on kiinni suljettujen, API-vain mallien tai mallejen havaintorutiineista, joille vain optimoidut (kvantitoidut) painot ovat saatavilla; ja jotka ovat siksi vaikeampia muokata ja muuttaa tavalla, jonka uusi tutkimus ehdottaa (koska sinulla ei ole suoraa pääsyä itse mallin arkkitehtuuriin).
Tämä avoimen lähdekoodin julkaisujen huomioon ottaminen on ehkä odottavaa Kiinan tutkimussektorilta, koska Kiinan tekoälytuotanto on viime vuoden ajan ollut tunnustettu avoimien, täysipainoisten mallien julkaisuista, jotka kilpailevat vahvasti länsimaisilla vastineillaan.
Uusi lähestymistapa, joka on nimeltään EditMark, erottuu siitä, että se ei vaadi, että malli olisi hienosäädetty vedenmerkin lisäämiseksi, eikä se vaadi, että malli olisi koulutettu alusta alkaen sisältäen vedenmerkin.
Tästä on useita etuja: yksi on, että mikä tahansa “paljastava” tieto, joka on sisällytetty koulutusaineistoon, katoaa, kun se on havaittu ja paljastettu, koska se voidaan suoraan kohdistaa; mutta EditMarkiin hyökkääjän on tiedettävä, mihin kerrokseen malliin kohdistua, ja mikä lähestymistapa on otettu – mikä on epätodennäköinen skenaario.
Toiseksi, lähestymistapa on nopea ja halpa, vaatiessaan vain sekunteja (ei päiviä tai jopa viikkoja) soveltamiseen koulutettuun malliin, poistaen hienosäätöön liittyvän suuren kustannuksen (joka kasvaa suoraan mallin koosta ja sovellettavasta aineistosta).
Lopulta, lähestymistapa aiheuttaa selvästi vähemmän vahinkoa mallin normaaleille toiminnalle kuin hienosäätö tai aiemmat muokkausmenetelmät.
Kokeissa EditMark – joka upottaa matemaattisia kysymyksiä useilla mahdollisilla vastauksilla mallin painoihin – saavutti 100 prosentin poistumisnopeuden.
Tekijät toteavat:
‘Kattavat kokeet osoittavat EditMarkin poikkeuksellisen suorituskyvyn vedenmerkintämenetelmässä LLM-malleissa. EditMark saavuttaa merkittävän tehokkuuden upottamalla 32-bittisen vedenmerkin alle 20 sekunnissa 100 prosentin vedenmerkin poistumisnopeudella (ESR).
‘Huomionarvoista on, että vedenmerkin upotus kestää alle 1/300 hienosäätöajasta (keskimäärin 6 875 sekuntia), mikä korostaa EditMarkin tehokkuutta toteuttaa suurikapasiteettisia vedenmerkkejä ennennäkemättömällä nopeudella ja luotettavuudella.
‘Lisäksi laajat kokeet vahvistavat EditMarkin kestävyyden, salamaisuuden ja uskollisuuden.’
Uusi tutkimus on nimeltään EditMark: Vedenmerkintä suurille kielen malleille perustuen mallin muokkaukseen, ja se tulee kahdeksalta tekijältä Kiinan tiede- ja teknologiayliopistosta, Sienan yliopistosta ja CFAR/IHPC/A*STAR:ista Singaporesta.
Menetelmä
EditMark-lähestymistapa koostuu neljästä osasta: Generaattori, Koodaus, Muokkaaja ja Purku:

EditMark-pipeline upottaa vedenmerkin muokkaamalla mallia vastaamaan tiettyjä matemaattisia kysymyksiä, jotka koodaavat piilotetun tunnistetiedon. Lähde: https://arxiv.org/pdf/2510.16367
Generaattori käyttää satunnaista siementä monivastauksellisten matemaattisten kysymysten luomiseen; Koodaus valitsee vastaukset vedenmerkin perusteella, jotka sitten upotetaan malliin erityisellä muokkausprosessilla. Kun muokattu malli on julkaistu tai väärinkäytetty, vedenmerkki voidaan poistaa kysymällä samat kysymykset ja dekoodausvastauksien kuviota.
Sen jälkeen Muokkaaja muuttaa mallin painoja siten, että kun kysymykset esitetään, malli tuottaa luotettavasti kohdennetut vastaukset, upottaen vedenmerkin suoraan mallin käyttäytymiseen. Purku sitten palauttaa vedenmerkin syöttämällä samat kysymykset epäiltyyn malliin ja kääntämällä vastausten kuviota takaisin piilotettuun allekirjoitukseen.
Uhkatila
Tutkimuksen uhkatila olettaa, että vedenmerkintä tehdään valkoisessa laatikossa. Vaikka tämä ei yleensä ole hyvä merkki turvallisuuteen liittyvässä tutkimuksessa, tässä tapauksessa se on normaalia, koska menetelmä pyrkii suojelemaan omistajia, joilla on täysi pääsy omaan työhönsä.
Hyökkääjä oletetaan myös omistavan valkoisen laatikon pääsyn malliin sen hankkimisen jälkeen, mikä tarkoittaa, että he voivat muokata sitä (esim. rajaa tai hienosäätää). Tämä skenaario on normaali ja odotettavissa avoimen lähdekoodin julkaisussa. Hyökkääjä ei kuitenkaan tiedä vedenmerkin poistoprosessia tai käytettyä skeemaa, ja he voivat löytää tämän menetelmän vain johtamalla ja kokeilemalla (tai vuotojen kautta).
Generaattori rakentaa loogisesti ja tosiasiallisesti päteviä matemaattisia kysymyksiä useilla oikeilla vastauksilla, käyttäen GPT-4o:ta mallien monipuolistamiseen (kuten alla olevassa kuvassa), ja satunnaista siementä, jotta jokainen kysymys on yksilöllinen. Tämä mahdollistaa tunnetun vedenmerkin upottamisen määrätietoisesti vastauksien permutaatioita käyttäen, minimoiden yhteentörmäyksen kysymysten välillä, jotta muokkaus ei sekaannu:

GPT-4o:n avulla luodut vedenmerkintäkysymysten mallit, joissa on useita voimassa olevia kokonaislukuvastauksia yhdestä epäyhtälöisyydestä.
Koodaus muuttaa jokaisen binäärivedenmerkin osan yksilölliseksi permutaatioksi, joka on poimittu annetun matemaattisen kysymyksen ratkaisujoukosta. Käyttäen sanajärjestyspermutaatioteoriaa, Koodaus kääntää jokaisen vedenmerkin osan desimaalisen arvon tiettyyn järjestyneeseen valintaan vastauksista, varmistamalla, että vedenmerkki upotetaan määrätietoisesti mallin käyttäytymiseen.
Muokkaajasta voidaan sanoa, että alkuperäinen AlphaEdit -mallin muokkausmenetelmä, jota käytetään vedenmerkintään, puuttuu sekä tarkkuutta että kestävyyttä, ja muokattu malli usein epäonnistuu antamasta vaadittuja vastauksia. Mitä muutoksia se tekee, ne ovat helposti rikkoontuvia rajaamisen tai melun kautta.
Ylittääkseen tämän, tekijät ovat kehittäneet monivaiheisen muokkausstrategian, joka asteittain säätää mallin painoja yhdellä MLP-kerroksella kunnes sen vastaukset ovat riittävän lähellä haluttuja vastauksia. Vahvistaakseen muokkaukset hyökkäyksiä vastaan, he myös lisäävät gaussian melua koulutuksen aikana, jotta simuloivat hyökkäykset:

K1:n muutosten jakautuminen Baichuan-7B:lle, Qwen-7B:lle ja LLaMA3-8B:lle ennen ja jälkeen hyökkäykset. Yläriveissä on satunnaisen melun vaikutus; alariveissä on mallin rajauksen vaikutus. Kaikki muutokset pysyvät lähellä nollaa, osoittaen, että hyökkäykset eivät vaikuta merkittävävästi mallin sisäiseen käyttäytymiseen.
Pistemääräjärjestelmä pysäyttää prosessin, kun muokkaukset ovat tarpeeksi tarkkoja, kun taas sääntöistäminen varmistaa, että päivitykset pysyvät vakaana useiden kierrosten ajan.
Purku kysyy mallilta samat erityiset kysymykset, jotka käytettiin vedenmerkinnässä, ja lukee vastauksia, jotta piilotettu tunniste voidaan palauttaa. Koska vastausten kuviota seuraa salainen sääntö, tämä tunniste voidaan palauttaa ilman, että mallin sisäisiä tietoja on tutkittava.
Data ja testit
Testatakseen EditMarkia, viisi LLM-mallia arvioitiin: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; ja Qwen-7B. Mainittu AlphaEdit käytettiin vedenmerkintään, kun taas vedenmerkin poistumisnopeus (ESR) ja upotusajan (ET) mittarit otettiin käyttöön.
Vertailukohtina tekijät valitsivat Malli Vedenmerkintä (takaportti); KIMark; ja BadEdit, joka on alun perin suunniteltu takaportin injektointiin, mutta sovellettu tämän projektiin omiin tarkoituksiin.
Tekijät muokkasivat LLaMA-3-8:n 15. kerrosta; GPT2-XL:n ja GPT-J-6B:n 17. kerrosta; ja Qwen-7B:n ja Baichuan-7B:n 14. kerrosta.
Kokeet suoritettiin neljällä NVIDIA RTX 4090 -näytönohjaimella (24 GB VRAM kullakin), ja vedenmerkkejä upotettiin 32-bittisen, 64-bittisen ja 128-bittisen pituuksilla. Kysymysmallit, joita käytettiin, on yksityiskohtaisesti kuvattu alla olevassa kuvassa:
<img class=" wp-image-224910" src="https://www.unite.ai/wp-content/uploads/2025/10/table-2aaa.jpg" alt="Mallit, joita käytettiin monivastauksellisten kysymysten luomiseen vedenmerkintään. Jokainen kysymys perustuu erilaisiin matemaattisiin epäyhtälöisyyksiin, joissa on satunnaiset arvot muuttujille. Malli pyydetään palauttamaan luettelo kokonaislukuratkaisuista, ja vastausten järjestys käytetään vedenmerkin bittien koodaamiseen tai dekoodaamiseen. Neljä mallia kattaa kvadratiset, logaritmiset, rationaaliset ja väliaikaiset muodot, ja kaikki ne luotiin GPT-4o:n avulla.
Aluksi tutkijat testasivat sekä ESR:ää että upotusaikaa eri LLM-malleissa:

EditMarkin vertailu kolmeen aiempaan vedenmerkintämenetelmään viidellä suurella kielen mallilla. Ilmoitetaan vedenmerkin poistumisnopeus (ESR) ja upotusaika sekunteina. EditMark saavuttaa jatkuvasti 100 prosentin onnistumisnopeuden ja vähentää upotusaikaa useilla kertaluokilla, ylittäen kaikki vertailukohteet sekä tarkkuudessa että tehokkuudessa eri kokoisilla ja arkkitehtuureilla varustetuilla malleilla.
Näistä tuloksista tekijät toteavat:
‘[EditMark] saavuttaa 100 prosentin ESR:n ja vaatii alle 20 sekuntia 32-bittisen vedenmerkin upottamiseen kaikille arvioituille LLM-malleille. Erityisesti Baichuan-7B:n ja Qwen-7B:n keskimääräinen upotusaika on alle 10 sekuntia, mikä osoittaa EditMarkin korkean tehokkuuden.’
128-bittisen vedenmerkin arvioinnissa, joka on korkein mahdollinen arvo tällaisessa järjestelmässä, EditMark pystyi säilyttämään “tuhoamattomuuden” tilan:

Vedenmerkin poistumisnopeudet ja upotusajat EditMarkille eri vedenmerkin pituuksilla (32, 64 ja 128 bittiä) viidellä kielen mallilla. Täydelliset onnistumisnopeudet säilytetään kaikissa tapauksissa, kun taas upotusaika kasvaa vedenmerkin koosta riippuen, mutta pysyy alle minuutin, jopa 128 bittin kohdalla.
Seuraavaksi järjestelmän vedenmerkin uskollisuuden säilyminen testattiin useilla mittareilla:

Vedenmerkin uskollisuuden arviointi neljällä mittarilla viidellä mallilla, vertaamalla muokkaamattomia malleja malleja, joissa on 32-bittinen ja 128-bittinen vedenmerkintä. Suorituskyky säilyy vakaana kaikissa konfiguraatioissa, ja keskimääräiset pisteet vaihtelevat vain vähän, osoittaen, että vedenmerkin lisääminen vaikuttaa vain vähän mittarin tarkkuuteen.
EditMarkin kestävyyttä testattiin kuutta yleistä hyökkäysstrategiaa vastaan. Malleja upotettiin 128-bittisillä vedenmerkeillä viidellä eri siemenellä. Hienosäätö aiheutti vain vähäistä heikentymistä vedenmerkin poistumisnopeuksissa (ESR) useimmille malleille:

Vedenmerkin poistumisnopeus ennen ja jälkeen hienosäätöä yhdestä kolmeen epochiin. Vaikka useimmat mallit säilyttävät korkean ESR:n koko ajan, Qwen-7B näyttää merkittävää laskua, osoittaen suuremman haavoittuvuuden parametrin päivityille.
Jopa useiden epochien jälkeen useimmat mallit säilyttivät ESR:t yli 90 prosentissa, osoittaen, että EditMark kestää LoRA-pohjaisen koulutuksen aiheuttamaa parametrin siirtymää.
Quantization-hyökkäykset vähensivät mallin tarkkuutta, mutta jättivät useimmat vedenmerkit koskemattomiksi:

Vedenmerkin poistumisnopeus muokattujen mallien ennen ja jälkeen kvantisaatiota käyttäen Int-8 ja Int-4 -tarkkuutta. ESR säilyy muuttumattomana Int-8-kvantisaatiolla kaikilla malleilla, kun taas Int-4-kvantisaatio aiheuttaa osittaisen heikentymisen, osoittaen, että alempi tarkkuus voi heikentää, mutta ei täysin poistaa vedenmerkintää.
Kuten yllä olevasta kuvasta voidaan nähdä, Int-8-kvantisaatio säilytti 100 prosentin ESR:n kaikilla malleilla, kun taas Int-4-kvantisaatio aiheutti kohtuullisen vaikutuksen ESR:ään, mutta toi hyväksymättömiä suorituskyvyn menetyksiä.
Kuten tutkimus toteaa, tämä skenaario osoittaa hyökkääjälle rajoitetun potentiaalin, koska se johtaa hakkeroituun, mutta suorituskyvyltään heikentyneeseen malliin.
Melun ja rajauksen testit arvioivat neljää benchmark-kehystä: MMLU; BLIMP; TruthfulQA; ja GLUE. Nämä hyökkäykset aiheuttivat vähenevää ESR:ää, kun häiriöt voimistuivat:

Melun (ylärivi) ja rajauksen (alarivi) vaikutus ESR:ään ja vedenmerkitettyjen mallien benchmark-suorituskykyyn. Kun ESR laskee kasvavan häiriön määrän mukaan, benchmark-suorituskyky heikkenee, erityisesti suuremmilla meluilla ja rajauksilla, korostaen (tavallisen) jännitteen vedenmerkin poiston ja mallin hyödyllisyyden välillä.
Kuitenkin nämä aiheuttivat myös teräviä laskuja tehtävän suorituskyvyssä, ja Baichuan-7B sai 27-31 prosentin laskun BLIMP:issä, kun melua tai rajaussovellettiin.
Mallin muokkaus ja sopeutuvat hyökkäykset arvioitiin myös:

Vedenmerkitettyjen mallien ESR, joihin on sovellettu eri määriä mallin muokkauksia. Vaikka jopa 50 muokkausta sovellettiin tunnettuihin vedenmerkintäkerroksiin, ESR säilyi yli 95 prosentissa kaikilla malleilla, osoittaen, että suorat parametrin muutokset vaikuttavat vain vähän vedenmerkin poistamiseen.
Tässä EditMark säilytti yli 95 prosentin ESR:n, jopa kun tarkka upotuskerros kohdistettiin.
Johtopäätös
DRM, salaiset vedenmerkit ja muut turvallisuuslähestymistavat, jotka ovat nauttineet (rajoitetusta tai osittaisesta) menestyksestä ennen tekoälyä, ovat vaikeasti sovellettavissa koneoppimisjärjestelmiin; tarkoituksella vähennetty arkkitehtuuri yhdistyy puutteellisen työkalun kanssa, mikä tekee kaikki injektoidut vedenmerkit melko hauraita.
On vaikuttavaa nähdä järjestelmä, joka on suunniteltu avoimen lähdekoodin jakamiseen, ja nähdä se kestävän kaikki skenaariot paitsi epätodennäköisimmät hyökkääjän aiemman tiedon suhteen. Kuitenkin vedenmerkin jälkeen tapahtuva pieni suorituskyvyn lasku, vaikka se on pieni näissä kokeissa, voi antaa potentiaalisille käyttäjille syyn epäröidä; etenkin koska perääntyminen API-keskeiseen mallin hallintaan poistaa tämänkaltaiset hyökkäykset lähes kokonaan.
* Tämä sivu on väittänyt, että Kiinan “avoin paino” -julkaisut eivät välttämättä laatuudu täysin vapaaksi ja avoimeksi lähdekoodiksi, koska dataa usein pidätetään, mikä estää täsmällisen koulutusputken uudelleenluomisen. Väittäen, että tämä aihe kutsuu syvemmän tarkastelun tekoälymallien julkaisujen politiikkaan, verrattuna länteen ja itään, mikä on tämän artikkelin ulottumattomissa.
Julkaistu ensimmäisen kerran maanantaina, 27. lokakuuta 2025












