Andersons vinkel

Identifikation af AI-modeltyveri gennem hemmelig sporing af data

mm
Føj Unite.AI til dine foretrukne kilder på Google
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

En ny metode kan hemmeligt vandmærke ChatGPT-lignende modeller på få sekunder uden omtræning, uden at efterlade nogen spor i almindelig output og overleve alle mulige fjernelsesforsøg.

 

Den subtile forskel mellem vandmærkning og ‘copyright-baiting’ er, at vandmærker – både åbne og skjulte – normalt er beregnet til at optræde igennem en samling (såsom et billedataset) som en almindelig hindring for uhæmmet kopiering.

Til gengæld er en fiktiv indførsel en lille tekstsekvens, normalt et ord eller en definition, der er en del af en stor og relativt generisk samling, designet til at bevise tyveri. Ideen er, at når hele værket ulovligt kopieres, enten i sig selv eller som grundlag for et afledt værk, vil tilstedeværelsen af en ‘unik’ og falsk faktum, der er plantet af den oprindelige ejer/e, let afsløre handlingen.

I forhold til tilføjelse af vandmærker til store sprogmodeller (LLM’er) og visionssprogmodeller (VLM’er), er omfanget af, hvortil outputtet skal indeholde disse afslørende tegn, ofte delt mellem disse to mål: at sikre, at alle eller de fleste output indeholder et åbenlyst eller latent vandmærke; eller at sikre, at en ‘hemmelig token’ kan genfindes, som beviser tyveri – men som ikke viser sig i normal output fra modellen.

Bevisvægt

Den sidste tilgang behandles i en interessant ny samarbejdsprojekt mellem Kina, Italien og Singapore; et arbejde, der sigter mod at give sådanne en afsløringmetode til open source-modeller, så de ikke let kan commercialiseres eller på anden måde bruges på måder, som den oprindelige licens ikke tillader.

For eksempel kan en models oprindelige licens kræve, at enhver kan profitere af arbejdet, så længe de gør deres egne ændringer eller ændringer offentligt tilgængelige under de samme generøse licensbetingelser – men et selskab kan ønske at beskytte deres ‘justeringer’ (såsom fine-tuned versioner), for at generere en voldgrav, hvor ingen virkelig er tilladt.

Det meste af forskningen på dette område beskæftiger sig med detektionsrutiner relateret til lukkede, API-kun modeller eller modeller, hvor kun optimerede (kvantificerede) vægte er tilgængelige; og som derfor er sværere at redigere og ændre på den måde, det nye papir foreslår (fordi der ikke er direkte adgang til modelarkitekturen selv).

Dette fokus på FOSS-udgivelser er måske ikke overraskende fra det kinesiske forskningssektor, da Kinas AI-udbytte det sidste år har været kendetegnet ved generøse fuldvægt-udgivelser af modeller, der mindst kan matche de mere ‘låste’ vestlige modeller.

Den nye metode, kaldet EditMark, adskiller sig ved ikke at kræve, at modellen skal finjusteres for at tilføje de ‘forgiftede’ data, eller trænes fra starten med dataene inkluderet.

Dette har flere fordele: en af dem er, at enhver ‘afslørende’ data, der er inkluderet i træningsdatasettet, når det først er opdaget og afsløret, vil være ineffektivt, da det kan målrettes direkte af angribere; men for at angribe EditMark ville en malafaktor skulle vide, hvilket lag af modellen at målrette, og hvilken tilgang der er valgt. Dette er en usandsynlig situation.

For det andet er metoden hurtig og billig, og tager kun få sekunder (i stedet for dage eller endda uger) at anvende på en trænet model, og eliminerer den store omkostning ved finjustering (som stiger lineært med modelstørrelsen og data, der skal anvendes).

Endelig gør metoden betydeligt mindre skade på den normale drift af den påvirkede model end enten finjustering eller tidligere redigeringsmetoder.

I tests opnåede EditMark – som indsætter matematiske spørgsmål med multiple mulige svar i modelvægtene – en udvindingsrate på 100%.

Forfatterne skriver:

‘Omfattende eksperimenter demonstrerer den exceptionelle præstation af EditMark i vandmærkning af LLM’er. EditMark opnår en bemærkelsesværdig effektivitet ved at indsætte et 32-bit vandmærke på under 20 sekunder med en 100% vandmærke-udvindings succesrate (ESR).

‘Bemærkelsesværdigt er vandmærke-indlejringstiden under 1/300 af finjustering (gennemsnit 6.875 sekunder), hvilket fremhæver EditMarks effektivitet i implementering af højkapacitetsvandmærker med usædvanlig hastighed og pålidelighed.

‘Desuden validerer omfattende eksperimenter robustheden, skjultheten og troværdigheden af EditMark.’

Den nye artikel har titlen EditMark: Vandmærkning af store sprogmodeller baseret på modelredigering, og kommer fra otte forfattere på University of Science and Technology of China, University of Siena og CFAR/IHPC/A*STAR i Singapore.

Metode

EditMark-metoden består af fire komponenter: en Generator, en Kodér, en Rediger og en Decodér:

The EditMark pipeline embeds a watermark by editing a model to answer specific mathematical questions in a way that encodes hidden identifying information. Source: https://arxiv.org/pdf/2510.16367

EditMark-pipeline indsætter et vandmærke ved at redigere en model til at besvare bestemte matematiske spørgsmål på en måde, der koder skjult identificerende information. Kilde: https://arxiv.org/pdf/2510.16367

Generatoren bruger en pseudo-tilfældig frø til at konstruere multiple-svar matematiske spørgsmål; Kodéren vælger svar baseret på vandmærket, som derefter indsættes i modellen via en specialiseret redigeringsproces. Når den redigerede model er udgivet eller misbrugt, kan vandmærket udvindes ved at stille de samme spørgsmål og afkode svarenes mønster.

Herefter ændrer Redigeren modelvægtene, således at modellen pålideligt producerer målsvarene, når den stilles for disse frøede spørgsmål, og indsætter vandmærket direkte i dens adfærd. Decodéren genfinder derefter vandmærket ved at stille de samme spørgsmål til den mistænkte model og oversætte dens svar tilbage til det skjulte signatur.

Trusselsmodel

Papirets trusselsmodel antager, at vandmærkning udføres i en white-box-sammenhæng. Selvom dette normalt ikke er et godt tegn i sikkerhedsrelateret forskning, er det her normalt, da metoden sigter mod at beskytte ejere, der har fuld adgang til deres eget arbejde.

Angriberen antages også at have white-box-adgang efter at have erhvervet modellen, hvilket betyder, at de kan ændre den (f.eks. ved at beskære eller finjustere). Igen er dette scenario normalt og forventet i tilfælde af en FOSS-udgivelse. Angriberen er dog ikke bekendt med vandmærke-udvindingsprocessen eller skemaet, der bruges, og kan kun finde denne metode ved slutning og eksperimenter (eller lækager).

Generatoren konstruerer logisk og faktisk gyldige matematiske spørgsmål med multiple korrekte svar, ved hjælp af GPT-4o til at diversificere skabeloner (som vist nedenfor), og en pseudo-tilfældig frø til at sikre, at hvert spørgsmål er unikt. Dette muliggør, at et kendt vandmærke kan indsættes deterministisk via svarkombinationer, samtidig med at overlap mellem spørgsmål minimiseres, for at undgå redigering sammenfletning:

Skabeloner af MA-spørgsmål genereret af GPT-4o til vandmærkning, hver struktureret til at give multiple gyldige heltals-svar fra en frøet ulighed.

Skabeloner af spørgsmål genereret af GPT-4o til vandmærkning, hver struktureret til at give multiple gyldige heltals-svar fra en frøet ulighed.

Kodéren transformerer hver binær vandmærke-segment til en unik permutation af heltal, der er hentet fra løsningsmængden af et givent matematisk spørgsmål. Ved hjælp af lexikografisk permutationsteori mapper Kodéren den decimalværdi af hver vandmærke-segment til en bestemt ordnet udvalg af svar, hvilket sikrer, at vandmærket deterministisk indsættes i modellens adfærd.

Med hensyn til Redigeren manglede den oprindelige AlphaEdit-modelredigeringsmetode til vandmærkning både præcision og robusthed, med den tilpassede model ofte fejlende i at returnere de krævede svar. Enhver ændring, den gør, er let brudt af beskæring eller støj.

For at overvinde dette har forfatterne udviklet en multi-rundes redigeringsstrategi, der gradvist justerer modelvægtene på ét enkelt MLP-lag, indtil dens svar er tilstrækkeligt aligneret med de ønskede svar. For at hårdne redigeringerne mod manipulation indsættes også Gaussisk støj under træning for at simulere angreb:

Distribution of changes in K1 for Baichuan-7B, Qwen-7B, and LLaMA3-8B before and after attacks. The top row shows the effect of random noise injection; the bottom row shows the effect of model pruning. All changes stay close to zero, suggesting that the attacks do not significantly disrupt the model’s internal behavior.

Forandringer i K1 for Baichuan-7B, Qwen-7B og LLaMA3-8B før og efter angreb. Øverste række viser effekten af tilfældig støjinjektion; nederste række viser effekten af modelbeskæring. Alle ændringer forbliver tæt på nul, hvilket antyder, at angrebene ikke væsentligt forstyrrer modellens interne adfærd.

Et pointsystem standser processen, når redigeringerne er præcise nok, mens regularisering sikrer, at opdateringer forbliver stabile over multiple runder.

Decodéren stiller modellen de samme specialspørgsmål, der blev brugt under vandmærkning, og læser dens svar for at slutte sig til det skjulte ID. Da svarenes mønster følger en hemmelig regel, kan dette ID genfindes uden at skulle undersøge modellens interne dele.

Data og tests

For at teste EditMark blev fem LLM’er evalueret: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; og Qwen-7B. Den ovennævnte AlphaEdit blev brugt til at indsætte vandmærker, mens udvindings succesrate (ESR) og indsættelsestid (ET) var de mål, der blev brugt.

For reference valgte forfatterne Model Watermark (backdoor); KIMark; og BadEdit, et framework oprindeligt designet til backdoor-injektion, her tilpasset til projektets egne formål.

Forfatterne redigerede 15. lag i LLaMA-3-8; 17. lag i GPT2-XL og GPT-J-6B; og 14. lag i Qwen-7B og Baichuan-7B.

Eksperimenterne blev udført på fire NVIDIA RTX 4090 GPU’er (24 GB VRAM hver), med vandmærker på 32-bit, 64-bit og 128-bit længde indsat. Spørgsmålskabelonerne, der blev brugt, er detaljeret i billedet nedenfor:

Skabeloner brugt til at generere multiple-svar-spørgsmål til vandmærkning. Hver spørgsmål er baseret på en anden type matematisk ulighed, med tilfældige værdier indssat for variablerne. Modellen bedes om at returnere en liste af heltalsløsninger, hvor rækkefølgen af svarene bruges til at kodificere eller dekodificere vandmærke-bits. De fire skabeloner dækker kvadratisk, logaritmisk, rational og intervalbaseret form. Alle blev genereret via GPT-4o.

Skabeloner brugt til at generere multiple-svar (MA)-spørgsmål til vandmærkning. Hver spørgsmål er baseret på en anden type matematisk ulighed, med tilfældige værdier indssat for variablerne. Modellen bedes om at returnere en liste af heltalsløsninger, hvor rækkefølgen af svarene bruges til at kodificere eller dekodificere vandmærke-bits. De fire skabeloner dækker kvadratisk, logaritmisk, rational og intervalbaseret form, og alle blev genereret ved hjælp af GPT-4o.

For at reducere effekten af tilfældighed blev frø fra 1 til 20 anvendt under test, på tværs af forskellige vandmærke-kapaciteter.

Initialt testede forskerne både ESR og tidskost ved at indsætte et vandmærke på tværs af rækken af LLM’er:

Sammenligning af EditMark med tre tidligere vandmærkningsmetoder på fem store sprogmodeller. Angivet er udvindings succesrate (ESR) og indsættelsestid (ET) i sekunder. EditMark opnår konsekvent en 100% succesrate og reducerer indsættelsestiden med flere størrelsesordener, og overgår alle referencepunkter i både nøjagtighed og effektivitet på tværs af modeller af varierende størrelse og arkitektur.

Sammenligning af EditMark med tre tidligere vandmærkningsmetoder på fem store sprogmodeller. Angivet er udvindings succesrate (ESR) og indsættelsestid (ET) i sekunder. EditMark opnår konsekvent en 100% succesrate og reducerer indsættelsestiden med flere størrelsesordener, og overgår alle referencepunkter i både nøjagtighed og effektivitet på tværs af modeller af varierende størrelse og arkitektur.

Af disse resultater skriver forfatterne:

‘[EditMark] opnår en 100% ESR og kræver under 20 sekunder til at indsætte et 32-bit vandmærke for alle LLM’er, der blev evalueret. Specifikt er den gennemsnitlige indsættelsestid for Baichuan-7B og Qwen-7B under 10 sekunder, hvilket demonstrerer den høje effektivitet af EditMark.’

For evaluering af et 128-bit vandmærke, den højeste værdi, der er mulig under en sådan skema, kunne EditMark fastholde en status af ‘uudslettelighed’:

Udvindings succesrater og indsættelsestider for EditMark på tværs af vandmærkelængder på 32, 64 og 128 bit på fem sprogmodeller. Perfekte succesrater opretholdes i alle tilfælde, mens indsættelsestiden stiger med vandmærkestørrelse, men forbliver under ét minut, selv ved 128 bit.

Udvindings succesrater og indsættelsestider for EditMark på tværs af vandmærkelængder på 32, 64 og 128 bit på fem sprogmodeller. Perfekte succesrater opretholdes i alle tilfælde, mens indsættelsestiden stiger med vandmærkestørrelse, men forbliver under ét minut, selv ved 128 bit.

Herefter testede systemets evne til at fastholde vandmærke-trofasthed på tværs af multiple benchmarks:

Evaluering af vandmærke-trofasthed på fire benchmarks på tværs af fem modeller, sammenligning af umodificerede modeller med modeller, der er vandmærket med 32-bit og 128-bit kapaciteter. Præstationen forbliver stabil på tværs af konfigurationer, med kun mindre fluktuationer i gennemsnitskarakterer, hvilket indikerer en begrænset indvirkning på benchmark-nøjagtighed fra vandmærke-indlejring.

Evaluering af vandmærke-trofasthed på fire benchmarks på tværs af fem modeller, sammenligning af umodificerede modeller med modeller, der er vandmærket med 32-bit og 128-bit kapaciteter. Præstationen forbliver stabil på tværs af konfigurationer, med kun mindre fluktuationer i gennemsnitskarakterer, hvilket indikerer en begrænset indvirkning på benchmark-nøjagtighed fra vandmærke-indlejring.

EditMarks robusthed blev testet mod seks almindelige angrebsstrategier. Modellerne blev først indsat med 128-bit vandmærker ved hjælp af fem forskellige frø. Finjustering, som vist i billedet nedenfor, medførte kun en mindre nedgang i udvindings succesrater (ESR) for de fleste modeller:

Udvindings succesrate (ESR) af vandmærkede LLM'er før og efter finjustering i én til tre epocher. Mens de fleste modeller fastholder en høj ESR på tværs af, viser Qwen-7B en markant nedgang, hvilket antyder en større sårbarhed over for parameteropdateringer.

Udvindings succesrate (ESR) af vandmærkede LLM’er før og efter finjustering i én til tre epocher. Mens de fleste modeller fastholder en høj ESR på tværs af, viser Qwen-7B en markant nedgang, hvilket antyder en større sårbarhed over for parameteropdateringer.

Even efter multiple epocher fastholdt de fleste modeller ESR’er over 90%, hvilket indikerer, at EditMark modstår den parameterdrift, der introduceres af LoRA-baseret træning.

Kvantiseringsangreb reducerede modelpræcision, men efterlod de fleste vandmærker intakte:

Udvindings succesrate (ESR) af vandmærkede modeller før og efter kvantiseringsangreb ved hjælp af Int-8 og Int-4 præcision. ESR forbliver uændret under Int-8 kvantiseringsangreb på tværs af alle modeller, mens Int-4 kvantiseringsangreb medfører en delvis nedgang, hvilket indikerer, at lavere præcision kan svække, men ikke fuldstændigt fjerne vandmærket.

Udvindings succesrate (ESR) af vandmærkede modeller før og efter kvantiseringsangreb ved hjælp af Int-8 og Int-4 præcision. ESR forbliver uændret under Int-8 kvantiseringsangreb på tværs af alle modeller, mens Int-4 kvantiseringsangreb medfører en delvis nedgang, hvilket indikerer, at lavere præcision kan svække, men ikke fuldstændigt fjerne vandmærket.

Test af støj og beskæring evaluerede fire benchmark-rammer: MMLU; BLIMP; TruthfulQA; og GLUE. Disse angreb medførte en nedgang i ESR, når perturbationer intensiveredes:

Effekten af støj (øverste række) og beskæring (nederste række) angreb på ESR og benchmark-præstation af vandmærkede modeller. Da ESR falder med øgende perturbation, falder også benchmark-nøjagtighed, især ved højere støjintensiteter og beskæringsforhold, hvilket fremhæver den (almindelige) spænding mellem vandmærke-fjernelse og modelnyttighed.

Effekten af støj (øverste række) og beskæring (nederste række) angreb på ESR og benchmark-præstation af vandmærkede modeller. Da ESR falder med øgende perturbation, falder også benchmark-nøjagtighed, især ved højere støjintensiteter og beskæringsforhold, hvilket fremhæver den (almindelige) spænding mellem vandmærke-fjernelse og modelnyttighed.

Modelredigering og adaptive angreb blev også evalueret:

Udvindings succesrate af vandmærkede modeller, der er udsat for varierende grader af modelredigering. Selv med op til 50 redigeringer anvendt på kendte vandmærkelag, forbliver ESR over 95% for alle modeller, hvilket indikerer, at direkte parametermodifikationer har en begrænset effekt på vandmærke-fjernelse.

Udvindings succesrate af vandmærkede modeller, der er udsat for varierende grader af modelredigering. Selv med op til 50 redigeringer anvendt på kendte vandmærkelag, forbliver ESR over 95% for alle modeller, hvilket indikerer, at direkte parametermodifikationer har en begrænset effekt på vandmærke-fjernelse.

Her fastholdt EditMark over 95% ESR, selv når de præcise indsættelseslag var målrettede.

Konklusion

DRM, hemmelige vandmærker og andre sikkerhedsapproacher, der har haft (begrænset eller delvis) succes i den før-AI-æra, er svære at anvende på maskinelærings-systemer; den bevidst reducerende natur af den nuværende række af værtsarkitekturer kombinerer med en mangel på passende værktøj til at gøre enhver indsat vandmærke ret ødelagt.

Det er imponerende at se et system rettet mod FOSS-modeldistribution og at se det overleve mod alle scenarier undtagen de mest usandsynlige, i forhold til en angribers forudgående viden. Alligevel kan den meget små nedgang i præstation, der følger med efter-træningsredigeringer, give potentielle adoptører grund til at pause; ikke mindst, da tilbagetrækning til en API-centreret kontrolmodel eliminerer sådanne angreb næsten fuldstændigt.

 

* Dette websted har hævdet, at ‘åben-vægt’-udgivelser fra Kina ikke nødvendigvis kvalificerer som fuldt FOSS, da data ofte ikke offentliggøres, hvilket forhindrer en præcis genskabelse af træningspipeline. Det kan siges, at dette emne inviterer til en dybere undersøgelse af politikken bag AI-modeludgivelser sammenlignet mellem vesten og østen, hvilket er uden for denne artikels rammer.

Først udgivet mandag, 27. oktober 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai