Andersons vinkel
Identifiering av AI-modellstöld genom hemliga spårningsdata

En ny metod kan hemligt vattenmärka ChatGPT-liknande modeller på några sekunder utan omträning, utan att lämna några spår i den allmänna utmatningen och överleva alla möjliga borttagningsförsök.
Den subtila skillnaden mellan vattenmärkning och “upphovsrättsfälla” är att vattenmärken – antingen öppna eller dolda – vanligtvis är avsedda att visas genom hela en samling (såsom en bildsamling) som en allmän hinder för kopiering.
I kontrast är en fiktiv post ett litet segment av text, vanligtvis ett ord eller en definition som visas i en stor och relativt generisk samling, utformad för att bevisa stöld. Idén är att när hela arbetet kopieras olagligt, antingen i sig självt eller som grund för ett derivat arbete, kommer närvaron av en “unik” och falsk faktum, planterad av den ursprungliga ägaren, att lätt avslöja stölden.
Vad gäller att lägga till vattenmärken i stora språkmodeller (LLM) och visionsspråkmodeller (VLM) är omfattningen av vilken utmatning som är avsedd att innehålla dessa avslöjande tecken ofta uppdelad mellan dessa två mål: att säkerställa att all eller mest utmatning innehåller ett uppenbart eller latents vattenmärke; eller att säkerställa att en “hemlig token” kan återvinnas som bevisar stöld – men som inte visas i vanlig utmatning från modellen.
Bevisens tyngd
Den senare metoden behandlas i ett intressant nytt samarbete mellan Kina, Italien och Singapore; ett arbete som syftar till att tillhandahålla en sådan avslöjandemetod till öppen källkodsmodeller, så att de inte kan kommersialiseras eller användas på sätt som den ursprungliga licensen inte tillåter.
Till exempel kan en modells ursprungliga licens kräva att alla som använder arbetet för vinst också gör sina egna ändringar eller tillägg tillgängliga under samma generösa licensvillkor – men ett företag kan vilja skydda sina “finjusteringar” (såsom finjusterade versioner), för att skapa en vallgrav där ingen egentligen är tillåten.
Merparten av forskningen inom detta område är upptagen med upptäcktsrutiner relaterade till slutna modeller, eller modeller för vilka endast optimerade (kvantiserade) vikter är tillgängliga; och som därför är svårare att effektivt redigera och ändra på det sätt som den nya artikeln föreslår (eftersom det inte finns någon direkt åtkomst till modellens arkitektur).
Den här uppmärksamheten på FOSS-utgåvor är kanske inte förvånande från den kinesiska forskningssektorn, eftersom Kinas AI-utgåvor under det senaste året har kännetecknats av generösa fullviktiga* utgåvor av modeller som åtminstone motsvarar de mer “låsta” västerländska motsvarigheterna.
Den nya metoden, kallad EditMark, skiljer sig från att den inte kräver att modellen finjusteras för att lägga till de “förgiftade” data, eller att den tränas från början med data inkluderad.
Detta har flera fördelar: en är att alla “avslöjande” data som ingår i träningsdata, när de väl upptäckts och avslöjats, kommer inte längre att vara effektiva, eftersom de kan direkt riktas mot av angripare; men för att attackera EditMark skulle en angripare behöva veta vilken lager av modellen som ska riktas, och vilken metod som har använts. Detta är ett osannolikt scenario.
Andra, metoden är snabb och billig, och tar bara några sekunder (i stället för dagar eller till och med veckor) att tillämpa på en tränad modell, och undviker den allvarliga kostnaden för finjustering (som ökar linjärt med modellens storlek och datamängden som ska tillämpas).
Slutligen, metoden skadar normal drift av den målmodellen betydligt mindre än antingen finjustering eller tidigare redigeringsmetoder.
I tester nådde EditMark – som inbäddar matematiska frågor med flera möjliga svar i modellvikterna – en extraheringsfrekvens på 100%.
Författarna hävdar:
‘Omfattande experiment visar EditMarks exceptionella prestanda vid vattenmärkning av LLM. EditMark uppnår enastående effektivitet genom att inbädda ett 32-bitars vattenmärke på mindre än 20 sekunder med en 100% vattenmärkesextraheringsframgång (ESR).
‘Notabelt är att vattenmärkesinbäddningstiden är mindre än 1/300 av finjustering (i genomsnitt 6 875 sekunder), vilket framhäver EditMarks effektivitet i att implementera högkapacitetsvattenmärken med utan motstycke hastighet och tillförlitlighet.
‘Dessutom validerar omfattande experiment robustheten, hemligheten och troheten hos EditMark.’
Den nya artikeln heter EditMark: Vattenmärkning av stora språkmodeller baserat på modellredigering, och kommer från åtta författare vid University of Science and Technology of China, University of Siena och CFAR/IHPC/A*STAR i Singapore.
Metod
EditMark-metoden består av fyra komponenter: en Generator, en Kodare, en Redigerare och en Avkodare:

EditMark-pipelinen inbäddar ett vattenmärke genom att redigera en modell för att svara på specifika matematiska frågor på ett sätt som kodar dold identifieringsinformation. Källa: https://arxiv.org/pdf/2510.16367
Generatoren använder en pseudo-slumpmässig seed för att konstruera matematiska frågor med flera svar; Kodaren väljer svar baserat på vattenmärket, som sedan inbäddas i modellen via en specialiserad redigeringsprocess. När den redigerade modellen släpps eller missbrukas kan vattenmärket extraheras genom att ställa samma frågor och avkoda svaren.
Därefter modifierar Redigeraren modellvikterna så att, när de tillfrågas om dessa seedade frågor, modellen tillförlitligt producerar målsvar, och inbäddar vattenmärket direkt i dess beteende. Avkodaren återvinner sedan vattenmärket genom att mata samma frågor till den misstänkta modellen och översätta dess svar tillbaka till den dolda signatur.
Hotmodell
Artikelns hotmodell antar att vattenmärkning görs i en vitlåda-miljö. Även om detta vanligtvis inte är ett bra tecken i säkerhetsrelaterad forskning, är det här normalt, eftersom metoden syftar till att skydda ägare som har full åtkomst till sitt eget arbete.
Angriparen antas också ha vitlåda-åtkomst efter att ha erhållit modellen, vilket innebär att de kan modifiera den (t.ex. genom beskärning eller finjustering). Återigen är detta scenario normalt och förväntat i fallet med en FOSS-utgåva. Men angriparen har inte tillgång till vattenmärkesextraheringsprocessen eller schemat som används, och kan endast hitta denna metod genom inferens och experiment (eller läckor).
Generatoren konstruerar logiskt och faktiskt giltiga matematiska frågor med flera korrekta svar, med hjälp av GPT-4o för att diversifiera mallar (som visas nedan), och en pseudo-slumpmässig seed för att säkerställa att varje fråga är unik. Detta möjliggör att ett känt vattenmärke kan inbäddas deterministiskt via svarspermutationer, samtidigt som överlappningen mellan frågorna minimeras för att undvika redigerings sammanflätning:

Mallar för frågor genererade av GPT-4o för vattenmärkning, var och en strukturerad för att ge flera giltiga heltalsvar från en seedad olikhet.
Kodaren omvandlar varje binärt vattenmärkesegment till en unik permutation av heltal som dras från lösningssamlingen för en given matematisk fråga. Med hjälp av lexikografisk permutations-teori omvandlar Kodaren den decimala värdet av varje vattenmärkessegment till en specifik ordnad urval av svar, vilket säkerställer att vattenmärket deterministiskt inbäddas i modellens beteende.
Vad gäller Redigeraren, så saknar den ursprungliga AlphaEdit modellredigeringsmetod som används för vattenmärkning både precision och robusthet, med den justerade modellen ofta misslyckas med att returnera de krävda svaren. Eventuella ändringar den gör är lätt att bryta med beskärning eller brus.
För att övervinna detta har författarna utvecklat en multi-omgångsredigeringsstrategi som gradvis justerar modellvikterna i en enda MLP-lager tills dess svar är tillräckligt anpassade till de önskade svaren. För att härdningsredigeringarna mot angrepp injiceras även Gaussiskt brus under träning, för att simulera angrepp:

Fördelning av ändringar i K1 för Baichuan-7B, Qwen-7B och LLaMA3-8B före och efter angrepp. Den övre raden visar effekten av slumpmässig brusinjektion; den nedre raden visar effekten av modellbeskärning. Alla ändringar förblir nära noll, vilket tyder på att angreppen inte stör modellens interna beteende avsevärt.
En poängsystem avslutar processen när redigeringarna är tillräckligt precisa, medan regularisering säkerställer att uppdateringar förblir stabila över flera omgångar.
Avkodaren ställer modellen samma speciella frågor som användes under vattenmärkning, och läser sedan dess svar för att inferera den dolda ID:n. Eftersom mönstret av svar följer en hemlig regel, kan denna ID återvinnas utan att behöva undersöka modellens interna struktur.
Data och tester
För att testa EditMark utvärderades fem LLM: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; och Qwen-7B. Den ovannämnda AlphaEdit användes för att inbädda vattenmärken, medan extraheringsframgångsgrad (ESR) och inbäddningstid (ET) var de metriker som antogs.
För baslinjer valde författarna Model Watermark (bakdörr); KIMark; och BadEdit, ett ramverk som ursprungligen var utformat för bakdörrsinjektion, men som här anpassats till projektets egna syften.
Författarna redigerade 15:e lagret i LLaMA-3-8; 17:e lagret i GPT2-XL och GPT-J-6B; och 14:e lagret i Qwen-7B och Baichuan-7B.
Experimenten genomfördes på fyra NVIDIA RTX 4090 GPU:er (24 GB VRAM vardera), med vattenmärken på 32-bitars, 64-bitars och 128-bitars längd inbäddade. Frågemallarna som användes beskrivs i bilden nedan:

Mallar som används för att generera matematiska frågor med flera svar (MA) för vattenmärkning. Varje fråga baseras på en annan typ av matematisk olikhet, med slumpmässiga värden infogade för variablerna. Modellen tillfrågas om att returnera en lista med heltalslösningar, med ordningen på svaren som används för att koda eller avkoda vattenmärkesbitar. De fyra mallarna täcker kvadratiska, logaritmiska, rationella och intervallbaserade former, och alla genererades med hjälp av GPT-4o.
För att minska effekterna av slumpmässighet tillämpades frön från 1 till 20 under testning, över olika vattenmärkeskapaciteter.
Initialt testade forskarna för både ESR och tidskostnad vid inbäddning av ett vattenmärke över hela LLM-området:

Jämförelse av EditMark mot tre tidigare vattenmärkningsmetoder på fem stora språkmodeller. Rapporterade är extraheringsframgångsgraden (ESR) och inbäddningstiden (ET) i sekunder. EditMark uppnår konsekvent en 100% framgångsgrad medan den reducerar inbäddningstiden med flera storleksordningar, och överträffar alla baslinjer i både noggrannhet och effektivitet över modeller av varierande storlek och arkitektur.
Av dessa resultat hävdar författarna:
‘[EditMark] uppnår en 100% ESR och kräver mindre än 20 sekunder för att inbädda ett 32-bitars vattenmärke för alla utvärderade LLM. I synnerhet är den genomsnittliga inbäddningstiden för Baichuan-7B och Qwen-7B under 10 sekunder, vilket visar EditMarks höga effektivitet.’
För utvärdering av ett 128-bitars vattenmärke, det högsta värdet som är möjligt under ett sådant system, kunde EditMark upprätthålla en status av “outplånlig”:

Extraheringsframgångsgrader och inbäddningstider för EditMark över vattenmärkeslängder på 32, 64 och 128 bitar på fem språkmodeller. Fullständiga framgångsgrader upprätthålls i alla fall, medan inbäddningstiden ökar med vattenmärkesstorlek, men förblir under en minut, även vid 128 bitar.
Sedan testades systemets förmåga att upprätthålla vattenmärkes trohet över flera benchmark:

Utvärdering av vattenmärkes trohet på fyra benchmark över fem modeller, jämförande omodifierade modeller med modeller som vattenmärkts med 32-bitars och 128-bitars kapacitet. Prestandan förblev stabil över konfigurationer, med endast mindre fluktuationer i genomsnittliga poäng, vilket tyder på en begränsad påverkan på benchmarknoggrannhet från vattenmärkesinbäddning.
EditMarks motståndskraft testades mot sex vanliga angreppsstrategier. Modellerna inbäddades först med 128-bitars vattenmärken med hjälp av fem olika frön. Finjustering orsakade endast en mindre försämring av extraheringsframgångsgrad (ESR) för de flesta modellerna:

Extraheringsframgångsgrad (ESR) av vattenmärkta LLM före och efter finjustering i en till tre epoker. Medan de flesta modeller behåller höga ESR under hela tiden, visar Qwen-7B en markant nedgång, vilket tyder på en större sårbarhet för parameteruppdateringar.
Även efter flera epoker behöll de flesta modellerna ESR över 90%, vilket tyder på att EditMark motstår den parameterdrift som introduceras av LoRA-baserad träning.
Kvantiseringsangrepp reducerade modellprecisionen, men lämnade de flesta vattenmärken intakta:

Extraheringsframgångsgrad (ESR) av vattenmärkta modeller före och efter kvantisering med Int-8 och Int-4 precision. ESR förblev oförändrad under Int-8-kvantisering över alla modeller, medan Int-4-kvantisering orsakade en partiell försämring, vilket tyder på att lägre precision kan försvaga, men inte helt ta bort vattenmärket.
Som vi kan se i bilden ovan, bevarade Int-8-kvantisering 100% ESR över alla modeller, medan Int-4-kvantisering hade en måttlig påverkan på ESR, men introducerade oacceptabla prestandaförluster.
Som artikeln påpekar, tyder detta scenario på en begränsad potential för en angripare, eftersom detta resulterar i en hackad men prestandaförsämrad modell.
Tester för brus och beskärning utvärderade fyra benchmark-ramverk: MMLU; BLIMP; TruthfulQA; och GLUE. Dessa angrepp ledde till minskad ESR när störningar intensifierades:

Effekten av brus (övre raden) och beskärning (nedre raden) på ESR, och benchmarkprestanda för vattenmärkta modeller. När ESR sjunker med ökande störning, försämras också benchmarknoggrannheten, särskilt vid högre brusintensiteter och beskärningsförhållanden, vilket lyfter fram den (vanliga) spänningen mellan vattenmärkesborttagning och modellnytta.
Men dessa orsakade också skarpa nedgångar i uppgiftsprestanda, med Baichuan-7B som fick en 27-31% nedgång på BLIMP när brus eller beskärning tillämpades.
Modellredigering och adaptiva angrepp utvärderades också:

Extraheringsframgångsgrad av vattenmärkta modeller som utsatts för varierande grad av modellredigering. Även med upp till femtio redigeringar tillämpade på kända vattenmärkeslager, förblir ESR över 95% för alla modeller, vilket tyder på att direkt parametermodifiering har en begränsad effekt på vattenmärkesborttagning.
Här behöll EditMark över 95% ESR, även när exakta inbäddningslager riktades.
Slutsats
DRM, hemliga vattenmärken och andra säkerhetsmetoder som har haft (begränsad eller partiell) framgång i den föregående AI-eran är svåra att tillämpa på maskinlärningssystem; den medvetna reducerande naturen hos den nuvarande uppsättningen av värdarkitekturer kombineras med en brist på lämpliga verktyg, vilket gör att alla inbäddade vattenmärken blir ganska ömtåliga.
Det är imponerande att se ett system som syftar till FOSS-modellfördelning, och att se det uthärda mot alla scenarier utom de mest osannolika, i termer av en angripares förkunskap. Trots detta kan den mycket lilla prestandaförsämring som kommer med post-träningsredigeringar, liten som den är i dessa experiment, ge potentiella adoptörer anledning att pausa; inte minst eftersom att dra sig tillbaka till en API-centrerad modell av kontroll eliminerar sådana angrepp nästan helt.
* Denna webbplats har hävdat att ‘öppna vikt’-utgåvor från Kina inte nödvändigtvis kvalificerar som fullständigt FOSS, eftersom data ofta undanhålls, vilket förhindrar exakt återskapande av träningspipelinen. Det kan hävdas att detta ämne inbjuder till en djupare titt på politiken kring AI-modellutgåvor jämförda mellan väst och öst, vilket ligger utanför ramen för denna artikel.
Publicerad första gången måndagen den 27 oktober 2025












