AI-modeller og platforme

MARKLLM: En Open-Source Toolkit til LLM-Vandmærkning

mm
Føj Unite.AI til dine foretrukne kilder på Google

LLM-vandmærkning, der integrerer usynlige, men detectable signaler i modeloutput for at identificere tekst genereret af LLM’er, er afgørende for at forhindre misbrug af store sprogmodeller. Disse vandmærkningsmetoder er hovedsageligt inddelt i to kategorier: KGW-familien og Christ-familien. KGW-familien ændrer logits, der produceres af LLM, for at skabe vandmærket output ved at kategorisere vocabularet i en grøn liste og en rød liste baseret på den foregående token. Bias introduceres til logits af grøn liste tokens under tekstgenerering, hvilket favoriserer disse tokens i den producerede tekst. En statistisk metrik beregnes derefter fra proportionen af grønne ord, og en grænse fastsættes for at skelne mellem vandmærket og ikke-vandmærket tekst. Forbedringer af KGW-metoden omfatter forbedret listeopdeling, bedre logit-manipulation, øget vandmærkeinformationskapacitet, modstand mod vandmærkefjernelsesangreb og evnen til at detektere vandmærker offentligt.

Om vendt, ændrer Christ-familien samplingprocessen under LLM-tekstgenerering, hvilket indlejrer et vandmærke ved at ændre, hvordan tokens vælges. Begge vandmærkningsfamilier sigter mod at balancere vandmærkedetektering med tekstkvalitet, hvilket omfatter udfordringer som robusthed i varierende entropiindstillinger, øget vandmærkeinformationskapacitet og beskyttelse mod fjernelsesforsøg. Seneste forskning har fokuseret på at forfine listeopdeling og logit-manipulation, forbedre vandmærkeinformationskapacitet, udvikle metoder til at modstå vandmærkefjernelse og enable offentlig detektion. Til sidst er LLM-vandmærkning afgørende for den etiske og ansvarlige brug af store sprogmodeller, hvilket giver en metode til at spore og verificere LLM-genereret tekst. KGW- og Christ-familierne tilbyder to forskellige tilgange, hver med unikke styrker og anvendelser, der kontinuerligt udvikles gennem fortsat forskning og innovation.

Takket være evnen af LLM-vandmærkningsrammer til at indlejre algoritmer, der kan detecteres i modeloutput for at identificere tekst genereret af en LLM-ramme, spiller en afgørende rolle i at mindske risikoen forbundet med misbrug af store sprogmodeller. Der er dog en overflod af LLM-vandmærkningsrammer på markedet i øjeblikket, hver med deres eget perspektiv og evalueringssystemer, hvilket gør det svært for forskerne at eksperimentere med disse rammer let. For at imødegå dette problem tilbyder MarkLLM, en open-source toolkit til vandmærkning, en udvidbar og samlet ramme til at implementere LLM-vandmærkningsalgoritmer, samtidig med at den tilbyder brugervenlige grænseflader for at sikre let brug og adgang. Desuden understøtter MarkLLM-rammen automatisk visualisering af mekanismerne i disse rammer, hvilket forbedrer forståelsen af disse modeller. MarkLLM-rammen tilbyder en omfattende samling af 12 værktøjer, der dækker tre perspektiver samt to automatiserede evalueringssystemer til at evaluere dens præstation. Denne artikel sigter mod at dække MarkLLM-rammen i dybden, og vi udforsker mekanismerne, metodologien, arkitekturen i rammen samt sammenligningen med state-of-the-art-rammer. Så lad os komme i gang.

MarkLLM: En LLM-VandmærkningsToolkit

Opkomsten af store sprogmodelrammer som LLaMA, GPT-4, ChatGPT og mere har betydeligt udviklet evnen af AI-modeller til at udføre bestemte opgaver, herunder kreativ skrivning, indholdforståelse, formationshenting og meget mere. Der er dog, sammen med de bemærkelsesværdige fordele forbundet med den exceptionelle dygtighed af nuværende store sprogmodeller, visse risici dukket op, herunder akademisk paper ghostwriting, LLM-genereret falsk nyheder og billeder, og personlig imitation for at nævne nogle. Givet risiciene forbundet med disse problemer er det afgørende at udvikle pålidelige metoder med evnen til at skelne mellem LLM-genereret og menneskeskabt indhold, en større krav til at sikre ægtheden af digital kommunikation og forhindre spredningen af misinformationskampagner. I de sidste par år er LLM-vandmærkning blevet anbefalet som en af de lovende løsninger til at skelne mellem LLM-genereret indhold og menneskeskabt indhold, og ved at indlejre distinkte funktioner under tekstgenereringsprocessen kan LLM-outputs være unikt identificeret ved hjælp af særligt designede detektorer. Der er dog, på grund af proliferation og relativt komplekse algoritmer af LLM-vandmærkningsrammer samt diversificering af evalueringssystemer og perspektiver, det blevet utroligt svært at eksperimentere med disse rammer.

For at brokke den nuværende kløft forsøger MarkLLM-rammen at bidrage til følgende. MARKLLM tilbyder konsistente og brugervenlige grænseflader til at indlæse algoritmer, generere vandmærket tekst, udføre detektionsprocesser og samle data til visualisering. Den tilbyder brugervenlige visualiseringsløsninger til både de store vandmærkningsalgoritmefamilier, hvilket giver brugerne mulighed for at se, hvordan forskellige algoritmer fungerer under forskellige konfigurationer med virkelige eksempler. Værktøjet indeholder en omfattende evalueringmodul med 12 værktøjer, der adresserer detekterbarhed, robusthed og tekstkvalitetsindvirkning. Desuden indeholder det to typer automatiserede evalueringssystemer, der understøtter brugerdefinerede datasets, modeller, evalueringssystemer og angreb, hvilket faciliterer fleksible og grundige vurderinger. Designet med en modulær, løst koblet arkitektur, forbedrer MarkLLM skalerbarhed og fleksibilitet. Dette designvalg understøtter integrationen af nye algoritmer, innovative visualiseringsteknikker og udvidelsen af evalueringssystemet af fremtidige udviklere.

Mange vandmærkningsalgoritmer er blevet foreslået, men deres unikke implementeringsmetoder prioriterer ofte bestemte krav over standardisering, hvilket fører til flere problemer

  1. Mangel på standardisering i klasse-design: Dette nødvendiggør betydelig indsats for at optimere eller udvide eksisterende metoder på grund af utilstrækkeligt standardiseret klasse-design.
  2. Mangel på ensartethed i top-niveau-kald-grænseflader: Uensartede grænseflader gør batchbehandling og replikering af forskellige algoritmer besværligt og arbejdskrævende.
  3. Kode-standard-problemer: Udfordringerne omfatter behovet for at ændre indstillinger på tværs af multiple kodesegmenter og uensartet dokumentation, hvilket komplicerer tilpasning og effektiv brug. Hardkodede værdier og uensartet fejlhåndtering forhindrer yderligere tilpasning og fejlfinding.

For at adresse disse problemer tilbyder vores værktøj en samlet implementeringsramme, der giver mulighed for let aktivering af forskellige state-of-the-art-algoritmer under fleksible konfigurationer. Desuden giver vores omhyggeligt designede klassestruktur mulighed for fremtidige udvidelser. Følgende figur demonstrerer designet af denne samlede implementeringsramme.

Takket være rammenes distributive design er det let for udviklere at tilføje yderligere top-niveau-grænseflader til en bestemt vandmærkningsalgoritme uden bekymring for at påvirke andre algoritmer.

MarkLLM: Arkitektur og Metodologi

LLM-vandmærkningsmetoder er hovedsageligt inddelt i to kategorier: KGW-familien og Christ-familien. KGW-familien ændrer logits, der produceres af LLM, for at skabe vandmærket output ved at kategorisere vocabularet i en grøn liste og en rød liste baseret på den foregående token. Bias introduceres til logits af grøn liste tokens under tekstgenerering, hvilket favoriserer disse tokens i den producerede tekst. En statistisk metrik beregnes derefter fra proportionen af grønne ord, og en grænse fastsættes for at skelne mellem vandmærket og ikke-vandmærket tekst. Forbedringer af KGW-metoden omfatter forbedret listeopdeling, bedre logit-manipulation, øget vandmærkeinformationskapacitet, modstand mod vandmærkefjernelsesangreb og evnen til at detektere vandmærker offentligt.

Om vendt, ændrer Christ-familien samplingprocessen under LLM-tekstgenerering, hvilket indlejrer et vandmærke ved at ændre, hvordan tokens vælges. Begge vandmærkningsfamilier sigter mod at balancere vandmærkedetektering med tekstkvalitet, hvilket omfatter udfordringer som robusthed i varierende entropiindstillinger, øget vandmærkeinformationskapacitet og beskyttelse mod fjernelsesforsøg. Seneste forskning har fokuseret på at forfine listeopdeling og logit-manipulation, forbedre vandmærkeinformationskapacitet, udvikle metoder til at modstå vandmærkefjernelse og enable offentlig detektion. Til sidst er LLM-vandmærkning afgørende for den etiske og ansvarlige brug af store sprogmodeller, hvilket giver en metode til at spore og verificere LLM-genereret tekst. KGW- og Christ-familierne tilbyder to forskellige tilgange, hver med unikke styrker og anvendelser, der kontinuerligt udvikles gennem fortsat forskning og innovation.

Automatiseret Komprehensiv Evaluering

At evaluere en LLM-vandmærkningsalgoritme er en kompleks opgave. Først og fremmest kræver det overvejelse af forskellige aspekter, herunder vandmærkedetektering, robusthed mod manipulation og indvirkning på tekstkvalitet. Dernæst kan evalueringer fra hvert perspektiv kræve forskellige metrikker, angrebs-scenarier og opgaver. Desuden indebærer evaluering typisk flere trin, såsom model- og datasetvalg, vandmærket tekstgenerering, efterbehandling, vandmærkedetektion, tekstmanipulation og metrikberegning. For at faciliterer let og grundig evaluering af LLM-vandmærkningsalgoritmer tilbyder MarkLLM 12 brugervenlige værktøjer, herunder forskellige metrikberegner og angribere, der dækker de tre nævnte evalueringssperspektiver. Desuden tilbyder MARKLLM to typer automatiserede demo-pipelines, hvis moduler kan tilpasses og samles fleksibelt, hvilket giver mulighed for let konfiguration og brug.

For aspektet af detekterbarhed kræver de fleste vandmærkningsalgoritmer ultimativt specifikation af en grænse for at skelne mellem vandmærket og ikke-vandmærket tekst. Vi tilbyder en grundlæggende succesrategenerator med en fast grænse. Desuden tilbyder vi en beregner, der understøtter dynamisk grænsevalg for at minimere indvirkningen af grænsevalg på detekterbarhed. Dette værktøj kan bestemme grænsen, der giver den bedste F1-score eller vælge en grænse baseret på en brugerdefineret mål-falsk-positiv-rates (FPR).

For aspektet af robusthed tilbyder MARKLLM tre ord-niveau tekstmanipulationsangreb: tilfældig ord-sletning i en specificeret ratio, tilfældig synonym-erstatning med WordNet som synonym-sæt og kontekst-bevidst synonym-erstatning med BERT som indlejringmodel. Desuden tilbyder vi to dokument-niveau tekstmanipulationsangreb: omskrivning af konteksten via OpenAI API eller Dipper-modellen. For aspektet af tekstkvalitet tilbyder MARKLLM to direkte analyseværktøjer: en forvirringsberegner til at måle flydende og en diversitetsberegner til at evaluere variationen af tekster. For at analysere indvirkningen af vandmærkning på tekstnyttighed i bestemte downstream-opgaver tilbyder vi en BLEU-beregner til maskinoversættelsesopgaver og en bestå-eller-ikke-dømmer til kodegenereringsopgaver. Desuden, givet de nuværende metoder til sammenligning af kvaliteten af vandmærket og ikke-vandmærket tekst, der inkluderer brug af en stærkere LLM til vurdering, tilbyder MarkLLM også en GPT-diskriminator, der anvender GPT-4 til at sammenligne tekstkvalitet.

Evalueringssystemer

For at faciliterer automatiseret evaluering af LLM-vandmærkningsalgoritmer tilbyder MARKLLM to evalueringssystemer: et til at vurder vandmærkedetektering med og uden angreb, og et til at analysere indvirkningen af disse algoritmer på tekstkvalitet. Følgende process har vi implementeret to pipelines: WMDetect3 og UWMDetect4. Den primære forskel mellem dem ligger i tekstgenereringsfasen. Den første kræver brug af generate_watermarked_text-metoden fra vandmærkningsalgoritmen, mens den sidste afhænger af text_source-parametren til at bestemme, om den skal hente naturlig tekst fra en dataset eller kalde generate_unwatermarked_text-metoden.

For at evaluere indvirkningen af vandmærkning på tekstkvalitet genereres par af vandmærket og ikke-vandmærket tekst. Teksterne, sammen med andre nødvendige inputs, behandles og føres ind i en bestemt tekstkvalitetsanalyse for at producere detaljeret analyse og sammenligningsresultater. Følgende process har vi implementeret tre pipelines til forskellige evalueringsscenarier:

  1. DirectQual.5: Dette pipeline er specifikt designet til at analysere tekstkvalitet ved at sammenligne karakteristikkerne af vandmærket tekst med karakteristikkerne af ikke-vandmærket tekst. Det vurderer metrikker såsom forvirring (PPL) og log-diversitet uden behov for ydre reference-tekster.
  2. RefQual.6: Dette pipeline vurderer tekstkvalitet ved at sammenligne både vandmærket og ikke-vandmærket tekst med en fælles reference-tekst. Det måler graden af lighed eller afvigelse fra reference-teksten, hvilket gør det ideelt til scenarier, der kræver bestemte downstream-opgaver til at vurderer tekstkvalitet, såsom maskinoversættelse og kodegenerering.
  3. ExDisQual.7: Dette pipeline anvender en ydre dømmer, såsom GPT-4 (OpenAI, 2023), til at vurder kvaliteten af både vandmærket og ikke-vandmærket tekst. Diskriminatoren vurderer teksterne baseret på brugerdefinerede opgavebeskrivelser, hvilket identificerer eventuel nedgang eller bevarelse af kvalitet på grund af vandmærkning. Denne metode er særligt værdifuld, når en avanceret, AI-baseret analyse af de subtile effekter af vandmærkning er nødvendig.

MarkLLM: Eksperimenter og Resultater

For at evaluere dens præstation udfører MarkLLM-rammen evalueringer på ni forskellige algoritmer og vurderer deres indvirkning, robusthed og detekterbarhed på tekstkvalitet.

Den ovenstående tabel indeholder evalueringssresultaterne for at vurder detekterbarheden af ni algoritmer, der understøttes i MarkLLM. Dynamisk grænsejustering anvendes til at evaluere vandmærkedetektering, med tre indstillinger: under en mål-FPR på 10%, under en mål-FPR på 1% og under betingelser for optimal F1-score-præstation. 200 vandmærkede tekster genereres, mens 200 ikke-vandmærkede tekster fungerer som negative eksempler. Vi leverer TPR og F1-score under dynamisk grænsejustering for 10% og 1% FPR, sammen med TPR, TNR, FPR, FNR, P, R, F1, ACC ved optimal præstation. Den følgende tabel indeholder evalueringssresultaterne for at vurder robustheden af ni algoritmer, der understøttes i MarkLLM. For hvert angreb genereres 200 vandmærkede tekster og herefter manipuleres, mens yderligere 200 ikke-vandmærkede tekster fungerer som negative eksempler. Vi rapporterer TPR og F1-score ved optimal præstation under hver omstændighed.

Endelige Tanker

I denne artikel har vi talt om MarkLLM, en open-source toolkit til vandmærkning, der tilbyder en udvidbar og samlet ramme til at implementere LLM-vandmærkningsalgoritmer, samtidig med at den tilbyder brugervenlige grænseflader til at sikre let brug og adgang. Desuden understøtter MarkLLM-rammen automatisk visualisering af mekanismerne i disse rammer, hvilket forbedrer forståelsen af disse modeller. MarkLLM-rammen tilbyder en omfattende samling af 12 værktøjer, der dækker tre perspektiver samt to automatiserede evalueringssystemer til at evaluere dens præstation.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.