AI-modeller og plattformer
MARKLLM: En åpen kilde-verktøy for LLM-vannmerking
LLM-vannmerking, som integrerer usynlige, men detekterbare signaler i modellutdata for å identifisere tekst generert av LLM-er, er viktig for å forebygge misbruk av store språkmodeller. Disse vannmerkingsteknikkene er hovedsakelig inndelt i to kategorier: KGW-familien og Christ-familien. KGW-familien modifiserer logittene produsert av LLM for å opprette vannmerket utdata ved å kategorisere vokabularet i en grønn liste og en rød liste basert på den foregående token. Forvrengning introduseres til logittene av grønn liste-tokens under tekstgenerering, som favoriserer disse tokenene i den produserte teksten. En statistisk metode beregnes deretter fra proporsjonen av grønne ord, og en terskel etableres for å skille mellom vannmerket og ikke-vannmerket tekst. Forbedringer av KGW-metoden inkluderer forbedret listeoppdeling, bedre logitt-manipulasjon, økt vannmerkeinformasjonskapasitet, motstand mot vannmerkefjerningsangrep og evnen til å detektere vannmerker offentlig.
På den andre siden, endrer Christ-familien utvalgsprosessen under LLM-tekstgenerering, og innfører et vannmerke ved å endre hvordan token velges. Begge vannmerkingfamilier har som mål å balansere vannmerkedetekterbarhet med tekstkvalitet, og møter utfordringer som robusthet i varierende entropiinnstillinger, økt vannmerkeinformasjonskapasitet og beskyttelse mot fjerningsforsøk. Nyere forskning har fokusert på å forbedre listeoppdeling og logitt-manipulasjon, øke vannmerkeinformasjonskapasitet, utvikle metoder for å motstå vannmerkefjerning og muliggjøre offentlig deteksjon. Til slutt er LLM-vannmerking avgjørende for den etiske og ansvarlige bruken av store språkmodeller, og gir en metode for å spore og verifisere LLM-generert tekst. KGW- og Christ-familien tilbyr to distinkte tilnærminger, hver med unike styrker og anvendelser, og utvikler seg kontinuerlig gjennom pågående forskning og innovasjon.
På grunn av evnen til LLM-vannmerkingrammeverk til å innføre algoritmer detekterbare signaler i modellutdata for å identifisere tekst generert av en LLM-rammeverk spiller en avgjørende rolle i å mildne risikoen forbundet med misbruk av store språkmodeller. Likevel, finnes det et overflod av LLM-vannmerkingrammeverk på markedet i dag, hver med sine egne perspektiver og evalueringprosedyrer, noe som gjør det vanskelig for forskerne å eksperimentere med disse rammeverkene enkelt. For å motvirke dette problemet, tilbyr MarkLLM, et åpen kilde-verktøy for vannmerking, et utvidbart og samlet rammeverk for å implementere LLM-vannmerkingalgoritmer samtidig som det tilbyr brukervennlige grensesnitt for å sikre enkelhet og tilgang. Videre støtter MarkLLM-rammeverket automatisk visualisering av mekanismene til disse rammeverkene, og øker dermed forståelsen av disse modellene. MarkLLM-rammeverket tilbyr et komprehensivt sett med 12 verktøy som dekker tre perspektiver samt to automatiserte evalueringsspor for å evaluere dens ytelse. Denne artikkelen har som mål å dekke MarkLLM-rammeverket i dybden, og vi utforsker mekanismen, metodikken, arkitekturen til rammeverket samt sammenligningen med state-of-the-art-rammeverk. La oss begynne.
MarkLLM: Et LLM-vannmerkingverktøy
Oppblomstringen av store språkmodellrammeverk som LLaMA, GPT-4, ChatGPT og mer har betydelig fremmet evnen til AI-modeller til å utføre bestemte oppgaver, inkludert kreativ skriving, innholdforståelse, formasjonsgjennvinning og mye mer. Likevel, sammen med de bemerkelsesverdige fordelene forbundet med den eksepsjonelle dyktigheten til nåværende store språkmodeller, har visse risikoer dukket opp, inkludert akademisk papirghostwriting, LLM-generert falsk nyheter og fremstillinger, og individuell personliggjøring, for å nevne noen. Gitt risikoene forbundet med disse problemene, er det avgjørende å utvikle pålitelige metoder med evnen til å skille mellom LLM-generert og menneskeskapt innhold, et større krav for å sikre autentisiteten til digital kommunikasjon og forhindre spredningen av desinformasjon. I de siste årene har LLM-vannmerking blitt anbefalt som en av de løftende løsningene for å skille LLM-generert innhold fra menneskeskapt innhold, og ved å innføre distinkte egenskaper under tekstgenereringsprosessen, kan LLM-utdataer bli unikt identifisert ved hjelp av spesialdesignet detektorer. Likevel, på grunn av spredningen og relativt komplekse algoritmer til LLM-vannmerkingrammeverk, samt diversifiseringen av evalueringmetrikker og perspektiver, har det blitt svært vanskelig å eksperimentere med disse rammeverkene.
For å brokke den nåværende gapen, prøver MarkLLM-rammeverket å bidra med følgende. MARKLLM tilbyr konsistente og brukervennlige grensesnitt for å laste algoritmer, generere vannmerket tekst, utføre detekteringsprosesser og samle data for visualisering. Det tilbyr tilpassede visualiseringsløsninger for begge hovedvannmerkingsalgoritmfamilier, som lar brukerne se hvordan forskjellige algoritmer fungerer under ulike konfigurasjoner med eksempler fra virkeligheten. Verktøyet inkluderer en komprehensiv evalueringmodul med 12 verktøy som addreser detekterbarhet, robusthet og tekstkvalitetspåvirkning. Videre har det to typer automatiserte evalueringsspor som støtter brukerdefinerte datasett, modeller, evalueringmetrikker og angrep, og muliggjør fleksible og grundige vurderinger. Designet med en modulær, løst koblet arkitektur, forbedrer MarkLLM skalerbarhet og fleksibilitet. Dette designvalget støtter integreringen av nye algoritmer, innovative visualiseringsmetoder og utvidelsen av evalueringverktøyet av fremtidige utviklere.
Mange vannmerkingalgoritmer har blitt foreslått, men deres unike implementeringsmetoder prioriterer ofte bestemte krav over standardisering, noe som fører til flere problemer
- Mangel på standardisering i klasseutforming: Dette krever betydelig innsats for å optimalisere eller utvide eksisterende metoder på grunn av utilstrekkelig standardiserte klasseutforminger.
- Mangel på enhetlighet i toppnivåkallgrensesnitt: Ulike grensesnitt gjør batchbehandling og replikering av forskjellige algoritmer tungvint og arbeidskrevende.
- Kodestandardproblemer: Utfordringer inkluderer behovet for å modifisere innstillinger over flere kodefragmenter og inkonsistent dokumentasjon, noe som kompliserer tilpasning og effektiv bruk. Hardkodede verdier og inkonsistent feilhåndtering hindrer ytterligere tilpasnings- og feilsøkingsforsøk.
For å addresse disse problemene, tilbyr vårt verktøy et samlet implementeringsrammeverk som muliggjør enkel påkalling av ulike state-of-the-art-algoritmer under fleksible konfigurasjoner. Videre åpner vår nøye designet klassestruktur veien for fremtidige utvidelser. Følgende figur demonstrerer designet til dette samlede implementeringsrammeverket.
På grunn av rammeverkets distributive design, er det enkelt for utviklere å legge til ytterligere toppnivågrensesnitt til en bestemt vannmerkealgoritmklassen uten å bekymre seg for å påvirke andre algoritmer.
MarkLLM: Arkitektur og Metodikk
LLM-vannmerkingsteknikker er hovedsakelig inndelt i to kategorier: KGW-familien og Christ-familien. KGW-familien modifiserer logittene produsert av LLM for å opprette vannmerket utdata ved å kategorisere vokabularet i en grønn liste og en rød liste basert på den foregående token. Forvrengning introduseres til logittene av grønn liste-tokens under tekstgenerering, som favoriserer disse tokenene i den produserte teksten. En statistisk metode beregnes deretter fra proporsjonen av grønne ord, og en terskel etableres for å skille mellom vannmerket og ikke-vannmerket tekst. Forbedringer av KGW-metoden inkluderer forbedret listeoppdeling, bedre logitt-manipulasjon, økt vannmerkeinformasjonskapasitet, motstand mot vannmerkefjerningsangrep og evnen til å detektere vannmerker offentlig.
På den andre siden, endrer Christ-familien utvalgsprosessen under LLM-tekstgenerering, og innfører et vannmerke ved å endre hvordan token velges. Begge vannmerkingfamilier har som mål å balansere vannmerkedetekterbarhet med tekstkvalitet, og møter utfordringer som robusthet i varierende entropiinnstillinger, økt vannmerkeinformasjonskapasitet og beskyttelse mot fjerningsforsøk. Nyere forskning har fokusert på å forbedre listeoppdeling og logitt-manipulasjon, øke vannmerkeinformasjonskapasitet, utvikle metoder for å motstå vannmerkefjerning og muliggjøre offentlig deteksjon. Til slutt er LLM-vannmerking avgjørende for den etiske og ansvarlige bruken av store språkmodeller, og gir en metode for å spore og verifisere LLM-generert tekst. KGW- og Christ-familien tilbyr to distinkte tilnærminger, hver med unike styrker og anvendelser, og utvikler seg kontinuerlig gjennom pågående forskning og innovasjon.
Automatisert Komprehensiv Evaluering
Evaluering av en LLM-vannmerkingalgoritme er en kompleks oppgave. Først og fremst, krever det overveielse av ulike aspekter, inkludert vannmerkedetekterbarhet, robusthet mot tampering og påvirkning på tekstkvalitet. For det andre, kan evalueringer fra hver perspektiv kreve ulike metrikker, angreps-scenarier og oppgaver. Videre, inkluderer evaluering vanligvis flere trinn, som modell- og datasettvalg, vannmerket tekstgenerering, etterbehandling, vannmerkedeteksjon, teksttampering og metodeberegnning. For å muliggjøre enkel og grundig evaluering av LLM-vannmerkingalgoritmer, tilbyr MarkLLM tolv brukervennlige verktøy, inkludert ulike metodekalkulatorer og angripere som dekker de tre ovennevnte evalueringperspektivene. Videre tilbyr MARKLLM to typer automatiserte demo-spor, hvis moduler kan tilpasses og samles fleksibelt, og lar brukerne enkelt konfigurere og bruke.
For aspektet detekterbarhet, krever de fleste vannmerkingalgoritmer ultimate å angi en terskel for å skille mellom vannmerket og ikke-vannmerket tekst. Vi tilbyr en grundig suksesshastighetskalkulator som bruker en fast terskel. Videre, for å minimere påvirkningen av terskelvalg på detekterbarhet, tilbyr vi også en kalkulator som støtter dynamisk terskelvalg. Dette verktøyet kan bestemme terskelen som gir den beste F1-score eller velge en terskel basert på en brukerdefinert mål false positiv rate (FPR).
For aspektet robusthet, tilbyr MARKLLM tre ordnivåteksttamperingsangrep: tilfeldig orddeleasjon i et spesifisert forhold, tilfeldig synonym-erstatning ved hjelp av WordNet som synonymsett, og kontekst-avhengig synonym-erstatning ved hjelp av BERT som innbettingsmodell. Videre tilbyr det to dokumentnivåteksttamperingsangrep: parafrasering av konteksten via OpenAI API eller Dipper-modellen. For aspektet tekstkvalitet tilbyr MARKLLM to direkte analyseverktøy: en forvirringskalkulator for å måle flyt og en diversitetskalkulator for å evaluere variasjonen av tekster. For å analysere påvirkningen av vannmerking på tekstens nytte i bestemte nedstrømsoppgaver, tilbyr vi en BLEU-kalkulator for maskinoversettelsesoppgaver og en bestående dommer for kodegenereringsoppgaver. Videre, gitt nåværende metoder for å sammenligne kvaliteten på vannmerket og uvannmerket tekst, som inkluderer å bruke en sterkere LLM for vurdering, tilbyr MarkLLM også en GPT-diskriminatore som bruker GPT-4 for å sammenligne tekstkvalitet.
Evalueringsspor
For å muliggjøre automatisert evaluering av LLM-vannmerkingalgoritmer, tilbyr MARKLLM to evalueringsspor: ett for å vurdere vannmerkedetekterbarhet med og uten angrep, og ett for å analysere påvirkningen av disse algoritmene på tekstkvalitet. Følgelig har vi implementert to spor: WMDetect3 og UWMDetect4. Den primære forskjellen mellom dem ligger i tekstgenereringsfasen. Den første krever bruk av generate_watermarked_text-metoden fra vannmerkingalgoritmen, mens den andre avhenger av tekst_kilden-parameteren for å bestemme om å hente naturlig tekst fra et datasett eller å påkalle generate_unwatermarked_text-metoden.
For å evaluere påvirkningen av vannmerking på tekstkvalitet, genereres par av vannmerket og uvannmerket tekst. Tekstene, sammen med andre nødvendige innstillinger, behandles og matet inn i en bestemt tekstkvalitetsanalyse for å produsere detaljert analyse og sammenligningsresultater. Følgelig har vi implementert tre spor for ulike evalueringsscenarier:
- DirectQual.5: Dette sporet er spesifikt designet for å analysere tekstens kvalitet ved å sammenligne karakteristika til vannmerket tekst med uvannmerket tekst. Det vurderer metrikker som forvirring (PPL) og log-diversitet, uten å kreve eksterne referansekst.
- RefQual.6: Dette sporet vurderer tekstkvalitet ved å sammenligne både vannmerket og uvannmerket tekst med en felles referansekst. Det måler graden av likhet eller avvik fra referanseksten, og gjør det ideelt for scenarier som krever bestemte nedstrømsoppgaver for å vurdere tekstkvalitet, som maskinoversettelse og kodegenerering.
- ExDisQual.7: Dette sporet bruker en ekstern dommer, som GPT-4 (OpenAI, 2023), for å vurdere kvaliteten på både vannmerket og uvannmerket tekst. Diskriminatoren vurderer tekstene basert på brukerdefinerte oppgavebeskrivelser, og identifiserer eventuell nedgradering eller bevarelse av kvalitet på grunn av vannmerking. Denne metoden er spesielt verdifull når en avansert, AI-basert analyse av de subtile effektene av vannmerking kreves.
MarkLLM: Eksperimenter og Resultater
For å evaluere dens ytelse, gjennomfører MarkLLM-rammeverket evalueringer på ni ulike algoritmer, og vurderer deres påvirkning, robusthet og detekterbarhet på tekstkvalitet.

Tabellen over inneholder evalueringresultatene for å vurdere detekterbarheten til ni algoritmer som støttes i MarkLLM. Dynamisk terskeljustering brukes for å evaluere vannmerkedetekterbarhet, med tre innstillinger: under en mål FPR på 10%, under en mål FPR på 1%, og under betingelser for optimal F1-score-ytelse. 200 vannmerket tekster genereres, mens 200 uvannmerket tekster tjener som negative eksempler. Vi leverer TPR og F1-score under dynamisk terskeljustering for 10% og 1% FPR, samt TPR, TNR, FPR, FNR, P, R, F1, ACC ved optimal ytelse.

Slutt tanker
I denne artikkelen har vi talt om MarkLLM, et åpen kilde-verktøy for vannmerking som tilbyr et utvidbart og samlet rammeverk for å implementere LLM-vannmerkingalgoritmer samtidig som det tilbyr brukervennlige grensesnitt for å sikre enkelhet og tilgang. Videre støtter MarkLLM-rammeverket automatisk visualisering av mekanismene til disse rammeverkene, og øker dermed forståelsen av disse modellene. MarkLLM-rammeverket tilbyr et komprehensivt sett med 12 verktøy som dekker tre perspektiver samt to automatiserte evalueringsspor for å evaluere dens ytelse.












