AI-modeller og plattformer

MARKLLM: En ÃĨpen kilde-verktÃļy for LLM-vannmerking

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

LLM-vannmerking, som integrerer usynlige, men detekterbare signaler i modellutdata for ÃĨ identifisere tekst generert av LLM-er, er viktig for ÃĨ forebygge misbruk av store sprÃĨkmodeller. Disse vannmerkingsteknikkene er hovedsakelig inndelt i to kategorier: KGW-familien og Christ-familien. KGW-familien modifiserer logittene produsert av LLM for ÃĨ opprette vannmerket utdata ved ÃĨ kategorisere vokabularet i en grÃļnn liste og en rÃļd liste basert pÃĨ den foregÃĨende token. Forvrengning introduseres til logittene av grÃļnn liste-tokens under tekstgenerering, som favoriserer disse tokenene i den produserte teksten. En statistisk metode beregnes deretter fra proporsjonen av grÃļnne ord, og en terskel etableres for ÃĨ skille mellom vannmerket og ikke-vannmerket tekst. Forbedringer av KGW-metoden inkluderer forbedret listeoppdeling, bedre logitt-manipulasjon, Ãļkt vannmerkeinformasjonskapasitet, motstand mot vannmerkefjerningsangrep og evnen til ÃĨ detektere vannmerker offentlig.

PÃĨ den andre siden, endrer Christ-familien utvalgsprosessen under LLM-tekstgenerering, og innfÃļrer et vannmerke ved ÃĨ endre hvordan token velges. Begge vannmerkingfamilier har som mÃĨl ÃĨ balansere vannmerkedetekterbarhet med tekstkvalitet, og mÃļter utfordringer som robusthet i varierende entropiinnstillinger, Ãļkt vannmerkeinformasjonskapasitet og beskyttelse mot fjerningsforsÃļk. Nyere forskning har fokusert pÃĨ ÃĨ forbedre listeoppdeling og logitt-manipulasjon, Ãļke vannmerkeinformasjonskapasitet, utvikle metoder for ÃĨ motstÃĨ vannmerkefjerning og muliggjÃļre offentlig deteksjon. Til slutt er LLM-vannmerking avgjÃļrende for den etiske og ansvarlige bruken av store sprÃĨkmodeller, og gir en metode for ÃĨ spore og verifisere LLM-generert tekst. KGW- og Christ-familien tilbyr to distinkte tilnÃĶrminger, hver med unike styrker og anvendelser, og utvikler seg kontinuerlig gjennom pÃĨgÃĨende forskning og innovasjon.

PÃĨ grunn av evnen til LLM-vannmerkingrammeverk til ÃĨ innfÃļre algoritmer detekterbare signaler i modellutdata for ÃĨ identifisere tekst generert av en LLM-rammeverk spiller en avgjÃļrende rolle i ÃĨ mildne risikoen forbundet med misbruk av store sprÃĨkmodeller. Likevel, finnes det et overflod av LLM-vannmerkingrammeverk pÃĨ markedet i dag, hver med sine egne perspektiver og evalueringprosedyrer, noe som gjÃļr det vanskelig for forskerne ÃĨ eksperimentere med disse rammeverkene enkelt. For ÃĨ motvirke dette problemet, tilbyr MarkLLM, et ÃĨpen kilde-verktÃļy for vannmerking, et utvidbart og samlet rammeverk for ÃĨ implementere LLM-vannmerkingalgoritmer samtidig som det tilbyr brukervennlige grensesnitt for ÃĨ sikre enkelhet og tilgang. Videre stÃļtter MarkLLM-rammeverket automatisk visualisering av mekanismene til disse rammeverkene, og Ãļker dermed forstÃĨelsen av disse modellene. MarkLLM-rammeverket tilbyr et komprehensivt sett med 12 verktÃļy som dekker tre perspektiver samt to automatiserte evalueringsspor for ÃĨ evaluere dens ytelse. Denne artikkelen har som mÃĨl ÃĨ dekke MarkLLM-rammeverket i dybden, og vi utforsker mekanismen, metodikken, arkitekturen til rammeverket samt sammenligningen med state-of-the-art-rammeverk. La oss begynne.

MarkLLM: Et LLM-vannmerkingverktÃļy

Oppblomstringen av store sprÃĨkmodellrammeverk som LLaMA, GPT-4, ChatGPT og mer har betydelig fremmet evnen til AI-modeller til ÃĨ utfÃļre bestemte oppgaver, inkludert kreativ skriving, innholdforstÃĨelse, formasjonsgjennvinning og mye mer. Likevel, sammen med de bemerkelsesverdige fordelene forbundet med den eksepsjonelle dyktigheten til nÃĨvÃĶrende store sprÃĨkmodeller, har visse risikoer dukket opp, inkludert akademisk papirghostwriting, LLM-generert falsk nyheter og fremstillinger, og individuell personliggjÃļring, for ÃĨ nevne noen. Gitt risikoene forbundet med disse problemene, er det avgjÃļrende ÃĨ utvikle pÃĨlitelige metoder med evnen til ÃĨ skille mellom LLM-generert og menneskeskapt innhold, et stÃļrre krav for ÃĨ sikre autentisiteten til digital kommunikasjon og forhindre spredningen av desinformasjon. I de siste ÃĨrene har LLM-vannmerking blitt anbefalt som en av de lÃļftende lÃļsningene for ÃĨ skille LLM-generert innhold fra menneskeskapt innhold, og ved ÃĨ innfÃļre distinkte egenskaper under tekstgenereringsprosessen, kan LLM-utdataer bli unikt identifisert ved hjelp av spesialdesignet detektorer. Likevel, pÃĨ grunn av spredningen og relativt komplekse algoritmer til LLM-vannmerkingrammeverk, samt diversifiseringen av evalueringmetrikker og perspektiver, har det blitt svÃĶrt vanskelig ÃĨ eksperimentere med disse rammeverkene.

For ÃĨ brokke den nÃĨvÃĶrende gapen, prÃļver MarkLLM-rammeverket ÃĨ bidra med fÃļlgende. MARKLLM tilbyr konsistente og brukervennlige grensesnitt for ÃĨ laste algoritmer, generere vannmerket tekst, utfÃļre detekteringsprosesser og samle data for visualisering. Det tilbyr tilpassede visualiseringslÃļsninger for begge hovedvannmerkingsalgoritmfamilier, som lar brukerne se hvordan forskjellige algoritmer fungerer under ulike konfigurasjoner med eksempler fra virkeligheten. VerktÃļyet inkluderer en komprehensiv evalueringmodul med 12 verktÃļy som addreser detekterbarhet, robusthet og tekstkvalitetspÃĨvirkning. Videre har det to typer automatiserte evalueringsspor som stÃļtter brukerdefinerte datasett, modeller, evalueringmetrikker og angrep, og muliggjÃļr fleksible og grundige vurderinger. Designet med en modulÃĶr, lÃļst koblet arkitektur, forbedrer MarkLLM skalerbarhet og fleksibilitet. Dette designvalget stÃļtter integreringen av nye algoritmer, innovative visualiseringsmetoder og utvidelsen av evalueringverktÃļyet av fremtidige utviklere.

Mange vannmerkingalgoritmer har blitt foreslÃĨtt, men deres unike implementeringsmetoder prioriterer ofte bestemte krav over standardisering, noe som fÃļrer til flere problemer

  1. Mangel pÃĨ standardisering i klasseutforming: Dette krever betydelig innsats for ÃĨ optimalisere eller utvide eksisterende metoder pÃĨ grunn av utilstrekkelig standardiserte klasseutforminger.
  2. Mangel pÃĨ enhetlighet i toppnivÃĨkallgrensesnitt: Ulike grensesnitt gjÃļr batchbehandling og replikering av forskjellige algoritmer tungvint og arbeidskrevende.
  3. Kodestandardproblemer: Utfordringer inkluderer behovet for ÃĨ modifisere innstillinger over flere kodefragmenter og inkonsistent dokumentasjon, noe som kompliserer tilpasning og effektiv bruk. Hardkodede verdier og inkonsistent feilhÃĨndtering hindrer ytterligere tilpasnings- og feilsÃļkingsforsÃļk.

For ÃĨ addresse disse problemene, tilbyr vÃĨrt verktÃļy et samlet implementeringsrammeverk som muliggjÃļr enkel pÃĨkalling av ulike state-of-the-art-algoritmer under fleksible konfigurasjoner. Videre ÃĨpner vÃĨr nÃļye designet klassestruktur veien for fremtidige utvidelser. FÃļlgende figur demonstrerer designet til dette samlede implementeringsrammeverket.

PÃĨ grunn av rammeverkets distributive design, er det enkelt for utviklere ÃĨ legge til ytterligere toppnivÃĨgrensesnitt til en bestemt vannmerkealgoritmklassen uten ÃĨ bekymre seg for ÃĨ pÃĨvirke andre algoritmer.

MarkLLM: Arkitektur og Metodikk

LLM-vannmerkingsteknikker er hovedsakelig inndelt i to kategorier: KGW-familien og Christ-familien. KGW-familien modifiserer logittene produsert av LLM for ÃĨ opprette vannmerket utdata ved ÃĨ kategorisere vokabularet i en grÃļnn liste og en rÃļd liste basert pÃĨ den foregÃĨende token. Forvrengning introduseres til logittene av grÃļnn liste-tokens under tekstgenerering, som favoriserer disse tokenene i den produserte teksten. En statistisk metode beregnes deretter fra proporsjonen av grÃļnne ord, og en terskel etableres for ÃĨ skille mellom vannmerket og ikke-vannmerket tekst. Forbedringer av KGW-metoden inkluderer forbedret listeoppdeling, bedre logitt-manipulasjon, Ãļkt vannmerkeinformasjonskapasitet, motstand mot vannmerkefjerningsangrep og evnen til ÃĨ detektere vannmerker offentlig.

PÃĨ den andre siden, endrer Christ-familien utvalgsprosessen under LLM-tekstgenerering, og innfÃļrer et vannmerke ved ÃĨ endre hvordan token velges. Begge vannmerkingfamilier har som mÃĨl ÃĨ balansere vannmerkedetekterbarhet med tekstkvalitet, og mÃļter utfordringer som robusthet i varierende entropiinnstillinger, Ãļkt vannmerkeinformasjonskapasitet og beskyttelse mot fjerningsforsÃļk. Nyere forskning har fokusert pÃĨ ÃĨ forbedre listeoppdeling og logitt-manipulasjon, Ãļke vannmerkeinformasjonskapasitet, utvikle metoder for ÃĨ motstÃĨ vannmerkefjerning og muliggjÃļre offentlig deteksjon. Til slutt er LLM-vannmerking avgjÃļrende for den etiske og ansvarlige bruken av store sprÃĨkmodeller, og gir en metode for ÃĨ spore og verifisere LLM-generert tekst. KGW- og Christ-familien tilbyr to distinkte tilnÃĶrminger, hver med unike styrker og anvendelser, og utvikler seg kontinuerlig gjennom pÃĨgÃĨende forskning og innovasjon.

Automatisert Komprehensiv Evaluering

Evaluering av en LLM-vannmerkingalgoritme er en kompleks oppgave. FÃļrst og fremst, krever det overveielse av ulike aspekter, inkludert vannmerkedetekterbarhet, robusthet mot tampering og pÃĨvirkning pÃĨ tekstkvalitet. For det andre, kan evalueringer fra hver perspektiv kreve ulike metrikker, angreps-scenarier og oppgaver. Videre, inkluderer evaluering vanligvis flere trinn, som modell- og datasettvalg, vannmerket tekstgenerering, etterbehandling, vannmerkedeteksjon, teksttampering og metodeberegnning. For ÃĨ muliggjÃļre enkel og grundig evaluering av LLM-vannmerkingalgoritmer, tilbyr MarkLLM tolv brukervennlige verktÃļy, inkludert ulike metodekalkulatorer og angripere som dekker de tre ovennevnte evalueringperspektivene. Videre tilbyr MARKLLM to typer automatiserte demo-spor, hvis moduler kan tilpasses og samles fleksibelt, og lar brukerne enkelt konfigurere og bruke.

For aspektet detekterbarhet, krever de fleste vannmerkingalgoritmer ultimate ÃĨ angi en terskel for ÃĨ skille mellom vannmerket og ikke-vannmerket tekst. Vi tilbyr en grundig suksesshastighetskalkulator som bruker en fast terskel. Videre, for ÃĨ minimere pÃĨvirkningen av terskelvalg pÃĨ detekterbarhet, tilbyr vi ogsÃĨ en kalkulator som stÃļtter dynamisk terskelvalg. Dette verktÃļyet kan bestemme terskelen som gir den beste F1-score eller velge en terskel basert pÃĨ en brukerdefinert mÃĨl false positiv rate (FPR).

For aspektet robusthet, tilbyr MARKLLM tre ordnivÃĨteksttamperingsangrep: tilfeldig orddeleasjon i et spesifisert forhold, tilfeldig synonym-erstatning ved hjelp av WordNet som synonymsett, og kontekst-avhengig synonym-erstatning ved hjelp av BERT som innbettingsmodell. Videre tilbyr det to dokumentnivÃĨteksttamperingsangrep: parafrasering av konteksten via OpenAI API eller Dipper-modellen. For aspektet tekstkvalitet tilbyr MARKLLM to direkte analyseverktÃļy: en forvirringskalkulator for ÃĨ mÃĨle flyt og en diversitetskalkulator for ÃĨ evaluere variasjonen av tekster. For ÃĨ analysere pÃĨvirkningen av vannmerking pÃĨ tekstens nytte i bestemte nedstrÃļmsoppgaver, tilbyr vi en BLEU-kalkulator for maskinoversettelsesoppgaver og en bestÃĨende dommer for kodegenereringsoppgaver. Videre, gitt nÃĨvÃĶrende metoder for ÃĨ sammenligne kvaliteten pÃĨ vannmerket og uvannmerket tekst, som inkluderer ÃĨ bruke en sterkere LLM for vurdering, tilbyr MarkLLM ogsÃĨ en GPT-diskriminatore som bruker GPT-4 for ÃĨ sammenligne tekstkvalitet.

Evalueringsspor

For ÃĨ muliggjÃļre automatisert evaluering av LLM-vannmerkingalgoritmer, tilbyr MARKLLM to evalueringsspor: ett for ÃĨ vurdere vannmerkedetekterbarhet med og uten angrep, og ett for ÃĨ analysere pÃĨvirkningen av disse algoritmene pÃĨ tekstkvalitet. FÃļlgelig har vi implementert to spor: WMDetect3 og UWMDetect4. Den primÃĶre forskjellen mellom dem ligger i tekstgenereringsfasen. Den fÃļrste krever bruk av generate_watermarked_text-metoden fra vannmerkingalgoritmen, mens den andre avhenger av tekst_kilden-parameteren for ÃĨ bestemme om ÃĨ hente naturlig tekst fra et datasett eller ÃĨ pÃĨkalle generate_unwatermarked_text-metoden.

For ÃĨ evaluere pÃĨvirkningen av vannmerking pÃĨ tekstkvalitet, genereres par av vannmerket og uvannmerket tekst. Tekstene, sammen med andre nÃļdvendige innstillinger, behandles og matet inn i en bestemt tekstkvalitetsanalyse for ÃĨ produsere detaljert analyse og sammenligningsresultater. FÃļlgelig har vi implementert tre spor for ulike evalueringsscenarier:

  1. DirectQual.5: Dette sporet er spesifikt designet for ÃĨ analysere tekstens kvalitet ved ÃĨ sammenligne karakteristika til vannmerket tekst med uvannmerket tekst. Det vurderer metrikker som forvirring (PPL) og log-diversitet, uten ÃĨ kreve eksterne referansekst.
  2. RefQual.6: Dette sporet vurderer tekstkvalitet ved ÃĨ sammenligne bÃĨde vannmerket og uvannmerket tekst med en felles referansekst. Det mÃĨler graden av likhet eller avvik fra referanseksten, og gjÃļr det ideelt for scenarier som krever bestemte nedstrÃļmsoppgaver for ÃĨ vurdere tekstkvalitet, som maskinoversettelse og kodegenerering.
  3. ExDisQual.7: Dette sporet bruker en ekstern dommer, som GPT-4 (OpenAI, 2023), for ÃĨ vurdere kvaliteten pÃĨ bÃĨde vannmerket og uvannmerket tekst. Diskriminatoren vurderer tekstene basert pÃĨ brukerdefinerte oppgavebeskrivelser, og identifiserer eventuell nedgradering eller bevarelse av kvalitet pÃĨ grunn av vannmerking. Denne metoden er spesielt verdifull nÃĨr en avansert, AI-basert analyse av de subtile effektene av vannmerking kreves.

MarkLLM: Eksperimenter og Resultater

For ÃĨ evaluere dens ytelse, gjennomfÃļrer MarkLLM-rammeverket evalueringer pÃĨ ni ulike algoritmer, og vurderer deres pÃĨvirkning, robusthet og detekterbarhet pÃĨ tekstkvalitet.

Tabellen over inneholder evalueringresultatene for ÃĨ vurdere detekterbarheten til ni algoritmer som stÃļttes i MarkLLM. Dynamisk terskeljustering brukes for ÃĨ evaluere vannmerkedetekterbarhet, med tre innstillinger: under en mÃĨl FPR pÃĨ 10%, under en mÃĨl FPR pÃĨ 1%, og under betingelser for optimal F1-score-ytelse. 200 vannmerket tekster genereres, mens 200 uvannmerket tekster tjener som negative eksempler. Vi leverer TPR og F1-score under dynamisk terskeljustering for 10% og 1% FPR, samt TPR, TNR, FPR, FNR, P, R, F1, ACC ved optimal ytelse.

Slutt tanker

I denne artikkelen har vi talt om MarkLLM, et ÃĨpen kilde-verktÃļy for vannmerking som tilbyr et utvidbart og samlet rammeverk for ÃĨ implementere LLM-vannmerkingalgoritmer samtidig som det tilbyr brukervennlige grensesnitt for ÃĨ sikre enkelhet og tilgang. Videre stÃļtter MarkLLM-rammeverket automatisk visualisering av mekanismene til disse rammeverkene, og Ãļker dermed forstÃĨelsen av disse modellene. MarkLLM-rammeverket tilbyr et komprehensivt sett med 12 verktÃļy som dekker tre perspektiver samt to automatiserte evalueringsspor for ÃĨ evaluere dens ytelse.

En ingeniÃļr av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjÃĶrlighet og forstÃĨelse av AI og ML, dedikert til ÃĨ forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.