AI-modeller och plattformar
MarkLLM: En Öppen Källkods-Toolkit för LLM Vattenstämpel
LLM-vattenstämpel, som integrerar otillgängliga men upptäckbara signaler i modellutdata för att identifiera text genererad av LLM, är viktigt för att förhindra missbruk av stora språkmodeller. Dessa vattenstämpeltekniker delas huvudsakligen in i två kategorier: KGW-familjen och Kristusfamiljen. KGW-familjen modifierar logits som produceras av LLM för att skapa vattenstämplad utdata genom att kategorisera ordförrådet i en grön lista och en röd lista baserat på den föregående token. Bias introduceras till logits av gröna listtokens under textgenerering, vilket gynnar dessa token i den producerade texten. En statistisk måttstock beräknas från andelen gröna ord, och en tröskel etableras för att skilja mellan vattenstämplad och icke-vattenstämplad text. Förbättringar av KGW-metoden inkluderar förbättrad listpartitionering, bättre logitmanipulation, ökad vattenstämpelinformationkapacitet, motstånd mot vattenstämpelborttagningsattacker och möjligheten att upptäcka vattenstämplar offentligt.
Tvärtemot, modifierar Kristusfamiljen urvalprocessen under LLM-textgenerering, inbäddar en vattenstämpel genom att ändra hur token väljs. Båda vattenstämpelfamiljerna syftar till att balansera vattenstämpeldetekterbarhet med textkvalitet, som hanterar utmaningar som robusthet i varierande entropiinställningar, ökad vattenstämpelinformationkapacitet och skydd mot borttagningsförsök. Nylig forskning har fokuserat på att förbättra listpartitionering och logitmanipulation, öka vattenstämpelinformationkapacitet, utveckla metoder för att motstå vattenstämpelborttagning och möjliggöra offentlig upptäckt. I slutändan är LLM-vattenstämpel avgörande för det etiska och ansvarsfulla användandet av stora språkmodeller, som tillhandahåller en metod för att spåra och verifiera LLM-genererad text. KGW- och Kristusfamiljerna erbjuder två distinkta tillvägagångssätt, var och en med unika styrkor och tillämpningar, som kontinuerligt utvecklas genom pågående forskning och innovation.
På grund av förmågan hos LLM-vattenstämpelframework att inbädda algoritmiskt upptäckbara signaler i modellutdata för att identifiera text genererad av en LLM-ram är det avgörande för att mildra riskerna förknippade med missbruk av stora språkmodeller. Men det finns ett överflöd av LLM-vattenstämpelframework på marknaden för närvarande, var och en med sina egna perspektiv och utvärderingsförfaranden, vilket gör det svårt för forskare att experimentera med dessa ramverk lätt. För att motverka detta problem erbjuder MarkLLM, en öppen källkods-toolkit för vattenstämpel, ett utbyggbart och enhetligt ramverk för att implementera LLM-vattenstämpelalgoritmer samtidigt som det tillhandahåller användarvänliga gränssnitt för att säkerställa enkelhet och tillgänglighet. Dessutom stöder MarkLLM-ramverket automatisk visualisering av mekanismerna för dessa ramverk, vilket förbättrar förståelsen av dessa modeller. MarkLLM-ramverket erbjuder ett omfattande paket med 12 verktyg som täcker tre perspektiv samt två automatiserade utvärderingspipelines för att utvärdera dess prestanda. Den här artikeln syftar till att täcka MarkLLM-ramverket i detalj, och vi utforskar mekanismen, metodiken, arkitekturen i ramverket samt dess jämförelse med state-of-the-art-ramverk. Så låt oss komma igång.
MarkLLM: En LLM Vattenstämpel-Toolkit
Uppkomsten av stora språkmodellsramverk som LLaMA, GPT-4, ChatGPT och fler har avsevärt främjat förmågan hos AI-modeller att utföra specifika uppgifter, inklusive kreativt skrivande, innehållsförståelse, formningsåtervinning och mycket mer. Men tillsammans med de anmärkningsvärda fördelarna som är förknippade med den exceptionella färdigheten hos nuvarande stora språkmodeller, har vissa risker uppstått, inklusive akademisk pappersspökskrivning, LLM-genererad falsk nyhet och avbildningar, och individuell imitation, för att nämna några. Med tanke på riskerna som är förknippade med dessa problem, är det avgörande att utveckla tillförlitliga metoder med förmågan att skilja mellan LLM-genererad och mänsklig innehåll, en stor krav för att säkerställa äktheten hos digital kommunikation och förhindra spridning av desinformation. Under de senaste åren har LLM-vattenstämpel rekommenderats som en av de lovande lösningarna för att skilja LLM-genererat innehåll från mänskligt innehåll, och genom att införa distinkta funktioner under textgenereringsprocessen, kan LLM-utdata unikt identifieras med hjälp av särskilt utformade detektorer. Men på grund av spridning och relativt komplexa algoritmer för LLM-vattenstämpelframework, tillsammans med diversifieringen av utvärderingsmetriker och perspektiv, har det blivit otroligt svårt att experimentera med dessa ramverk.
För att överbrygga det nuvarande gapet, försöker MarkLLM-ramverket att bidra till följande. MarkLLM erbjuder konsekventa och användarvänliga gränssnitt för att ladda algoritmer, generera vattenstämplad text, utföra upptäcktsprocesser och samla in data för visualisering. Det tillhandahåller anpassade visualiseringslösningar för båda stora vattenstämpelalgoritmiska familjer, vilket tillåter användare att se hur olika algoritmer fungerar under olika konfigurationer med verkliga exempel. Verktyget innehåller en omfattande utvärderingsmodul med 12 verktyg som hanterar upptäckbarhet, robusthet och textkvalitetspåverkan. Dessutom innehåller det två typer av automatiserade utvärderingspipelines som stöder användardefiniering av datamängder, modeller, utvärderingsmetriker och attacker, vilket underlättar flexibla och omfattande bedömningar. Utformad med en modulär, löst kopplad arkitektur, förbättrar MarkLLM skalbarhet och flexibilitet. Detta designval stöder integrationen av nya algoritmer, innovativa visualiseringstekniker och utvidgningen av utvärderingsverktyget av framtida utvecklare.
Många vattenstämpelalgoritmer har föreslagits, men deras unika implementeringsmetoder prioriterar ofta specifika krav över standardisering, vilket leder till flera problem
- Brist på standardisering i klassdesign: Detta kräver betydande ansträngningar för att optimera eller utöka befintliga metoder på grund av otillräckligt standardiserade klassdesigner.
- Brist på enhetlighet i toppnivåanropssnitt: Oenheterliga gränssnitt gör batchbearbetning och replikering av olika algoritmer besvärliga och arbetsintensiva.
- Kodstandardproblem: Utmaningar inkluderar behovet av att modifiera inställningar över flera kodsegment och inkonsekvent dokumentation, vilket komplicerar anpassning och effektiv användning. Hårdkodade värden och inkonsekvent felhantering försvårar dessutom anpassnings- och felsökningsförsök.
För att hantera dessa problem erbjuder vår toolkit ett enhetligt implementeringsramverk som möjliggör bekväm anropning av olika state-of-the-art-algoritmer under flexibla konfigurationer. Dessutom möjliggör vår noggrant utformade klassstruktur framtida utvidgningar. Följande figur visar designen av detta enhetliga implementeringsramverk.
På grund av ramverkets distributiva design är det enkelt för utvecklare att lägga till ytterligare toppnivågränssnitt till valfri vattenstämpelalgoritmisk klass utan oro för att påverka andra algoritmer.
MarkLLM: Arkitektur och Metodik
LLM-vattenstämpeltekniker delas huvudsakligen in i två kategorier: KGW-familjen och Kristusfamiljen. KGW-familjen modifierar logits som produceras av LLM för att skapa vattenstämplad utdata genom att kategorisera ordförrådet i en grön lista och en röd lista baserat på den föregående token. Bias introduceras till logits av gröna listtokens under textgenerering, vilket gynnar dessa token i den producerade texten. En statistisk måttstock beräknas från andelen gröna ord, och en tröskel etableras för att skilja mellan vattenstämplad och icke-vattenstämplad text. Förbättringar av KGW-metoden inkluderar förbättrad listpartitionering, bättre logitmanipulation, ökad vattenstämpelinformationkapacitet, motstånd mot vattenstämpelborttagningsattacker och möjligheten att upptäcka vattenstämplar offentligt.
Tvärtemot, modifierar Kristusfamiljen urvalprocessen under LLM-textgenerering, inbäddar en vattenstämpel genom att ändra hur token väljs. Båda vattenstämpelfamiljerna syftar till att balansera vattenstämpeldetekterbarhet med textkvalitet, som hanterar utmaningar som robusthet i varierande entropiinställningar, ökad vattenstämpelinformationkapacitet och skydd mot borttagningsförsök. Nylig forskning har fokuserat på att förbättra listpartitionering och logitmanipulation, öka vattenstämpelinformationkapacitet, utveckla metoder för att motstå vattenstämpelborttagning och möjliggöra offentlig upptäckt. I slutändan är LLM-vattenstämpel avgörande för det etiska och ansvarsfulla användandet av stora språkmodeller, som tillhandahåller en metod för att spåra och verifiera LLM-genererad text. KGW- och Kristusfamiljerna erbjuder två distinkta tillvägagångssätt, var och en med unika styrkor och tillämpningar, som kontinuerligt utvecklas genom pågående forskning och innovation.
Automatiserad Omfattande Utvärdering
Att utvärdera en LLM-vattenstämpelalgoritm är en komplex uppgift. Först kräver det att man överväger olika aspekter, inklusive vattenstämpeldetekterbarhet, robusthet mot manipulering och påverkan på textkvalitet. För det andra kan utvärderingar från varje perspektiv kräva olika metriker, attackscenarier och uppgifter. Dessutom kräver en utvärdering vanligtvis flera steg, såsom modell- och datamängdval, vattenstämplad textgenerering, efterbearbetning, vattenstämpeldetektering, textmanipulering och måttberäkning. För att underlätta en bekväm och omfattande utvärdering av LLM-vattenstämpelalgoritmer erbjuder MarkLLM tolv användarvänliga verktyg, inklusive olika måttberäknare och angripare som täcker de tre ovannämnda utvärderingsperspektiven. Dessutom erbjuder MarkLLM två typer av automatiserade demopipelines, vars moduler kan anpassas och sammansättas flexibelt, vilket möjliggör enkel konfiguration och användning.
För aspekten av detekterbarhet kräver de flesta vattenstämpelalgoritmer slutligen att man specificerar en tröskel för att skilja mellan vattenstämplad och icke-vattenstämplad text. Vi tillhandahåller en grundläggande framgångshastighetsberäknare med en fast tröskel. Dessutom, för att minimera påverkan av tröskelvalet på detekterbarhet, erbjuder vi också en beräknare som stöder dynamisk tröskelval. Detta verktyg kan bestämma tröskeln som ger den bästa F1-poängen eller välja en tröskel baserat på en användarspecificerad målfalsk positiv frekvens (FPR).
För aspekten av robusthet erbjuder MarkLLM tre ordnivåtextmanipuleringar: slumpmässig ordradering vid en specificerad ratio, slumpmässig synonymersättning med WordNet som synonymuppsättning och kontextmedveten synonymersättning med BERT som inbäddningsmodell. Dessutom erbjuds två dokumentnivåtextmanipuleringar: parafrasering av kontext via OpenAI API eller Dipper-modellen. För aspekten av textkvalitet erbjuder MarkLLM två direkta analysverktyg: en förvirringsberäknare för att mäta flyt och en diversitetsberäknare för att utvärdera variabiliteten hos texter. För att analysera påverkan av vattenstämpel på textanvändbarhet i specifika nedströmsuppgifter tillhandahåller vi en BLEU-beräknare för maskinöversättningsuppgifter och en pass-eller-icke-domare för kodgenereringsuppgifter. Dessutom, med tanke på de nuvarande metoderna för att jämföra kvaliteten på vattenstämplad och icke-vattenstämplad text, som inkluderar att använda en starkare LLM för bedömning, erbjuder MarkLLM också en GPT-diskriminatör, som använder GPT-4 för att jämföra textkvalitet.
Utvärderingspipelines
För att underlätta en automatiserad utvärdering av LLM-vattenstämpelalgoritmer erbjuder MarkLLM två utvärderingspipelines: en för att bedöma vattenstämpeldetekterbarhet med och utan attacker, och en för att analysera påverkan av dessa algoritmer på textkvalitet. Följande pipeline har implementerats: WMDetect3 och UWMDetect4. Den primära skillnaden mellan dem ligger i textgenereringsfasen. Den första kräver användning av generate_watermarked_text-metoden från vattenstämpelalgoritmen, medan den andra beror på text_source-parametern för att bestämma om man ska hämta naturlig text direkt från en datamängd eller anropa generate_unwatermarked_text-metoden.
För att utvärdera påverkan av vattenstämpel på textkvalitet genereras par av vattenstämplad och icke-vattenstämplad text. Texterna, tillsammans med andra nödvändiga indata, bearbetas och matas in i en utvald textkvalitetsanalysator för att producera detaljerad analys och jämförelseresultat. Följande pipeline har implementerats för olika utvärderingsscenarier:
- DirectQual.5: Denna pipeline är specifikt utformad för att analysera textkvalitet genom att direkt jämföra egenskaperna hos vattenstämplad text med de hos icke-vattenstämplad text. Den utvärderar mått som förvirring (PPL) och logaritmisk diversitet, utan behov av externa referenstexter.
- RefQual.6: Denna pipeline utvärderar textkvalitet genom att jämföra både vattenstämplad och icke-vattenstämplad text med en gemensam referenstext. Den mäter graden av likhet eller avvikelse från referenstexten, vilket gör den idealisk för scenarier som kräver specifika nedströmsuppgifter för att utvärdera textkvalitet, såsom maskinöversättning och kodgenerering.
- ExDisQual.7: Denna pipeline använder en extern bedömare, såsom GPT-4 (OpenAI, 2023), för att utvärdera kvaliteten på både vattenstämplad och icke-vattenstämplad text. Diskriminatoren utvärderar texterna baserat på användardefinierade uppgiftsbeskrivningar, vilket identifierar eventuell kvalitetsförsämring eller bevarande på grund av vattenstämpel. Denna metod är särskilt värdefull när en avancerad, AI-baserad analys av de subtila effekterna av vattenstämpel krävs.
MarkLLM: Experiment och Resultat
För att utvärdera dess prestanda, genomför MarkLLM-ramverket utvärderingar av nio olika algoritmer och bedömer deras påverkan, robusthet och detekterbarhet på textkvalitet.

Ovanstående tabell innehåller utvärderingsresultaten för att bedöma detekterbarheten hos nio algoritmer som stöds i MarkLLM. Dynamisk tröskeljustering används för att utvärdera vattenstämpeldetekterbarhet, med tre inställningar tillgängliga: under en målfalsk positiv frekvens på 10%, under en målfalsk positiv frekvens på 1% och under förhållanden för optimal F1-prestanda. 200 vattenstämplade texter genereras, medan 200 icke-vattenstämplade texter fungerar som negativa exempel. Vi tillhandahåller TPR och F1-poäng under dynamisk tröskeljustering för 10% och 1% FPR, tillsammans med TPR, TNR, FPR, FNR, P, R, F1, ACC vid optimal prestanda. Följande tabell innehåller utvärderingsresultaten för att bedöma robustheten hos nio algoritmer som stöds i MarkLLM. För varje attack genereras 200 vattenstämplade texter och manipuleras sedan, med ytterligare 200 icke-vattenstämplade texter som fungerar som negativa exempel. Vi rapporterar TPR och F1-poäng vid optimal prestanda under varje omständighet.

Slutliga Tankar
I denna artikel har vi talat om MarkLLM, en öppen källkods-toolkit för vattenstämpel som erbjuder ett utbyggbart och enhetligt ramverk för att implementera LLM-vattenstämpelalgoritmer samtidigt som det tillhandahåller användarvänliga gränssnitt för att säkerställa enkelhet och tillgänglighet. Dessutom stöder MarkLLM-ramverket automatisk visualisering av mekanismerna för dessa ramverk, vilket förbättrar förståelsen av dessa modeller. MarkLLM-ramverket erbjuder ett omfattande paket med 12 verktyg som täcker tre perspektiv samt två automatiserade utvärderingspipelines för att utvärdera dess prestanda.












