AI-modellen en platforms
MARKLLM: Een Open-Source Toolkit voor LLM Watermerken
LLM-watermerken, die onzichtbare maar detecteerbare signalen integreren in modeluitvoer om tekst gegenereerd door LLM’s te identificeren, zijn essentieel voor het voorkomen van misbruik van grote taalmodellen. Deze watermerktechnieken zijn voornamelijk onderverdeeld in twee categorieën: de KGW-familie en de Christ-familie. De KGW-familie wijzigt de logits die door de LLM worden gegenereerd om een watermerkuitvoer te creëren door het vocabulaire in te delen in een groene lijst en een rode lijst op basis van het voorgaande token. Er wordt een bias geïntroduceerd in de logits van de groene lijsttokens tijdens de tekstgeneratie, waardoor deze tokens in de gegenereerde tekst worden bevoroordeeld. Een statistische metric wordt vervolgens berekend uit de verhouding van groene woorden, en een drempelwaarde wordt ingesteld om watermerk- en niet-watermerk-tekst te onderscheiden. Verbeteringen aan de KGW-methode omvatten verbeterde lijstpartitionering, betere logitmanipulatie, verhoogde watermerkinformatiecapaciteit, weerstand tegen watermerkverwijderingsaanvallen en de mogelijkheid om watermerken openbaar te detecteren.
Anderszins wijzigt de Christ-familie het steekproces tijdens de LLM-tekstgeneratie, waardoor een watermerk wordt ingebed door te veranderen hoe tokens worden geselecteerd. Beide watermerkfamilies hebben als doel om watermerkdetecteerbaarheid in balans te brengen met tekstkwaliteit, waarbij uitdagingen zoals robuustheid in variabele entropie-instellingen, verhoogde watermerkinformatiecapaciteit en bescherming tegen verwijderingspogingen worden aangepakt. Recent onderzoek heeft zich gericht op het verfijnen van lijstpartitionering en logitmanipulatie, het verhogen van watermerkinformatiecapaciteit, het ontwikkelen van methoden om watermerkverwijdering te weerstaan en het mogelijk maken van openbare detectie. Uiteindelijk is LLM-watermerken cruciaal voor het ethische en verantwoordelijke gebruik van grote taalmodellen, waardoor een methode wordt geboden om LLM-gegenereerde tekst te traceren en te verifiëren. De KGW- en Christ-families bieden twee verschillende benaderingen, elk met unieke sterke punten en toepassingen, die voortdurend evolueren door voortdurend onderzoek en innovatie.
Door de mogelijkheid van LLM-watermerkframeworks om algoritme-detecteerbare signalen in modeluitvoer te embedden om tekst gegenereerd door een LLM-framework te identificeren, speelt een cruciale rol bij het mitigeren van de risico’s geassocieerd met het misbruik van grote taalmodellen. Echter, is er een overvloed aan LLM-watermerkframeworks op de markt momenteel, elk met hun eigen perspectieven en evaluatieprocedures, waardoor het voor onderzoekers moeilijk is om gemakkelijk met deze frameworks te experimenteren. Om dit probleem te counteren, biedt MarkLLM, een open-source toolkit voor watermerken, een uitbreidbaar en uniform framework om LLM-watermerkalgoritmen te implementeren, terwijl het gebruikersvriendelijke interfaces biedt om gemakkelijk te gebruiken en toegang te verlenen. Bovendien ondersteunt de MarkLLM-framework automatische visualisatie van de mechanismen van deze frameworks, waardoor de begrijpelijkheid van deze modellen wordt verbeterd. De MarkLLM-framework biedt een uitgebreide set van 12 tools die drie perspectieven dekken, evenals twee geautomatiseerde evaluatiepijpleidingen voor het evalueren van de prestaties. Dit artikel heeft als doel om de MarkLLM-framework in detail te behandelen, en we onderzoeken de mechanisme, de methodologie, de architectuur van de framework, evenals de vergelijking met state-of-the-art frameworks. Laten we beginnen.
MarkLLM: Een LLM Watermerk Toolkit
De opkomst van grote taalmodel frameworks zoals LLaMA, GPT-4, ChatGPT en meer heeft de mogelijkheden van AI-modellen om specifieke taken uit te voeren aanzienlijk verbeterd, waaronder creatief schrijven, inhoudsverwerking, vormingsoverdracht en veel meer. Echter, samen met de opmerkelijke voordelen geassocieerd met de uitzonderlijke vaardigheid van huidige grote taalmodellen, zijn bepaalde risico’s naar voren gekomen, waaronder academische paper ghostwriting, LLM-gegenereerde valse nieuws en afbeeldingen, en individuele impersonatie, om er een paar te noemen. Gezien de risico’s geassocieerd met deze kwesties, is het essentieel om betrouwbare methoden te ontwikkelen die in staat zijn om onderscheid te maken tussen LLM-gegenereerde en menselijke inhoud, een belangrijke vereiste om de authenticiteit van digitale communicatie te waarborgen en de verspreiding van misinformatie te voorkomen. Gedurende de afgelopen jaren is LLM-watermerken aanbevolen als een van de veelbelovende oplossingen om LLM-gegenereerde inhoud van menselijke inhoud te onderscheiden, en door het incorporeren van distincte kenmerken tijdens het tekstgeneratieproces, kunnen LLM-uitvoer uniek worden geïdentificeerd met behulp van speciaal ontworpen detectors. Echter, vanwege de proliferatie en relatief complexe algoritmen van LLM-watermerkframeworks, evenals de diversificatie van evaluatiemetrics en perspectieven, is het uiterst moeilijk geworden om met deze frameworks te experimenteren.
Om de huidige kloof te overbruggen, probeert de MarkLLM-framework de volgende bijdragen te leveren. MARKLLM biedt consistente en gebruikersvriendelijke interfaces voor het laden van algoritmen, het genereren van watermerk-tekst, het uitvoeren van detectieprocessen en het verzamelen van gegevens voor visualisatie. Het biedt aangepaste visualisatieoplossingen voor beide belangrijkste watermerkalgoritme-families, waardoor gebruikers kunnen zien hoe verschillende algoritmen werken onder verschillende configuraties met echte voorbeelden. De toolkit omvat een uitgebreide evaluatiemodule met 12 tools die detecteerbaarheid, robuustheid en tekstkwaliteitimpact aanpakken. Bovendien bevat het twee soorten geautomatiseerde evaluatiepijpleidingen die gebruikersaanpassing van datasets, modellen, evaluatiemetrics en aanvallen ondersteunen, waardoor flexibele en grondige beoordelingen mogelijk worden. Ontworpen met een modulair, losjes gekoppeld architectuur, verhoogt MARKLLM schaalbaarheid en flexibiliteit. Deze ontwerpkeuze ondersteunt de integratie van nieuwe algoritmen, innovatieve visualisatietechnieken en de uitbreiding van de evaluatietoolkit door toekomstige ontwikkelaars.
Talrijke watermerkalgoritmen zijn voorgesteld, maar hun unieke implementatiebenaderingen geven vaak prioriteit aan specifieke vereisten boven standaardisatie, waardoor verschillende problemen ontstaan
- Geen standaardisatie in klasse-ontwerp: Dit vereist aanzienlijke inspanning om bestaande methoden te optimaliseren of uit te breiden vanwege onvoldoende gestandaardiseerde klasse-ontwerpen.
- Geen uniformiteit in top-niveau-interfaces: Onconsistentie in interfaces maakt batchverwerking en replicatie van verschillende algoritmen omslachtig en arbeidsintensief.
- Code-standaardproblemen: Uitdagingen omvatten het wijzigen van instellingen in meerdere code-segmenten en inconsistentie in documentatie, waardoor aanpassing en effectief gebruik worden bemoeilijkt. Hardgecodeerde waarden en inconsistent foutafhandeling verhinderen aanpassings- en debug-inspanningen.
Om deze problemen aan te pakken, biedt onze toolkit een uniform implementatieframework dat het gemakkelijk maakt om verschillende state-of-the-art algoritmen onder flexibele configuraties aan te roepen. Bovendien biedt onze zorgvuldig ontworpen klassestructuur de weg voor toekomstige uitbreidingen. De volgende figuur toont het ontwerp van dit uniforme implementatieframework.
Vanwege het distributieve ontwerp van de framework is het voor ontwikkelaars eenvoudig om extra top-niveau-interfaces toe te voegen aan elke specifieke watermerkalgoritme-klasse zonder zich zorgen te maken over de impact op andere algoritmen.
MarkLLM: Architectuur en Methodologie
LLM-watermerktechnieken zijn voornamelijk onderverdeeld in twee categorieën: de KGW-familie en de Christ-familie. De KGW-familie wijzigt de logits die door de LLM worden gegenereerd om een watermerkuitvoer te creëren door het vocabulaire in te delen in een groene lijst en een rode lijst op basis van het voorgaande token. Er wordt een bias geïntroduceerd in de logits van de groene lijsttokens tijdens de tekstgeneratie, waardoor deze tokens in de gegenereerde tekst worden bevoroordeeld. Een statistische metric wordt vervolgens berekend uit de verhouding van groene woorden, en een drempelwaarde wordt ingesteld om watermerk- en niet-watermerk-tekst te onderscheiden. Verbeteringen aan de KGW-methode omvatten verbeterde lijstpartitionering, betere logitmanipulatie, verhoogde watermerkinformatiecapaciteit, weerstand tegen watermerkverwijderingsaanvallen en de mogelijkheid om watermerken openbaar te detecteren.
Anderszins wijzigt de Christ-familie het steekproces tijdens de LLM-tekstgeneratie, waardoor een watermerk wordt ingebed door te veranderen hoe tokens worden geselecteerd. Beide watermerkfamilies hebben als doel om watermerkdetecteerbaarheid in balans te brengen met tekstkwaliteit, waarbij uitdagingen zoals robuustheid in variabele entropie-instellingen, verhoogde watermerkinformatiecapaciteit en bescherming tegen verwijderingspogingen worden aangepakt. Recent onderzoek heeft zich gericht op het verfijnen van lijstpartitionering en logitmanipulatie, het verhogen van watermerkinformatiecapaciteit, het ontwikkelen van methoden om watermerkverwijdering te weerstaan en het mogelijk maken van openbare detectie. Uiteindelijk is LLM-watermerken cruciaal voor het ethische en verantwoordelijke gebruik van grote taalmodellen, waardoor een methode wordt geboden om LLM-gegenereerde tekst te traceren en te verifiëren. De KGW- en Christ-families bieden twee verschillende benaderingen, elk met unieke sterke punten en toepassingen, die voortdurend evolueren door voortdurend onderzoek en innovatie.
Geautomatiseerde Uitgebreide Evaluatie
Het evalueren van een LLM-watermerkalgoritme is een complexe taak. Ten eerste vereist het overweging van verschillende aspecten, waaronder watermerkdetecteerbaarheid, robuustheid tegen manipulatie en impact op tekstkwaliteit. Ten tweede vereisen evaluaties van elk perspectief mogelijk verschillende metrics, aanvals-scenario’s en taken. Bovendien omvat het uitvoeren van een evaluatie typisch meerdere stappen, zoals model- en datasetselectie, watermerk-tekstgeneratie, post-processing, watermerkdetectie, tekstmanipulatie en metric-berekening. Om een gemakkelijke en grondige evaluatie van LLM-watermerkalgoritmen te faciliteren, biedt MarkLLM twaalf gebruikersvriendelijke tools, waaronder verschillende metric-calculators en aanvallers die de drie genoemde evaluatieperspectieven dekken. Bovendien biedt MARKLLM twee soorten geautomatiseerde demo-pijpleidingen, waarvan de modules flexibel kunnen worden aangepast en samengesteld, waardoor gemakkelijke configuratie en gebruik mogelijk worden.
Voor het aspect van detecteerbaarheid vereisen de meeste watermerkalgoritmen uiteindelijk het specificeren van een drempelwaarde om watermerk- en niet-watermerk-tekst te onderscheiden. We bieden een basis-succesratecalculator met een vaste drempelwaarde. Bovendien, om de impact van drempelwaarde-selectie op detecteerbaarheid te minimaliseren, bieden we ook een calculator die dynamische drempelwaarde-selectie ondersteunt. Dit hulpmiddel kan de drempelwaarde bepalen die de beste F1-score oplevert of een drempelwaarde selecteren op basis van een door de gebruiker gespecificeerde doel-valse-positieve-ratio (FPR).
Voor het aspect van robuustheid biedt MARKLLM drie woordniveau-tekstmanipulatie-aanvallen: willekeurige woordverwijdering bij een gespecificeerd ratio, willekeurige synoniemvervanging met behulp van WordNet als synoniemset, en context-gevoelige synoniemvervanging met behulp van BERT als embedding-model. Bovendien worden twee documentniveau-tekstmanipulatie-aanvallen geboden: parafraseren van de context via OpenAI API of de Dipper-model. Voor het aspect van tekstkwaliteit biedt MARKLLM twee directe analysehulpmiddelen: een perplexity-calculator om vloeiendheid te meten en een diversiteitscalculator om de variabiliteit van teksten te evalueren. Om de impact van watermerken op tekstgebruik in specifieke downstream-taken te analyseren, bieden we een BLEU-calculator voor machinevertaaltaken en een pass-or-not-judger voor codegeneratietaken. Bovendien, gegeven de huidige methoden voor het vergelijken van de kwaliteit van watermerk- en niet-watermerk-tekst, die het gebruik van een sterkere LLM voor oordeel omvatten, biedt MarkLLM ook een GPT-discriminator, die GPT-4 gebruikt om tekstkwaliteit te vergelijken.
Evaluatiepijpleidingen
Om een geautomatiseerde evaluatie van LLM-watermerkalgoritmen te faciliteren, biedt MARKLLM twee evaluatiepijpleidingen: een voor het evalueren van watermerkdetecteerbaarheid met en zonder aanvallen, en een voor het analyseren van de impact van deze algoritmen op tekstkwaliteit. Volgend op dit proces, hebben we twee pijpleidingen geïmplementeerd: WMDetect3 en UWMDetect4. Het primaire verschil tussen hen ligt in de tekstgeneratiefase. De eerste vereist het gebruik van de generate_watermarked_text-methode van het watermerkalgoritme, terwijl de tweede afhankelijk is van de text_source-parameter om te bepalen of natuurlijke tekst rechtstreeks uit een dataset moet worden opgehaald of de generate_unwatermarked_text-methode moet worden aangeroepen.
Om de impact van watermerken op tekstkwaliteit te evalueren, worden paren van watermerk- en niet-watermerk-tekst gegenereerd. De teksten, samen met andere noodzakelijke invoer, worden vervolgens verwerkt en gevoerd in een aangewezen tekstkwaliteitsanalysator om gedetailleerde analyse- en vergelijkingresultaten te produceren. Volgend op dit proces, hebben we drie pijpleidingen geïmplementeerd voor verschillende evaluatiescenario’s:
- DirectQual.5: Deze pijpleiding is specifiek ontworpen om de kwaliteit van teksten te analyseren door de kenmerken van watermerk-teksten rechtstreeks te vergelijken met die van niet-watermerk-teksten. Het evalueert metrics zoals perplexity (PPL) en log-diversiteit, zonder de noodzaak van externe referentieteksten.
- RefQual.6: Deze pijpleiding evalueert tekstkwaliteit door zowel watermerk- als niet-watermerk-teksten te vergelijken met een gemeenschappelijke referentietekst. Het meet de mate van overeenkomst of afwijking van de referentietekst, waardoor het ideaal is voor scenario’s die specifieke downstream-taken vereisen om tekstkwaliteit te evalueren, zoals machinevertaling en codegeneratie.
- ExDisQual.7: Deze pijpleiding gebruikt een externe judger, zoals GPT-4 (OpenAI, 2023), om de kwaliteit van zowel watermerk- als niet-watermerk-teksten te evalueren. De discriminator evalueert de teksten op basis van door de gebruiker verstrekte taakbeschrijvingen, waardoor mogelijke degradatie of behoud van kwaliteit door watermerken kan worden geïdentificeerd. Deze methode is bijzonder waardevol wanneer een geavanceerde, AI-gebaseerde analyse van de subtiele effecten van watermerken is vereist.
MarkLLM: Experimenten en Resultaten
Om de prestaties te evalueren, voert de MarkLLM-framework evaluaties uit op negen verschillende algoritmen en beoordeelt hun impact, robuustheid en detecteerbaarheid op de kwaliteit van de tekst.

De bovenstaande tabel bevat de evaluatieresultaten van het evalueren van de detecteerbaarheid van negen algoritmen die in MarkLLM worden ondersteund.

Slotgedachten
In dit artikel hebben we het over MarkLLM gehad, een open-source toolkit voor watermerken die een uitbreidbaar en uniform framework biedt om LLM-watermerkalgoritmen te implementeren, terwijl het gebruikersvriendelijke interfaces biedt om gemakkelijk te gebruiken en toegang te verlenen. Bovendien ondersteunt de MarkLLM-framework automatische visualisatie van de mechanismen van deze frameworks, waardoor de begrijpelijkheid van deze modellen wordt verbeterd. De MarkLLM-framework biedt een uitgebreide set van 12 tools die drie perspectieven dekken, evenals twee geautomatiseerde evaluatiepijpleidingen voor het evalueren van de prestaties.












