KI-Modelle und Plattformen
MARKLLM: Ein Open-Source-Toolkit für LLM-Wasserzeichen
LLM-Wasserzeichen, die unauffällige, aber erkennbare Signale in Modellausgaben integrieren, um Text zu identifizieren, der von LLMs generiert wurde, sind entscheidend, um den Missbrauch von großen Sprachmodellen zu verhindern. Diese Wasserzeichen-Techniken werden hauptsächlich in zwei Kategorien unterteilt: die KGW-Familie und die Christ-Familie. Die KGW-Familie modifiziert die Logits, die von der LLM produziert werden, um wassermarkierte Ausgaben zu erstellen, indem sie das Vokabular in eine grüne Liste und eine rote Liste unterteilt, basierend auf dem vorherigen Token. Eine Voreinstellung wird den Logits der grünen Liste-Tokens während der Textgenerierung eingeführt, wodurch diese Tokens in der produzierten Text bevorzugt werden. Ein statistisches Maß wird dann aus dem Verhältnis der grünen Wörter berechnet und eine Schwelle wird festgelegt, um zwischen wassermarkiertem und nicht-wassermarkiertem Text zu unterscheiden. Verbesserungen der KGW-Methode umfassen eine verbesserte Listenteilung, bessere Logit-Manipulation, erhöhte Wasserzeichen-Kapazität, Widerstandsfähigkeit gegen Wasserzeichen-Entfernung und die Fähigkeit, Wasserzeichen öffentlich zu erkennen.
Andererseits ändert die Christ-Familie den Stichprozess während der LLM-Textgenerierung, indem sie ein Wasserzeichen einbettet, indem sie ändert, wie Tokens ausgewählt werden. Beide Wasserzeichen-Familien zielen darauf ab, die Erkennbarkeit von Wasserzeichen mit der Textqualität in Einklang zu bringen, wobei Herausforderungen wie Robustheit in verschiedenen Entropie-Einstellungen, Erhöhung der Wasserzeichen-Kapazität und Schutz vor Entfernungsversuchen berücksichtigt werden. Aktuelle Forschung hat sich auf die Verfeinerung der Listenteilung und Logit-Manipulation konzentriert, die Erhöhung der Wasserzeichen-Kapazität, die Entwicklung von Methoden zur Abwehr von Wasserzeichen-Entfernungen und die Ermöglichung der öffentlichen Erkennung. Letztendlich ist LLM-Wasserzeichen entscheidend für die ethische und verantwortungsvolle Nutzung von großen Sprachmodellen, da es eine Methode bietet, um LLM-generierten Text zu verfolgen und zu verifizieren. Die KGW- und Christ-Familien bieten zwei unterschiedliche Ansätze, jeweils mit einzigartigen Stärken und Anwendungen, die kontinuierlich durch laufende Forschung und Innovation weiterentwickelt werden.
Aufgrund der Fähigkeit von LLM-Wasserzeichen-Frameworks, algorithmisch erkennbare Signale in Modellausgaben zu integrieren, um Text zu identifizieren, der von einer LLM-Framework generiert wurde, spielt es eine entscheidende Rolle bei der Minderung der Risiken, die mit dem Missbrauch von großen Sprachmodellen verbunden sind. Es gibt jedoch eine Vielzahl von LLM-Wasserzeichen-Frameworks auf dem Markt, jedes mit seinen eigenen Perspektiven und Bewertungsverfahren, was es für Forscher schwierig macht, mit diesen Frameworks leicht zu experimentieren. Um dieses Problem zu bekämpfen, bietet MarkLLM, ein Open-Source-Toolkit für Wasserzeichen, ein erweiterbares und einheitliches Framework, um LLM-Wasserzeichen-Algorithmen zu implementieren, während es benutzerfreundliche Schnittstellen bietet, um die Bedienung und den Zugang zu erleichtern. Darüber hinaus unterstützt das MarkLLM-Framework die automatische Visualisierung der Mechanismen dieser Frameworks, wodurch die Verständlichkeit dieser Modelle verbessert wird. Das MarkLLM-Framework bietet ein umfassendes Set von 12 Tools, die drei Perspektiven abdecken, sowie zwei automatisierte Bewertungspipelines, um seine Leistung zu bewerten. Dieser Artikel zielt darauf ab, das MarkLLM-Framework in-depth zu behandeln, und wir erkunden den Mechanismus, die Methodik, die Architektur des Frameworks sowie seinen Vergleich mit State-of-the-Art-Frameworks. Lassen Sie uns beginnen.
MarkLLM: Ein LLM-Wasserzeichen-Toolkit
Die Entstehung von großen Sprachmodell-Frameworks wie LLaMA, GPT-4, ChatGPT und mehr hat die Fähigkeit von KI-Modellen, bestimmte Aufgaben auszuführen, einschließlich kreativen Schreibens, Textverständnisses, Informationsabruf und vielem mehr, erheblich verbessert. Es gibt jedoch auch Risiken, die mit den außergewöhnlichen Vorteilen von großen Sprachmodellen verbunden sind, wie z.B. akademisches Ghostwriting, LLM-generierte Fake-Nachrichten und -Darstellungen sowie individuelle Nachahmung, um nur einige zu nennen. Angesichts der Risiken, die mit diesen Problemen verbunden sind, ist es entscheidend, zuverlässige Methoden zu entwickeln, die in der Lage sind, zwischen LLM-generiertem und menschlichem Inhalt zu unterscheiden, eine wichtige Anforderung, um die Authentizität von digitaler Kommunikation zu gewährleisten und die Verbreitung von Fehlinformationen zu verhindern. In den letzten Jahren wurde LLM-Wasserzeichen als eine der vielversprechendsten Lösungen zur Unterscheidung zwischen LLM-generiertem und menschlichem Inhalt empfohlen, und durch die Integration von einzigartigen Merkmalen während des Textgenerierungsprozesses können LLM-Ausgaben mithilfe speziell entwickelter Detektoren eindeutig identifiziert werden. Es gibt jedoch aufgrund der Verbreitung und der relativ komplexen Algorithmen von LLM-Wasserzeichen-Frameworks sowie der Vielfalt von Bewertungsmetriken und -perspektiven enorme Schwierigkeiten, mit diesen Frameworks zu experimentieren.
Um diese Lücke zu schließen, versucht das MarkLLM-Framework, die folgenden Beiträge zu leisten. MARKLLM bietet konsistente und benutzerfreundliche Schnittstellen für das Laden von Algorithmen, die Generierung von wassermarkiertem Text, die Durchführung von Erkennungsprozessen und die Erfassung von Daten für die Visualisierung. Es bietet benutzerdefinierte Visualisierungslösungen für beide großen Wasserzeichen-Algorithmen-Familien, die es Benutzern ermöglichen, zu sehen, wie verschiedene Algorithmen unter verschiedenen Konfigurationen mit realen Beispielen funktionieren. Das Toolkit enthält ein umfassendes Bewertungsmodul mit 12 Tools, die die Erkennbarkeit, Robustheit und Textqualitätsauswirkung ansprechen. Darüber hinaus bietet es zwei Arten von automatisierten Bewertungspipelines, die die Benutzeranpassung von Daten, Modellen, Bewertungsmetriken und Angriffen unterstützen, wodurch flexible und gründliche Bewertungen ermöglicht werden. Durch die modulare, lose gekoppelte Architektur wird die Skalierbarkeit und Flexibilität von MARKLLM verbessert. Diese Architektur entscheidet sich für die Integration neuer Algorithmen, innovativer Visualisierungstechniken und die Erweiterung des Bewertungstools durch zukünftige Entwickler.
Es wurden zahlreiche Wasserzeichen-Algorithmen vorgeschlagen, aber ihre einzigartigen Implementierungsansätze priorisieren oft bestimmte Anforderungen gegenüber Standardisierung, was zu mehreren Problemen führt
- Mangel an Standardisierung in der Klassendesign: Dies erfordert erhebliche Anstrengungen, um bestehende Methoden zu optimieren oder zu erweitern, aufgrund unzureichend standardisierter Klassendesigns.
- Mangel an Einheitlichkeit in den Top-Level-Aufrufsschnittstellen: Inkonsistente Schnittstellen machen die Batch-Verarbeitung und die Reproduktion verschiedener Algorithmen umständlich und arbeitsintensiv.
- Code-Standard-Probleme: Herausforderungen umfassen die Notwendigkeit, Einstellungen in mehreren Code-Segmenten zu ändern und inkonsistente Dokumentation, was die Anpassung und den effektiven Einsatz erschwert. Hartcodierte Werte und inkonsistente Fehlerbehandlung behindern zusätzlich die Anpassungsfähigkeit und die Fehlersuche.
Um diese Probleme zu lösen, bietet unser Toolkit ein einheitliches Implementierungsframework, das den bequemen Aufruf verschiedener State-of-the-Art-Algorithmen unter flexiblen Konfigurationen ermöglicht. Darüber hinaus ermöglicht unsere sorgfältig gestaltete Klassenstruktur eine zukünftige Erweiterung. Die folgende Abbildung zeigt die Gestaltung dieses einheitlichen Implementierungsframeworks.
Aufgrund der verteilten Gestaltung des Frameworks ist es für Entwickler einfach, zusätzliche Top-Level-Schnittstellen zu jeder bestimmten Wasserzeichen-Algorithmen-Klasse hinzuzufügen, ohne sich um die Auswirkungen auf andere Algorithmen zu kümmern.
MarkLLM: Architektur und Methodik
LLM-Wasserzeichen-Techniken werden hauptsächlich in zwei Kategorien unterteilt: die KGW-Familie und die Christ-Familie. Die KGW-Familie modifiziert die Logits, die von der LLM produziert werden, um wassermarkierte Ausgaben zu erstellen, indem sie das Vokabular in eine grüne Liste und eine rote Liste unterteilt, basierend auf dem vorherigen Token. Eine Voreinstellung wird den Logits der grünen Liste-Tokens während der Textgenerierung eingeführt, wodurch diese Tokens in der produzierten Text bevorzugt werden. Ein statistisches Maß wird dann aus dem Verhältnis der grünen Wörter berechnet und eine Schwelle wird festgelegt, um zwischen wassermarkiertem und nicht-wassermarkiertem Text zu unterscheiden. Verbesserungen der KGW-Methode umfassen eine verbesserte Listenteilung, bessere Logit-Manipulation, erhöhte Wasserzeichen-Kapazität, Widerstandsfähigkeit gegen Wasserzeichen-Entfernung und die Fähigkeit, Wasserzeichen öffentlich zu erkennen.
Andererseits ändert die Christ-Familie den Stichprozess während der LLM-Textgenerierung, indem sie ein Wasserzeichen einbettet, indem sie ändert, wie Tokens ausgewählt werden. Beide Wasserzeichen-Familien zielen darauf ab, die Erkennbarkeit von Wasserzeichen mit der Textqualität in Einklang zu bringen, wobei Herausforderungen wie Robustheit in verschiedenen Entropie-Einstellungen, Erhöhung der Wasserzeichen-Kapazität und Schutz vor Entfernungsversuchen berücksichtigt werden. Aktuelle Forschung hat sich auf die Verfeinerung der Listenteilung und Logit-Manipulation konzentriert, die Erhöhung der Wasserzeichen-Kapazität, die Entwicklung von Methoden zur Abwehr von Wasserzeichen-Entfernungen und die Ermöglichung der öffentlichen Erkennung. Letztendlich ist LLM-Wasserzeichen entscheidend für die ethische und verantwortungsvolle Nutzung von großen Sprachmodellen, da es eine Methode bietet, um LLM-generierten Text zu verfolgen und zu verifizieren. Die KGW- und Christ-Familien bieten zwei unterschiedliche Ansätze, jeweils mit einzigartigen Stärken und Anwendungen, die kontinuierlich durch laufende Forschung und Innovation weiterentwickelt werden.
Automatisierte umfassende Bewertung
Die Bewertung eines LLM-Wasserzeichen-Algorithms ist eine komplexe Aufgabe. Zunächst erfordert es die Berücksichtigung verschiedener Aspekte, einschließlich Wasserzeichen-Erkennbarkeit, Robustheit gegenüber Manipulationen und Auswirkungen auf die Textqualität. Zweitens können Bewertungen aus jeder Perspektive unterschiedliche Metriken, Angriffsszenarien und Aufgaben erfordern. Darüber hinaus beinhaltet die Durchführung einer Bewertung in der Regel mehrere Schritte, wie z.B. die Auswahl von Modellen und Daten, die Generierung von wassermarkiertem Text, die Nachbearbeitung, die Wasserzeichen-Erkennung, die Text-Manipulation und die Metrik-Berechnung. Um eine bequeme und gründliche Bewertung von LLM-Wasserzeichen-Algorithmen zu ermöglichen, bietet MarkLLM zwölf benutzerfreundliche Tools, einschließlich verschiedener Metrik-Berechnern und Angreifern, die die drei genannten Bewertungsperspektiven abdecken. Darüber hinaus bietet MARKLLM zwei Arten von automatisierten Demo-Pipelines, deren Module flexibel angepasst und zusammengestellt werden können, wodurch eine einfache Konfiguration und Nutzung ermöglicht wird.
Für den Aspekt der Erkennbarkeit erfordern die meisten Wasserzeichen-Algorithmen letztendlich die Festlegung einer Schwelle, um zwischen wassermarkiertem und nicht-wassermarkiertem Text zu unterscheiden. Wir bieten einen grundlegenden Erfolgsrate-Rechner mit einer festen Schwelle. Darüber hinaus bieten wir einen Rechner, der die dynamische Schwelle-Anpassung unterstützt, um die Auswirkungen der Schwelle-Auswahl auf die Erkennbarkeit zu minimieren. Dieses Tool kann die Schwelle bestimmen, die den besten F1-Wert ergibt oder eine Schwelle basierend auf einer vom Benutzer angegebenen Ziel-Falsch-Positiv-Rate (FPR) auswählen.
Für den Aspekt der Robustheit bietet MARKLLM drei Wort-Text-Manipulationsangriffe: zufällige Wort-Entfernung bei einem bestimmten Verhältnis, zufällige Synonym-Ersetzung unter Verwendung von WordNet als Synonym-Set und kontextbezogene Synonym-Ersetzung unter Verwendung von BERT als Einbettungsmodell. Darüber hinaus bietet es zwei Dokument-Text-Manipulationsangriffe: die Umformulierung des Kontexts über die OpenAI-API oder das Dipper-Modell. Für den Aspekt der Textqualität bietet MARKLLM zwei direkte Analyse-Tools: einen Perplexitäts-Rechner, um die Flüssigkeit zu messen, und einen Diversitäts-Rechner, um die Variabilität von Texten zu bewerten. Um die Auswirkungen des Wasserzeichens auf die Text-Nützlichkeit in bestimmten Downstream-Aufgaben zu analysieren, bietet es einen BLEU-Rechner für maschinelle Übersetzungs-Aufgaben und einen Pass-oder-Nicht-Beurteiler für Code-Generierungs-Aufgaben. Darüber hinaus bietet es, angesichts der aktuellen Methoden zum Vergleich der Qualität von wassermarkiertem und unwatermarkiertem Text, die Verwendung eines stärkeren LLM für die Beurteilung, einen GPT-Diskriminator, der GPT-4 verwendet, um die Textqualität zu vergleichen.
Bewertungspipelines
Um eine automatisierte Bewertung von LLM-Wasserzeichen-Algorithmen zu ermöglichen, bietet MARKLLM zwei Bewertungspipelines: eine für die Bewertung der Wasserzeichen-Erkennbarkeit mit und ohne Angriffe und eine für die Analyse der Auswirkungen dieser Algorithmen auf die Textqualität. Als Ergebnis haben wir zwei Pipelines implementiert: WMDetect3 und UWMDetect4. Der Hauptunterschied zwischen ihnen liegt in der Text-Generierungsphase. Die erste erfordert die Verwendung der generate_watermarked_text-Methode aus dem Wasserzeichen-Algorithmus, während die zweite von der text_source-Parameter abhängt, um zu bestimmen, ob natürlichen Text aus einem Dataset abzurufen ist oder die generate_unwatermarked_text-Methode aufzurufen ist.
Um die Auswirkungen des Wasserzeichens auf die Textqualität zu bewerten, werden Paare von wassermarkiertem und unwatermarkiertem Text generiert. Der Text, zusammen mit anderen notwendigen Eingaben, wird dann verarbeitet und in einen bestimmten Textqualitäts-Analysator eingegeben, um detaillierte Analysen und Vergleichsergebnisse zu produzieren. Als Ergebnis haben wir drei Pipelines für verschiedene Bewertungsszenarien implementiert:
- DirectQual.5: Diese Pipeline ist speziell dafür ausgelegt, die Qualität von Texten zu analysieren, indem sie die Merkmale von wassermarkierten Texten mit denen von unwatermarkierten Texten vergleicht. Sie bewertet Metriken wie Perplexität (PPL) und Log-Diversität, ohne die Notwendigkeit von externen Referenztexten.
- RefQual.6: Diese Pipeline bewertet die Textqualität, indem sie sowohl wassermarkierte als auch unwatermarkierte Texte mit einem gemeinsamen Referenztext vergleicht. Sie misst den Grad der Ähnlichkeit oder Abweichung vom Referenztext, was es ideal für Szenarien macht, die spezifische Downstream-Aufgaben erfordern, um die Textqualität zu bewerten, wie maschinelle Übersetzung und Code-Generierung.
- ExDisQual.7: Diese Pipeline verwendet einen externen Beurteiler, wie z.B. GPT-4 (OpenAI, 2023), um die Qualität von wassermarkierten und unwatermarkierten Texten zu bewerten. Der Diskriminator bewertet die Texte basierend auf benutzerdefinierten Aufgabenbeschreibungen, wodurch potenzielle Verschlechterungen oder Erhaltung der Qualität aufgrund des Wasserzeichens identifiziert werden können. Diese Methode ist besonders wertvoll, wenn eine fortgeschrittene, KI-basierte Analyse der subtilen Auswirkungen des Wasserzeichens erforderlich ist.
MarkLLM: Experimente und Ergebnisse
Um seine Leistung zu bewerten, führt das MarkLLM-Framework Bewertungen von neun verschiedenen Algorithmen durch und bewertet ihre Auswirkungen, Robustheit und Erkennbarkeit auf die Textqualität.

Die obige Tabelle enthält die Bewertungsergebnisse der Erkennbarkeit von neun Algorithmen, die in MarkLLM unterstützt werden. Die dynamische Schwelle-Anpassung wird verwendet, um die Wasserzeichen-Erkennbarkeit zu bewerten, mit drei Einstellungen: bei einer Ziel-FPR von 10%, bei einer Ziel-FPR von 1% und bei Bedingungen für den optimalen F1-Wert. 200 wassermarkierte Texte werden generiert, während 200 unwatermarkierte Texte als negative Beispiele dienen. Wir liefern TPR und F1-Wert unter dynamischer Schwelle-Anpassung für 10% und 1% FPR, zusammen mit TPR, TNR, FPR, FNR, P, R, F1, ACC bei optimaler Leistung. Die folgende Tabelle enthält die Bewertungsergebnisse der Robustheit von neun Algorithmen, die in MarkLLM unterstützt werden. Für jeden Angriff werden 200 wassermarkierte Texte generiert und manipuliert, während 200 unwatermarkierte Texte als negative Beispiele dienen. Wir berichten den TPR und F1-Wert bei optimaler Leistung unter jeder Umgebung.

Final Thoughts
In diesem Artikel haben wir über MarkLLM gesprochen, ein Open-Source-Toolkit für Wasserzeichen, das ein erweiterbares und einheitliches Framework bietet, um LLM-Wasserzeichen-Algorithmen zu implementieren, während es benutzerfreundliche Schnittstellen bietet, um die Bedienung und den Zugang zu erleichtern. Darüber hinaus unterstützt das MarkLLM-Framework die automatische Visualisierung der Mechanismen dieser Frameworks, wodurch die Verständlichkeit dieser Modelle verbessert wird. Das MarkLLM-Framework bietet ein umfassendes Set von 12 Tools, die drei Perspektiven abdecken, sowie zwei automatisierte Bewertungspipelines, um seine Leistung zu bewerten.












