Andersons Blickwinkel
Eine forensische Datenmethode für eine neue Generation von Deepfakes

Obwohl die Deepfaking von Privatpersonen zu einer wachsenden öffentlichen Besorgnis geworden ist und in verschiedenen Regionen immer mehr verboten wird, bleibt es extrem herausfordernd, zu beweisen, dass ein benutzerdefiniertes Modell – wie eines, das Rache-Porn ermöglicht – speziell auf die Bilder einer bestimmten Person trainiert wurde.
Um das Problem in den Kontext zu setzen: Ein wichtiger Aspekt eines Deepfake-Angriffs ist die falsche Behauptung, dass ein Bild oder Video eine bestimmte Person zeigt. Es reicht bereits aus, zu behaupten, dass jemand in einem Video die Identität #A ist, anstatt nur ein Lookalike, um Schaden anzurichten, und hierfür ist keine KI erforderlich.
Wenn jedoch ein Angreifer AI-Bilder oder -Videos mit Modellen erzeugt, die auf echten Personendaten trainiert wurden, werden die Bild- und Suchmaschinen-Systeme von sozialen Medien automatisch den gefälschten Inhalt mit dem Opfer in Verbindung bringen, ohne dass Namen in Beiträgen oder Metadaten erforderlich sind. Die AI-erzeugten Bilder allein gewährleisten die Assoziation.
Je distinkter die Erscheinung einer Person ist, desto unvermeidlicher wird dies, bis der gefälschte Inhalt in Bildsuchen erscheint und letztendlich das Opfer erreicht.
Face to Face
Das gängigste Mittel, um identitätsorientierte Modelle zu verbreiten, ist derzeit die Low-Rank-Anpassung (LoRA), bei der der Benutzer ein paar Stunden lang ein paar Bilder gegen die Gewichte eines viel größeren Grundmodells wie Stable Diffusion (hauptsächlich für statische Bilder) oder Hunyuan Video für Video-Deepfakes trainiert.
Die häufigsten Ziele von LoRAs, einschließlich der neuen Generation von video-basierten LoRAs, sind weibliche Berühmtheiten, deren Berühmtheit sie dieser Art von Behandlung aussetzt, mit weniger öffentlicher Kritik als im Falle von “unbekannten” Opfern, aufgrund der Annahme, dass solche abgeleiteten Werke unter “Fair Use” (zumindest in den USA und Europa) fallen.

Weibliche Berühmtheiten dominieren die LoRA- und Dreambooth-Listen auf dem civit.ai-Portal. Die beliebteste LoRA hat derzeit über 66.000 Downloads, was angesichts der Tatsache, dass diese Verwendung von KI als “Nischenaktivität” gilt, beachtlich ist.
Es gibt kein öffentliches Forum für die nicht-berühmten Opfer von Deepfakes, die nur in den Medien auftauchen, wenn Strafverfahren eingeleitet werden oder die Opfer in populären Medien sprechen.
Wenn jedoch in beiden Szenarien die Modelle, die zur Fälschung der Zielidentitäten verwendet werden, ihre Trainingsdaten so gründlich in den latenten Raum des Modells destilliert haben, dass es schwierig ist, die Quellbilder zu identifizieren, die verwendet wurden.
Wenn es jedoch möglich wäre, dies innerhalb eines akzeptablen Fehlertoleranzbereichs zu tun, würde dies die Verfolgung derjenigen ermöglichen, die LoRAs teilen, da es nicht nur die Absicht beweist, eine bestimmte Identität (d. h. die einer bestimmten “unbekannten” Person) zu fälschen, sondern auch den Hochlader wegen Urheberrechtsverletzungen anklagt, wo anwendbar.
Letzteres wäre in Rechtsordnungen nützlich, in denen die rechtliche Regulierung von Deepfake-Technologien fehlt oder hinterherhinkt.
Over-Exposed
Das Ziel des Trainings eines Grundmodells, wie des mehrere Gigabyte großen Basismodells, das ein Benutzer von Hugging Face herunterladen könnte, besteht darin, dass das Modell gut generalisiert und anpassungsfähig wird. Dies erfordert das Training auf einer ausreichenden Anzahl von verschiedenen Bildern und mit geeigneten Einstellungen und das Training vor dem Überanpassen des Modells an die Daten.
Ein überangepasstes Modell hat die Daten so viele Male (exzessiv) während des Trainingsprozesses gesehen, dass es dazu neigt, Bilder zu reproduzieren, die sehr ähnlich sind, und somit die Quelle der Trainingsdaten preisgibt.

Die Identität ‘Ann Graham Lotz’ kann im Stable-Diffusion-V1.5-Modell fast perfekt reproduziert werden. Die Rekonstruktion ist fast identisch mit den Trainingsdaten (links im Bild oben). Quelle: https://arxiv.org/pdf/2301.13188
Überangepasste Modelle werden jedoch in der Regel von ihren Erstellern verworfen, anstatt verbreitet zu werden, da sie ohnehin untauglich für den Zweck sind. Daher ist dies ein unwahrscheinliches forensisches “Glücksfall”. In jedem Fall gilt das Prinzip mehr für das teure und umfangreiche Training von Grundmodellen, bei dem mehrere Versionen desselben Bildes, die in eine große Quelldatenbank eingedrungen sind, bestimmte Trainingsbilder leicht abrufbar machen (siehe Bild und Beispiel oben).
Die Dinge sind ein wenig anders im Falle von LoRA- und Dreambooth-Modellen (obwohl Dreambooth aus der Mode gekommen ist, aufgrund seiner großen Dateigröße). Hier wählt der Benutzer eine sehr begrenzte Anzahl von verschiedenen Bildern eines Subjekts aus und verwendet diese, um ein LoRA zu trainieren.

Links: Ausgabe eines Hunyuan-Video-LoRAs. Rechts: Die Daten, die die Ähnlichkeit ermöglichten (Bilder mit Genehmigung der abgebildeten Person verwendet).
Häufig hat das LoRA ein trainiertes Schlüsselwort, wie z. B. [Name des Celebrities]. Es ist jedoch sehr oft der Fall, dass das speziell trainierte Subjekt auch in den generierten Ausgaben erscheint, ohne solche Prompts, da selbst ein gut ausgewogenes (d. h. nicht überangepasstes) LoRA ein wenig “fixiert” auf das Material ist, auf dem es trainiert wurde, und tendenziell dazu neigt, es in jeder Ausgabe zu enthalten.
Diese Vorliebe, kombiniert mit der begrenzten Anzahl von Bildern, die für ein LoRA-Datensatz optimal sind, legt das Modell einer forensischen Analyse offen, wie wir sehen werden.
Unmasking the Data
Diese Fragen werden in einer neuen Studie aus Dänemark behandelt, die eine Methodik zur Identifizierung von Quellbildern (oder Gruppen von Quellbildern) in einem Black-Box-Membership-Inference-Angriff (MIA) anbietet. Die Technik umfasst unter anderem die Verwendung von benutzerdefinierten, trainierten Modellen, die dazu dienen, Quelldaten durch die Erzeugung eigener “Deepfakes” aufzudecken:

Beispiele für “falsche” Bilder, die durch den neuen Ansatz erzeugt wurden, bei immer höheren Ebenen von Classifier-Free-Guidance (CFG), bis hin zum Punkt der Zerstörung. Quelle: https://arxiv.org/pdf/2502.11619
Obwohl die Arbeit, mit dem Titel Membership-Inference-Angriffe für Gesichtsbilder gegen fein abgestimmte latente Diffusionsmodelle, ein interessanter Beitrag zur Literatur zu diesem speziellen Thema ist, ist sie auch ein unzugänglich geschriebenes Papier, das erhebliche Entschlüsselung erfordert. Daher werden wir hier zumindest die grundlegenden Prinzipien hinter dem Projekt und eine Auswahl der Ergebnisse behandeln.
Im Grunde kann die Methode des Autors beweisen, dass jemand ein AI-Modell auf Ihrem Gesicht fein abgestimmt hat, indem sie nach verräterischen Anzeichen von Memorierung in den generierten Bildern des Modells sucht.
Im ersten Schritt wird ein Ziel-AI-Modell auf einem Datensatz von Gesichtsbildern fein abgestimmt, wodurch es wahrscheinlicher wird, dass es Details aus diesen Bildern in seinen Ausgaben reproduziert. Anschließend wird ein Angriffsmodus mithilfe von AI-erzeugten Bildern aus dem Zielmodell als “Positive” (vermutete Mitglieder des Trainingsdatensatzes) und anderen Bildern aus einem anderen Datensatz als “Negative” (Nichtmitglieder) trainiert.
Indem das Angriffsmodell die subtilen Unterschiede zwischen diesen Gruppen lernt, kann es vorhersagen, ob ein bestimmtes Bild ursprünglich Teil des Datensatzes war, der zum Feinabstimmen des Zielmodells verwendet wurde.
Der Angriff ist am effektivsten in Fällen, in denen das AI-Modell umfassend fein abgestimmt wurde, was bedeutet, dass das Modell umso spezifischer ist, desto einfacher es ist, zu erkennen, ob bestimmte Bilder verwendet wurden. Dies gilt allgemein für LoRAs, die darauf ausgelegt sind, Berühmtheiten oder Privatpersonen nachzubilden.
Die Autoren fanden auch heraus, dass die Hinzufügung von sichtbaren Wasserzeichen zu den Trainingsbildern die Erkennung noch weiter erleichtert – jedoch helfen versteckte Wasserzeichen nicht so viel.
Die Methode, die entwickelt wurde, ist rechenintensiv, wie die Autoren einräumen; jedoch liegt der Wert dieser Arbeit darin, die Richtung für weitere Forschung zu weisen und zu beweisen, dass Daten realistisch extrahiert werden können, um eine akzeptable Toleranz zu erreichen; daher muss sie an diesem Stadium nicht auf einem Smartphone laufen.
Methoden/Daten
Für die Studie wurden mehrere Datensätze von der Technischen Universität Dänemarks (DTU, der Gastinstitution für die drei Forscher) verwendet, um das Zielmodell fein abzustimmen und das Angriffsmodell zu trainieren und zu testen.
Die verwendeten Datensätze stammen von DTU Orbit:
DseenDTU Der Basisbildsatz.
DDTU Bilder, die von DTU Orbit gesammelt wurden.
DseenDTU Eine Partition von DDTU, die zum Feinabstimmen des Zielmodells verwendet wurde.
DunseenDTU Eine Partition von DDTU, die nicht zum Feinabstimmen eines Bildgenerierungsmodells verwendet wurde, sondern stattdessen zum Testen oder Trainieren des Angriffsmodells.
wmDseenDTU Eine Partition von DDTU mit sichtbaren Wasserzeichen, die zum Feinabstimmen des Zielmodells verwendet wurde.
hwmDseenDTU Eine Partition von DDTU mit versteckten Wasserzeichen, die zum Feinabstimmen des Zielmodells verwendet wurde.
DgenDTU Bilder, die von einem Latent-Diffusionsmodell (LDM) erzeugt wurden, das auf dem DseenDTU-Bildsatz fein abgestimmt wurde.
Die verwendeten Datensätze zum Feinabstimmen des Zielmodells bestehen aus Bild-Text-Paaren, die vom BLIP-Beschreibungmodell beschriftet wurden (vielleicht nicht zufällig eines der beliebtesten unzensierten Modelle in der Casual-AI-Community).
BLIP wurde so eingestellt, dass es den Satz ‘a dtu headshot of a’ jedem Beschreibungstext voranstellte.
Zusätzlich wurden mehrere Datensätze von der Universität Aalborg (AAU) in den Tests verwendet, alle von dem AU VBN-Korpus abgeleitet:
DAAU Bilder, die von AAU vbn gesammelt wurden.
DseenAAU Eine Partition von DAAU, die zum Feinabstimmen des Zielmodells verwendet wurde.
DunseenAAU Eine Partition von DAAU, die nicht zum Feinabstimmen eines Bildgenerierungsmodells verwendet wurde, sondern stattdessen zum Testen oder Trainieren des Angriffsmodells.
DgenAAU Bilder, die von einem LDM erzeugt wurden, das auf dem DseenAAU-Bildsatz fein abgestimmt wurde.
Äquivalent zu den vorherigen Sätzen wurde der Satz ‘a aau headshot of a’ verwendet. Dies gewährleistete, dass alle Labels im DTU-Datensatz dem Format ‘a dtu headshot of a (…)’ folgten, wodurch die Kernmerkmale des Datensatzes während des Feinabstimmens verstärkt wurden.
Tests
Mehrere Experimente wurden durchgeführt, um zu bewerten, wie gut die Membership-Inference-Angriffe gegen das Zielmodell funktionierten. Jeder Test zielte darauf ab, zu bestimmen, ob es möglich war, innerhalb des angegebenen Schemas einen erfolgreichen Angriff durchzuführen, bei dem das Zielmodell auf einem Bild-datensatz fein abgestimmt wurde, der ohne Autorisierung erlangt wurde.

Schema für den Ansatz.
Wenn das fein abgestimmte Modell abgefragt wird, um Ausgabebilder zu generieren, werden diese Bilder als positive Beispiele für das Training des Angriffsmodells verwendet, während zusätzliche nicht verwandte Bilder als negative Beispiele (Nichtmitglieder) hinzugefügt werden.
Das Angriffsmodell wird mithilfe von überwachtem Lernen trainiert und dann auf neue Bilder getestet, um zu bestimmen, ob sie ursprünglich Teil des Datensatzes waren, der zum Feinabstimmen des Zielmodells verwendet wurde. Um die Genauigkeit des Angriffs zu bewerten, wird 15 % der Testdaten für die Validierung zurückgehalten.
Da das Zielmodell auf einem bekannten Datensatz fein abgestimmt wurde, ist der tatsächliche Mitgliedschaftsstatus jedes Bildes bereits festgelegt, wenn die Trainingsdaten für das Angriffsmodell erstellt werden. Diese kontrollierte Einrichtung ermöglicht eine klare Bewertung der Effektivität des Angriffsmodells bei der Unterscheidung zwischen Bildern, die Teil des Feinabstimmungsdatensatzes waren, und solchen, die es nicht waren.
Bei diesen Tests wurde Stable Diffusion V1.5 verwendet. Obwohl dieses ziemlich alte Modell in der Forschung aufgrund der Notwendigkeit konsistenter Tests und des umfangreichen Korpus von vorheriger Arbeit, die es verwendet, häufig vorkommt, ist dies ein geeigneter Anwendungsfall; V1.5 blieb in der Stable-Diffusion-Hobbyist-Community für eine lange Zeit beliebt, trotz mehrerer nachfolgender Versionen und sogar trotz des Aufkommens von Flux – weil das Modell völlig unzensiert ist.
Das Angriffsmodell der Forscher basierte auf ResNet-18, wobei die vorgegebenen Gewichte des Modells beibehalten wurden. ResNet-18s 1000-Neuronen-letzte Schicht wurde durch eine vollständig verbundene Schicht mit zwei Neuronen ersetzt. Der Trainingsverlust war kategorieller Kreuzentropieverlust, und der Adam-Optimizer wurde verwendet.
Bei jedem Test wurde das Angriffsmodell fünfmal mit unterschiedlichen Zufallsseeds trainiert, um 95%-Vertrauensintervalle für die wichtigsten Metriken zu berechnen. Zero-Shot-Klassifizierung mit dem CLIP-Modell wurde als Basis verwendet.
(Bitte beachten Sie, dass die ursprüngliche primäre Ergebnistabelle im Papier sehr knapp und ungewöhnlich schwer zu verstehen ist. Daher habe ich sie hier in einer benutzerfreundlicheren Form reformuliert. Bitte klicken Sie auf das Bild, um es in besserer Auflösung zu sehen)

Zusammenfassung der Ergebnisse aller Tests. Klicken Sie auf das Bild, um es in höherer Auflösung zu sehen
Die Angriffsmethode der Forscher erwies sich als am effektivsten, wenn sie auf fein abgestimmte Modelle abzielte, insbesondere solche, die auf einem bestimmten Satz von Bildern trainiert wurden, wie z. B. das Gesicht einer Person. Allerdings kann der Angriff zwar bestimmen, ob ein Datensatz verwendet wurde, hat jedoch Schwierigkeiten, einzelne Bilder innerhalb dieses Datensatzes zu identifizieren.
Praktisch gesehen ist Letzteres jedoch kein Hindernis für die Verwendung eines solchen Ansatzes in der Forensik; während es relativ wenig Wert hat, festzustellen, dass ein bekannter Datensatz wie ImageNet in einem Modell verwendet wurde, wird ein Angreifer auf eine Privatperson (nicht auf eine Berühmtheit) tendenziell weniger Auswahl an Quelldaten haben und vollständig auf verfügbare Daten wie soziale Medien-Alben und andere Online-Sammlungen angewiesen sein. Diese erstellen im Wesentlichen einen “Hash”, der durch die beschriebenen Methoden aufgedeckt werden kann.
Das Papier weist darauf hin, dass eine weitere Möglichkeit, die Genauigkeit zu verbessern, darin besteht, AI-erzeugte Bilder als “Nichtmitglieder” zu verwenden, anstatt sich ausschließlich auf echte Bilder zu verlassen. Dies verhindert künstlich hohe Erfolgsraten, die die Ergebnisse sonst täuschen könnten.
Ein weiterer Faktor, der die Erkennung erheblich beeinflusst, ist, wie die Autoren feststellen, das Wasserzeichen. Wenn Trainingsbilder sichtbare Wasserzeichen enthalten, wird der Angriff sehr effektiv, während versteckte Wasserzeichen wenig bis gar keinen Vorteil bieten.

Das rechte Bild zeigt das tatsächliche “versteckte” Wasserzeichen, das in den Tests verwendet wurde.
Schließlich spielt auch das Maß an Text-Bild-Steuerung bei der Bildgenerierung eine Rolle, wobei der ideale Ausgleich bei einem Steuerungsskala von etwa 8 liegt. Selbst wenn kein direkter Prompt verwendet wird, neigt ein fein abgestimmtes Modell immer noch dazu, Ausgaben zu produzieren, die seinem Trainingsdatensatz ähneln, was die Effektivität des Angriffs verstärkt.
Schlussfolgerung
Es ist schade, dass dieses interessante Papier auf eine so unzugängliche Weise geschrieben wurde, da es für Datenschützer und Casual-AI-Forscher gleichermaßen von Interesse sein sollte.
Obwohl Membership-Inference-Angriffe möglicherweise zu einem interessanten und fruchtbaren forensischen Werkzeug werden, ist es vielleicht noch wichtiger, dass diese Forschungsrichtung allgemeine, anwendbare Prinzipien entwickelt, um zu verhindern, dass sie in dasselbe Spiel von “Whac-A-Mole” gerät, das für die Deepfake-Erkennung im Allgemeinen auftritt, wenn die Veröffentlichung eines neuen Modells die Erkennung und ähnliche forensische Systeme negativ beeinflusst.
Da es einige Hinweise auf ein höheres Leitprinzip in dieser neuen Forschung gibt, können wir hoffen, in Zukunft mehr Arbeit in diese Richtung zu sehen.
Erstveröffentlicht am Freitag, den 21. Februar 2025.












