Andersons Blickwinkel
Deepfake-Erkennung verfolgt neues Terrain: Latente Diffusionsmodelle und GANs

Meinung
Die Forschungsgemeinschaft zur Deepfake-Erkennung, die seit Ende 2017 fast ausschließlich mit dem Autoencoder-basierten Framework beschäftigt war, das zu dieser Zeit so viel öffentliche Bewunderung (und Entsetzen) auslöste, hat begonnen, sich für weniger stagnante Architekturen zu interessieren, darunter latente Diffusionsmodelle wie DALL-E 2 und Stable Diffusion, sowie die Ausgabe von Generativen Adversarial Networks (GANs). Zum Beispiel veröffentlichte die UC Berkeley im Juni die Ergebnisse ihrer Forschung zur Entwicklung eines Detektors für die Ausgabe von DALL-E 2.
Was diese wachsende Interesse zu treiben scheint, ist der plötzliche evolutionäre Sprung in der Fähigkeit und Verfügbarkeit von latenten Diffusionsmodellen im Jahr 2022, mit der geschlossenen und begrenzten Veröffentlichung von DALL-E 2 im Frühjahr, gefolgt im Spätsommer von der sensationellen Open-Source-Veröffentlichung von Stable Diffusion durch stability.ai.
GANs wurden auch längere Zeit in diesem Kontext studiert, wenn auch weniger intensiv, da es sehr schwierig ist, sie für überzeugende und aufwändige video-basierte Nachbildungen von Personen zu verwenden; zumindest im Vergleich zu den inzwischen altgedienten Autoencoder-Paketen wie FaceSwap und DeepFaceLab – und dessen Live-Streaming-Variante, DeepFaceLive.
Bewegte Bilder
In beiden Fällen scheint der galvanisierende Faktor die Aussicht auf einen anschließenden Entwicklungssprint für Video-Synthese zu sein. Der Beginn des Oktobers – und die große Konferenzsaison 2022 – war geprägt von einer Lawine plötzlicher und unerwarteter Lösungen für verschiedene langjährige Video-Synthese-Probleme: Kaum hatte Facebook Beispiele seiner eigenen Text-zu-Video-Plattform veröffentlicht, als Google Research schnell den anfänglichen Beifall durch die Ankündigung seiner neuen Imagen-to-Video-T2V-Architektur erstickte, die in der Lage ist, High-Resolution-Footage (zumindest über ein 7-Schichten-Netz von Upscalern) auszugeben.
Wenn Sie glauben, dass solche Dinge in Dreiergruppen kommen, betrachten Sie auch die enigmatische Zusage von stability.ai, dass “Video kommt” zu Stable Diffusion, offensichtlich später in diesem Jahr, während Stable Diffusion-Co-Entwickler Runway eine ähnliche Zusage gemacht hat, obwohl es unklar ist, ob sie sich auf dasselbe System beziehen. Die Discord-Nachricht von Stabilitys CEO Emad Mostaque versprach auch ‘Audio, Video [und] 3D’.
Was mit einer unerwarteten Bereitstellung von mehreren neuen Audio-Generierungsframeworks (einige basieren auf latenter Diffusion) und einem neuen Diffusionsmodell, das authentische Charakterbewegung generieren kann, beginnt die Idee, dass “statische” Frameworks wie GANs und Diffusern endlich ihre Rolle als unterstützende Adjunkte zu externen Animationsframeworks einnehmen werden, an Fahrt zu gewinnen.
Um es kurz zu sagen, es scheint wahrscheinlich, dass die behinderte Welt der autoencoder-basierten Video-Deepfakes, die nur effektiv den zentralen Teil eines Gesichts ersetzen können, bis zu diesem Zeitpunkt im nächsten Jahr von einer neuen Generation von diffusion-basierten Deepfake-fähigen Technologien übertroffen werden könnte – populäre, Open-Source-Ansätze mit dem Potenzial, nicht nur ganze Körper, sondern ganze Szenen photorealistisch zu fälschen.
Daher vielleicht beginnt die Anti-Deepfake-Forschungsgemeinschaft, Bildsynthese ernst zu nehmen und zu erkennen, dass sie mehr als nur die Generierung von falschen LinkedIn-Profilfotos dienen könnte; und dass, wenn all ihre undurchdringlichen latenten Räume in Bezug auf temporale Bewegung nur dazu in der Lage sind, als sehr guter Texture-Renderer zu fungieren, das möglicherweise mehr als genug sein könnte.
Blade Runner
Die beiden neuesten Arbeiten, die jeweils latente Diffusion und GAN-basierte Deepfake-Erkennung behandeln, sind DE-FAKE: Erkennung und Zuordnung von gefälschten Bildern, die durch Text-zu-Bild-Diffusionsmodelle generiert wurden, eine Zusammenarbeit zwischen dem CISPA Helmholtz-Zentrum für Informationssicherheit und Salesforce (CRM ); und BLADERUNNER: Schnelle Gegenmaßnahme für synthetische (künstlich generierte) StyleGAN-Gesichter, von Adam Dorian Wong am MIT’s Lincoln Laboratory.
Bevor das neue Verfahren erklärt wird, nimmt die letztere Arbeit einige Zeit, um vorherige Ansätze zur Bestimmung, ob ein Bild durch einen GAN (die Arbeit befasst sich speziell mit NVIDIAs StyleGAN-Familie) generiert wurde, zu untersuchen.
Die “Brady-Bunch”-Methode – vielleicht ein sinnloser Verweis für jeden, der in den 1970er Jahren nicht fernsah oder die Filmadaptionen der 1990er Jahre verpasst hat – identifiziert GAN-generierte Inhalte basierend auf den festen Positionen, die bestimmte Teile eines GAN-Gesichts einnehmen, aufgrund der routinierten und schematischen Natur des “Produktionsprozesses”.

Die ‘Brady-Bunch’-Methode, die in einem Webcast des SANS-Instituts 2022 vorgestellt wurde: Ein GAN-basierter Gesichtsgenerator wird eine unglaubwürdig einheitliche Platzierung bestimmter Gesichtszüge durchführen, was die Herkunft des Fotos in bestimmten Fällen verrät. Quelle: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf
Ein weiterer nützlicher bekannter Hinweis ist StyleGANs häufige Unfähigkeit, mehrere Gesichter (erstes Bild unten) zu rendern, wenn notwendig, sowie seine mangelnde Begabung in Accessoire-Koordination (zweites Bild unten) und eine Neigung, eine Haarlinie als Start einer improvisierten Mütze zu verwenden (drittes Bild unten).

Die dritte Methode, auf die der Forscher hinweist, ist Photo-Overlay (ein Beispiel dafür kann in unserem August-Artikel über AI-gestützte Diagnose von psychischen Gesundheitsstörungen gesehen werden), das kompositorische “Bild-Blending”-Software wie die CombineZ-Serie verwendet, um mehrere Bilder zu einem einzigen Bild zu verbinden, oft unterliegende Gemeinsamkeiten in der Struktur aufdeckend – ein potenzieller Hinweis auf Synthese.

Die in der neuen Arbeit vorgeschlagene Architektur trägt den Titel (möglicherweise gegen alle SEO-Ratschläge) Blade Runner, der sich auf den Voight-Kampff-Test bezieht, der bestimmt, ob Antagonisten in der Science-Fiction-Franchise “falsch” oder nicht sind.
Die Pipeline besteht aus zwei Phasen, von denen die erste der PapersPlease-Analyser ist, der Daten aus bekannten GAN-Gesichts-Websites wie thispersondoesnotexist.com oder generated.photos auswerten kann.

Obwohl eine gekürzte Version des Codes auf GitHub (siehe unten) inspiziert werden kann, werden wenige Details darüber bereitgestellt, außer dass OpenCV und DLIB verwendet werden, um Gesichter in dem gesammelten Material zu umranden und zu erkennen.
Das zweite Modul ist der AmongUs-Detektor. Das System ist darauf ausgelegt, koordinierte Augenplatzierung in Fotos zu suchen, ein persistierendes Merkmal von StyleGANs Gesichtsausgabe, typisiert in dem “Brady-Bunch”-Szenario, das oben beschrieben wird. AmongUs wird von einem Standard-68-Landmark-Detektor angetrieben.

Gesichtspunkte-Anmerkungen über die Intelligent Behaviour Understanding Group (IBUG), deren Gesichtslandmarken-Plot-Code im Blade-Runner-Paket verwendet wird.
AmongUs hängt von vorgebildeten Landmarken basierend auf den bekannten “Brady-Bunch”-Koordinaten von PapersPlease ab und ist für die Verwendung gegen Live-, web-basierte Beispiele von StyleGAN-basierten Gesichtsbildern gedacht.
Blade Runner, so schlägt der Autor vor, ist eine Plug-and-Play-Lösung, die für Unternehmen oder Organisationen gedacht ist, die nicht über die Ressourcen verfügen, um in-house-Lösungen für die Art der Deepfake-Erkennung zu entwickeln, die hier behandelt wird, und eine “Zwischenlösung, um Zeit für dauerhaftere Gegenmaßnahmen zu gewinnen”.
Tatsächlich gibt es in diesem so volatilen und schnell wachsenden Sicherheitssektor derzeit nicht viele maßgeschneiderte oder von Cloud-Anbietern bereitgestellte Lösungen, auf die ein unterressourcetes Unternehmen mit Vertrauen zurückgreifen kann.
Obwohl Blade Runner gegenüber brillengetragenen StyleGAN-generierten Personen schlecht abschneidet, ist dies ein relativ häufiges Problem bei ähnlichen Systemen, die darauf angewiesen sind, Augenumrisse als Kernpunkte zu bewerten, die in solchen Fällen verdeckt sind.
Eine reduzierte Version von Blade Runner wurde auf GitHub als Open Source veröffentlicht. Eine umfangreichere proprietäre Version existiert, die mehrere Fotos verarbeiten kann, anstatt nur ein Foto pro Operation wie im Open-Source-Repository. Der Autor beabsichtigt, er sagt, die GitHub-Version auf den gleichen Standard zu bringen, sobald Zeit dafür ist. Er räumt auch ein, dass StyleGAN wahrscheinlich über seine bekannten oder aktuellen Schwächen hinauswachsen wird, und die Software wird ebenfalls weiterentwickelt werden müssen.
DE-FAKE
Die DE-FAKE-Architektur zielt nicht nur darauf ab, eine “universelle Erkennung” für durch Text-zu-Bild-Diffusionsmodelle generierte Bilder zu erreichen, sondern auch eine Methode bereitzustellen, um zu bestimmen, welches latentes Diffusionsmodell (LD-Modell) das Bild produziert hat.

Das universelle Erkennungsframework in DE-FAKE behandelt lokale Bilder, ein Hybridframework (grün) und offene Weltbilder (blau). Quelle: http://export.arxiv.org/pdf/2210.06998
Um ehrlich zu sein, ist dies derzeit eine ziemlich einfache Aufgabe, da alle populären LD-Modelle – geschlossen oder Open Source – bemerkenswerte Unterscheidungsmerkmale aufweisen.
Zusätzlich teilen die meisten einige gemeinsame Schwächen, wie eine Neigung, Köpfe abzuschneiden, aufgrund der willkürlichen Art, wie nicht quadratische Web-Scraping-Bilder in die riesigen Datensätze aufgenommen werden, die Systeme wie DALL-E 2, Stable Diffusion und MidJourney antreiben:

Latente Diffusionsmodelle, wie alle Computer-Vision-Modelle, erfordern quadratische Eingaben; aber das aggregierte Web-Scraping, das den LAION5B-Datensatz speist, bietet keine ‘Luxus-Extras’ wie die Fähigkeit, Gesichter (oder alles andere) zu erkennen und zu fokussieren, und schneidet Bilder stattdessen brutal ab, anstatt sie auszupuffern (was das gesamte Quellbild beibehalten, aber mit niedrigerer Auflösung würde). Sobald sie trainiert sind, werden diese ‘Crops’ normalisiert und treten sehr häufig in der Ausgabe von latenten Diffusionsmodellen wie Stable Diffusion auf. Quellen: https://blog.novelai.net/novelai-improvements-on-stable-diffusion-e10d38db82ac und Stable Diffusion.
DE-FAKE soll algorithmunabhängig sein, ein lang gehegter Wunsch der Autoencoder-Anti-Deepfake-Forscher, und im Moment ziemlich erreichbar in Bezug auf LD-Systeme.
Die Architektur verwendet OpenAIs Contrastive Language-Image Pretraining (CLIP) Multimodal-Bibliothek – ein wesentliches Element in Stable Diffusion und immer mehr das Herzstück der neuen Welle von Bild-/Video-Synthese-Systemen – als Mittel, um Einbettungen aus “gefälschten” LD-Bildern zu extrahieren und einen Klassifikator auf den beobachteten Mustern und Klassen zu trainieren.
In einem mehr “black box”-Szenario, in dem die PNG-Chunks, die Informationen über den Generierungsprozess enthalten, bereits durch Upload-Prozesse und aus anderen Gründen entfernt wurden, verwenden die Forscher das Salesforce-BLIP-Framework (auch ein Bestandteil in mindestens einer Distribution von Stable Diffusion), um die Bilder “blind” auf die wahrscheinliche semantische Struktur der Ersteller zu untersuchen.

Die Forscher verwendeten Stable Diffusion, Latent Diffusion (selbst ein diskretes Produkt), GLIDE und DALL-E 2, um ein Trainings- und Testdatenset zu erstellen, das auf MSCOCO und Flickr30k basiert.
Normalerweise würden wir uns die Ergebnisse der Forscher ausführlich ansehen, aber in Wahrheit scheinen die Ergebnisse von DE-FAKE eher als zukünftiger Benchmark für spätere Iterationen und ähnliche Projekte nützlich zu sein, als als sinnvoller Maßstab für den Erfolg des Projekts, angesichts der volatilen Umgebung, in der es operiert, und dass das System, gegen das es in den Versuchen des Papiers antritt, fast drei Jahre alt ist – aus der Zeit, als die Bildsynthese-Szene noch wirklich im Entstehen war.

Links: die beiden ‘herausgeforderten’ vorherigen Frameworks, die 2019 entstanden sind, schneiden vorhersehbar schlechter gegenüber DE-FAKE (rechts) bei den vier getesteten LD-Systemen ab.
Das Team erzielt überwältigend positive Ergebnisse aus zwei Gründen: Es gibt kaum vorherige Arbeiten, mit denen es verglichen werden kann (und keine, die einen fairen Vergleich bieten, d. h. die die zwölf Wochen seit der Open-Source-Veröffentlichung von Stable Diffusion abdecken).
Zweitens, wie oben erwähnt, entwickelt sich das LD-Bildsynthese-Feld mit exponentieller Geschwindigkeit, und die Ausgabeinhalte der aktuellen Angebote “wasserzeichen” sich selbst aufgrund ihrer eigenen strukturellen (und sehr vorhersehbaren) Mängel und Eigenheiten – viele davon werden wahrscheinlich im Falle von Stable Diffusion durch die Veröffentlichung des leistungsstärkeren 1,5-Checkpoints (d. h. des 4 GB trainierten Modells, das das System antreibt) behoben.
Im gleichen Zeitraum hat Stability bereits angekündigt, dass es einen klaren Fahrplan für V2 und V3 des Systems hat. Angesichts der Schlagzeilen der letzten drei Monate ist es wahrscheinlich, dass jede korporative Trägheit von OpenAI und anderen Mitbewerbern im Bildsynthese-Bereich verschwunden ist, was bedeutet, dass wir auch im geschlossenen Bildsynthese-Bereich mit einem ähnlich rasanten Fortschritt rechnen können. Erstveröffentlicht am 14. Oktober 2022.












