Andersons Blickwinkel

Deepfake-Erkennung basierend auf ursprünglichen biometrischen Merkmalen des Menschen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
Images produced by deepfakers at the DeepFaceLab Discord Channel

Ein neues Papier von Forschern in Italien und Deutschland schlägt eine Methode vor, um Deepfake-Videos anhand biometrischen Verhaltens von Gesicht und Stimme zu erkennen, anstatt auf Artefakte, die von Gesichtssynthese-Systemen erstellt werden, teuren Wasserzeichenslösungen oder anderen unwieldiereren Ansätzen.

Das Framework erfordert eine Eingabe von 10 oder mehr verschiedenen, nicht gefälschten Videos des Subjekts. Es erfordert jedoch keine spezifische Schulung, Nachschulung oder Ergänzung auf pro-Fall-Videos, da das integrierte Modell bereits die wahrscheinlichen Vektor-Abstände zwischen echten und gefälschten Videos in einer breit anwendbaren Weise abstrahiert hat.

Kontrastives Lernen bildet die Grundlage des POI-Forensics-Ansatzes. Vektoren, die aus Quellmaterial auf pro-Fall-Basis abgeleitet werden, werden mit den gleichen Vektoren in einem potenziell gefälschten Video verglichen, wobei Aspekte und Merkmale aus beiden Video- und Audio-Komponenten des potenziell gefälschten Footage verwendet werden. Quelle: https://arxiv.org/pdf/2204.03083.pdf

Kontrastives Lernen bildet die Grundlage des POI-Forensics-Ansatzes. Vektoren, die aus Quellmaterial auf pro-Fall-Basis abgeleitet werden, werden mit den gleichen Vektoren in einem potenziell gefälschten Video verglichen, wobei Aspekte und Merkmale aus beiden Video- und Audio-Komponenten des potenziell gefälschten Footage verwendet werden. Quelle: https://arxiv.org/pdf/2204.03083.pdf

Der Ansatz, der als POI-Forensics bezeichnet wird, basiert auf Bewegungs- und Audio-Hinweisen, die einzigartig für die realen Personen sind, die tiefgefälscht werden.

Obwohl ein solches System eine vollständig automatisierte, “vorgerenderte” Authentifizierungs-Infrastruktur für Celebrities, Politiker, YouTube-Influencer und andere Personen ermöglichen könnte, für die eine große Menge an Video-Material verfügbar ist, könnte es auch in ein Framework integriert werden, in dem normale Opfer von Deepfake-Technologien möglicherweise eine Plattform haben, um die Unechtheit von Angriffen gegen sie zu beweisen.

Visualisierungen von extrahierten Merkmalen aus echten und gefälschten Videos über vier Subjekte in POI-Forensics, über das t-SNE-Framework.

Visualisierungen von extrahierten Merkmalen aus echten und gefälschten Videos über vier Subjekte in POI-Forensics, über das t-SNE-Framework.

Die Autoren behaupten, dass POI-Forensics einen neuen Stand der Technik in der Deepfake-Erkennung erreicht. Über eine Vielzahl von gängigen Datensätzen in diesem Bereich wird das Framework als eine Verbesserung der AUC-Werte (Fläche unter der ROC-Kurve) von 3%, 10% und 7% für hochwertige, niedrigwertige und “angegriffene” Videos gemeldet. Die Forscher versprechen, den Code bald zu veröffentlichen.

Die Leistung von POI-Forensics im Vergleich zu anderen Frameworks wie pDFDC, DeepFakeTIMIT, FakeAVCelebV2 und KoDF. Die Schulung wurde in jedem Fall auf FaceForensics++, ID-Reveal und dem Verfahren der Autoren auf VoxCeleb2 durchgeführt. Die Ergebnisse umfassen hoch- und niedrigwertige Videos.

Die Leistung von POI-Forensics im Vergleich zu anderen Frameworks wie pDFDC, DeepFakeTIMIT, FakeAVCelebV2 und KoDF. Die Schulung wurde in jedem Fall auf FaceForensics++ und dem Verfahren der Autoren auf VoxCeleb2 durchgeführt. Die Ergebnisse umfassen hoch- und niedrigwertige Videos.

Die Autoren erklären:

‘Die Schulung wird ausschließlich mit echten Gesichtsvideos durchgeführt, sodass der Detektor nicht von einer bestimmten Manipulationsmethode abhängt und die höchste Verallgemeinerungsfähigkeit bietet. Darüber hinaus kann unsere Methode sowohl Ein-Modus- (nur Audio oder nur Video) als auch Multi-Modus-Angriffe (Audio-Video) erkennen und ist robust gegenüber niedrigwertigen oder beschädigten Videos, indem sie nur auf hochstufige semantische Merkmale aufbaut.’

Das neue Papier, das Elemente des ID-Reveal-Projekts der Autoren von 2021 enthält, trägt den Titel Audio-Visuelle Person-of-Interest-Deepfake-Erkennung und ist eine gemeinsame Arbeit zwischen der Universität Federico II in Neapel und der Technischen Universität München.

Der Deepfake-Wettkampf

Um ein solches Erkennungssystem zu besiegen, müssten Deepfake- und menschliche Synthese-Systeme die Fähigkeit haben, zumindest visuelle und audio-biometrische Hinweise von der beabsichtigten Synthese-Ziel-Person zu simulieren – eine Technologie, die viele Jahre entfernt ist und wahrscheinlich in teuren und proprietären geschlossenen Systemen von VFX-Unternehmen bleiben wird, die den Vorteil der Zusammenarbeit und Teilnahme der beabsichtigten Ziele (oder ihrer Nachlässe im Falle der Simulation von verstorbenen Personen) haben.

Der vorherige Ansatz der Autoren, ID-Reveal, konzentrierte sich ausschließlich auf visuelle Informationen. Quelle: https://arxiv.org/pdf/2012.02512.pdf

Der vorherige Ansatz der Autoren, ID-Reveal, konzentrierte sich ausschließlich auf visuelle Informationen. Quelle: https://arxiv.org/pdf/2012.02512.pdf

Erfolgreiche und beliebte Deepfake-Methoden wie FaceSwap und DeepFaceLab/Live haben derzeit keine Fähigkeit, solche granularen biometrischen Approximationen zu erstellen, sondern verlassen sich auf talentierte Impersonatoren, auf denen die gefälschte Identität aufgezwungen wird, und viel häufiger auf geeignete In-the-Wild-Aufnahmen von “ähnlichen” Personen. Auch die Struktur des ursprünglichen 2017-Codes, der wenig Modularität aufweist und der immer noch die Quelle für DFL und FaceSwap ist, macht es nicht möglich, diese Art von Funktionalität hinzuzufügen.

Diese beiden dominanten Deepfake-Pakete basieren auf Autoencodern. Alternative menschliche Synthese-Methoden können ein Generative Adversarial Network (GAN) oder einen Neural Radiance Field (NeRF)-Ansatz zur Erstellung von menschlicher Identität verwenden; aber beide Forschungsansätze haben Jahre der Arbeit vor sich, um vollständig photorealistische menschliche Videos zu produzieren.

Abgesehen von Audio (gefälschten Stimmen) ist biometrische Simulation sehr weit unten auf der Liste der Herausforderungen, die der menschlichen Bildsynthese gegenüberstehen. In jedem Fall reproduziert die Perfektion von AI-generierter Stimmsimulation nicht deren Eigenheiten und “Tells” oder die Art und Weise, wie das reale Subjekt semantische Konstruktionen verwendet. Daher löst auch die Perfektion von AI-generierter Stimmsimulation nicht das potenzielle Feuerwall-Problem der biometrischen Authentizität.

Allein auf Arxiv werden jede Woche mehrere Deepfake-Erkennungsstrategien und Innovationen veröffentlicht. Kürzliche Ansätze haben sich auf Voice-Face-Homogenität, Lokale Binär-Histogramm (FF-LBPH), menschliche Wahrnehmung von Audio-Deepfakes, Analyse von Gesichtsgrenzen, Berücksichtigung von Video-Degradierung und ‘Forensische Ballistik’ – unter vielen anderen.

Histogramm-Analyse ist eine der neuesten Techniken, die zur Verbesserung der Deepfake-Erkennung angeboten werden. Quelle: https://arxiv.org/pdf/2203.09928.pdf

Segmentierte Histogramm-Analyse ist eine der neuesten Techniken, die zur Verbesserung der Deepfake-Erkennung angeboten werden. Quelle: https://arxiv.org/pdf/2203.09928.pdf

Ansatz, Daten und Architektur

POI-Forensics verwendet einen multi-modalen Ansatz zur Identitätsüberprüfung, der weiche Biometrie auf visuelle und audio-biometrische Hinweise stützt. Das Framework umfasst separate Audio- und Video-Netzwerke, die letztendlich charakteristische Vektordaten ableiten, die mit den gleichen extrahierten Merkmalen in einem potenziell gefälschten Video verglichen werden können.

Die Architektur von POI-Forensics.

Die konzeptionelle Architektur von POI-Forensics.

Sowohl separate (Audio oder Video) als auch Fusion-Analyse können auf Ziel-Clips durchgeführt werden, um letztendlich einen POI-Ähnlichkeits-Index zu erhalten. Die verwendete kontrastive Verlustfunktion basiert auf einer akademischen Zusammenarbeit von 2021 zwischen Google Research, Boston University, Snap Inc. (SNAP ) und MIT.

Die Basis-Datenmenge wurde auf pro-Identitäts-Basis geteilt. 4608 Identitäten wurden für die Schulung verwendet, und 512 wurden für die Validierung zurückgehalten. Die 500 Identitäten, die in FakeAVCelebV2 (ein Testkandidat, siehe unten) verwendet wurden, wurden ausgeschlossen, um nicht polarisierte Ergebnisse zu erhalten.

Die beiden Netzwerke wurden für 12 Epochen mit einer ungewöhnlich großen Batch-Größe von 2304 Batches pro Epoche trainiert, wobei jedes Batch aus 8×8-Video-Segmenten bestand – 8 Segmente für 8 verschiedene Identitäten. Der Adam-Optimizer wurde mit entkoppeltem Gewichts-Abfall bei einer Lernrate von 10−4 und einem Gewichts-Abfall von 0,01 verwendet.

Testen und Ergebnisse

Die Deepfake-Datensätze, die für das Projekt getestet wurden, waren die Vorschau DeepFake Detection Challenge-Datensatz, der Face-Swaps über 68 Subjekte umfasst, von denen 44 Identitäten ausgewählt wurden, die mehr als neun verwandte Videos haben, insgesamt 920 echte Videos und 2925 gefälschte Videos; DeepFake-TIMIT, ein GAN-basiertes Datensatz, das 320 Videos von 32 Subjekten umfasst, insgesamt 290 echte Videos und 580 gefälschte Videos mit einer Dauer von mindestens vier Sekunden; FakeAVCelebV2, das 500 echte Videos von Voxceleb2 umfasst und etwa 20.000 gefälschte Videos aus verschiedenen Datensätzen, denen gefälschte Klonaudio mit SV2TTS für Kompatibilität hinzugefügt wurde; und KoDF, ein koreanischer Deepfake-Datensatz mit 403 Identitäten, die durch FaceSwap, DeepFaceLab und FSGAN gefälscht wurden, sowie drei First Order Motion Models (FOMM).

Letzterer umfasst auch audio-getriebene Gesichtssynthese ATFHP und Ausgabe von Wav2Lip, wobei die Autoren einen abgeleiteten Datensatz mit 276 echten Videos und 544 gefälschten Videos verwenden.

Verwendete Metriken umfassten die Fläche unter der Receiver-Operating-Characteristic-Kurve (AUC) und eine approximierte 10%ige “Falsch-Alarm-Rate”, die in Frameworks, die gefälschte Daten einbeziehen und trainieren, problematisch wäre, aber die durch die Tatsache aufgehoben wird, dass POI-Forensics nur echte Video-Aufnahmen als Eingabe verwendet.

Die Methoden wurden gegen den Seferbekov-Deepfake-Detektor getestet, der den ersten Platz im Kaggle Deepfake Detection Challenge erreichte; FTCN (Fully Temporal Convolution Network), eine Zusammenarbeit zwischen der Xiamen-Universität in China und Microsoft (MSFT ) Research Asia; LipForensics, eine gemeinsame Arbeit von 2021 zwischen dem Imperial College London und Facebook; und ID-Reveal, ein vorheriges Projekt einiger der Autoren des neuen Papiers, das einen Audio-Aspekt auslässt und 3D-Morphable-Modelle in Kombination mit einem adversarialen Spiel-Szenario zur Erkennung von gefälschten Ausgaben verwendet.

In den Ergebnissen (siehe oben) übertraf POI-Forensics den Referenz-Leader Seferbekov um 2,5% in AUC und 1,5% in Bezug auf Genauigkeit. Die Leistung war wettbewerbsfähiger auf anderen Datensätzen bei HQ.

Das neue Verfahren zeigte jedoch eine bemerkenswerte Führung gegenüber allen konkurrierenden Referenzmethoden für niedrigwertige Videos, die das wahrscheinlichste Szenario darstellen, in dem Deepfakes casual-Zuschauer täuschen, basierend auf “realen” Kontexten.

Die Autoren behaupten:

‘Tatsächlich bietet dieser anspruchsvolle Ansatz nur identitätsbasierte Ansätze, die auf hochstufigen semantischen Merkmalen basieren, die ziemlich robust gegenüber Bild-Beeinträchtigungen sind.’

Wenn man bedenkt, dass POI-Forensics nur reales Video als Quellmaterial verwendet, ist die Leistung umso bemerkenswerter und legt nahe, dass die Verwendung der natürlichen biometrischen Merkmale von potenziellen Deepfake-Opfern ein lohnender Weg ist, um dem “Artefakt-Kalten-Krieg” zwischen Deepfake-Software und Deepfake-Erkennungslösungen zu entkommen.

In einem letzten Test fügten die Forscher dem Eingabesignal adverses Rauschen hinzu, eine Methode, die zuverlässig Klassifikatoren täuschen kann. Die inzwischen altbewährte Schnell-Gradienten-Zeichen-Methode erweist sich immer noch als besonders effektiv in dieser Hinsicht.

Adversarial-Angriffsstrategien senkten die Erfolgsrate über alle Methoden und Datensätze, wobei die AUC um 10% bis 38% abnahm. Allerdings konnte nur POI-Forensics und das vorherige Verfahren der Autoren, ID-Reveal, eine vernünftige Leistung unter diesem Angriffsszenario aufrechterhalten, was darauf hindeutet, dass die hochstufigen Merkmale, die mit weichen Biometrien verbunden sind, außerordentlich resistent gegen Deepfake-Erkennungsevasion sind.

Die Autoren schlussfolgern:

‘Insgesamt glauben wir, dass unsere Methode ein erster Schrittstein ist; insbesondere die Verwendung von höherstufigen semantischen Merkmalen ist eine vielversprechende Zukunftsperspektive für zukünftige Forschung. Darüber hinaus könnte die multimodale Analyse durch die Einbeziehung von mehr Informationen aus anderen Bereichen wie Textdaten weiter bereichert werden.’

Erstveröffentlicht am 8. April 2022.

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai