Andersons Blickwinkel

Die Verwendung von “Wahrscheinlichkeit” als Metrik zur Erkennung von Deepfakes

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
Montage against AI-generated (GPT-1) image of Vesuvius exploding in 79AD, featuring Donald Trump from South Park season 27 episode 1, David Icke on 'Wogan' in 1991, and politician Catherine Connolly.

Wenn künstlich generierte Videos und Audiodateien gut genug sind, funktionieren Deepfake-Erkennungsmethoden, die auf visuellen Artefakten oder anderen traditionellen Signalen basieren, nicht mehr. Aber angesichts der Tatsache, dass Menschen nur selten von ihrem vorhersehbaren Verhalten abweichen, könnte perhaps “Wahrscheinlichkeit” als Signal dafür, ob ein Video oder ein Gerücht wahrscheinlich wahr ist, tiefer verankert werden.

 

Meinung In den frühen 1990er Jahren enthüllte der ehemalige britische Fußballspieler und Fernsehkommentator David Icke in einer Talkshow, dass er der “Sohn Gottes” sei – eine bizarre und unerwartete Enthüllung, die sich im Laufe der folgenden Jahrzehnte zu einer anhaltenden und elaborierte Verschwörungstheorie über eine geheime und mächtige globale Kabale von “Echsenmenschen”.

Als die Internetnutzung noch einige Jahre in der Zukunft lag und der Einsatz sozialer Medien noch weiter entfernt war, hatte die enorme Diskrepanz zwischen Ickes Berühmtheit und der Art seiner neuen Erkenntnisse einen tiefgreifenden Einfluss auf die britische Öffentlichkeit – nicht zuletzt wegen des völligen Fehlens von Kontext oder irgendeiner Art von Vorbereitung auf diese massive Wende, von einem bekannten und etablierten Sportpersönlichkeit.

Über zwanzig Jahre später trat ein ähnlicher und viel dunklerer Strang dieses gesellschaftlichen Schocks auf, als der beliebte Wohltätigkeitskampagnenführer und Kinderfernsehmoderator Jimmy Savile posthum als serieller und räuberischer Lebenslanger Sexualstraftäter entlarvt wurde, der sein wohlwollendes öffentliches Image genutzt hatte, um seine Verbrechen zu ermöglichen.

Die anschließende Operation Yewtree-Polizeiuntersuchung deckte viele weitere britische Berühmtheiten mit langjährigen sexuellen Straftaten auf; später führte die Verfolgung von Harvey Weinstein zur Entdeckung ähnlicher Berühmtheiten in den USA, die sich zur #metoo-Bewegung entwickelte und permanent in die amerikanische Kultur einprägte, wie in The Morning Show. “Schock”-Nachrichten schienen ein neues und abruptes Muster zu entwickeln – eines, das schließlich von Deepfake-Angreifern übernommen werden würde.

Das Ende der “traditionellen” Deepfake-Erkennung?

Selbst wenn soziale Medien und künstliche Intelligenz in den frühen Neunzigerjahren verfügbar gewesen wären, hätte kein Vorhersagesystem auf der Welt Ickes Enthüllungen in der Talkshow vorhersehen können, die (wie ich mich gut erinnere) in den Jahren vor dem Ereignis in keiner Weise angekündigt wurden.

Wenn jedoch künstliche Intelligenz verfügbar gewesen wäre, hätte es möglicherweise einige Zeit gedauert, um eine breitere Öffentlichkeit davon zu überzeugen, dass Ickes Aussagen nicht das Ergebnis von Google Veo 3 oder einer anderen neuen Generation von hyperrealen Audio-/Video-Deepfake-Frameworks waren.

Es ist erst in den letzten 6-12 Monaten, dass künstliche Intelligenz-Deepfake-Methoden effektiv genug geworden sind, um Jahre von Medien-Doom-Saying über Deepfake-Einmischung in Wahlen und in der Lage sind, die Art von schnellen Reputationsverlust zu erzeugen, der falsch ist, aber schwer zu tilgen in einer zunehmend gläubigen Kultur.

Bislang fallen die Ausgaben von künstlicher Intelligenz für Video typischerweise kurz vor der wahren Realität, begrenzt durch technische Hürden und zunehmend polarisiert durch eine sich verbreiternde Lücke zwischen restriktiven westlichen Modellen und Chinas unzensierten Open-Source-Veröffentlichungen**.

Trotzdem bemerke ich in der Forschungsliteratur eine drohende Kapitulation in diesem Kalten Krieg, zum Beispiel in der neuen Studie Leistungsrückgang bei der Deepfake-Erkennung†:

‘[Wir] nehmen an, dass Deepfake-Videos weiterhin maschinell erlernbare Merkmale enthalten, die sie zuverlässig von echten Videos unterscheiden. Wenn die Fähigkeiten der generativen künstlichen Intelligenz weiterhin schnell voranschreiten, kann diese Annahme möglicherweise zusammenbrechen.

‘In einem solchen Szenario bieten Wasserzeichen und andere Methoden zur Nachverfolgung der Herkunft die einzige Möglichkeit, Vertrauen in digitale Medien aufrechtzuerhalten.’

Jedoch räumt die gleiche Studie ein, dass Herkunfts-basierte Lösungen wie die von Adobe angeführte Content Authenticity Initiative (und die vielen kleineren Forschungsangebote der letzten 7-8 Jahre) eine so weit verbreitete Akzeptanz erfordern, dass sie unrealistisch sind; und die Studie endet mit einem allgemeinen Rückzugs- und Niederlageston.
Wenn audiovisuelle Deepfake-Erkennungsmethoden von der generativen künstlichen Intelligenz überholt werden und die globale Akzeptanz eines intrusiven Wasserzeichens oder eines Herkunfts-Schemas an den diversen logistischen Hürden scheitert, was könnte als gemeinsames zentrales Merkmal die Erkennung von potenziell gefälschten Ausgaben ersetzen? Oder müssen wir uns mit einer Welt abfinden, in der alle Medien in Frage gestellt werden und der Lügnerdividende herrscht?

Wissensgraphen

Es scheint Zeit, “Wahrscheinlichkeit” und “Plausibilität” von “gemeldeten Ereignissen” als Signalmerkmal in der Deepfake-Erkennung tiefer zu nutzen. Weiterhin könnte es an der Zeit sein, die getrennten Forschungsstränge von “falschen Nachrichten” (als textbasiertes Erzählereignis) und gefälschten Bildern/Videos zu konvergieren, da generative Audio-/Video-KI-Systeme zunehmend konvergieren.

Ein Wahrscheinlichkeits-Deepfake-Metrik ist nicht dasselbe wie RAG-unterstützte Faktüberprüfung, bei der ein KI-Modell aktuelle Web-Ergebnisse einbringen kann, um Kenntnisse von Ereignissen zu erlangen, die nach seinem eigenen Stichtag auftreten, und/oder um seine Behauptungen zu bestätigen.

Stattdessen würde es Vorhersagen auf der Grundlage allgemein indikativierter statistischer Trends durchführen, die aus historischen Mustern abgeleitet sind, die einem aktuellen Anliegen entsprechen.

In diesem Sinne ist eine Wahrscheinlichkeitsmethode näher an statistischer Analyse als an moderne Ansätze in der aktuellen maschinellen Lernszene.

Obwohl sie zuvor von moderneren Transformers-Ära-Ansätzen verdrängt wurden, machen Wissensgraphen inzwischen eine Art Comeback im Unternehmensbereich und scheinen für die potenzielle Bereitstellung von “Wahrscheinlichkeits”-Metriken in der Deepfake-Erkennung geeignet.

Ein vereinfachter Wissensgraph, der zeigt, wie Menschen, Orte, Kunstwerke und Ereignisse durch beschriftete Beziehungen miteinander verknüpft werden können, sodass Maschinen über reale Entitäten und ihre Verbindungen nachdenken können. Quelle [ https://blog.langchain.com/enhancing-rag-based-applications-accuracy-by-constructing-and-leveraging-knowledge-graphs/ 

Ein vereinfachter Wissensgraph, der zeigt, wie Menschen, Orte, Kunstwerke und Ereignisse durch beschriftete Beziehungen miteinander verknüpft werden können, sodass Maschinen über reale Entitäten und ihre Verbindungen nachdenken können. Quelle

Ein Wissensgraph ist eine Möglichkeit, Informationen zu organisieren, indem reale Dinge wie Menschen, Unternehmen, Ereignisse oder Ideen in ein Netzwerk von verbundenen Fakten umgewandelt werden.

Jedes Sub-Element ist ein Knoten, und die Verbindungen zwischen ihnen (Kanten) beschreiben, wie sie miteinander in Beziehung stehen. Zum Beispiel könnte “Microsoft (MSFT ) ” (ein Knoten) mit “OpenAI” (ein weiterer Knoten) durch eine Kante verbunden sein, die sagt “ist Kunde von”. Diese Verbindungen werden oft in Graphendatenbanken gespeichert und folgen einer Subjekt-Prädikat-Objekt-Struktur, wie “Microsoft ist Kunde von OpenAI”.

Persistentes Gedächtnis

Eine chinesische Studie vom September dieses Jahres schlug eine trainingsfreie Methode vor, die graphbasiertes Reasoning verwendet, um subtile Inkonsistenzen in multimodalen Deepfakes zu erkennen.

Statt Rationales oder Feinabstimmung großer Modelle zu generieren, ruft das System Bild-Text-Paare ab, baut einen Ähnlichkeitsgraphen und bewertet Verbindungen, um die relevantesten Beispiele abzurufen, und diese leiten das Urteil des Modells ohne die Notwendigkeit von Neu-Schulung:

Überblick über das GASP-ICL-Framework, das die Deepfake-Erkennung durch Kombination von graphbasierter Stichprobenauswahl mit kontextbasiertem Lernen verbessert, sodass ein gefrorenes visuell-linguistisches Modell Bild-Text-Paare als echt oder gefälscht klassifizieren kann, ohne Schulung oder Feinabstimmung.  Quelle [  https://www.arxiv.org/pdf/2509.21774

Überblick über das GASP-ICL-Framework, das die Deepfake-Erkennung durch Kombination von graphbasierter Stichprobenauswahl mit kontextbasiertem Lernen verbessert, sodass ein gefrorenes visuell-linguistisches Modell Bild-Text-Paare als echt oder gefälscht klassifizieren kann, ohne Schulung oder Feinabstimmung.  Quelle

Dies ist wahrscheinlich die nächste Arbeit, die ich kenne, zu einem “informierten” und historisch bewussten Ansatz zur Bewertung und Verifizierung neuer Medieninhalte. Zum größten Teil analysieren Computer-Vision-Ansätze weiterhin Bilder (einschließlich Frames von Videos und temporale Anomalien, die mehrere Frames umfassen), während “falsche Nachrichten”-Erkennungsframeworks weiterhin textbasierte Daten betonen, auch in multimodalen Projekten.

Feature Creep

Die Herausforderung eines Vorhersagesystems dieser Art ist der Umfang der Überwachung, die notwendig sein könnte, um den Ansatz vollständig leistungsfähig zu machen – zumindest jenseits der Analyse von Berühmtheiten und öffentlichen Persönlichkeiten, für die bereits frei zugängliche Daten existieren.

Wahrscheinlich ist der aktuellste Forschungsstrang, der dem am nächsten kommt, das Feld der Vorverbrechensbekämpfung, das diverse multimodale Intelligenzsignale als “verdächtig” kennzeichnet und sich als künstliche Intelligenz-Schreckgespenst in Produktionen wie Jonathan Nolans Person of Interest (2011-2016) und Steven Spielbergs Minderheit Bericht (2002) präsentiert.

Während ein Person of Interest-ähnliches, allumfassendes Überwachungssystem optimale Ergebnisse liefern würde, ist es unwahrscheinlich, dass die westliche Kultur derzeit die erforderliche persönliche Intrusivität sanktionieren könnte, die Chinas interne Netzwerke ihren Bürgern auferlegen.

Daher wäre es, im Hinblick auf potenzielle Falschmeldungen über nicht-Berühmtheiten, nur Regierungsbehörden wie die Polizei (sowie Geburts- und Sterberegister und Steuerämter) genug historische Informationen haben, um Wahrscheinlichkeiten in einem graphbasierten Arbeitsablauf zu informieren; und selbst sie würden CCCP-ähnlichen Willen, Kapazitäten, Gesetzgebung und Ressourcen benötigen, um durchschnittliche Bürger in ihre Abdeckung und Analysen einzubeziehen (d. h. über banale, aber obligatorische Datenpunkte wie Reisepassnummern und Autokennzeichen hinaus).

Wahrscheinlichkeitsbewertung

Es scheint wahrscheinlich, dass die potenzielle Effektivität eines Systems dieser Art auf die offensichtlichsten (aktuell) Verwendungszwecke für Deepfake-Inhalte beschränkt wäre: Destabilisierung (staatlich unterstützte Deepfakes); Deepfakes von Berühmtheiten und “Unbekannten” (die beide als bösartig angesehen werden können, obwohl der letztere Fall tendenziell tieferes Medieninteresse auf sich zieht); Betrug (einschließlich Audio-/Video-Deepfakes, die zur Ausführung von ‘Impersonationsraub‘ konzipiert sind); und politische Charakterermordung.

Ein wissensbasiertes System würde eine Skala von Wahrscheinlichkeiten für eine Vielzahl von möglichen Ereignissen benötigen. An einem Ende des Spektrums, alltägliche menschliche Schwächen wie fragwürdige Finanzverwaltung, Untreue, Sucht, Unbesonnenheit usw.; am anderen Ende… die Enthüllung, dass man der Sohn Gottes ist, in einer Live-Fernseh-Show (oder Ereignisse von ähnlichem Umfang und Auswirkungen).

Sogar in letzterem Fall würden persönliche historische Faktoren für jeden Einzelnen das Wahrscheinlichkeitsergebnis gewichten: Eine prominente politische Figur, die in der Vergangenheit öffentlich in kontroversen Angelegenheiten schwankte (wie der Wahrhaftigkeit der Mondlandungen in den 1960er/70er Jahren), um Kapital bei einem zunehmend ‘alternativ informierten‘ Wählerschaft zu gewinnen, könnte zusätzlichen Joker-Status in Verifizierungsroutinen erhalten, im Vergleich zu ihren zurückhaltenderen Kollegen.

Im Falle von Deepfakes von Berühmtheiten gibt es genug realweltlichen Kontext (d. h. die 2012-Lecks von Promi-Fotos, unter anderen – relativ seltenen – Vorfällen), um einen moderaten Lügnerdividenden in bestimmten Kontexten zu erzeugen; aber da diese Ausreißerfälle tendenziell als Ausnahmen dienen, die die Regel beweisen, würden die meisten aktuellen Deepfake-Videos von Berühmtheiten als extrem “unwahrscheinlich” angesehen (obwohl dies das Problem der Aneignung von Identitäten für solche Zwecke nicht löst).

In Bezug auf nationale Störungen gibt es eine erhebliche Menge an statistischen Daten, die bei der Bewertung der Wahrscheinlichkeiten von “katastrophalen” Berichten helfen können. Selbst in der Antike waren scheinbar “aus heiterem Himmel” auftretende Ereignisse wie der Ausbruch des unbekannten Vesuv-Vulkans im Jahr 79 n. Chr. vorhersehbar, wenn man nur genug Aufmerksamkeit geschenkt hätte; und abgesehen von der Verfügbarkeit einer Vielzahl von Regierungs- und NGO-gestützten Feeds kann die sich entwickelnde Fähigkeit der künstlichen Intelligenz, Struktur aus rohen Daten zu extrahieren, zusätzlichen historischen Kontext für die Wahrscheinlichkeitsbewertung liefern.

Schlussfolgerung

Selbst ein gut implementiertes Vorhersagesystem dieser Art könnte nicht für Zufall, Naturkatastrophen, unvorhersehbare Ereignisse oder bösartige Ereignisse, die außerhalb jeder Aufsicht konzipiert werden, Rechnung tragen.

Des Weiteren wäre die enorme Menge an Daten, die erforderlich wäre, um auch nicht-berühmte Personen abzudecken, ein politischer Stolperstein – zumindest für den Moment.

Die Wahlmöglichkeiten scheinen sich jedoch zu verringern; die auf Sicht basierende Analyse steht vor dem Scheitern angesichts der verbesserten generativen künstlichen Intelligenz, während Verifizierungs- und Herkunfts-Schemata eine belastende Hypothek technischer Schulden und Reibung gegenüber der Akzeptanz mit sich bringen. Dies macht Lösungen wie die Content Authenticity Initiative und das unerfüllte Metaphysic.ai-Gesichts-Urheberrechtssystem Metaphysic Pro herausfordernd, populär zu machen.

In ihrer breitesten Verwendung können RAG-basierte Systeme nur bestimmen, ob eine Autoritätsquelle eine nicht verifizierte Behauptung unterstützt; und da viele große (wahre) Nachrichtengeschichten ohne vorherigen Kontext auftauchen, ist das Fehlen von Unterstützung durch Autoritätsquellen nicht unbedingt bedeutungsvoll.

Ihr Wert dürfte größer sein, wenn sie Teil eines größeren Datenökosystems sein können, das sich mit dem beschäftigt, was die meisten aktuellen Formen der künstlichen Intelligenz herausfordern – historischen Kontext.

 

* Nicht zu verwechseln mit den frühen Autoencoder-Veröffentlichungen, die 2017 debütierten und schließlich von überlegenen Ansätzen abgelöst wurden.

† https://arxiv.org/abs/2511.07009

** Das normalerweise auf leistungsstarken Heim-PCs laufen kann, anstatt nur über gate-kept-APIs wie ChatGPT und die Veo-Serie verfügbar zu sein.

††† Ausgenommen legitime Unterhaltungszwecke, wie professionelle visuelle Effekte in Film- und Fernsehproduktionen.

Erstveröffentlichung am Donnerstag, 13. November 2025

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai