Andersons Blickwinkel
Der Aufstieg von Hunyuan-Video-Deepfakes

Aufgrund der Natur einiger der hier besprochenen Materialien enthält dieser Artikel weniger Referenzlinks und Illustrationen als üblich.
Etwas Beachtenswertes geschieht derzeit in der AI-Synthese-Gemeinschaft, obwohl seine Bedeutung möglicherweise einige Zeit brauchen wird, um klar zu werden. Hobbyisten trainieren generative AI-Video-Modelle, um die Ähnlichkeit von Personen wiederzugeben, unter Verwendung von video-basierten LoRAs auf Tencents kürzlich veröffentlichtem Open-Source-Hunyuan-Video-Framework.*
Bitte klicken, um abzuspielen. Vielfältige Ergebnisse aus Hunyuan-basierten LoRA-Anpassungen sind kostenlos bei der Civit-Community verfügbar. Durch das Training von Low-Rank-Adaptationsmodellen (LoRAs) werden die Probleme mit der temporalen Stabilität, die die AI-Video-Generierung seit zwei Jahren plagten, erheblich reduziert. Quellen: civit.ai
Im oben gezeigten Video wurden die Ähnlichkeiten von Schauspielerinnen wie Natalie Portman, Christina Hendricks und Scarlett Johansson sowie des Tech-Führers Elon Musk in relativ kleine Add-on-Dateien für das Hunyuan-Generative-Video-System trainiert, das ohne Inhaltsfilter (wie NSFW-Filter) auf einem Benutzer-Computer installiert werden kann.
Der Ersteller der Christina-Hendricks-LoRA oben erklärt, dass nur 16 Bilder aus der Mad-Men-Fernsehserie benötigt wurden, um das Modell zu entwickeln (das nur 307 MB zum Herunterladen ist); mehrere Beiträge aus der Stable-Diffusion-Community auf Reddit und Discord bestätigen, dass LoRAs dieser Art normalerweise keine großen Mengen an Trainingsdaten oder lange Trainingszeiten erfordern.
Klicken Sie, um abzuspielen. Arnold Schwarzenegger wird in einem Hunyuan-Video-LoRA zum Leben erweckt, der auf Civit heruntergeladen werden kann. Siehe https://www.youtube.com/watch?v=1D7B9g9rY68 für weitere Arnie-Beispiele von AI-Enthusiasten Bob Doyle.
Hunyuan-LoRAs können auf statische Bilder oder Videos trainiert werden, obwohl das Training auf Videos mehr Hardware-Ressourcen und eine längere Trainingszeit erfordert.
Das Hunyuan-Video-Modell verfügt über 13 Milliarden Parameter, was die 12 Milliarden Parameter von Sora übertrifft und das weniger leistungsfähige Hunyuan-DiT-Modell, das im Sommer 2024 als Open Source veröffentlicht wurde, bei weitem übertrifft, das nur 1,5 Milliarden Parameter hat.
Wie es vor zweieinhalb Jahren der Fall war, als Stable Diffusion und LoRA (siehe Beispiele für Stable Diffusion 1.5s “native” Celebrities hier) veröffentlicht wurden, hat das Basis-Modell in Frage eine viel begrenztere Vorstellung von Celebrity-Persönlichkeiten im Vergleich zum Niveau der Treue, das durch “ID-injected” LoRA-Implementierungen erzielt werden kann.
Effektiv erhält ein personalisierter, auf Persönlichkeit fokussierter LoRA eine “kostenlose Fahrt” auf den bedeutenden Synthese-Fähigkeiten des Basis-Hunyuan-Modells und bietet eine bemerkenswert effektivere menschliche Synthese als durch 2017-er Autoencoder-Deepfakes oder durch das Hinzufügen von Bewegung zu statischen Bildern über Systeme wie das gefeierte LivePortrait.
Alle LoRAs, die hier dargestellt werden, können kostenlos von der sehr beliebten Civit-Community heruntergeladen werden, während die zahlreicheren älteren, benutzerdefinierten “statischen Bild”-LoRAs auch potenziell “Seed”-Bilder für den Video-Erstellungsprozess erstellen können (d. h. Bild-zu-Video, eine bevorstehende Veröffentlichung für Hunyuan-Video, obwohl Workarounds möglich sind, für den Moment).
Bitte klicken, um abzuspielen. Oben, Beispiele aus einem “statischen” Flux-LoRA; unten, Beispiele aus einem Hunyuan-Video-LoRA mit der Musikerin Taylor Swift. Beide LoRAs sind kostenlos bei der Civit-Community verfügbar.
Wenn ich schreibe, bietet die Civit-Website 128 Suchergebnisse für “Hunyuan” an. Fast alle davon sind in irgendeiner Weise NSFW-Modelle; 22 zeigen Celebrities; 18 sind dafür ausgelegt, die Generierung von Hardcore-Pornografie zu erleichtern; und nur sieben davon zeigen Männer anstelle von Frauen.
Was ist neu?
Aufgrund der entwickelten Natur des Begriffs Deepfake und des begrenzten öffentlichen Verständnisses der (sehr strengen) Einschränkungen von AI-Human-Video-Synthese-Frameworks bis dato, ist die Bedeutung von Hunyuan-LoRA nicht leicht zu verstehen für eine Person, die die generative AI-Szene nur oberflächlich verfolgt. Lassen Sie uns einige der wichtigsten Unterschiede zwischen Hunyuan-LoRAs und vorherigen Ansätzen zur identitätsbasierten AI-Video-Generierung überprüfen.
1: Ungehinderte lokale Installation
Der wichtigste Aspekt von Hunyuan Video ist die Tatsache, dass es lokal heruntergeladen werden kann und dass es ein sehr leistungsfähiges und unzensiertes AI-Video-Generierungssystem in die Hände des Casual-Users und der VFX-Community legt (soweit Lizenzen dies über geografische Regionen hinweg zulassen).
Das letzte Mal, als dies passierte, war die Veröffentlichung von Stability.ai Stable Diffusion im Sommer 2022. Zu dieser Zeit hatte OpenAIs DALL-E2 die öffentliche Vorstellungskraft erobert, obwohl DALLE-2 ein kostenpflichtiger Dienst mit bemerkenswerten Einschränkungen war (die im Laufe der Zeit zunahmen).
Als Stable Diffusion verfügbar wurde und Low-Rank-Adaptation es ermöglichte, Bilder der Identität von jeder Person (Celebrity oder nicht) zu generieren, half die enorme Konzentration von Entwickler- und Verbraucherinteresse Stable Diffusion, die Popularität von DALLE-2 zu übertreffen; obwohl letzterer ein leistungsfähigeres System aus der Box war, wurden seine Zensurroutinen von vielen seiner Benutzer als onerous angesehen, und Anpassungen waren nicht möglich.
Arguably gilt das gleiche Szenario jetzt zwischen Sora und Hunyuan – oder genauer zwischen Sora-grad proprietären generativen Video-Systemen und Open-Source-Rivalen, von denen Hunyuan der erste ist – aber wahrscheinlich nicht der letzte (hier ist zu beachten, dass Flux schließlich erheblichen Boden auf Stable Diffusion gutgemacht hat).
Benutzer, die Hunyuan-LoRA-Ausgaben erstellen möchten, aber über keine leistungsfähige Ausrüstung verfügen, können wie immer die GPU-Seite des Trainings auf Online-Compute-Dienste wie RunPod auslagern. Dies ist nicht dasselbe, wie AI-Videos auf Plattformen wie Kaiber oder Kling zu erstellen, da keine semantische oder bildbasierte Filterung (Zensur) erforderlich ist, um eine Online-GPU zu mieten, um einen ansonsten lokalen Arbeitsablauf zu unterstützen.
2: Kein Bedarf für “Host”-Videos und hohen Aufwand
Als Deepfakes Ende 2017 auf der Szene erschienen, entwickelte sich der anonym gepostete Code zu den Mainstream-Forks DeepFaceLab und FaceSwap (sowie das DeepFaceLive-Echtzeit-Deepfaking-System).
Diese Methode erforderte die sorgfältige Kuratierung von Tausenden von Gesichtsbildern jeder Identität, die ausgetauscht werden sollte; je weniger Aufwand in dieser Phase betrieben wurde, desto weniger effektiv war das Modell. Zusätzlich variierten die Trainingszeiten zwischen 2-14 Tagen, je nach verfügbarer Hardware, was sogar leistungsfähige Systeme auf Dauer belastete.
Wenn das Modell schließlich fertig war, konnte es nur Gesichter in bestehende Videos einfügen und benötigte normalerweise ein “Ziel” (d. h. eine reale Identität), das dem überlagerten Gesicht in puncto Aussehen ähnelte.
In jüngerer Zeit haben ROOP, LivePortrait und zahlreiche ähnliche Frameworks eine ähnliche Funktionalität mit viel weniger Aufwand und oft mit überlegenen Ergebnissen bereitgestellt – aber ohne die Fähigkeit, genaue Vollkörper-Deepfakes zu erstellen – oder jedes andere Element außer Gesichtern.

Beispiele für ROOP Unleashed und LivePortrait (in der unteren linken Ecke), von Bob Doyles Content-Stream auf YouTube. Quellen: https://www.youtube.com/watch?v=i39xeYPBAAM und https://www.youtube.com/watch?v=QGatEItg2Ns
Im Gegensatz dazu ermöglichen Hunyuan-LoRAs (und ähnliche Systeme, die unweigerlich folgen werden) die unfetterte Erstellung ganzer Welten, einschließlich vollständiger Körper- und Umgebungs-Simulationen der benutzertrainierten LoRA-Identität.
3: Massiv verbesserte temporale Konsistenz
Die temporale Konsistenz war das Heilige der temporalen Konsistenz von Diffusions-Videos für mehrere Jahre. Die Verwendung eines LoRAs zusammen mit geeigneten Prompts gibt einer Hunyuan-Video-Generierung eine konstante Identitätsreferenz, der sie folgen kann. Theoretisch (dies sind noch frühe Tage) könnte man mehrere LoRAs einer bestimmten Identität trainieren, jedes mit spezifischer Kleidung.
Unter diesen Umständen ist es weniger wahrscheinlich, dass die Kleidung während der Video-Generierung “mutiert” (da das generative System die nächste Rahmen auf einem sehr begrenzten Fenster vorheriger Rahmen basiert).
(Alternativ, wie bei image-basierten LoRA-Systemen, kann man einfach mehrere LoRAs anwenden, wie z. B. Identitäts- + Kostüm-LoRAs, auf eine einzelne Video-Generierung)
4: Zugang zum “Menschen-Experiment”
Wie ich kürzlich beobachtet habe, erscheint der proprietäre und FAANG-Level-Generative-AI-Sektor jetzt so sehr besorgt über mögliche Kritik im Zusammenhang mit den menschlichen Synthese-Fähigkeiten seiner Projekte, dass tatsächliche Menschen selten in Projektseiten für große Ankündigungen und Veröffentlichungen erscheinen. Stattdessen zeigen die damit verbundenen Öffentlichkeitsliteraturen zunehmend “süße” und andere “nicht bedrohliche” Themen in synthetisierten Ergebnissen.
Mit dem Aufkommen von Hunyuan-LoRAs hat die Community zum ersten Mal die Gelegenheit, die Grenzen der LDM-basierten menschlichen Video-Synthese in einem hochleistungsfähigen (und nicht marginalen) System zu erforschen und das Thema, das die meisten von uns am meisten interessiert – Menschen – vollständig zu erforschen.
Implikationen
Da eine Suche nach “Hunyuan” in der Civit-Community hauptsächlich Celebrity-LoRAs und “harte” LoRAs zeigt, ist die zentrale Implikation des Aufkommens von Hunyuan-LoRAs, dass sie verwendet werden, um AI-Pornovideos von realen Personen – Celebrities und Unbekannten – zu erstellen.
Für Compliance-Zwecke sind die Hobbyisten, die Hunyuan-LoRAs erstellen und auf verschiedenen Discord-Servern experimentieren, sorgfältig darauf bedacht, Beispiele von realen Personen von der Veröffentlichung auszuschließen. Die Realität ist, dass sogar Bild-Deepfakes jetzt sehr bewaffnet sind; und die Aussicht, realistische Videos hinzuzufügen, kann schließlich die erhöhten Befürchtungen rechtfertigen, die in den letzten sieben Jahren in den Medien wiederholt geäußert wurden und die zu neuen Regulierungen geführt haben.
Der treibende Faktor
Wie immer bleibt Porn der treibende Faktor für Technologie. Was auch immer unsere Meinung über eine solche Verwendung ist, treibt dieser unermüdliche Motor der Antriebskraft Fortschritte im Stand der Technik voran, die letztendlich der breiteren Anwendung zugute kommen können.
In diesem Fall ist es möglich, dass der Preis höher als üblich ist, da die Open-Sourcing von hyperrealistischer Video-Erstellung offensichtliche Implikationen für kriminelle, politische und ethische Missbrauch hat.
Eine Reddit-Gruppe (die ich hier nicht nennen werde), die sich der AI-Generierung von NSFW-Video-Inhalten widmet, hat einen zugehörigen, offenen Discord-Server, auf dem Benutzer ComfyUI-Workflows für die Hunyuan-basierte Video-Porn-Generierung verfeinern. Täglich veröffentlichen Benutzer Beispiele für NSFW-Clips – viele davon können vernünftigerweise als “extrem” oder zumindest als “die Einschränkungen in den Forenregeln strapazierend” bezeichnet werden.
Diese Community unterhält auch ein umfangreiches und gut entwickeltes GitHub-Repository mit Tools, die pornografische Videos herunterladen und verarbeiten können, um Trainingsdaten für neue Modelle bereitzustellen.
Da der beliebteste LoRA-Trainer, Kohya-ss, jetzt Hunyuan-LoRA-Training unterstützt, sinken die Einstiegshürden für ungebundene generative Video-Training täglich, zusammen mit den Hardware-Anforderungen für Hunyuan-Training und Video-Generierung.
Der entscheidende Aspekt von dedizierten Trainingsprogrammen für pornografische AI (im Gegensatz zu Identitäts-Modellen wie Celebrities) besteht darin, dass ein Standard-Basis-Modell wie Hunyuan nicht speziell auf NSFW-Ausgaben trainiert ist und möglicherweise entweder schlecht abschneidet, wenn es aufgefordert wird, NSFW-Inhalte zu generieren, oder Schwierigkeiten hat, gelernte Konzepte und Assoziationen in einer überzeugenden Weise zu entwirren.
Durch die Entwicklung fein abgestimmter NSFW-Basis-Modelle und LoRAs wird es zunehmend möglich, trainierte Identitäten in ein dediziertes “Porn”-Video-Domain zu projizieren; schließlich ist dies nur die Video-Version von etwas, das bereits für Standbilder in den letzten zweieinhalb Jahren passiert ist.
VFX
Der enorme Anstieg der temporalen Konsistenz, den Hunyuan-Video-LoRAs bieten, ist ein offensichtlicher Segen für die AI-Visual-Effects-Industrie, die sehr stark auf die Anpassung von Open-Source-Software angewiesen ist.
Obwohl ein Hunyuan-Video-LoRA-Ansatz ein ganzes Bild und eine Umgebung generiert, haben VFX-Unternehmen wahrscheinlich bereits begonnen, die temporal konsistenten menschlichen Gesichter zu isolieren, die mit dieser Methode erhalten werden können, um Gesichter in Echtzeit-Quellmaterial zu überlagern oder zu integrieren.
Wie die Hobbyisten-Community müssen auch VFX-Unternehmen auf die Veröffentlichung von Hunyuans Bild-zu-Video- und Video-zu-Video-Funktionalität warten, die möglicherweise die nützlichste Brücke zwischen LoRA-getriebenen, ID-basierten “Deepfake”-Inhalten ist; oder improvisieren und die Zwischenzeit nutzen, um die äußeren Fähigkeiten des Frameworks und möglicher Anpassungen und sogar proprietärer Inhouse-Forks von Hunyuan Video zu erforschen.
Obwohl die Lizenzbedingungen für Hunyuan Video technisch die Darstellung realer Personen zulassen, solange eine Genehmigung vorliegt, verbieten sie deren Verwendung in der EU, im Vereinigten Königreich und in Südkorea. Nach dem Grundsatz “was in Vegas passiert, bleibt in Vegas” bedeutet dies nicht unbedingt, dass Hunyuan Video nicht in diesen Regionen verwendet wird; jedoch könnte die Aussicht auf externe Daten-Audits, um wachsende Regulierungen im Bereich der generativen KI durchzusetzen, eine solche illegale Verwendung riskant machen.
Ein weiterer möglicherweise mehrdeutiger Bereich der Lizenzbedingungen besagt:
‘Wenn am Tag der Veröffentlichung der Tencent Hunyuan-Version die monatlichen aktiven Benutzer aller Produkte oder Dienstleistungen, die von oder für den Lizenznehmer bereitgestellt werden, mehr als 100 Millionen monatliche aktive Benutzer im vorherigen Kalendermonat sind, müssen Sie eine Lizenz von Tencent anfordern, die Tencent nach eigenem Ermessen erteilen kann, und Sie sind nicht berechtigt, die Rechte unter diesem Vertrag auszuüben, es sei denn, Tencent erteilt Ihnen diese Rechte ausdrücklich.’
Diese Klausel ist offensichtlich auf die Vielzahl von Unternehmen abzielt, die wahrscheinlich Hunyuan Video für eine relativ technisch ungebildete Benutzerbasis “zwischenlagern” und die verpflichtet sind, Tencent in den Verteilungsprozess einzubinden, wenn eine bestimmte Benutzerschwelle überschritten wird.
Ob die breite Formulierung auch eine indirekte Verwendung (d. h. durch die Bereitstellung von Hunyuan-aktiver visueller Effekt-Ausgabe in beliebten Filmen und Fernsehsendungen) abdecken kann, muss möglicherweise geklärt werden.
Schlussfolgerung
Da Deepfake-Videos seit langem existieren, könnte es leicht sein, die Bedeutung von Hunyuan-Video-LoRA als Ansatz zur Identitätssynthese und Deepfaking zu unterschätzen und anzunehmen, dass die derzeit in der Civit-Community, auf Discord und Subreddits sichtbaren Entwicklungen nur einen kleinen Schritt in Richtung wirklich kontrollierbarer menschlicher Video-Synthese darstellen.
Wahrscheinlicher ist, dass die derzeitigen Bemühungen nur einen Bruchteil des Potenzials von Hunyuan Video zur Erstellung vollständig überzeugender Vollkörper- und Vollumgebungs-Deepfakes darstellen; sobald die Bild-zu-Video-Komponente veröffentlicht wird (von der vermutet wird, dass sie diesen Monat erscheinen wird), wird ein viel granulareres Level der generativen Leistung für die Hobbyisten- und Profi-Community verfügbar sein.
Als Stability.ai Stable Diffusion 2022 veröffentlichte, konnten viele Beobachter nicht verstehen, warum das Unternehmen ein so wertvolles und leistungsfähiges generatives System einfach verschenken würde. Mit Hunyuan Video ist der Gewinnmotiv direkt in die Lizenz eingebaut – obwohl es sich als schwierig für Tencent erweisen kann, zu bestimmen, wann ein Unternehmen das Gewinnbeteiligungs-System auslöst.
Wie dem auch sei, das Ergebnis ist das gleiche wie 2022: Um die Veröffentlichung herum haben sich sofort und mit intensiver Begeisterung dedizierte Entwickler-Communities gebildet. Einige der Wege, die diese Bemühungen in den nächsten 12 Monaten einschlagen werden, sind sicherlich darauf ausgerichtet, neue Schlagzeilen zu produzieren.
* Bis zur Veröffentlichung.
Erstveröffentlichung am Dienstag, 7. Januar 2025












