Andersons vinkel

Opkomsten af Hunyuan Video Deepfakes

mm
Føj Unite.AI til dine foretrukne kilder på Google
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

På grund af nogle af de emner, der diskuteres her, vil denne artikel indeholde færre reference-links og illustrationer end normalt.

Noget bemærkelsesværdigt sker i øjeblikket i AI-syntese-fællesskabet, selvom betydningen kan tage lidt tid at blive tydelig. Hobbyister træner generative AI-video-modeller til at genskabe lighederne af mennesker ved hjælp af video-baserede LoRAs på Tencents nyligt udgivne open source Hunyuan Video-ramme.*

Klik for at afspille. Forskellige resultater fra Hunyuan-baserede LoRA-tilpasninger, frit tilgængelige på Civit-fællesskabet. Ved at træne lav-rang-adaptationsmodeller (LoRAs), reduceres problemerne med temporal stabilitet, som har plaget AI-video-generering i to år, betydeligt. Kilder: civit.ai

I den ovenstående video er lighederne af skuespillerinderne Natalie Portman, Christina Hendricks og Scarlett Johansson, sammen med tech-leder Elon Musk, blevet trænet ind i relativt små tilføjelsesfiler til Hunyuan-generative video-system, som kan installeres uden indholdsfiltre (såsom NSFW-filtre) på en brugers computer.

Opretteren af Christina Hendricks LoRA ovenfor angiver, at kun 16 billeder fra Mad Men-tv-serien var nødvendige for at udvikle modellen (som er en blot 307mb-download); multiple indlæg fra Stable Diffusion-fællesskabet på Reddit og Discord bekræfter, at LoRAs af denne type ikke kræver store mængder træningsdata eller lange træningstider i de fleste tilfælde.

Klik for at afspille. Arnold Schwarzenegger bliver bragt til live i en Hunyuan video LoRA, som kan downloades på Civit. Se https://www.youtube.com/watch?v=1D7B9g9rY68 for yderligere Arnie-eksempler fra AI-entusiast Bob Doyle.

Hunyuan LoRAs kan trænes på enten statiske billeder eller videoer, selvom træning på videoer kræver større hardware-resurser og øget træningstid.

Hunyuan Video-modellen har 13 milliarder parametre, hvilket overgår Sora’s 12 milliarder parametre, og langt overgår den mindre kapable Hunyuan-DiT-model, som blev udgivet til open source i sommeren 2024, og som kun har 1,5 milliarder parametre.

Som var tilfældet to og en halv år siden med Stable Diffusion og LoRA (se eksempler på Stable Diffusion 1.5’s ‘native’ celebrities her), har grundmodellen i spørgsmålet en langt mere begrænset forståelse af celebrity-personligheder, sammenlignet med niveauet af troværdighed, der kan opnås gennem ‘ID-injected’ LoRA-implementeringer.

Effektivt set får en tilpasset, personligheds-fokuseret LoRA en ‘gratis tur’ på den betydelige syntese-kapacitet af grund-Hunyuan-modellen, og tilbyder en bemærkelsesværdigt mere effektiv menneske-syntese end kan opnås enten ved 2017-æra autoencoder deepfakes eller ved at tilføje bevægelse til statiske billeder via systemer som det berømte LivePortrait.

Alle LoRAs, der er vist her, kan downloades frit fra det meget populære Civit-fællesskab, mens det mere talrige antal ældre, speciallavede ‘statisk-billede’-LoRAs også potentielt kan skabe ‘frø’-billeder til video-opsætningen (dvs. billed-til-video, en kommende udgivelse til Hunyuan Video, selvom arbejdsgange er mulige for øjeblikket).

Klik for at afspille. Ovenfor, eksempler fra en ‘statisk’ Flux LoRA; nedenfor, eksempler fra en Hunyuan video LoRA med musikeren Taylor Swift. Begge disse LoRAs er frit tilgængelige på Civit-fællesskabet.

Da jeg skriver, tilbyder Civit-website 128 søgeresultater for ‘Hunyuan’*. Næsten alle disse er på en eller anden måde NSFW-modeller; 22 afbilder celebrities; 18 er designet til at faciliterer generering af hardcore-pornografi; og kun syv af dem afbilder mænd i stedet for kvinder.

Hvad er nyt?

På grund af den udviklende natur af begrebet deepfake, og begrænset offentlig forståelse af (de ret betydelige) begrænsninger af AI-menneske-video-syntese-rammer indtil nu, er betydningen af Hunyuan LoRA ikke let at forstå for en person, der følger generative AI-scenen på en mere afslappet måde. Lad os gennemgå nogle af de vigtigste forskelle mellem Hunyuan LoRAs og tidligere tilgange til identitets-baseret AI-video-generering.

1: Ubegrænset lokal installation

Det vigtigste aspekt af Hunyuan Video er, at det kan downloades lokalt, og at det giver en meget kraftfuld og ucensureret AI-video-genereringssystem i hænderne på den almindelige bruger, samt VFX-fællesskabet (i den udstrækning, licenser tillader det på tværs af geografiske regioner).

Den sidste gang dette skete, var da Stability.ai Stable Diffusion-model blev udgivet til open source i sommeren 2022. På det tidspunkt havde OpenAI’s DALL-E2 fanget den offentlige imagination, selvom DALLE-2 var en betalt tjeneste med bemærkelsesværdige begrænsninger (som voksede over tid).

Da Stable Diffusion blev tilgængelig, og Low-Rank Adaptation derefter gjorde det muligt at generere billeder af identiteten af enhver person (celebrity eller ej), hjalp det enorme fokus af udvikler- og forbruger-interesse med at gøre Stable Diffusion mere populær end DALLE-2; selvom sidstnævnte var en mere kapabel system ud af boksen, var dets censur-rutiner set som betungende af mange af dets brugere, og tilpasning var ikke mulig.

Argumenterbart set gælder det samme scenarie nu mellem Sora og Hunyuan – eller mere præcist, mellem Sora-grad proprietære generative video-systemer og open source-rivaler, hvoraf Hunyuan er den første – men sandsynligvis ikke den sidste (her skal man overveje, at Flux ville til sidst få betydelig ground på Stable Diffusion).

Brugere, der ønsker at oprette Hunyuan LoRA-udsalg, men som mangler effektivt kraftfuld udstyr, kan, som altid, offload GPU-aspektet af træning til online compute-tjenester såsom RunPod. Dette er ikke det samme som at oprette AI-videoer på platforme såsom Kaiber eller Kling, da der ikke er nogen semantisk eller billede-baseret filtrering (censur) involveret i at leje en online GPU til at understøtte en ellers lokal arbejdsproces.

2: Ingen behov for ‘vært’-videoer og høj indsats

Da deepfakes dukkede op på scenen i slutningen af 2017, ville den anonymt-postede kode udvikle sig til de mainstream-fork DeepFaceLab og FaceSwap (samt DeepFaceLive real-time deepfaking-system).

Dette metode krævede den møjsommelige kuratering af tusinder af ansigtsbilleder af hver identitet, der skulle udskiftes; jo mindre indsats, der blev lagt i denne fase, desto mindre effektiv ville modellen være. Derudover var træningstiderne varierende mellem 2-14 dage, afhængigt af tilgængelige hardware, og belastede selv kapable systemer over tid.

Da modellen endelig var klar, kunne den kun indsætte ansigter i eksisterende video, og havde normalt brug for en ‘mål’ (dvs. reel) identitet, der var tæt på den indsætte identitet.

For nylig har ROOP, LivePortrait og talrige lignende rammer leveret lignende funktionalitet med langt mindre indsats, og ofte med overlegne resultater – men med ingen kapacitet til at generere præcise fuld-krop-deepfakes – eller nogen anden del end ansigter.

Eksempler på ROOP Unleashed og LivePortrait (inset nederst til venstre), fra Bob Doyles indhold på YouTube. Kilder: https://www.youtube.com/watch?v=i39xeYPBAAM og https://www.youtube.com/watch?v=QGatEItg2Ns

Eksempler på ROOP Unleashed og LivePortrait (inset nederst til venstre), fra Bob Doyles indhold på YouTube. Kilder: https://www.youtube.com/watch?v=i39xeYPBAAM og https://www.youtube.com/watch?v=QGatEItg2Ns

I modsætning hertil giver Hunyuan LoRAs (og lignende systemer, der uvægerligt vil følge) mulighed for ubegrænset skabelse af hele verdener, herunder fuld-krop-simulation af den bruger-trænede LoRA-identitet.

3: Massivt forbedret temporal konsistens

Temporal konsistens har været den hellige gral for diffusion-video i flere år nu. Brugen af en LoRA, sammen med passende prompts, giver en Hunyuan video-generering en konstant identitets-reference at holde fast i. I teorien (disse er tidlige dage) kunne man træne multiple LoRAs af en bestemt identitet, hver med specifikke klædningsgenstande.

Under disse omstændigheder er det mindre sandsynligt, at klædningsgenstandene ‘mutere’ gennem video-genereringen (da genererings-systemet baserer den næste ramme på en meget begrænset vindue af tidligere rammer).

(Alternativt, som med billede-baserede LoRA-systemer, kan man blot anvende multiple LoRAs, såsom identitet + dragt-LoRAs, til en enkelt video-generering)

4: Adgang til ‘menneske-eksperimentet’

Som jeg for nylig observerede, ser den proprietære og FAANG-niveau generative AI-sektor ud til at være så forsigtig med potentielle kritik relateret til de menneske-syntese-kapaciteter af deres projekter, at rigtige mennesker sjældent vises i projekt-sider for store bekendtgørelser og udgivelser. I stedet viser relateret publikationslitteratur stadig mere ‘søde’ og ‘ikke-truende’ emner i syntetiserede resultater.

Med opkomsten af Hunyuan LoRAs har fællesskabet for første gang en mulighed for at udvide grænserne for LDM-baseret menneske-video-syntese i et meget kapabelt (i stedet for marginelt) system, og fuldt ud at udforske det emne, der interesserer de fleste af os – mennesker.

Konsekvenser

Da en søgning efter ‘Hunyuan’ på Civit-fællesskabet primært viser celebrity LoRAs og ‘hardcore’ LoRAs, er den centrale konsekvens af opkomsten af Hunyuan LoRAs, at de vil blive brugt til at skabe AI-pornografiske (eller andensteds nedsættende) videoer af rigtige mennesker – både celebrities og ukendte.

For overholdelse af reglerne er hobbyisterne, der skaber Hunyuan LoRAs og eksperimenterer med dem på diverse Discord-servere, omhyggelige med at forbyde eksempler på rigtige mennesker fra at blive offentliggjort. Virkeligheden er, at selv billede-baserede deepfakes nu er blevet alvorligt våben; og udsigten til at tilføje virkelig realistiske videoer til blandingen kan måske endelig retfærdiggøre de forhøjede frygt, der har været tilbagevendende i medierne over de sidste syv år, og som har udløst nye reguleringer.

Den drivende kraft

Som altid forbliver porn den drivende kraft for teknologi. Uanset vores mening om sådan brug, driver denne uophørlige motor af fremdrift fremme i den nyeste udvikling, som kan komme til at gavne mere mainstream-tilpasning.

I dette tilfælde kan prisen være højere end normalt, da open-sourcing af hyper-realistisk video-skabelse har åbenlyse konsekvenser for kriminel, politisk og etisk misbrug.

En Reddit-gruppe (som jeg ikke vil nævne her) dedikeret til AI-generering af NSFW-video-indhold har en tilhørende, åben Discord-server, hvor brugere forbedrer ComfyUI-arbejdsgange for Hunyuan-baseret video-porn-generering. Dagligt offentliggør brugere eksempler på NSFW-klip – mange af dem kan rimeligt betegnes som ‘ekstreme’ eller i hvert fald stræber efter at overtræde begrænsningerne i forum-reglerne.

Dette fællesskab vedligeholder også et betydeligt og veludviklet GitHub-repositorium med værktøjer, der kan downloade og behandle pornografiske videoer, for at give træningsdata til nye modeller.

Da den mest populære LoRA-træner, Kohya-ss, nu understøtter Hunyuan LoRA-træning, sænkes barriererne for ubegrænset generativ video-træning dagligt, sammen med hardware-kravene for Hunyuan-træning og video-generering.

Det afgørende aspekt af dedikeret træningsskemaer for porn-baseret AI (i stedet for identitets-baserede modeller, såsom celebrities) er, at en standard grund-model som Hunyuan ikke specifikt er trænet på NSFW-udsalg, og derfor enten kan opføre sig dårligt, når den bedes om at generere NSFW-indhold, eller ikke kan adskille lært koncepter og associationer på en performant eller overbevisende måde.

Ved at udvikle finjusterede NSFW grund-modeller og LoRAs vil det være muligt at projicere trænede identiteter ind i en dedikeret ‘porn’-video-domæne; efter alt, dette er kun video-versionen af noget, der allerede er sket for statiske billeder over de sidste to og en halv år.

VFX

Den enorme forbedring af temporal konsistens, som Hunyuan Video LoRAs tilbyder, er en åbenbar fordel for AI-visuelt effekt-industrien, som læner sig meget tungt på tilpasning af open source-software.

Selvom en Hunyuan Video LoRA-tilgang genererer en hel ramme og omgivelser, har VFX-virksomheder sandsynligvis allerede begyndt at eksperimentere med at isolere de temporal-konsistente menneske-ansigter, der kan opnås ved denne metode, for at indsætte eller integrere ansigter i virkelige kilde-videoer.

Ligesom hobbyist-fællesskabet må VFX-virksomheder vente på Hunyuan Videos billed-til-video og video-til-video-funktionalitet, som potentielt er den mest nyttige bro mellem LoRA-drevet, ID-baseret ‘deepfake’-indhold; eller også improvisere og bruge tidsrummet til at udforske de ydre muligheder for rammen og mulige tilpasninger, og endda proprietære interne forks af Hunyuan Video.

Selvom licens-vilkårene for Hunyuan Video teknisk set tillader afbildning af rigtige personer, så længe tilladelse gives, forbyder de brug i EU, Storbritannien og Sydkorea. På ‘what happens in Vegas, stays in Vegas’-princippet betyder dette ikke nødvendigvis, at Hunyuan Video ikke vil blive brugt i disse regioner; dog kan udsigten til eksterne data-audit, for at gennemtvinge voksende reguleringer omkring generativ AI, kunne gøre en sådan ulovlig brug risikabel.

En anden mulig tvetydig område i licens-vilkårene lyder:

‘Hvis, på Tencents Hunyuan-version-udgivelsesdato, det månedlige antal aktive brugere af alle produkter eller tjenester, der er tilgængelige for eller på vegne af licenshaveren, er større end 100 millioner månedlige aktive brugere i den foregående kalendermåned, skal du anmode om en licens fra Tencent, som Tencent kan give dig efter eget skøn, og du er ikke berettiget til at udøve nogen af rettighederne under denne aftale, medmindre eller til Tencent udtrykkeligt giver dig sådanne rettigheder.’

Dette vilkår er åbenbart rettet mod de mange virksomheder, der sandsynligvis vil ‘mellemlande’ Hunyuan Video for en relativt teknisk ukyndig brugergruppe, og som vil blive påkrævet at give Tencent en andel i aktionen over en vis grænse for brugere.

Hvorvidt den brede formulering også kan dække indirekte brug (dvs. via tilbud af Hunyuan-aktiveret visuelt effekt-udsalg i populære film og TV-serier) kan måske kræve klarhed.

Konklusion

Da deepfake-video har eksisteret i lang tid, ville det være let at undervurdere betydningen af Hunyuan Video LoRA som en tilgang til identitets-syntese og deepfaking; og at antage, at de udviklinger, der i øjeblikket viser sig på Civit-fællesskabet, og på relaterede Discords og subreddits, kun repræsenterer en lille skub i retning af fuldt kontrollerbar menneske-video-syntese.

Det er mere sandsynligt, at de nuværende bestræbelser kun repræsenterer en brøkdel af Hunyuan Videos potentiale til at skabe fuldt overbevisende fuld-krop- og fuld-miljø-deepfakes; når billed-til-video-komponenten udgives (rygtes at ske denne måned), vil et langt mere detaljeret niveau af generativ kraft blive tilgængeligt for både hobbyist- og professionelle fællesskaber.

Da Stability.ai udgav Stable Diffusion i 2022, kunne mange iagttagere ikke bestemme, hvorfor virksomheden ville give væk en så værdifuld og kraftfuld generativ system; med Hunyuan Video er profitmotivet bygget direkte ind i licensen – selvom det kan vise sig svært for Tencent at bestemme, når en virksomhed udløser profit-delings-skemaet.

Under alle omstændigheder er resultatet det samme, som det var i 2022: dedikeret udvikler-fællesskaber har dannet sig straks og med intens glød omkring udgivelsen. Nogle af de veje, disse bestræbelser vil tage i de næste 12 måneder, er sandsynligvis på vej til at fremkalde nye overskrifter.

 

* Op til 136 på tidspunktet for offentliggørelse.

Offentliggjort tirsdag, 7. januar 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai