Andersons vinkel

Oppgangen av Hunyuan Video Deepfakes

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

På grunn av noen av de emnene som diskuteres her, vil denne artikkelen inneholde færre referanser og illustrasjoner enn vanlig.

Noen merkbart er for tiden i gang i AI-syntesegemenskapen, selv om betydningen kan ta en stund å bli klar. Hobbyister trener generative AI-videomodeller for å gjenskape likhetene til mennesker, ved hjelp av video-baserte LoRAs på Tencents nylig lanserte åpne kildekodemodell Hunyuan Video-rammeverk.*

Klikk for å spille. Forskjellige resultater fra Hunyuan-basert LoRA-tilpasninger som er fritt tilgjengelig på Civit-samfunnet. Ved å trene lav-rang-tilpasningsmodeller (LoRAs), reduseres problemene med tidsmessig stabilitet, som har plaget AI-videogenerering i to år, betydelig. Kilder: civit.ai

I videoen ovenfor er likhetene til skuespillerne Natalie Portman, Christina Hendricks og Scarlett Johansson, sammen med teknologilederen Elon Musk, blitt trenet inn i relativt små tilleggsfiler for Hunyuan-generativt videosystem, som kan installeres uten innholdfiltre (slik som NSFW-filtre) på en brukers datamaskin.

Skaperen av Christina Hendricks LoRA ovenfor hevder at bare 16 bilder fra Mad Men-TV-serien var nødvendig for å utvikle modellen (som er en kun 307mb-nedlastning); flere innlegg fra Stable Diffusion-samfunnet på Reddit og Discord bekrefter at LoRAs av denne typen ikke krever store mengder treningdata eller lange treningsperioder, i de fleste tilfeller.

Klikk for å spille. Arnold Schwarzenegger blir levendegjort i en Hunyuan-videoloRA som kan lastes ned på Civit. Se https://www.youtube.com/watch?v=1D7B9g9rY68 for flere Arnie-eksempler, fra AI-entusiast Bob Doyle.

Hunyuan LoRAs kan trenes på enten statiske bilder eller videoer, selv om trening på videoer krever større maskinvareressurser og økt treningsperiode.

Hunyuan Video-modellen har 13 milliarder parametre, og overgår Sora sine 12 milliarder parametre, og langt overgår den mindre kapable Hunyuan-DiT-modellen som ble lansert som åpen kilde i sommeren 2024, som kun har 1,5 milliarder parametre.

Som var tilfelle for to og en halv år siden med Stable Diffusion og LoRA (se eksempler på Stable Diffusion 1.5 sine ‘native’ kjendiser her), har grunnmodellen i question en langt mer begrenset forståelse av kjendispersonligheter, sammenlignet med nivået av troverdighet som kan oppnås gjennom ‘ID-injeksjon’ LoRA-implementeringer.

Effektivt, en tilpasset, personlighetsfokusert LoRA får en ‘gratis tur’ på den betydelige syntese-evnen til grunnmodellen Hunyuan, og tilbyr en merkbart mer effektiv menneskesyntese enn hva som kan oppnås enten ved 2017-års autoencoder deepfakes eller ved å legge til bevegelse til statiske bilder via systemer som det berømte LivePortrait.

Alle LoRAs avbildet her kan lastes ned fritt fra det svært populære Civit-samfunnet, mens den mer tallrike eldre, tilpassede ‘statisk-bilde’ LoRAs også potensielt kan skape ‘frø’ bilder for videoprosessen (dvs. bilde-til-video, en ventende utgivelse for Hunyuan Video, selv om arbeidsganger er mulig, for øyeblikket).

Klikk for å spille. Ovenfor, eksempler fra en ‘statiske’ Flux LoRA; nedenfor, eksempler fra en Hunyuan-videoloRA med musikeren Taylor Swift. Begge disse LoRAs er fritt tilgjengelige på Civit-samfunnet.

Da jeg skriver, tilbyr Civit-nettstedet 128 søke resultater for ‘Hunyuan’*. Nesten alle disse er på noen måte NSFW-modeller; 22 avbilder kjendiser; 18 er designet for å fasilitere generering av hardcore-pornografi; og bare syv av dem avbilder menn i stedet for kvinner.

Hva er nytt?

På grunn av den utviklende naturen av begrepet deepfake, og begrenset offentlig forståelse av (ganske alvorlige) begrensningene av AI-menneske-videosyntese-rammeverk til dags dato, er betydningen av Hunyuan LoRA ikke lett å forstå for en person som følger generativ AI-scenen på en kasuell måte. La oss gjennomgå noen av de viktigste forskjellene mellom Hunyuan LoRAs og tidligere tilnærminger til identitetsbasert AI-videogenerering.

1: Ubegrenset lokal installasjon

Det viktigste aspektet ved Hunyuan Video er at det kan lastes ned lokalt, og at det plasserer en svært kraftig og usensurert AI-videogenereringssystem i hendene på den kasuelle brukeren, samt VFX-samfunnet (i den utstrekning lisensene tillater over geografiske regioner).

Den siste gangen dette skjedde var ved lanseringen av Stability.ai Stable Diffusion-modellen sommeren 2022. Da hadde OpenAI’s DALL-E2 fanget den offentlige fantasien, selv om DALLE-2 var en betalt tjeneste med merkede begrensninger (som vokste over tid).

Da Stable Diffusion ble tilgjengelig, og Low-Rank-tilpasning gjorde det mulig å generere bilder av identiteten til enhver person (kjendis eller ikke), hjalp det enorme fokuset på utvikler- og forbrukerinteresse Stable Diffusion til å overskygge populariteten til DALLE-2; selv om sistnevnte var en mer kapabel system ut av boksen, var dens sensur-rutiner sett som påtvingende av mange av dens brukere, og tilpasning var ikke mulig.

Argumenterbart er det samme scenario nå gjelder mellom Sora og Hunyuan – eller, mer nøyaktig, mellom Sora-grad proprietære generative videosystemer, og åpne kildekoderivaler, av hvilke Hunyuan er den første – men sannsynligvis ikke den siste (her, vurdér at Flux ville til slutt vinne betydelig terreng på Stable Diffusion).

Brukere som ønsker å lage Hunyuan LoRA-utdata, men som mangler effektivt kraftige enheter, kan, som alltid, laste ned GPU-delen av treningsprosessen til online-komputertjenester slik som RunPod. Dette er ikke det samme som å lage AI-videopå platformer som Kaiber eller Kling, siden det ikke er noen semantisk eller bilde-basert filtrering (sensur) medført i å leie en online-GPU for å støtte en ellers lokal arbeidsflyt.

2: Ingen behov for ‘vert’-videoer og høy innsats

Da deepfakes dukket opp på scenen i slutten av 2017, ville den anonymt-postede koden utvikle seg til de mest kjente forkene DeepFaceLab og FaceSwap (samt DeepFaceLive realtids-deepfaking-systemet).

Dette metoden krevde den møysommelige kurasjonen av tusenvis av ansiktsbilder av hver identitet som skulle byttes ut; jo mindre innsats som ble lagt i denne fasen, jo mindre effektiv ville modellen være. I tillegg varierte treningsperiodene mellom 2-14 dager, avhengig av tilgjengelig maskinvare, og belastet selv kapable systemer på lang sikt.

Da modellen endelig var klar, kunne den bare påføre ansikter inn i eksisterende video, og trengte vanligvis en ‘mål’ (dvs. ekte) identitet som var nær i utseende til den overlagte identiteten.

Mer nylig har ROOP, LivePortrait og lignende rammeverk tilbudt lignende funksjonalitet med langt mindre innsats, og ofte med overlegne resultater – men uten evne til å generere nøyaktige full-kropps-deepfakes – eller noen annen element enn ansikter.

Eksempler på ROOP Unleashed og LivePortrait (insett nede til venstre), fra Bob Doyles innhold på YouTube. Kilder: https://www.youtube.com/watch?v=i39xeYPBAAM og https://www.youtube.com/watch?v=QGatEItg2Ns

Eksempler på ROOP Unleashed og LivePortrait (insett nede til venstre), fra Bob Doyles innhold på YouTube. Kilder: https://www.youtube.com/watch?v=i39xeYPBAAM og https://www.youtube.com/watch?v=QGatEItg2Ns

I motsetning tillater Hunyuan LoRAs (og lignende systemer som vil følge) ubegrenset skapning av hele verdener, inkludert full-kropps-simulering av bruker-trente LoRA-identiteten.

3: Massivt forbedret tidsmessig konsistens

Tidsmessig konsistens har vært den hellige gral for diffusjonsvideo i flere år nå. Bruken av en LoRA, sammen med passende promter, gir en Hunyuan-videogenerering en konstant identitetsreferanse å holde seg til. I teorien (disse er tidlige dager) kunne en trene flere LoRAs av en bestemt identitet, hver med spesifikke klær.

Under disse omstendighetene er det mindre sannsynlig at klærne ‘muterer’ gjennom løpet av en videogenerering (siden genererings-systemet baserer neste ramme på en svært begrenset vindu av forrige rammene).

(Alternativt, som med bilde-basert LoRA-systemer, kan en enkelt anvende flere LoRAs, slik som identitet + kostyme LoRAs, til en enkelt videogenerering)

4: Tilgang til ‘menneske-eksperimentet’

Som jeg nylig observerte, ser det proprietære og FAANG-nivå generative AI-sektoren nå ut til å være så redd for potensiell kritikk relatert til menneske-syntese-egenskapene til sine prosjekter, at faktiske mennesker sjelden vises i prosjekt-sider for store annonseringer og utgivelser. I stedet viser relatert publikasjonslitteratur stadig oftere ‘cute’ og andre ‘ikke-truende’ subjekter i syntetiske resultater.

Med introduksjonen av Hunyuan LoRAs, har samfunnet for første gang en mulighet til å presse grensene for LDM-basert menneske-videosyntese i et svært kapabelt (i stedet for marginelt) system, og å fullt ut utforske emnet som interesserer majoriteten av oss – mennesker.

Konsekvenser

Ettersom en søkning etter ‘Hunyuan’ på Civit-samfunnet hovedsakelig viser kjendis-LoRAs og ‘hardcore’-LoRAs, er den sentrale konsekvensen av introduksjonen av Hunyuan LoRAs at de vil bli brukt til å lage AI-pornografiske (eller andre skadelige) videoer av ekte mennesker – både kjendiser og ukjente.

For overholdelse av regler, er hobbyistene som lager Hunyuan LoRAs og som eksperimenterer med dem på diverse Discord-servere, nøye med å forbyle eksempler på ekte mennesker fra å bli postet. Virkeligheten er at selv bilde-basert deepfakes nå er svært våpenisert; og utsikten til å legge til realistiske videoer i blandingen, kan endelig rettferdiggjøre de forhøyede fryktene som har vært gjentakende i media over de siste syv årene, og som har utløst nye reguleringer.

Den drivende kraften

Som alltid, er porn den drivende kraften for teknologi. Uansett vår mening om slik bruk, driver denne uavbrutte motoren fremover fremtredende fremgang i standen av kunnskap som kan til slutt komme til å benefitere mer mainstream-tilpasning.

I dette tilfellet kan prisen være høyere enn vanlig, siden åpne kildekodemodellen for hyper-realistisk videokreasjon har åpenbare implikasjoner for kriminell, politisk og etisk misbruk.

En Reddit-gruppe (som jeg ikke vil navngi her) dedikert til AI-generering av NSFW-video-innhold, har en tilhørende åpen Discord-server hvor brukerne forbedrer ComfyUI-arbeidsflyter for Hunyuan-basert video-pornogenerering. Daglig posterer brukerne eksempler på NSFW-klipp – mange av dem kan rimeligvis kalles ‘ekstreme’, eller i det minste strekker grensene for restriksjonene i forum-regler.

Dette samfunnet vedlikeholder også et betydelig og velutviklet GitHub-repositorium med verktøy som kan laste ned og prosessere pornografiske videoer, for å gi treningsdata for nye modeller.

Ettersom den mest populære LoRA-treneren, Kohya-ss, nå støtter Hunyuan LoRA-trening, senkes barrierene for ubegrenset generativ videotrening daglig, sammen med maskinvarekravene for Hunyuan-trening og videogenerering.

Det kritiske aspektet ved dedikerte treningsordninger for porn-basert AI (i stedet for identitets-baserte modeller, slik som kjendiser) er at en standard grunnmodell som Hunyuan ikke er spesifikt trenet på NSFW-utdata, og kan derfor enten fungere dårlig når den blir bedt om å generere NSFW-innhold, eller mislykkes i å skille lært konsepter og assosiasjoner på en performant eller overbevisende måte.

Ved å utvikle finjusterte NSFW-grunnmodeller og LoRAs, vil det bli stadig mulig å projicere trenede identiteter inn i en dedikert ‘porn’-video-domen; etter all, dette er bare video-versjonen av noe som allerede har skjedd for statiske bilder over de siste to og en halv årene.

VFX

Den enorme økningen i tidsmessig konsistens som Hunyuan Video LoRAs tilbyr, er en åpenbar gevinst for AI-visuelle effekter-industrien, som hviler tungt på å tilpasse åpen kildekode.

Selv om en Hunyuan Video LoRA-tilnærming genererer en hel ramme og miljø, har VFX-selskaper nesten sikkert begynt å eksperimentere med å isolere de tidsmessig-konsistente menneskeansikter som kan oppnås ved denne metoden, for å overføre eller integrere ansikter inn i virkelige kilde-klipp.

Liksom hobbyist-samfunnet, må VFX-selskaper vente på at Hunyuan Video får image-til-video- og video-til-video-funksjonalitet, som potensielt er den mest nyttige broen mellom LoRA-drevet, ID-basert ‘deepfake’-innhold; eller også improvisere, og bruke intervallet til å utforske de ytre evnene til rammeverket og til mulige tilpasninger, og selv proprietære interne grenutgaver av Hunyuan Video.

Siden lisensvilkårene for Hunyuan Video teknisk sett tillater avbildningen av ekte personer så lenge tillatelse er gitt, forbryter de bruken i EU, Storbritannia og Sør-Korea. På ‘stays in Vegas’-prinsippet, betyr dette ikke nødvendigvis at Hunyuan Video ikke vil bli brukt i disse regionene; likevel kan utsikten til eksterne data-auditorer, for å håndheve en økende reguleringer rundt generativ AI, gjøre en slik ulovlig bruk risikabel.

En annen mulig tvetydig del av lisensvilkårene lyder:

‘Hvis, på Tencents Hunyuan-versjons-utgivelsesdato, den månedlige aktive brukerne av alle produkter eller tjenester som er tilgjengelige av eller for lisenshaver, er større enn 100 millioner månedlige aktive brukere i den foregående kalendermåned, må du be om en lisens fra Tencent, som Tencent kan gi til deg etter eget skjønn, og du er ikke autorisert til å utøve noen av rettighetene under denne avtalen med mindre eller til Tencent ellers uttrykkelig gir deg slik rettighet.’

Dette vilkåret er åpenbart rettet mot mangfoldet av selskaper som sannsynligvis vil ‘megle’ Hunyuan Video for en relativt teknisk uvitende gruppe brukere, og som vil bli pålagt å gi Tencent en andel av inntektene over en bestemt grense av brukere.

Hvorvidt den brede formuleringen også kan dekke indirekte bruk (dvs. via tilbud av Hunyuan-aktivert visuell effekt-utdata i populære filmer og TV-serier) kan trenge klargjøring.

Konklusjon

Ettersom deepfake-video har eksistert i lang tid, ville det være lett å undervurdere betydningen av Hunyuan Video LoRA som en tilnærming til identitetssyntese og deepfaking; og å anta at de utviklingene som for tiden manifesterer seg på Civit-samfunnet, og på relaterte Discords og subreddits, representerer bare en mindre, inkrementell skubbe mot fullt kontrollerbar menneske-videosyntese.

Mer sannsynlig er at de nåværende innsatsene bare representerer en brøkdel av Hunyuan Videos potensiale til å skape fullstendig overbevisende full-kropps- og full-miljø-deepfakes; når image-til-video-komponenten blir utgitt (ryktet sier at dette skjer denne måneden), vil en langt mer detaljert nivå av generativ kraft bli tilgjengelig for både hobbyist- og profesjonelle samfunn.

Når Stability.ai lanserte Stable Diffusion i 2022, kunne mange observatører ikke bestemme hvorfor selskapet bare ga bort hva som på den tiden var et så verdifullt og kraftig generativt system. Med Hunyuan Video er profitmotivet bygget direkte inn i lisensen – selv om det kan vise seg å være vanskelig for Tencent å bestemme når et selskap utløser gevinst-delingsordningen.

Uansett, er resultatet det samme som det var i 2022: dedikerte utviklingssamfunn har dannet seg umiddelbart og med intens glød rundt utgivelsen. Noen av veiene som disse innsatsene vil ta i de neste 12 månedene, er sikkert å utløse nye overskrifter.

 

* Opp til 136 på tidspunktet for utgivelsen.

Først utgitt tirsdag, 7. januar 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai