Andersons vinkel

Hunyuan Video Deepfakes Uppåtgången

mm
Lägg till Unite.AI bland dina föredragna källor på Google
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

På grund av vissa av de ämnen som diskuteras här kommer den här artikeln att innehålla färre referenslänkar och illustrationer än vanligt.

Något anmärkningsvärt händer för närvarande i AI-syntesgemenskapen, även om dess betydelse kan ta en stund att bli tydlig. Hobbyister tränar generativa AI-videomodeller för att reproducera likheterna hos människor med hjälp av video-baserade LoRAs på Tencents nyligen släppta öppen källkods Hunyuan Video-ramverk.*

Klicka för att spela. Olika resultat från Hunyuan-baserade LoRA-anpassningar som fritt finns tillgängliga i Civit-samhället. Genom att träna låg-rank-adaptationsmodeller (LoRAs) minskas problemen med temporär stabilitet, som har plågat AI-videogenerering i två år, avsevärt. Källor: civit.ai

I videon ovan har likheterna hos skådespelerskorna Natalie Portman, Christina Hendricks och Scarlett Johansson, tillsammans med teknikledaren Elon Musk, tränats in i relativt små tilläggsfiler för Hunyuan-generativa videosystemet, som kan installeras utan innehållsfilter (såsom NSFW-filter) på en användares dator.

Skaparen av Christina Hendricks LoRA ovan påstår att endast 16 bilder från Mad Men-TV-serien behövdes för att utveckla modellen (som är enbart 307mb nedladdning); flera inlägg från Stable Diffusion-gemenskapen på Reddit och Discord bekräftar att LoRAs av detta slag inte kräver stora mängder träningsdata eller långa tränings­tider i de flesta fall.

Klicka för att spela. Arnold Schwarzenegger kommer till liv i en Hunyuan-videoloRA som kan laddas ner på Civit. Se https://www.youtube.com/watch?v=1D7B9g9rY68 för ytterligare Arnie-exempel, från AI-entusiasten Bob Doyle.

Hunyuan LoRAs kan tränas på antingen statiska bilder eller videor, även om tränings­tiden kräver större hårdvaruresurser och ökad tränings­tidsåtgång.

Hunyuan-videomodellen har 13 miljarder parametrar, vilket överstiger Soras 12 miljarder parametrar och vida överstiger den mindre kapabla Hunyuan-DiT-modellen som släpptes som öppen källkod sommaren 2024, som endast har 1,5 miljarder parametrar.

Som var fallet för två och ett halvt år sedan med Stable Diffusion och LoRA (se exempel på Stable Diffusions ‘inbyggda’ kändisar här), har grundmodellen i fråga en långt mer begränsad förståelse för kändispersonligheter jämfört med den nivå av trohet som kan erhållas genom ‘ID-injektion’ av LoRA-implementeringar.

Effektivt får en anpassad, personlighetsfokuserad LoRA en ‘gratis resa’ på den betydande syntesförmågan hos grundmodellen Hunyuan, vilket erbjuder en påtagligt mer effektiv mänsklig syntes än vad som kan erhållas antingen genom 2017 års autoencoder-deepfakes eller genom att lägga till rörelse till statiska bilder via system som det hyllade LivePortrait.

Alla LoRAs som visas här kan laddas ner fritt från det mycket populära Civit-samhället, medan det större antalet äldre anpassade ‘statiska-bild’-LoRAs också potentiellt kan skapa ‘frö’-bilder för videokreationen (dvs. bild-till-video, en kommande version för Hunyuan Video, även om lösningar är möjliga för tillfället).

Klicka för att spela. Ovan, prover från en ‘statisk’ Flux LoRA; nedan, exempel från en Hunyuan-videoloRA med musikern Taylor Swift. Båda dessa LoRAs är fritt tillgängliga i Civit-samhället.

När jag skriver erbjuder Civit-webbplatsen 128 sökresultat för ‘Hunyuan’*. Nästan alla av dessa är på något sätt NSFW-modeller; 22 avbildar kändisar; 18 är utformade för att underlätta generering av hårdporr; och endast sju av dem avbildar män snarare än kvinnor.

Vad är nytt?

På grund av den utvecklande naturen av termen deepfake och den begränsade allmänna förståelsen av (ganska allvarliga) begränsningarna av AI-mänsklig videosyntesramverk hittills, är betydelsen av Hunyuan LoRA inte lätt att förstå för en person som följer den generativa AI-scenen på ett ledigt sätt. Låt oss gå igenom några av de viktigaste skillnaderna mellan Hunyuan LoRAs och tidigare tillvägagångssätt för identitetsbaserad AI-videogenerering.

1: Otillbundet lokalt installation

Den viktigaste aspekten av Hunyuan Video är det faktum att den kan laddas ner lokalt och att den ger en mycket kraftfull och ocensurerad AI-videogenereringssystem i händerna på den ovanliga användaren, samt VFX-gemenskapen (i den utsträckning som licenser kan tillåta över geografiska regioner).

Senast detta hände var när Stability.ai släppte Stable Diffusion som öppen källkod sommaren 2022. Vid den tiden hade OpenAI:s DALL-E2 fångat den allmänna fantasin, även om DALLE-2 var en betald tjänst med anmärkningsvärda begränsningar (som växte över tiden).

När Stable Diffusion blev tillgänglig och Low-Rank Adaptation gjorde det möjligt att generera bilder av identiteten hos vilken som helst person (kändis eller inte), hjälpte den enorma lokusen av utvecklare och konsumentintresse till att göra Stable Diffusion mer populärt än DALLE-2; även om den senare var ett mer kapabelt system ur lådan, sågs dess censurrutiner som betungande av många av dess användare, och anpassning var inte möjlig.

Troligen gäller samma scenario nu mellan Sora och Hunyuan – eller, mer exakt, mellan Sora-grad proprietära generativa videor och öppen källkods-rivaler, av vilka Hunyuan är den första – men troligen inte den sista (här bör man överväga att Flux så småningom skulle vinna mark på Stable Diffusion).

Användare som vill skapa Hunyuan LoRA-utdata men som saknar effektivt kraftfull utrustning kan, som alltid, lägga över GPU-aspekten av träningsprocessen till onlineberäkningstjänster såsom RunPod. Detta är inte detsamma som att skapa AI-videor på plattformar som Kaiber eller Kling, eftersom det inte finns någon semantisk eller bildbaserad filtrering (censur) inblandad i att hyra en online-GPU för att stödja en annars lokal arbetsprocess.

2: Inget behov av ‘värd’-videor och hög ansträngning

När deepfakes bröt ut på scenen i slutet av 2017, utvecklades den anonymt publicerade koden till de mest populära grenarna DeepFaceLab och FaceSwap (samt DeepFaceLive realtids-deepfaking-system).

Denna metod krävde den mödosamma samlingen av tusentals ansiktsbilder av varje identitet som skulle bytas ut; ju mindre ansträngning som lades ner på detta stadium, desto mindre effektivt blev modellen. Dessutom varierade tränings­tider mellan 2-14 dagar, beroende på tillgänglig hårdvara, och stressade till och med kapabla system på lång sikt.

När modellen slutligen var klar kunde den endast imponera ansikten i befintliga videor och behövde vanligtvis en ‘mål’ (dvs. verklig) identitet som var nära i utseende till den överlagrade identiteten.

På senare tid har ROOP, LivePortrait och liknande ramverk tillhandahållit liknande funktionalitet med betydligt mindre ansträngning och ofta med överlägsna resultat – men utan förmåga att generera exakta fullkropps-deepfakes – eller någon annan komponent än ansikten.

Exempel på ROOP Unleashed och LivePortrait (insett längst ner till vänster), från Bob Doyles innehållsström på YouTube. Källor: https://www.youtube.com/watch?v=i39xeYPBAAM och https://www.youtube.com/watch?v=QGatEItg2Ns

Exempel på ROOP Unleashed och LivePortrait (insett längst ner till vänster), från Bob Doyles innehållsström på YouTube. Källor: https://www.youtube.com/watch?v=i39xeYPBAAM och https://www.youtube.com/watch?v=QGatEItg2Ns

Till skillnad från detta tillåter Hunyuan LoRAs (och liknande system som troligen kommer att följa) skapandet av hela världar, inklusive fullkropps-simulering av den användar-tränade LoRA-identiteten.

3: Massivt förbättrad temporär konsekvens

Temporär konsekvens har varit den heliga graal för diffusion video under flera år nu. Användningen av en LoRA, tillsammans med lämpliga promter, ger en Hunyuan-videogenerering en konstant identitetsreferens att följa. I teorin (detta är tidiga dagar) kunde man träna flera LoRAs av en specifik identitet, var och en iklädd specifika kläder.

Under dessa omständigheter är kläderna mindre benägna att ‘mutera’ under videogenereringens gång (eftersom det generativa systemet baserar nästa bildruta på ett mycket begränsat fönster av föregående bildrutor).

(Alternativt, som med bildbaserade LoRA-system, kan man enkelt tillämpa flera LoRAs, såsom identitet + kostym-LoRAs, på en enda videogenerering)

4: Tillgång till ‘människo-experimentet’

Som jag nyligen observerade, verkar den proprietära och FAANG-nivå generativa AI-sektorn nu vara så rädd för potentiell kritik relaterad till de mänskliga syntesförmågorna hos sina projekt, att faktiska människor sällan visas i projekt sidor för stora tillkännagivanden och utgåvor. I stället tenderar relaterad publicistlitteratur alltmer att visa ‘söta’ och på annat sätt ‘icke-hotfulla’ ämnen i syntetiserade resultat.

Med Hunyuan LoRAs får samhället för första gången en möjlighet att driva gränserna för LDM-baserad mänsklig videosyntes i ett högkvalitativt (snarare än marginellt) system och att fullständigt utforska det ämne som intresserar de flesta av oss – människor.

Implikationer

Eftersom en sökning efter ‘Hunyuan’ i Civit-samhället mest visar kändis-LoRAs och ‘hårdporr’-LoRAs, är den centrala implikationen av Hunyuan LoRAs att de kommer att användas för att skapa AI-porografiska (eller på annat sätt förtalande) videor av verkliga människor – kändisar och okända lika.

För efterlevnadssyften är hobbyister som skapar Hunyuan LoRAs och som experimenterar med dem på olika Discord-servrar försiktiga med att förbjuda exempel på verkliga människor från att publiceras. Verkligheten är att även bild-baserade deepfakes nu allvarligt vapen; och utsikten att lägga till verkligt realistiska videor i mixen kan slutligen berättiga de förhöjda farhågor som har varit återkommande i media under de senaste sju åren och som har utlöst nya regleringar.

Den drivande kraften

Som alltid förblir porr den drivande kraften för teknologi. Oavsett vår uppfattning om en sådan användning driver denna outtröttliga motor för framsteg framåt på ett sätt som kan gynna mer allmän användning.

I det här fallet kan priset vara högre än vanligt, eftersom öppen källkod för hyperrealistisk videokreation har uppenbara implikationer för brottslig, politisk och etisk missbruk.

En Reddit-grupp (som jag inte kommer att nämna här) som är dedikerad till AI-generering av NSFW-videoinnehåll har en associerad, öppen Discord-server där användare förfinar ComfyUI-arbetsflöden för Hunyuan-baserad videoporr-generering. Dagligen publicerar användare exempel på NSFW-klipp – många av vilka rimligtvis kan kallas ‘extrema’ eller åtminstone sträcker sig utanför begränsningarna som anges i forumregler.

Denna gemenskap underhåller också ett betydande och välutvecklat GitHub-arkiv med verktyg som kan ladda ner och bearbeta pornografiska videor för att tillhandahålla träningsdata för nya modeller.

Eftersom den mest populära LoRA-tränaren, Kohya-ss, nu stöder Hunyuan LoRA-träning, sänks barriärerna för obehindrad generativ videoträning dagligen, samt hårdvarukraven för Hunyuan-träning och videogenerering.

Den avgörande aspekten av dedikerade träningsplaner för porr-baserad AI (snarare än identitets-baserade modeller, såsom kändisar) är att en standard grundmodell som Hunyuan inte är specifikt tränad på NSFW-utdata och därför antingen kan utföra dåligt när den begärs att generera NSFW-innehåll eller misslyckas med att avskilja inlärda koncept och associationer på ett tillfredsställande eller övertygande sätt.

Genom att utveckla finjusterade NSFW-grundmodeller och LoRAs kommer det att bli alltmer möjligt att projicera tränade identiteter in i en dedikerad ‘porr’-videodomän; efter allt är detta bara videoversionen av något som redan har hänt för stillbilder under de senaste två och ett halvt åren.

VFX

Den enorma ökningen av temporär konsekvens som Hunyuan Video LoRAs erbjuder är en uppenbar fördel för den AI-visuella effektindustrin, som litar tungt på anpassning av öppen källkodsprogramvara.

Även om en Hunyuan Video LoRA-ansats genererar en hel bildruta och miljö, har VFX-företag förmodligen redan börjat experimentera med att isolera de temporärt konsekventa mänskliga ansikten som kan erhållas med denna metod, för att implantera eller integrera ansikten i verkliga källbilder.

Liksom hobbyist-gemenskapen måste VFX-företag vänta på Hunyuan Videos bild-till-video och video-till-video-funktionalitet, som potentiellt är den mest användbara bron mellan LoRA-driven, ID-baserad ‘deepfake’-innehåll; eller också improvisera och använda intervallet för att undersöka de yttre förmågorna hos ramverket och eventuella anpassningar, och till och med proprietära in-house-grenar av Hunyuan Video.

Även om licensvillkoren för Hunyuan Video tekniskt sett tillåter avbildning av verkliga personer så länge tillstånd ges, förbjuder de dess användning i EU, Storbritannien och i Sydkorea. På ‘stays in Vegas’-principen behöver detta inte nödvändigtvis betyda att Hunyuan Video inte kommer att användas i dessa regioner; dock kan utsikten till externa datarevisioner för att verkställa en växande reglering kring generativ AI göra en sådan otillåten användning riskabel.

En annan potentiellt tvetydig del av licensvillkoren lyder:

‘Om, på datum för utgivning av Tencent Hunyuan-version, den månatliga aktiva användarantalet för alla produkter eller tjänster som görs tillgängliga av eller för licensinnehavaren är större än 100 miljoner månatliga aktiva användare under den föregående kalendermånaden, måste du begära en licens från Tencent, som Tencent kan bevilja dig efter eget gottfinnande, och du är inte behörig att utöva någon av rättigheterna enligt detta avtal såvida och så länge Tencent inte uttryckligen beviljar dig sådana rättigheter.’

Denna klausul är tydligt riktad mot det stora antalet företag som sannolikt kommer att ‘mellanhandla’ Hunyuan Video för en relativt tekniskt outvecklad grupp användare och som kommer att krävas att ge Tencent en andel, över en viss gräns för användare.

Om den breda formuleringen också kan täcka indirekt användning (dvs. via tillhandahållande av Hunyuan-aktiverad visuell effektutdata i populära filmer och TV-serier) kan kräva förtydligande.

Slutsats

Eftersom deepfake-video har funnits under en lång tid, vore det lätt att underskatta betydelsen av Hunyuan Video LoRA som en ansats till identitetssyntes och deepfaking; och att anta att de insatser som för närvarande manifesteras i Civit-samhället och på relaterade Discords och subreddits representerar enbart en marginell skjutning mot fullständigt kontrollerbar mänsklig videosyntes.

Mer troligt är att de nuvarande ansträngningarna representerar endast en bråkdel av Hunyuan Videos potential att skapa fullständigt övertygande fullkropps- och fullmiljö-deepfakes; när bild-till-video-komponenten släpps (ryktas att ske denna månad), kommer en mycket mer detaljerad nivå av generativ kraft att bli tillgänglig för både hobbyist- och proffsgemenskaperna.

När Stability.ai släppte Stable Diffusion 2022 kunde många observatörer inte bestämma varför företaget skulle ge bort vad som då var ett så värdefullt och kraftfullt generativt system. Med Hunyuan Video är vinstmotivet byggt direkt in i licensen – även om det kan visa sig svårt för Tencent att avgöra när ett företag utlöser vinst-delningssystemet.

I vilket fall som helst är resultatet detsamma som det var 2022: dedikerade utvecklingsgemenskaper har bildats omedelbart och med intensiv iver runt utgivningen. Några av de vägar som dessa ansträngningar kommer att ta under de kommande 12 månaderna är säkerligen på väg att framkalla nya rubriker.

 

* Upp till 136 vid tidpunkten för publicering.

Publicerad första gången tisdag, den 7 januari 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai