Unghiul lui Anderson

Ascensiunea Hunyuan Video Deepfakes

mm
Adaugă Unite.AI la sursele tale preferate pe Google
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

Din cauza naturii unor materiale discutate aici, acest articol va conține mai puține legături de referință și ilustrații decât de obicei.

Ceva notabil se întâmplă în prezent în comunitatea de sinteză AI, deși semnificația sa poate dura ceva timp pentru a deveni clară. Amatori sunt antrenați pentru a reproduce asemănarea oamenilor, folosind video-bazate LoRAs pe cadrul deschis recent lansat de Tencent Hunyuan Video.*

Apăsați pentru a reda. Rezultate diverse de la personalizările Hunyuan bazate pe LoRA disponibile gratuit în comunitatea Civit. Prin antrenarea modelelor de adaptare de rang scăzut (LoRAs), se reduc semnificativ problemele de stabilitate temporală, care au afectat generarea de videoclipuri AI în ultimii doi ani. Surse: civit.ai

În videoclipul de mai sus, asemănarea actrițelor Natalie Portman, Christina Hendricks și Scarlett Johansson, împreună cu liderul tehnologic Elon Musk, au fost antrenate în fișiere suplimentare relativ mici pentru sistemul generativ de videoclipuri Hunyuan, care poate fi instalat fără filtre de conținut (cum ar fi filtrele NSFW) pe computerul unui utilizator.

Creatorul LoRA Christinei Hendricks prezentat mai sus afirmă că au fost necesare doar 16 imagini din serialul de televiziune Mad Men pentru a dezvolta modelul (care este doar 307mb descărcare); multiple postări din comunitatea Stable Diffusion de pe Reddit și Discord confirmă că LoRAs de acest fel nu necesită cantități mari de date de antrenament, sau timp de antrenament, în majoritatea cazurilor.

Apăsați pentru a reda. Arnold Schwarzenegger este adus la viață într-un LoRA Hunyuan video care poate fi descărcat la Civit. Vedeți https://www.youtube.com/watch?v=1D7B9g9rY68 pentru exemple suplimentare Arnie, de la entuziastul AI Bob Doyle.

LoRAs Hunyuan pot fi antrenate pe imagini statice sau pe videoclipuri, deși antrenarea pe videoclipuri necesită resurse de hardware mai mari și timp de antrenament mai mare.

Modelul de videoclipuri Hunyuan are 13 miliarde de parametri, depășind cei 12 miliarde de parametri ai lui Sora și mult depășind modelul mai puțin capabil Hunyuan-DiT lansat în surse deschise în vara anului 2024, care are doar 1,5 miliarde de parametri.

La fel ca în urmă cu doi ani și jumătate, cu Stable Diffusion și LoRA (vezi exemplele de celebrități “native” ale lui Stable Diffusion 1.5 aici), modelul de bază în cauză are o înțelegere mult mai limitată a personalităților celebrităților, comparativ cu nivelul de fidelitate care poate fi obținut prin implementări “injectate” de LoRA.

În esență, o LoRA personalizată, axată pe personalitate, beneficiază de o “călătorie gratuită” pe capacitățile semnificative de sinteză ale modelului de bază Hunyuan, oferind o sinteză umană mult mai eficientă decât cea care poate fi obținută fie prin autoencoder deepfakes din 2017, fie prin încercarea de a adăuga mișcare la imagini statice prin sisteme precum LivePortrait.

Toate LoRAs prezentate aici pot fi descărcate gratuit de la comunitatea foarte populară Civit, în timp ce numărul mai mare de LoRAs “statice” personalizate mai vechi pot crea, de asemenea, “seminte” de imagini pentru procesul de creare de videoclipuri (adică imagine-la-videoclip, o lansare în așteptare pentru Hunyuan Video, deși sunt posibile soluții, pentru moment).

Apăsați pentru a reda. Exemple de mai sus de la un LoRA “static” Flux; mai jos, exemple de la un LoRA Hunyuan video cu muzicianul Taylor Swift. Ambele LoRAs sunt disponibile gratuit în comunitatea Civit.

Pe măsură ce scriu, site-ul Civit oferă 128 de rezultate de căutare pentru “Hunyuan”. Aproape toate acestea sunt într-un fel sau altul modele NSFW; 22 înfățișează celebrități; 18 sunt concepute pentru a facilita generarea de pornografie dură; și doar șapte dintre ele înfățișează bărbați, nu femei.

Ce este nou?

Datorită naturii evolutive a termenului deepfake și lipsei de înțelegere publică a (limitărilor severe) limitărilor sistemelor de sinteză video AI până în prezent, semnificația LoRA Hunyuan nu este ușor de înțeles pentru o persoană care urmărește comunitatea de generare de AI. Să examinăm unele dintre diferențele cheie între LoRAs Hunyuan și abordările anterioare de generare de videoclipuri AI bazate pe identitate.

1: Instalare locală neîngrădită

Aspectul cel mai important al lui Hunyuan Video este faptul că poate fi descărcat local și pune în mâinile utilizatorului casual, precum și în cele ale comunității VFX (în măsura în care licențele permit în regiuni geografice).

Ultima dată când s-a întâmplat acest lucru a fost lansarea modelului Stable Diffusion de către Stability.ai în vara anului 2022. În acel moment, DALL-E2 al lui OpenAI a capturat imaginația publică, deși DALLE-2 era un serviciu plătit cu restricții notabile (care au crescut în timp).

Când Stable Diffusion a devenit disponibil, și Low-Rank Adaptation a făcut posibilă generarea de imagini cu identitatea oricărei persoane (celebritate sau nu), interesul enorm al dezvoltatorilor și utilizatorilor a ajutat Stable Diffusion să eclipseze popularitatea DALLE-2; deși acesta din urmă era un sistem mai capabil din cutie, rutinele sale de cenzură erau considerate oneroase de mulți dintre utilizatorii săi, și personalizarea nu era posibilă.

Probabil, același scenariu se aplică acum între Sora și Hunyuan – sau, mai exact, între sistemele generative de videoclipuri de tip Sora proprietare și rivalele deschise, dintre care Hunyuan este primul – dar probabil nu ultimul (aici, luați în considerare că Flux va câștiga în cele din urmă teren semnificativ pe Stable Diffusion).

Utilizatorii care doresc să creeze output LoRA Hunyuan, dar care lipsesc de echipamente eficiente, pot, ca întotdeauna, să externalizeze aspectul GPU al antrenamentului către servicii de calcul online cum ar fi RunPod. Acest lucru nu este același lucru cu crearea de videoclipuri AI la platforme precum Kaiber sau Kling, deoarece nu există niciun fel de filtrare semantică sau bazată pe imagini (cenzură) implicată în închirierea unui GPU online pentru a sprijini un flux de lucru în general local.

2: Nu este necesar “gazda” de videoclipuri și efortul ridicat

Când deepfakes au apărut pe scena la sfârșitul anului 2017, codul postat în mod anonim s-a transformat în ramurile mainstream DeepFaceLab și FaceSwap (precum și sistemul de deepfaking în timp real DeepFaceLive).

Această metodă necesita curățarea atentă a miilor de imagini cu fețe ale fiecărei identități care urmau să fie înlocuite; cu cât se punea mai puțin efort în această etapă, cu atât modelul era mai puțin eficient. În plus, timpul de antrenament varia între 2-14 zile, în funcție de hardware-ul disponibil, stresând chiar și sistemele capabile pe termen lung.

Când modelul era în cele din urmă gata, putea doar impune fețe în videoclipuri existente și, de obicei, necesita o “țintă” (adică o identitate reală) care era apropiată ca aspect de identitatea suprapusă.

Mai recent, ROOP, LivePortrait și numeroase cadre similare au oferit funcționalități similare cu mult mai puțin efort și adesea cu rezultate superioare – dar fără capacitatea de a genera deepfakes de corp întreg – sau orice alt element în afara fețelor.

Exemple de ROOP Unleashed și LivePortrait (inserat în partea inferioară stângă), de la fluxul de conținut al lui Bob Doyle pe YouTube. Surse: https://www.youtube.com/watch?v=i39xeYPBAAM și https://www.youtube.com/watch?v=QGatEItg2Ns

Exemple de ROOP Unleashed și LivePortrait (inserat în partea inferioară stângă), de la fluxul de conținut al lui Bob Doyle pe YouTube. Surse: https://www.youtube.com/watch?v=i39xeYPBAAM și https://www.youtube.com/watch?v=QGatEItg2Ns

Prin contrast, LoRAs Hunyuan (și sistemele similare care vor urma inevitabil) permit crearea nelimitată a întregului univers, inclusiv simularea corpului întreg a identității LoRA antrenate de utilizator.

3: Consistență temporală masiv îmbunătățită

Consistența temporală a fost Sfântul Graal al videoclipurilor de difuzie de mai mulți ani. Utilizarea unei LoRAs, împreună cu prompturi adecvate, oferă o referință constantă de identitate pentru generarea de videoclipuri Hunyuan. În teorie (sunt zilele de început), s-ar putea antrena multiple LoRAs ale unei identități, fiecare purtând îmbrăcăminte specifică.

În aceste condiții, îmbrăcămintea este mai puțin probabil să “muta” pe parcursul unui videoclip generat (deoarece sistemul generativ se bazează pe o fereastră limitată de cadre anterioare).

(Alternativ, ca și în cazul sistemelor de imagini bazate pe LoRA, se pot aplica multiple LoRAs, cum ar fi identitate + LoRAs de costume, unei singure generări de videoclip)

4: Acces la “Experimentul Uman”

Așa cum am observat recent , sectorul generativ de inteligență artificială proprietar și de nivel FAANG pare să fie atât de precaut în ceea ce privește capacitățile de sinteză umană ale proiectelor sale, încât oamenii reali rareori apar în paginile de proiect pentru anunțuri și lansări majore. În schimb, literatura de publicitate conexe arată în mod tot mai frecvent subiecte “drăguțe” și “neamenințătoare” în rezultatele sintetizate.

Cu apariția LoRAs Hunyuan, pentru prima dată, comunitatea are oportunitatea de a împinge limitele sintezei video umane bazate pe LDM într-un sistem foarte capabil (și nu marginal) și de a explora pe deplin subiectul care îi interesează pe majoritatea dintre noi – oamenii.

Implicații

Deoarece o căutare pentru “Hunyuan” în comunitatea Civit arată în principal LoRAs de celebrități și “hardcore”, implicația centrală a apariției LoRAs Hunyuan este că vor fi utilizate pentru a crea videoclipuri pornografice AI (sau defăimătoare) cu oameni reali – atât celebrități, cât și persoane necunoscute.

Pentru scopuri de conformitate, amatorii care creează LoRAs Hunyuan și care experimentează cu ele pe diverse servere Discord sunt atenți să interzică exemple de oameni reali să fie postate. Realitatea este că chiar și deepfakes de imagini sunt acum sever armate; și perspectiva adăugării de videoclipuri realiste în amestec poate justifica în cele din urmă temerile crescute care au fost recurente în mass-media în ultimii șapte ani și care au determinat reglementări noi.

Forța motrice

Ca întotdeauna, pornografia rămâne forța motrice pentru tehnologie. Indiferent de opinia noastră despre astfel de utilizări, acest motor de impuls neîncetat conduce avansuri în stadiul actual care pot beneficia în cele din urmă adoptarea mai mainstream.

În acest caz, este posibil ca prețul să fie mai mare decât de obicei, deoarece deschiderea creației video hiperrealiste are implicații evidente pentru utilizarea criminală, politică și etică.

Un grup Reddit (pe care nu îl voi numi aici) dedicat generării de videoclipuri NSFW AI are un server Discord asociat unde utilizatorii rafinează fluxuri de lucru ComfyUI pentru generarea de videoclipuri pornografice bazate pe Hunyuan. Zilnic, utilizatorii postează exemple de clipuri NSFW – multe dintre care pot fi rezonabil numite “extreme” sau cel puțin încălcă regulile forumului.

Acesta menține, de asemenea, un depozit GitHub substanțial și bine dezvoltat, care prezintă unelte care pot descărca și prelucra videoclipuri pornografice, pentru a furniza date de antrenament pentru noi modele.

Deoarece cel mai popular antrenor de LoRA, Kohya-ss, susține acum antrenamentul LoRA Hunyuan, barierele de intrare pentru antrenamentul generativ de videoclipuri nelimitat scad zilnic, împreună cu cerințele de hardware pentru antrenamentul și generarea de videoclipuri Hunyuan.

Aspectul crucial al schemelor de antrenament dedicate pentru AI pornografic (în loc de modele “bazate pe identitate”, cum ar fi celebritățile) este că un model de bază standard, cum ar fi Hunyuan, nu este antrenat în mod specific pe output NSFW și, prin urmare, poate funcționa slab atunci când i se cere să genereze conținut NSFW sau să nu poată dezlega concepte și asocieri învățate într-un mod performant sau convingător.

Prin dezvoltarea de modele de bază NSFW fine și LoRAs, va fi din ce în ce mai posibil să proiecteze identități antrenate într-un domeniu de videoclipuri “pornografice” dedicat; după toate, aceasta este doar versiunea video a ceva care a apărut deja pentru imagini statice în ultimii doi ani și jumătate.

VFX

Creșterea uriașă a consistenței temporale pe care o oferă LoRAs Hunyuan Video este un avantaj evident pentru industria de efecte vizuale AI, care se bazează foarte mult pe adaptarea software-ului deschis.

Deși o abordare LoRA Hunyuan Video generează un cadru întreg și un mediu, companiile VFX au început, probabil, să experimenteze cu izolarea fețelor temporale consistente care pot fi obținute prin această metodă, pentru a le suprapune sau integra în filmări reale.

La fel ca și comunitatea amatorilor, companiile VFX trebuie să aștepte lansarea funcționalității imagine-la-videoclip și videoclip-la-videoclip a lui Hunyuan Video, care este potențial cel mai util pod între conținut “deepfake” bazat pe LoRA și ID; sau să improvizeze și să folosească intervalul pentru a explora capacitățile externe ale cadrului și ale adaptărilor posibile, și chiar pentru a crea ramuri proprietare interne ale lui Hunyuan Video.

Deși termenii licenței pentru Hunyuan Video permit, în mod tehnic, reprezentarea persoanelor reale, cu condiția să se obțină permisiunea, interzic utilizarea sa în UE, Regatul Unit și Coreea de Sud. Pe principiul “rămâne în Vegas”, acest lucru nu înseamnă neapărat că Hunyuan Video nu va fi utilizat în aceste regiuni; cu toate acestea, perspectiva auditurilor de date externe pentru a impune reglementări în creștere în jurul inteligenței artificiale generative poate face o astfel de utilizare riscantă.

O altă zonă potențial ambiguă a termenilor licenței stipulează:

‘Dacă, la data lansării versiunii Tencent Hunyuan, numărul de utilizatori activi lunar ai tuturor produselor sau serviciilor puse la dispoziție de sau pentru Licențiat este mai mare de 100 de milioane de utilizatori activi lunar în luna calendaristică anterioară, trebuie să solicitați o licență de la Tencent, pe care Tencent o poate acorda în discreția sa exclusivă, și nu sunteți autorizați să exercitați niciunul dintre drepturile în conformitate cu acest Acord, cu excepția cazului în care Tencent vă acordă în mod expres astfel de drepturi.’

Acestă clauză este clar îndreptată către multitudinea de companii care sunt susceptibile să “intermedieze” Hunyuan Video pentru un corp relativ tehnic de utilizatori și care vor fi obligate să includă Tencent în acțiune, peste un anumit plafon de utilizatori.

Nu este clar dacă formularea largă ar putea acoperi, de asemenea, utilizarea indirectă (de exemplu, prin furnizarea de ieșiri de efecte vizuale Hunyuan activate în filme și emisiuni TV populare) și poate necesita clarificare.

Concluzie

Deoarece videoclipurile deepfake au existat de mult timp, ar fi ușor să subestimăm semnificația LoRA Hunyuan Video ca abordare a sintezei de identitate și a deepfaking-ului; și să presupunem că eforturile actuale care se manifestă în comunitatea Civit și în Discords și subreddits conexe reprezintă doar o mică împingere incrementală către o sinteză video umană cu adevărat controlabilă.

Mai probabil este că eforturile actuale reprezintă doar o fracțiune din potențialul lui Hunyuan Video de a crea deepfakes de corp întreg și mediu complet convingătoare; odată ce componenta imagine-la-videoclip va fi lansată (se presupune că se va întâmpla luna aceasta), un nivel mult mai granular de putere generativă va deveni disponibil atât pentru comunitatea amatorilor, cât și pentru cea profesională.

Când Stability.ai a lansat Stable Diffusion în 2022, mulți observatori nu au putut determina de ce compania ar da pur și simplu o astfel de sistem generativ valoros și puternic. Cu Hunyuan Video, motivația profitului este încorporată direct în licență – deși s-ar putea dovedi dificil pentru Tencent să determine când o companie declanșează schema de împărțire a profitului.

În orice caz, rezultatul este același ca în 2022: comunități de dezvoltare dedicate s-au format imediat și cu fervoare intensă în jurul lansării. Unele dintre drumurile pe care aceste eforturi le vor urma în următorii 12 luni sunt sigur să provoace titluri noi.

 

* Până la 136 la momentul publicării.

Publicat pentru prima dată marți, 7 ianuarie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai