Unghiul lui Anderson

HunyuanCustom aduce videoclipuri cu deepfakes create pe baza unei singure imagini, cu sunet și sincronizare a buzelor

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Acest articol discută o nouă lansare a unui model de video multimodal Hunyuan, numit ‘HunyuanCustom’. Noua lucrare are o acoperire amplă, combinată cu mai multe probleme în exemplele de videoclipuri furnizate pe pagina proiectului*, ceea ce ne limitează la o acoperire mai generală decât de obicei și la o reproducere limitată a cantității uriașe de material video care însoțește această lansare (deoarece multe dintre videoclipuri necesită editare și prelucrare semnificativă pentru a îmbunătăți lizibilitatea layout-ului).

Vă rugăm să observați, în plus, că lucrarea se referă la sistemul generativ bazat pe API Kling ca ‘Keling’. Pentru claritate, mă refer la ‘Kling’ în întregul articol.

 

Tencent este în proces de lansare a unei noi versiuni a modelului său Hunyuan Video, intitulat HunyuanCustom. Noua lansare pare a fi capabilă să facă modelele Hunyuan LoRA redundante, permițând utilizatorului să creeze videoclipuri personalizate de tip “deepfake” prin intermediul unei imagini unice:

Apăsați pentru a reda. Prompt: ‘Un bărbat ascultă muzică și gătește noodles în bucătărie’. Noua metodă este comparată cu metodele cu sursă închisă și deschisă, inclusiv Kling, care este un concurent semnificativ în acest spațiu. Source: https://hunyuancustom.github.io/ (atenționare: site-ul este intensiv pentru CPU/memorie!)

În coloana din stânga a videoclipului de mai sus, vedem imaginea sursă unică furnizată HunyuanCustom, urmată de interpretarea sistemului nou a promptului în a doua coloană, lângă ea. Coloanele rămase arată rezultatele din diverse sisteme cu sursă închisă și deschisă: Kling; Vidu; Pika; Hailuo; și Wan-based SkyReels-A2.

În videoclipul de mai jos, vedem renderizări ale trei scenarii esențiale pentru această lansare: respectiv, persoană + obiect; emulare a unui singur caracter; și încercare virtuală (persoană + haine):

Apăsați pentru a reda. Trei exemple editate din materialul de la site-ul de suport pentru Hunyuan Video.

Putem observa câteva lucruri din aceste exemple, în mare parte legate de faptul că sistemul se bazează pe o imagine sursă unică, în loc de mai multe imagini ale aceleiași subiect:

În primul clip, bărbatul este esențialmente încă îndreptat spre cameră. El își coboară capul în jos și lateral la nu mai mult de 20-25 de grade de rotație, dar, la o înclinație mai mare decât aceasta, sistemul ar trebui să înceapă să ghicească cum arată el în profil. Acest lucru este greu, probabil imposibil de evaluat cu exactitate dintr-o singură imagine frontală.

În al doilea exemplu, vedem că fetița zâmbește în videoclipul generat, așa cum face și în imaginea statică sursă. Din nou, cu această singură imagine ca referință, HunyuanCustom ar trebui să facă o ghicire relativ nefondată despre cum arată fața ei “în repaus”. De asemenea, fața ei nu se abate de la poziția cu fața spre cameră mai mult decât în exemplul anterior (‘bărbatul care mănâncă crisps’).

În ultimul exemplu, vedem că, deoarece materialul sursă – femeia și hainele pe care este îmbrăcată – nu sunt imagini complete, renderul a decupat scenariul pentru a se potrivi – ceea ce este, de fapt, o soluție destul de bună pentru o problemă de date!

Punctul este că, deși noul sistem poate gestiona mai multe imagini (cum ar fi persoană + crisps sau persoană + haine), el nu pare să permită unghiuri multiple sau perspective alternative ale unui singur caracter, astfel încât expresii diverse sau unghiuri neobișnuite să poată fi acomodate. În această măsură, sistemul poate să aibă dificultăți în a înlocui ecosistemul în creștere al modelelor LoRA care au apărut în jurul HunyuanVideo de la lansarea sa din decembrie, deoarece acestea pot ajuta HunyuanVideo să producă caractere consistente din orice unghi și cu orice expresie facială reprezentată în setul de antrenament (20-60 de imagini este tipic).

Conectat la sunet

Pentru audio, HunyuanCustom folosește sistemul LatentSync (notoriu greu de configurat și de obținut rezultate bune pentru hobbisti) pentru a obține mișcări ale buzelor care se potrivesc cu audio și textul furnizat de utilizator:

Conține audio. Apăsați pentru a reda. Diverse exemple de sincronizare a buzelor de la site-ul suplimentar HunyuanCustom, editate împreună.

La momentul scrierii, nu există exemple în limba engleză, dar acestea par a fi destul de bune – cu atât mai mult cu cât metoda de creare a acestora pare a fi ușor de instalat și accesibil.

Editarea videoclipurilor existente

Noul sistem oferă ceea ce pare a fi rezultate foarte impresionante pentru editarea videoclipurilor existente, în care un segment dintr-un videoclip existent (real) este mascate și înlocuite inteligent cu un subiect dat într-o imagine de referință. Mai jos este un exemplu de la site-ul suplimentar:

Apăsați pentru a reda. Doar obiectul central este vizat, dar ceea ce rămâne în jurul lui se schimbă și el într-o trecere vid2vid a HunyuanCustom.

Putem vedea, și așa cum este standard într-un scenariu vid2vid, întregul videoclip este alterat într-o oarecare măsură de proces, deși cel mai mult alterat în regiunea vizată, adică jucăria de pluș. Presupunând că pot fi create pipeline-uri pentru a crea astfel de transformări sub o abordare garbage matte care lasă majoritatea conținutului videoclipului identic cu originalul. Acest lucru este ceea ce face Adobe Firefly sub acoperire și face destul de bine – dar este un proces substudiat în scena generativă cu sursă deschisă.

Acesta spune că majoritatea exemplelor alternative furnizate fac o treabă mai bună de a viza aceste integrări, așa cum putem vedea în compilația de mai jos:

Apăsați pentru a reda. Diverse exemple de conținut interjectat folosind vid2vid în HunyuanCustom, arătând un respect notabil pentru materialul nerezat.

O nouă început?

Această inițiativă este o dezvoltare a proiectului Hunyuan Video, și nu o schimbare radicală a direcției de dezvoltare. Îmbunătățirile proiectului sunt introduse ca inserții arhitecturale discrete, și nu ca schimbări structurale majore, având ca scop să permită modelului să mențină fidelitatea identității pe parcursul cadrelor fără a se baza pe reglare fină specifică subiectului reglare fină, așa cum se face cu LoRA sau abordări de inversare textuală.

Pentru a fi clar, deci, HunyuanCustom nu este antrenat de la zero, ci mai degrabă o reglare fină a modelului de bază HunyuanVideo din decembrie 2024.

Cei care au dezvoltat LoRA pentru HunyuanVideo se pot întreba dacă acestea vor funcționa încă cu această nouă ediție, sau dacă vor trebui să reinventeze roata LoRA încă o dată dacă doresc capacități de personalizare mai mari decât cele încorporate în această nouă lansare.

În general, o lansare puternic reglată a unui model hiperscalabil alterează greutățile modelului suficient de mult, astfel încât LoRA create pentru modelul anterior nu vor funcționa corect, sau deloc, cu noul model rafinat.

Uneori, totuși, popularitatea unei reglări poate contesta originile sale: un exemplu de reglare care devine un fork eficient, cu un ecosistem și adepți dedicați, este Pony Diffusion reglarea Stable Diffusion XL (SDXL). Pony are în prezent peste 592.000 de descărcări pe domeniul CivitAI, cu o gamă largă de LoRA care au folosit Pony (și nu SDXL) ca model de bază, și care necesită Pony la momentul inferenței.

Lansarea

Pagina proiectului pentru noua lucrare (care se intitulează HunyuanCustom: O arhitectură condusă de multimodal pentru generarea de videoclipuri personalizate) conține legături către un site GitHub care, la momentul scrierii, a devenit funcțional și pare a conține toate codurile și greutățile necesare pentru implementarea locală, împreună cu o propusă cronologie (unde singurul lucru important care urmează să vină este integrarea ComfyUI).

La momentul scrierii, prezența proiectului pe Hugging Face este încă un 404. Există, totuși, o versiune bazată pe API a sistemului, unde se pare că puteți demonstra sistemul, atâta timp cât puteți furniza un cod de scanare WeChat.

Niciodată nu am văzut o utilizare atât de elaborată și extinsă a unor proiecte atât de diverse, cum este cazul HunyuanCustom – și, probabil, unele dintre licențe ar obliga, în orice caz, o lansare completă.

Doi modele sunt anunțați pe pagina GitHub: un model de 720px1280px care necesită 8 GB de memorie GPU, și un model de 512px896px care necesită 60 GB de memorie GPU.

Depozitul afirmă ‘Memoria GPU minimă necesară este de 24 GB pentru 720px1280px129f, dar este foarte lent…Recomandăm utilizarea unei GPU cu 80 GB de memorie pentru o calitate de generare mai bună’ – și repetă că sistemul a fost testat până acum doar pe Linux.

Modelul Hunyuan Video anterior a fost, de la lansarea oficială, cuantificat până la dimensiuni în care poate fi rulat pe mai puțin de 24 GB de VRAM, și pare rezonabil să presupunem că noul model va fi, de asemenea, adaptat în forme mai prietenoase pentru consumatori de către comunitate și că va fi adaptat rapid pentru utilizare pe sisteme Windows, de asemenea.

Datorită constrângerilor de timp și cantității copleșitoare de informații care însoțesc această lansare, putem lua doar o privire mai amplă, mai degrabă decât una în profunzime, asupra acestei lansări. Cu toate acestea, hai să deschidem puțin capota HunyuanCustom.

O privire asupra lucrării

Pipeline-ul de date pentru HunyuanCustom, care pare a fi conform cu cadrul GDPR, incorporează atât seturi de date video sintetizate, cât și deschise, incluzând OpenHumanVid, cu opt categorii nucleu reprezentate: oameni, animale, plante, peisaje, vehicule, obiecte, arhitectură, și anime.

Din lucrarea de lansare, o privire de ansamblu asupra pachetelor diverse care contribuie la pipeline-ul de construcție a datelor HunyuanCustom. Source: https://arxiv.org/pdf/2505.04512

Din lucrarea de lansare, o privire de ansamblu asupra pachetelor diverse care contribuie la pipeline-ul de construcție a datelor HunyuanCustom. Source: https://arxiv.org/pdf/2505.04512

Filtrarea inițială începe cu PySceneDetect, care segmentează videoclipurile în clipe cu un singur cadru. TextBPN-Plus-Plus este apoi utilizat pentru a elimina videoclipurile care conțin text excesiv pe ecran, subtitrări, filigrane sau logo-uri.

Pentru a aborda inconstistențele în rezoluție și durată, clipele sunt standardizate la cinci secunde în lungime și redimensionate la 512 sau 720 de pixeli pe latura scurtă. Filtrarea estetică este gestionată folosind Koala-36M, cu un prag personalizat de 0,06 aplicat pentru setul de date curat al noii lucrări.

Procesul de extragere a subiectului combină Qwen7B Large Language Model (LLM), cadrul de recunoaștere a obiectelor YOLO11X și arhitectura populară InsightFace, pentru a identifica și valida identități umane.

Pentru subiecte non-umane, QwenVL și Grounded SAM 2 sunt utilizate pentru a extrage cutii de delimitare relevante, care sunt eliminate dacă sunt prea mici.

Exemple de segmentare semantică cu Grounded SAM 2, utilizate în proiectul Hunyuan Control. Source: https://github.com/IDEA-Research/Grounded-SAM-2

Exemple de segmentare semantică cu Grounded SAM 2, utilizate în proiectul Hunyuan Control. Source: https://github.com/IDEA-Research/Grounded-SAM-2

Extragerea multi-subiect utilizează Florence2 pentru anotarea cutiilor de delimitare, și Grounded SAM 2 pentru segmentare, urmată de clustering și segmentare temporală a cadrelor de antrenament.

Clipele prelucrate sunt ulterior îmbunătățite prin anotare, utilizând un sistem de etichetare structurată dezvoltat de echipa Hunyuan, și care furnizează metadate stratificate, cum ar fi descrieri și indicii de mișcare a camerei.

Strategiile de augmentare a mascajului, incluzând conversia în cutii de delimitare, au fost aplicate în timpul antrenamentului pentru a reduce supraantrenarea și a asigura că modelul se adaptează la forme de obiecte diverse.

Datele audio au fost sincronizate utilizând LatentSync menționat anterior, și clipele au fost eliminate dacă scorurile de sincronizare scad sub un prag minim.

Cadrul de evaluare a calității imaginilor HyperIQA a fost utilizat pentru a exclude videoclipuri care au obținut sub 40 (pe scara HyperIQA specială). Urmele audio valabile au fost apoi prelucrate cu Whisper pentru a extrage caracteristici pentru sarcini ulterioare.

Autorii incorporează modelul asistent de limbă LLaVA în timpul fazei de anotare, și subliniază poziția centrală pe care acest cadru o are în HunyuanCustom. LLaVA este utilizat pentru a genera titluri de imagine și pentru a ajuta la alinierea conținutului vizual cu prompturi text, sprijinind construirea unui semnal de antrenament coerent pe mai multe moduri:

Cadrul HunyuanCustom sprijină generarea de videoclipuri coerente cu identitate, condiționate de intrări text, imagine, audio și video.

Cadrul HunyuanCustom sprijină generarea de videoclipuri coerente cu identitate, condiționate de intrări text, imagine, audio și video.

Prin exploatarea capacităților de aliniere vizual-lingvistică ale LLaVA, pipeline-ul câștigă un strat suplimentar de consistență semantică între elemente vizuale și descrierile lor textuale – în special valoros în scenarii cu mai multe subiecte sau complexe.

Videoclipuri personalizate

Pentru a permite generarea de videoclipuri pe baza unei imagini de referință și a unui prompt, au fost create două module centrate în jurul LLaVA, care adaptează mai întâi structura de intrare a HunyuanVideo pentru a putea accepta o imagine împreună cu text.

Acest lucru a implicat formatarea promptului într-un mod care încorporează imaginea direct sau o etichetează cu o scurtă descriere de identitate. Un token de separator a fost utilizat pentru a preveni ca încorporarea imaginii să nu înăbușe conținutul promptului.

Deoarece encoderul vizual LLaVA are tendința de a comprima sau de a abandona detalii spațiale fine în timpul alinierii caracteristicilor de imagine și text (în special atunci când se traduce o singură imagine de referință într-o încorporare semantică generală), a fost incorporat un modul de îmbunătățire a identității. Deoarece aproape toate modelele de difuzie latentă de videoclipuri au dificultăți în menținerea identității fără un LoRA, chiar și într-un clip de cinci secunde, performanța acestui modul în testele comunității poate dovedi a fi semnificativă.

În orice caz, imaginea de referință este redimensionată și încorporată utilizând 3D-VAE cauzal din modelul original HunyuanVideo, și încorporarea sa latentă este introdusă în latența videoclipului de-a lungul axei temporale, cu o decalare spațială aplicată pentru a preveni ca imaginea să nu fie reprodusă direct în ieșire, în timp ce încă ghidând generarea.

Modelul a fost antrenat utilizând Flow Matching, cu mostre de zgomot extrase dintr-o distribuție logit-normală – și rețeaua a fost antrenată pentru a recupera videoclipul corect din aceste latențe zgomotoase. LLaVA și generatorul de videoclipuri au fost ambele reglate fin pentru a face ca imaginea și promptul să poată ghida ieșirea mai fluent și să mențină identitatea subiectului coerent.

Pentru prompturi cu mai multe subiecte, fiecare pereche imagine-text a fost încorporată separat și i s-a atribuit o poziție temporală distinctă, permițând identităților să fie diferențiate și sprijinind generarea de scene care implică mai multe subiecte care interacționează.

Sunet și viziune

HunyuanCustom condiționează generarea de audio/vorbire utilizând atât intrări audio de la utilizator, cât și un prompt text, permițând caracterelor să vorbească în scene care reflectă setarea descrisă.

Pentru a sprijini acest lucru, un modul AudioNet cu identitate disjunctă introduce caracteristici audio fără a perturba semnalele de identitate încorporate din imaginea de referință și prompt. Aceste caracteristici sunt aliniate cu timeline-ul videoclipului comprimat, împărțit în segmente la nivel de cadru, și injectate utilizând un mecanism de atenție spațială cross-attention care ține fiecare cadru izolat, păstrând consistența subiectului și evitând interferența temporală.

Un al doilea modul de injecție temporală oferă un control mai fin asupra sincronizării și mișcării, lucrând în tandem cu AudioNet, mapping caracteristici audio la regiuni specifice ale secvenței latente, și utilizând un Perceptron Multistrat (MLP) pentru a le converti în deplasări de token. Acest lucru permite gesturilor și mișcărilor faciale să urmeze ritmul și accentul intrării vorbite cu o precizie mai mare.

HunyuanCustom permite subiectelor din videoclipuri existente să fie editate direct, înlocuind sau inserând oameni sau obiecte într-o scenă fără a necesita reconstruirea întregului clip de la zero. Acest lucru îl face util pentru sarcini care implică alterarea aspectului sau mișcării într-un mod țintit.

Apăsați pentru a reda. Un exemplu suplimentar de la site-ul suplimentar.

Pentru a facilita înlocuirea eficientă a subiectului în videoclipuri existente, noul sistem evită abordarea intensivă a resurselor a metodelor recente, cum ar fi VACE, sau cele care merg videoclipuri întregi împreună, preferând în schimb comprimarea unei imagini de referință utilizând 3D-VAE preantrenat – aliniind-o cu latențele interne ale pipeline-ului de generare, și apoi adăugându-le împreună. Acest lucru păstrează procesul relativ ușor, permițând în același timp conținutul videoclipului extern să ghideze ieșirea.

Un mic rețea neurală gestionează alinierea dintre videoclipul curat de intrare și latențele zgomotoase utilizate în generare. Sistemul testează două moduri de injectare a acestor informații: fuzionarea celor două seturi de caracteristici înainte de a le comprima din nou; și adăugarea caracteristicilor cadru cu cadru. A doua metodă funcționează mai bine, au constatat autorii, și evită pierderea calității în timp ce menține încărcarea computațională neschimbată.

Date și teste

În teste, metricile utilizate au fost: modulul de consistență a identității din ArcFace, care extrage încorporări faciale atât din imaginea de referință, cât și din fiecare cadru al videoclipului generat, și apoi calculează similaritatea cosinus medie între ele; similaritatea subiectului, prin trimiterea segmentelor YOLO11x la Dino 2 pentru comparație; CLIP-B, alinierea text-videoclip, care măsoară similaritatea dintre prompt și videoclipul generat; CLIP-B din nou, pentru a calcula similaritatea dintre fiecare cadru și atât cadrele sale vecine, cât și primul cadru, precum și consistența temporală; și gradul dinamic, așa cum este definit de VBench.

După cum s-a indicat anterior, competitorii de bază cu sursă închisă au fost Hailuo; Vidu 2.0; Kling (1.6); și Pika. Cadrele de concurență cu sursă deschisă au fost VACE și SkyReels-A2.

Evaluarea performanței modelului prin compararea HunyuanCustom cu metodele de personalizare de videoclipuri lider, pe ID de consistență (Face-Sim), similaritate a subiectului (DINO-Sim), alinierea text-videoclip (CLIP-B-T), consistență temporală (Temp-Consis), și intensitate de mișcare (DD). Rezultatele optime și suboptime sunt afișate în aldine și subliniate, respectiv.

Evaluarea performanței modelului prin compararea HunyuanCustom cu metodele de personalizare de videoclipuri lider, pe ID de consistență (Face-Sim), similaritate a subiectului (DINO-Sim), alinierea text-videoclip (CLIP-B-T), consistență temporală (Temp-Consis), și intensitate de mișcare (DD). Rezultatele optime și suboptime sunt afișate în aldine și subliniate, respectiv.

Dintre aceste rezultate, autorii afirmă:

‘HunyuanCustom nostru obține cea mai bună consistență a identității și cea mai bună consistență a subiectului. De asemenea, obține rezultate comparabile în ceea ce privește urmărirea promptului și consistența temporală. [Hailuo] are cel mai bun scor CLIP, deoarece poate urma instrucțiunile textuale bine, cu doar consistență a identității, sacrificând consistența subiectelor non-umane (cea mai slabă DINO-Sim). În ceea ce privește gradul dinamic, [Vidu] și [VACE] se desfășoară slab, ceea ce se poate datora dimensiunii mici a modelului.’

Deși site-ul proiectului este saturat cu videoclipuri de comparație (al cărui layout pare a fi fost proiectat pentru estetica site-ului, mai degrabă decât pentru comparații facile), el nu prezintă în prezent un videoclip echivalent cu rezultatele statice împachetate în PDF, în ceea ce privește testele calitative inițiale. Deși îl includ aici, încurajez cititorul să examineze cu atenție videoclipurile de la site-ul proiectului, deoarece ele oferă o impresie mai bună a rezultatelor:

Din lucrare, o comparație pe personalizarea videoclipurilor centrate pe obiect. Deși cititorul ar trebui (ca întotdeauna) să se refere la PDF-ul original pentru o rezoluție mai bună, videoclipurile de la site-ul proiectului ar putea fi o resursă mai iluminantă în acest caz.

Din lucrare, o comparație pe personalizarea videoclipurilor centrate pe obiect. Deși cititorul ar trebui (ca întotdeauna) să se refere la PDF-ul original pentru o rezoluție mai bună, videoclipurile de la site-ul proiectului ar putea fi o resursă mai iluminantă în acest caz.

Autorii comentează aici:

‘Se poate vedea că [Vidu], [Skyreels A2] și metoda noastră obțin rezultate relativ bune în ceea ce privește alinierea promptului și consistența subiectului, dar calitatea noastră de videoclip este mai bună decât cea a Vidu și Skyreels, datorită performanței bune de generare a videoclipului a modelului nostru de bază, adică [Hunyuanvideo-13B].

‘Printre produsele comerciale, deși [Kling] are o calitate a videoclipului bună, primul cadru al videoclipului are o problemă de copiere-lipire, și uneori subiectul se mișcă prea repede și [se estompează], ducând la o experiență de vizionare slabă.’

Autorii mai comentează că Pika se desfășoară slab în ceea ce privește consistența temporală, introducând artefacte de subtitrare (efecte datorate unei curățări slabe a datelor, în care elemente de text din clipe au fost lăsate să contamineze conceptele de bază).

Hailuo menține identitatea facială, afirmă ei, dar nu reușește să păstreze consistența corpului întreg. Printre metodele cu sursă deschisă, VACE, cercetătorii afirmă că este incapabilă să mențină consistența identității, în timp ce susțin că HunyuanCustom produce videoclipuri cu o puternică păstrare a identității, menținând în același timp calitatea și diversitatea.

Următorul test a fost efectuat pentru personalizarea videoclipurilor cu mai multe subiecte, împotriva acelorași competitori. La fel ca în exemplul anterior, rezultatele aplatizate din PDF nu sunt echivalente cu videoclipurile disponibile pe site-ul proiectului, dar sunt unice printre rezultatele prezentate:

Comparații utilizând personalizarea videoclipurilor cu mai multe subiecte. Vă rugăm să consultați PDF-ul pentru detalii și rezoluție mai bună.

Comparații utilizând personalizarea videoclipurilor cu mai multe subiecte. Vă rugăm să consultați PDF-ul pentru detalii și rezoluție mai bună.

Lucrarea afirmă:

‘[Pika] poate genera subiectele specificate, dar prezintă instabilitate în cadrele videoclipului, cu exemple de un bărbat care dispare într-un scenariu și o femeie care nu reușește să deschidă o ușă așa cum a fost promptată. [Vidu] și [VACE] capturează parțial identitatea umană, dar pierd detalii semnificative ale obiectelor non-umane, indicând o limitare în reprezentarea subiectelor non-umane.

‘[SkyReels A2] experimentează o instabilitate severă a cadrului, cu schimbări notabile în cipuri și artefacte numeroase în scenariul din dreapta.

‘În schimb, HunyuanCustom nostru capturează în mod eficient atât identitățile umane, cât și cele non-umane, generează videoclipuri care se conformează prompturilor date și menține o calitate vizuală și o stabilitate ridicate.’

Un test suplimentar a fost ‘reclamă virtuală umană’, în care cadrele au fost însărcinate să integreze un produs cu o persoană:

Din testele calitative, exemple de plasare de produse neuronale. Vă rugăm să consultați PDF-ul pentru detalii și rezoluție mai bună.

Din testele calitative, exemple de plasare de produse neuronale. Vă rugăm să consultați PDF-ul pentru detalii și rezoluție mai bună.

Pentru această rundă, autorii afirmă:

‘Rezultatele demonstrează că HunyuanCustom menține în mod eficient identitatea umană, păstrând în același timp detalii ale produsului țintă, inclusiv textul de pe el.

‘Mai mult, interacțiunea dintre om și produs pare naturală, iar videoclipul se conformează îndeaproape promptului dat, subliniind potențialul semnificativ al HunyuanCustom în generarea de videoclipuri publicitare.’

O zonă în care rezultatele videoclipurilor ar fi fost foarte utile a fost runda calitativă pentru personalizarea subiectului condusă de audio, în care personajul vorbește audio-ul corespunzător dintr-un scenariu și o postură descrisă textual.

Rezultate parțiale date pentru runda audio – deși rezultatele videoclipurilor ar fi fost preferabile în acest caz. Doar jumătatea superioară a figurii PDF este reprodusă aici, deoarece este mare și greu de acomodat în acest articol. Vă rugăm să consultați PDF-ul original pentru detalii și rezoluție mai bună.

Rezultate parțiale date pentru runda audio – deși rezultatele videoclipurilor ar fi fost preferabile în acest caz. Doar jumătatea superioară a figurii PDF este reprodusă aici, deoarece este mare și greu de acomodat în acest articol. Vă rugăm să consultați PDF-ul original pentru detalii și rezoluție mai bună.

Autorii afirmă:

‘Metodele anterioare de animație umană conduse de audio introduc o imagine umană și un audio, unde poziția, îmbrăcămintea și mediul rămân constante cu imaginea dată și nu pot genera videoclipuri în alte gesturi și medii, ceea ce poate limita aplicațiile lor.

‘…[HunyuanCustom nostru] permite personalizarea umană condusă de audio, unde personajul vorbește audio-ul corespunzător într-un scenariu și o postură descrisă textual, permițând o animație umană condusă de audio mai flexibilă și controlabilă.’

Teste suplimentare (vă rugăm să consultați PDF-ul pentru toate detaliile) au inclus o rundă care a pus noul sistem împotriva VACE și Kling 1.6 pentru înlocuirea subiectului în modul video-la-video:

Testarea înlocuirii subiectului în modul video-la-video. Vă rugăm să consultați PDF-ul original pentru detalii și rezoluție mai bună.

Testarea înlocuirii subiectului în modul video-la-video. Vă rugăm să consultați PDF-ul original pentru detalii și rezoluție mai bună.

Despre acestea, cercetătorii opină:

‘VACE suferă de artefacte de margine datorate aderării stricte la măștile de intrare, rezultând forme de subiect ne naturale și continuitate a mișcării perturbată. [Kling], în schimb, prezintă un efect de copiere-lipire, unde subiectele sunt suprapuse direct peste videoclip, ducând la o integrare slabă cu fundalul.

‘În comparație, HunyuanCustom evită artefactele de margine, realizează o integrare fără probleme cu fundalul videoclipului și menține o puternică păstrare a identității—demonstrându-și performanța superioară în sarcinile de editare a videoclipurilor.’

Concluzie

Acesta este un lansare fascinantă, nu în ultimul rând pentru că abordează ceva ce scena hobbysită, mereu nemulțumită, s-a plâns mai recent despre – lipsa sincronizării buzelor, astfel încât realismul crescut capabil în sisteme precum Hunyuan Video și Wan 2.1 să poată fi dat o nouă dimensiune de autenticitate.

Deși layout-ul exemplelor de videoclipuri comparative de pe site-ul proiectului face dificilă compararea capacităților HunyuanCustom cu cele ale competitorilor anteriori, trebuie remarcat că foarte puține proiecte din spațiul sintezei de videoclipuri au curajul de a se confrunta în teste cu Kling, API-ul comercial de difuzie de videoclipuri care este întotdeauna la sau aproape de vârful clasamentelor; Tencent pare a fi făcut progrese împotriva acestui concurent într-un mod destul de impresionant.

 

* Problema fiind că unele dintre videoclipuri sunt atât de late, scurte și de înaltă rezoluție, încât nu vor fi reda în jucători de videoclipuri standard, cum ar fi VLC sau Windows Media Player, afișând ecrane negre.

Publicat pentru prima dată joi, 8 mai 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai