KÄ t Andersona
ZnaczÄ cy postÄp w ludzkim sterowaniu AI wideo

Uwaga: Strona projektu zawiera 33 autoplaying filmy o wysokiej rozdzielczoÅci, ktÃģre ÅÄ cznie majÄ rozmiar pÃģÅ gigabajta, co destabilizowaÅo mÃģj system podczas Åadowania. Z tego powodu nie bÄdÄ bezpoÅrednio linkowaÄ do niej. Czytelnicy mogÄ znaleÅšÄ adres URL w abstrakcie lub PDF artykuÅu, jeÅli zdecydujÄ siÄ na to.
Jednym z gÅÃģwnych celÃģw badaÅ nad syntezÄ wideo jest generowanie peÅnego wystÄpu AI z jednego obrazu. W tym tygodniu nowy artykuÅ opublikowany przez Bytedance Intelligent Creation przedstawiÅ, co moÅže byÄ najbardziej kompleksowym systemem tego rodzaju, w stanie produkowaÄ peÅne i pÃģÅ-ciaÅo animacje, ktÃģre ÅÄ czÄ wyraziste szczegÃģÅy twarzy z dokÅadnymi duÅžymi ruchami, a takÅže osiÄ gajÄ poprawionÄ spÃģjnoÅÄ toÅžsamoÅci â obszar, w ktÃģrym nawet wiodÄ ce systemy komercyjne czÄsto zawodzÄ .
W poniÅžszym przykÅadzie widzimy wystÄp sterowany przez aktora (gÃģra lewa) i pochodzÄ cy z jednego obrazu (gÃģra prawa), ktÃģry zapewnia niezwykle elastycznÄ i zwinnÄ renderowanÄ , bez typowych problemÃģw zwiÄ zanych z tworzeniem duÅžych ruchÃģw lub âprzewidywaniemâ ukrytych obszarÃģw (tj. czÄÅci ubrania i kÄ tÃģw twarzy, ktÃģre muszÄ byÄ wywnioskowane lub wymyÅlone, poniewaÅž nie sÄ widoczne na jedynym zdjÄciu ÅšrÃģdÅowym):
ZAWARTOÅÄ DÅđWIÄKOWA. Kliknij, aby odtworzyÄ. WystÄp powstaje z dwÃģch ÅšrÃģdeÅ, w tym z synchronizacjÄ ust, ktÃģra zwykle jest zastrzeÅžona dla dedykowanych systemÃģw pomocniczych. Jest to wersja zmniejszona z witryny ÅšrÃģdÅowej (patrz uwaga na poczÄ tku artykuÅu â dotyczy wszystkich innych osadzonych filmÃģw tutaj).
Mimo Åže widzimy pewne pozostaÅe wyzwania dotyczÄ ce trwaÅoÅci toÅžsamoÅci w kaÅždym klipie, jest to pierwszy system, ktÃģry widziaÅem, ktÃģry ogÃģlnie (choÄ nie zawsze) utrzymuje toÅžsamoÅÄ przez dÅuÅžszy czas bez uÅžycia LoRAs:
ZAWARTOÅÄ DÅđWIÄKOWA. Kliknij, aby odtworzyÄ. Kolejne przykÅady z projektu DreamActor.
Nowy system, zatytuÅowany DreamActor, wykorzystuje trÃģjczÄÅciowy hybrydowy system sterowania, ktÃģry poÅwiÄca specjalnÄ uwagÄ wyrazom twarzy, rotacji gÅowy i projektowi szkieletu, umoÅžliwiajÄ c wystÄpy sterowane przez AI, w ktÃģrych ani twarz, ani ciaÅo nie cierpiÄ na rzecz drugiego â rzadka, a byÄ moÅže nieznana zdolnoÅÄ wÅrÃģd podobnych systemÃģw.
PoniÅžej widzimy jednÄ z tych cech, rotacjÄ gÅowy, w dziaÅaniu. Kolorowa kula w rogu kaÅždej miniatury po prawej stronie wskazuje rodzaj wirtualnego gimbalu, ktÃģry definiuje orientacjÄ gÅowy niezaleÅžnie od ruchu twarzy i wyrazu, ktÃģry jest tutaj sterowany przez aktora (dolna lewa).
Kliknij, aby odtworzyÄ. Wizualizacja osi obrotu gÅowy awatara, podczas gdy wyraz jest zasilany przez oddzielny moduÅ i poinformowany o wystÄpie aktora (widoczny tutaj dolna lewa).
JednÄ z najbardziej interesujÄ cych funkcjonalnoÅci projektu, ktÃģra nie jest nawet wÅaÅciwie uwzglÄdniona w testach artykuÅu, jest jego zdolnoÅÄ do pochodzenia ruchu synchronizacji ust bezpoÅrednio z dÅšwiÄku â funkcjonalnoÅÄ, ktÃģra dziaÅa niezwykle dobrze, nawet bez sterujÄ cego aktora-wideo.
Badacze podjÄli wyzwanie wobec najlepszych systemÃģw w tym zakresie, w tym bardzo chwalonego Runway Act-One i LivePortrait, i donoszÄ , Åže DreamActor byÅ w stanie osiÄ gnÄ Ä lepsze wyniki iloÅciowe.
PoniewaÅž badacze mogÄ ustaliÄ wÅasne kryteria, wyniki iloÅciowe nie sÄ koniecznie empirycznym standardem; ale towarzyszÄ ce testy jakoÅciowe wydajÄ siÄ potwierdzaÄ wnioski autorÃģw.
Niestety, ten system nie jest przeznaczony do wydania publicznego, a jedynÄ wartoÅciÄ , jakÄ spoÅecznoÅÄ moÅže potencjalnie uzyskaÄ z tego projektu, jest ewentualne odtworzenie metodologii opisanej w artykule (jak to zrobiono z rÃģwnie zamkniÄtym Google Dreambooth w 2022 roku ).
ArtykuÅ stwierdza*:
âAnimacja obrazu ludzkiego ma moÅžliwe ryzyko spoÅeczne, takie jak naduÅžywanie do tworzenia faÅszywych filmÃģw. Proponowana technologia mogÅaby byÄ wykorzystana do tworzenia faÅszywych filmÃģw z ludÅšmi, ale istniejÄ ce narzÄdzia wykrywania [Demamba, Dormant] mogÄ wykryÄ te faÅszywe filmy.
âAby zmniejszyÄ te ryzyka, konieczne sÄ wyraÅšne zasady etyczne i odpowiednie wytyczne dotyczÄ ce uÅžytkowania. BÄdziemy ÅciÅle ograniczaÄ dostÄp do naszych podstawowych modeli i kodÃģw, aby zapobiec naduÅžyciom.â
OczywiÅcie, rozwaÅžania etyczne tego rodzaju sÄ wygodne z punktu widzenia komercyjnego, poniewaÅž zapewniajÄ uzasadnienie dla dostÄpu do modelu tylko przez API, ktÃģry moÅže byÄ nastÄpnie komercjalizowany. ByteDance juÅž raz zrobiÅ to w 2025 roku, udostÄpniajÄ c bardzo chwalonego OmniHuman do dostÄpu za punkty na stronie Dreamina. Zatem, poniewaÅž DreamActor jest prawdopodobnie jeszcze silniejszym produktem, wydaje siÄ to najbardziej prawdopodobny wynik. Co pozostaje do zobaczenia, to stopieÅ, w jakim jego zasady, o ile sÄ wyjaÅnione w artykule, mogÄ pomÃģc spoÅecznoÅci open source.
Nowy artykuÅ pt. DreamActor-M1: Holistyczna, wyrazista i niezawodna animacja obrazu ludzkiego z hybrydowym sterowaniem, pochodzi od szeÅciu badaczy Bytedance.
Metoda
System DreamActor proponowany w artykule ma na celu wygenerowanie animacji ludzkiej z obrazu odniesienia i filmu sterujÄ cego, przy uÅžyciu Diffusion Transformer (DiT) ramy dostosowanej do przestrzeni latentnej (wydaje siÄ, Åže jest to jakiÅ rodzaj Stable Diffusion, chociaÅž artykuÅ cytujÄ tylko publikacjÄ z 2022 roku).
Zamiast polegaÄ na zewnÄtrznych moduÅach do obsÅugi warunkÃģw odniesienia, autorzy ÅÄ czÄ cechy wyglÄ du i ruchu bezpoÅrednio wewnÄ trz DiT, umoÅžliwiajÄ c interakcjÄ w przestrzeni i czasie za pomocÄ uwagi:

Schemat nowego systemu: DreamActor koduje pozÄ, ruch twarzy i wyglÄ d w oddzielne latenty, ÅÄ czÄ c je z haÅasowanymi latencjami wideo wyprodukowanymi przez 3D VAE. SygnaÅy te sÄ ÅÄ czone wewnÄ trz Diffusion Transformer przy uÅžyciu self- i cross-uwagi, z wspÃģÅdzielonymi wagami na gaÅÄziach. Model jest nadzorowany przez porÃģwnywanie oczyszczonych danych wyjÅciowych z czystymi latencjami wideo. ÅđrÃģdÅo: https://arxiv.org/pdf/2504.01724
Aby to zrobiÄ, model wykorzystuje wstÄpnie wytrenowany 3D variational autoencoder do zakodowania zarÃģwno wejÅciowego filmu, jak i obrazu odniesienia. Te latenty sÄ patchyfikowane, ÅÄ czone i wprowadzane do DiT, ktÃģry je przetwarza wspÃģlnie.
Architektura ta odbiega od powszechnego praktyki doÅÄ czania sieci wtÃģrnej do wstrzykniÄcia odniesienia, co byÅo podejÅciem dla wpÅywowego Animate Anyone i Animate Anyone 2 projektÃģw.
Zamiast tego, DreamActor buduje fuzjÄ w samym modelu, upraszczajÄ c projekt i poprawiajÄ c przepÅyw informacji miÄdzy wskazÃģwkami wyglÄ du i ruchu. Model jest nastÄpnie szkolony przy uÅžyciu dopasowania przepÅywu zamiast standardowego celu dyfuzji (dopasowanie przepÅywu szkoli modele dyfuzji, bezpoÅrednio przewidujÄ c pola prÄdkoÅci miÄdzy danymi a haÅasem, pomijajÄ c szacowanie wyniku).
Hybrydowe sterowanie ruchem
Metoda hybrydowego sterowania ruchem, ktÃģra informuje renderowania neuronalne, ÅÄ czy tokeny pozy z pochodzÄ cymi z 3D szkieletÃģw ciaÅa i sfery gÅowy; jawne reprezentacje twarzy wyprowadzane przez wstÄpnie wytrenowany kodujÄ cy twarz; i tokeny wyglÄ du odniesienia pobrane z obrazu ÅšrÃģdÅowego.
Elementy te sÄ zintegrowane wewnÄ trz Diffusion Transformer przy uÅžyciu odrÄbnych mechanizmÃģw uwagi, umoÅžliwiajÄ c systemowi koordynowanie globalnego ruchu, wyrazu twarzy i toÅžsamoÅci wizualnej w caÅym procesie generacji.
Dla pierwszego z nich, zamiast polegaÄ na punktach orientacji twarzy, DreamActor wykorzystuje jawne reprezentacje twarzy do sterowania generacjÄ wyrazu, co wydaje siÄ umoÅžliwiaÄ bardziej precyzyjnÄ kontrolÄ nad dynamikÄ twarzy, a takÅže rozÅÄ cza toÅžsamoÅÄ i pozÄ gÅowy od wyrazu.
Aby utworzyÄ te reprezentacje, potok najpierw wykrywa i obcina region twarzy w kaÅždym klatce filmu sterujÄ cego, zmniejszajÄ c go do 224Ã224. ObciÄte twarze sÄ przetwarzane przez kodujÄ cy ruch twarzy wstÄpnie wytrenowany na PD-FGC, a nastÄpnie warunkowany przez warstwÄ MLP.

PD-FGC, zastosowany w DreamActor, generuje gÅowÄ mÃģwcÄ z obrazu odniesienia z rozÅÄ cznym sterowaniem synchronizacji ust (z dÅšwiÄku), pozie gÅowy, ruchem oka i wyrazem (z oddzielnych filmÃģw), umoÅžliwiajÄ c precyzyjnÄ , niezaleÅžnÄ manipulacjÄ kaÅždym. ÅđrÃģdÅo: https://arxiv.org/pdf/2211.14506
Wynikiem jest sekwencja tokenÃģw ruchu twarzy, ktÃģre sÄ wstrzykiwane do Diffusion Transformer przez warstwÄ cross-uwagi.
Ten sam framework obsÅuguje rÃģwnieÅž wariant sterowany dÅšwiÄkiem, w ktÃģrym oddzielny kodujÄ cy jest szkolony, ktÃģry mapuje dane wejÅciowe dÅšwiÄku bezpoÅrednio na tokeny ruchu twarzy. To umoÅžliwia generowanie zsynchronizowanej animacji twarzy â w tym ruchÃģw ust â bez filmu sterujÄ cego.
ZAWARTOÅÄ DÅđWIÄKOWA. Kliknij, aby odtworzyÄ. Synchronizacja ust pochodzÄ ca wyÅÄ cznie z dÅšwiÄku, bez filmu sterujÄ cego. Jedynym wejÅciem postaci jest statyczne zdjÄcie widoczne w prawym gÃģrnym rogu.
Drugie, aby kontrolowaÄ pozÄ gÅowy niezaleÅžnie od wyrazu twarzy, system wprowadza reprezentacjÄ sfery gÅowy (patrz film osadzony wczeÅniej w tym artykule), ktÃģra rozÅÄ cza dynamikÄ twarzy od globalnego ruchu gÅowy, poprawiajÄ c precyzyjnoÅÄ i elastycznoÅÄ podczas animacji.
Sfery gÅowy sÄ generowane przez wyprowadzenie parametrÃģw 3D twarzy â takich jak rotacja i poÅoÅženie kamery â z filmu sterujÄ cego przy uÅžyciu metody FaceVerse.

Schemat projektu FaceVerse. ÅđrÃģdÅo: https://www.liuyebin.com/faceverse/faceverse.html
Parametry te sÄ wykorzystywane do renderowania kolorowej sfery projekcji na 2D pÅaszczyÅšnie obrazu, przestrzennie wyrÃģwnanej z gÅowÄ sterujÄ cÄ . Rozmiar sfery odpowiada gÅowie odniesienia, a jej kolor odzwierciedla orientacjÄ gÅowy. Abstrakcja ta redukuje zÅoÅžonoÅÄ uczenia 3D ruchu gÅowy, pomagajÄ c zachowaÄ stylizowane lub przesadzone ksztaÅty gÅowy w postaciach z animacji.

Wizualizacja sfery kontrolnej wpÅywajÄ cej na orientacjÄ gÅowy.
Wreszcie, aby sterowaÄ peÅnym ruchem ciaÅa, system wykorzystuje 3D szkielety ciaÅa z adaptacyjnÄ normalizacjÄ dÅugoÅci koÅci. Parametry ciaÅa i rÄ k sÄ szacowane przy uÅžyciu 4DHumans i HaMeR, ktÃģre dziaÅajÄ na modelu SMPL-X.

SMPL-X stosuje siatkÄ parametrycznÄ na caÅe ciaÅo ludzkie na obrazie, wyrÃģwnujÄ c z oszacowanÄ pozÄ i wyrazem, umoÅžliwiajÄ c manipulacjÄ pozÄ przy uÅžyciu siatki jako przewodnika objÄtoÅciowego. ÅđrÃģdÅo: https://arxiv.org/pdf/1904.05866
Z tych danych wyjÅciowych wybiera siÄ kluczowe stawy, projekty w 2D i ÅÄ czy w mapy szkieletowe oparte na liniach. W przeciwieÅstwie do metod takich jak Champ, ktÃģre renderujÄ peÅne siatki ciaÅa, to podejÅcie unika narzucania predefiniowanych priorytetÃģw ksztaÅtu, a poprzez poleganie wyÅÄ cznie na strukturze szkieletu, model jest zachÄcany do wnioskowania o ksztaÅt i wyglÄ d ciaÅa bezpoÅrednio z obrazÃģw odniesienia, redukujÄ c uprzedzenia wobec okreÅlonych typÃģw ciaÅa i poprawiajÄ c uogÃģlnienie na rÃģÅžnych pozach i budowach.
Podczas szkolenia, 3D szkielety ciaÅa sÄ ÅÄ czone z sferami gÅowy i przekazywane przez kodujÄ cy pozÄ, ktÃģry wyprowadza cechy, ktÃģre sÄ nastÄpnie ÅÄ czone z haÅasowanymi latencjami wideo, aby wyprodukowaÄ tokeny haÅasu wykorzystywane przez Diffusion Transformer.
W czasie inferencji, system uwzglÄdnia rÃģÅžnice szkieletowe miÄdzy podmiotami, normalizujÄ c dÅugoÅci koÅci. WstÄpnie wytrenowany model SeedEdit przeksztaÅca oba obrazy odniesienia i sterujÄ ce w standardowÄ konfiguracjÄ kanonicznÄ . RTMPose jest nastÄpnie wykorzystywany do wyprowadzenia proporcji szkieletu, ktÃģre sÄ wykorzystywane do dostosowania szkieletu sterujÄ cego do anatomii podmiotu odniesienia.

PrzeglÄ d potoku inferencji. Pseudo-odniesienia mogÄ byÄ generowane, aby wzbogaciÄ wskazÃģwki wyglÄ du, podczas gdy hybrydowe sygnaÅy sterujÄ ce â jawne ruch twarzy i jawne poza z sfer gÅowy i szkieletu ciaÅa â sÄ wyprowadzane z filmu sterujÄ cego. NastÄpnie sÄ one wprowadzane do modelu DiT, aby wyprodukowaÄ animowany wynik, z ruchem twarzy rozÅÄ czonym od pozy ciaÅa, umoÅžliwiajÄ c uÅžycie dÅšwiÄku jako sterujÄ cego.
Sterowanie wyglÄ dem
Aby poprawiÄ wiernoÅÄ wyglÄ du, szczegÃģlnie w obszarach zakrytych lub rzadko widocznych, system uzupeÅnia gÅÃģwny obraz odniesienia pseudo-odniesieniami pobranymi z wejÅciowego filmu.
Kliknij, aby odtworzyÄ. System przewiduje potrzebÄ dokÅadnego i spÃģjnego renderowania obszarÃģw zakrytych. Jest to jeden z najbliÅžszych przykÅadÃģw, jakich widziaÅem, w projekcie tego rodzaju, do podejÅcia bitmapowego w tradycyjnych technikach CGI.
Te dodatkowe klatki sÄ wybrane dla rÃģÅžnorodnoÅci pozy przy uÅžyciu RTMPose i filtrowane przy uÅžyciu podobieÅstwa CLIP, aby upewniÄ siÄ, Åže pozostajÄ spÃģjne z toÅžsamoÅciÄ podmiotu.
Wszystkie ramki odniesienia (gÅÃģwne i pseudo) sÄ zakodowane przez ten sam kodujÄ cy wizualny i ÅÄ czone za pomocÄ mechanizmu uwagi, umoÅžliwiajÄ c modelowi dostÄp do uzupeÅniajÄ cych wskazÃģwek wyglÄ du. To ustawienie poprawia pokrycie szczegÃģÅÃģw, takich jak widoki profilowe lub tekstury koÅczyn. Pseudo-odniesienia sÄ zawsze uÅžywane podczas szkolenia i opcjonalnie podczas inferencji.
Szkolenie
DreamActor zostaÅ wytrenowany w trzech etapach, aby stopniowo wprowadzaÄ zÅoÅžonoÅÄ i poprawiaÄ stabilnoÅÄ.
W pierwszym etapie, tylko 3D szkielety ciaÅa i 3D sfery gÅowy byÅy uÅžywane jako sygnaÅy sterujÄ ce, wykluczajÄ c reprezentacje twarzy. To pozwoliÅo na adaptacjÄ modelu generacji wideo do animacji ludzkiej bez zalewania go drobnymi kontrolami.
W drugim etapie, jawne reprezentacje twarzy zostaÅy dodane, ale wszystkie inne parametry zamroÅžone. Tylko kodujÄ cy ruch twarzy i warstwy uwagi twarzy byÅy szkolone w tym momencie, umoÅžliwiajÄ c modelowi naukÄ szczegÃģÅÃģw wyrazu w izolacji.
W koÅcowym etapie, wszystkie parametry byÅy odblokowane do wspÃģlnej optymalizacji na wyglÄ d, pozÄ i dynamikÄ twarzy.
Dane i testy
Do fazy testowej model jest inicjowany z wstÄpnie wytrenowanego punktu kontrolnego DiT i szkolony w trzech etapach: 20 000 krokÃģw dla kaÅždego z pierwszych dwÃģch etapÃģw i 30 000 krokÃģw dla trzeciego.
Aby poprawiÄ uogÃģlnienie na rÃģÅžne dÅugoÅci i rozdzielczoÅci, klipy wideo byÅy losowo wybrane z dÅugoÅciami miÄdzy 25 a 121 klatkami. NastÄpnie zostaÅy one zmniejszone do 960x640px, zachowujÄ c proporcje.
Szkolenie zostaÅo przeprowadzone na oÅmiu (chiÅskich) procesorach NVIDIA H20, kaÅždy z 96GB pamiÄci VRAM, przy uÅžyciu optymalizatora AdamW z (tolerancjÄ ) wysokim wspÃģÅczynnikiem uczenia 5eâ6.
Podczas inferencji, kaÅždy segment wideo zawieraÅ 73 klatki. Aby utrzymaÄ spÃģjnoÅÄ miÄdzy segmentami, ostateczny latent z jednego segmentu byÅ ponownie wykorzystywany jako poczÄ tkowy latent dla nastÄpnego, ktÃģry kontekstualizuje zadanie jako sekwencyjnÄ generacjÄ obrazu na wideo.
Bezklasowe sterowanie zostaÅo zastosowane z wagÄ 2,5 zarÃģwno dla obrazÃģw odniesienia, jak i sygnaÅÃģw sterujÄ cych.
Autorzy zbudowali zestaw danych szkoleniowych (bez podanych ÅšrÃģdeÅ w artykule) skÅadajÄ cy siÄ z 500 godzin wideo z rÃģÅžnych dziedzin, zawierajÄ cych przypadki (miÄdzy innymi) taÅca, sportu, filmu i publicznych wystÄ pieÅ. Zestaw danych zostaÅ zaprojektowany, aby uchwyciÄ szeroki zakres ruchu i wyrazu ludzkiego, z rÃģwnym rozkÅadem miÄdzy peÅnymi i pÃģÅ-ciaÅem ujÄciami.
Aby poprawiÄ jakoÅÄ syntezy twarzy, Nersemble zostaÅ uwzglÄdniony w procesie przygotowania danych.

PrzykÅady z zestawu danych Nersemble, wykorzystanego do wzbogacenia danych dla DreamActor. ÅđrÃģdÅo: https://www.youtube.com/watch?v=a-OAWqBzldU
Do oceny, badacze wykorzystali swÃģj zestaw danych rÃģwnieÅž jako benchmark, aby oceniÄ uogÃģlnienie na rÃģÅžne scenariusze.
Wyniki modelu zostaÅy zmierzone przy uÅžyciu standardowych miar z poprzednich prac: FrÃĐchet Inception Distance (FID); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); oraz Peak Signal-to-Noise Ratio (PSNR) do jakoÅci na poziomie klatki. FrÃĐchet Video Distance (FVD) zostaÅ wykorzystany do oceny spÃģjnoÅci czasowej i ogÃģlnej wiernoÅci wideo.
Badacze przeprowadzili eksperymenty na zadaniach animacji ciaÅa i portretu, wszystkie zatrudniajÄ ce jeden (cel) obraz odniesienia.
Dla animacji ciaÅa, DreamActor-M1 zostaÅ porÃģwnany z Animate Anyone; Champ; MimicMotion; oraz DisPose.

PorÃģwnania iloÅciowe z rywalizujÄ cymi ramami.
ChociaÅž PDF zawiera statyczny obraz jako porÃģwnanie wizualne, jeden z filmÃģw z witryny projektu moÅže bardziej wyraÅšnie podkreÅliÄ rÃģÅžnice:
ZAWARTOÅÄ DÅđWIÄKOWA. Kliknij, aby odtworzyÄ. PorÃģwnanie wizualne miÄdzy ramami rywalizujÄ cymi. Film sterujÄ cy jest widoczny w lewym gÃģrnym rogu, a wniosek autorÃģw, Åže DreamActor produkuje najlepsze wyniki, wydaje siÄ uzasadniony.
Dla testÃģw animacji portretu, model zostaÅ oceniony przeciwko LivePortrait; X-Portrait; SkyReels-A1; oraz Act-One.

PorÃģwnania iloÅciowe dla animacji portretu.
Badacze zauwaÅžajÄ , Åže ich metoda wygrywa w testach iloÅciowych i twierdzÄ , Åže jest rÃģwnieÅž lepsza jakoÅciowo.
ZAWARTOÅÄ DÅđWIÄKOWA. Kliknij, aby odtworzyÄ. PrzykÅady porÃģwnaÅ animacji portretu.
MoÅžna argumentowaÄ, Åže trzeci i ostatni z klipÃģw pokazanych w powyÅžszym filmie wykazuje mniej przekonywujÄ cÄ synchronizacjÄ ust w porÃģwnaniu z kilkoma rywalizujÄ cymi ramami, chociaÅž ogÃģlna jakoÅÄ jest niezwykle wysoka.
Wnioski
PrzewidujÄ c potrzebÄ tekstur, ktÃģre sÄ sugerowane, ale nie sÄ obecne w jedynym obrazie docelowym, Bytedance rozwiÄ zaÅ jeden z najwiÄkszych wyzwaÅ stojÄ cych przed generacjÄ wideo opartÄ na dyfuzji â spÃģjne i trwaÅe tekstury. NastÄpnym logicznym krokiem po udoskonaleniu takiego podejÅcia byÅoby stworzenie atlasu odniesienia z wygenerowanego klipu, ktÃģry mÃģgÅby byÄ zastosowany do nastÄpnych, rÃģÅžnych generacji, aby utrzymaÄ wyglÄ d bez LoRAs.
ChociaÅž takie podejÅcie byÅoby w zasadzie zewnÄtrznym odniesieniem, nie rÃģÅžni siÄ to od mapowania tekstur w tradycyjnych technikach CGI, a jakoÅÄ realizmu i prawdopodobieÅstwa jest znacznie wyÅžsza niÅž ta, ktÃģrÄ mogÄ osiÄ gnÄ Ä te starsze metody.
Powiedzmy, Åže najbardziej imponujÄ cym aspektem DreamActor jest poÅÄ czony trÃģjczÄÅciowy system sterowania, ktÃģry w inteligentny sposÃģb ÅÄ czy tradycyjnÄ przepaÅÄ miÄdzy syntezÄ ludzkÄ skupionÄ na twarzy a syntezÄ ciaÅa.
pozostaje tylko pytanie, czy niektÃģre z tych podstawowych zasad mogÄ byÄ wykorzystane w bardziej dostÄpnych ofertach; jak na razie DreamActor wydaje siÄ przeznaczony do zostania kolejnÄ usÅugÄ syntetyzujÄ cÄ , surowo ograniczonÄ przez ograniczenia uÅžytkowania i niepraktycznoÅÄ prowadzenia obszernych eksperymentÃģw z komercyjnÄ architekturÄ .
Â
* Moja заОÐĩÐ―Ð° hiperÅÄ czy na autorÃģw; cytaty w tekÅcie
â Jak wspomniano wczeÅniej, nie jest jasne, jaki smak Stable Diffusion zostaÅ uÅžyty w tym projekcie.
Pierwotnie opublikowane w piÄ tek, 4 kwietnia 2025












