Kąt Andersona

HunyuanCustom wprowadza funkcję tworzenia filmów z jednego obrazu, z dźwiękiem i synchronizacją ust

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Ten artykuł omawia nowy wydanie wielomodalnego modelu Hunyuan Video o nazwie ‘HunyuanCustom’. Nowy artykuł ma bardzo szeroki zakres, a wiele przykładowych filmów na stronie projektu* ogranicza nas do bardziej ogólnych informacji i ograniczonej ilości materiału filmowego, który towarzyszy temu wydaniu (ponieważ wiele filmów wymaga znacznego edytowania i przetwarzania, aby poprawić czytelność układu).

Proszę zwrócić uwagę, że artykuł odnosi się do systemu generatywnego opartego na API o nazwie Kling jako ‘Keling’. Dla wyjaśnienia, będę odnosił się do ‘Kling’ przez cały czas.

 

Tencent jest w trakcie wydania nowej wersji swojego modelu Hunyuan Video, zatytułowanej HunyuanCustom. Nowe wydanie zdaje się umożliwiać tworzenie filmów w stylu ‘deepfake’ za pomocą jednego obrazu:

Kliknij, aby odtworzyć. Podpowiedź: ‘Mężczyzna słucha muzyki i gotuje makaron w kuchni’. Nowa metoda porównywana jest z metodami zamkniętymi i otwartymi, w tym z Kling, który jest znaczącym przeciwnikiem w tej dziedzinie. Źródło: https://hunyuancustom.github.io/ (ostrzeżenie: strona wymaga dużej ilości pamięci i procesora!)

W lewej kolumnie powyższego filmu widzimy pojedynczy obraz źródłowy dostarczony do HunyuanCustom, a następnie nowy system interpretuje podpowiedź w drugiej kolumnie. Pozostałe kolumny pokazują wyniki z różnych systemów zamkniętych i otwartych: Kling; Vidu; Pika; Hailuo; oraz Wan-based SkyReels-A2.

W poniższym filmie widzimy renderowania trzech scenariuszy istotnych dla tego wydania: odpowiednio, osoba + obiekt; emulacja pojedynczego charakteru; oraz wirtualna przymierzalnia (osoba + ubranie):

Kliknij, aby odtworzyć. Trzy przykłady edytowane z materiału na stronie wspierającej Hunyuan Video.

Możemy zauważyć kilka rzeczy z tych przykładów, głównie związanych z tym, że system opiera się na pojedynczym obrazie źródłowym, zamiast na wielu obrazach tego samego obiektu.

W pierwszym klipie mężczyzna jest praktycznie cały czas zwrócony w stronę kamery. Nachylił głowę w dół i na bok o mniej niż 20-25 stopni, ale przy większym nachyleniu system musiałby zacząć zgadywać, jak wygląda z boku. To jest trudne, prawdopodobnie niemożliwe do ustalenia dokładnie na podstawie jednego przedniego obrazu.

W drugim przykładzie widzimy, że dziewczynka uśmiecha się w wyrenderowanym filmie, tak jak na statycznym obrazie źródłowym. Ponownie, z tym samym obrazem jako odniesieniem, HunyuanCustom musiałby zrobić dość niepoinformowaną próbę, aby ustalić, jak wygląda jej “spokojna twarz”. Dodatkowo, jej twarz nie odbiega od pozycji zwróconej w stronę kamery o więcej niż w poprzednim przykładzie (‘mężczyzna jedzący chipsy’).

W ostatnim przykładzie widzimy, że ponieważ materiał źródłowy – kobieta i ubranie, które jest nakładane – nie są pełnymi obrazami, render został obcięty, aby dopasować się do sytuacji – co jest naprawdę dość dobrym rozwiązaniem problemu z danymi!

Chodzi o to, że chociaż nowy system może obsługiwać wiele obrazów (takich jak osoba + chipsy lub osoba + ubranie), nie zdaje się umożliwiać wielu kątów lub alternatywnych widoków pojedynczego charakteru, aby mogły być uwzględnione różne wyrażenia lub niezwykłe kąty. W tym zakresie system może mieć trudności z zastąpieniem rosnącej ekosystemu modeli LoRA, które wyrósł wokół HunyuanVideo od jego wydania w grudniu, ponieważ mogą one pomóc HunyuanVideo w tworzeniu spójnych postaci z dowolnego kąta i z dowolnym wyrażeniem twarzy reprezentowanym w zbiorze danych szkoleniowych (20-60 obrazów jest typowe).

Podłączony do dźwięku

Dla dźwięku HunyuanCustom wykorzystuje LatentSync system (notorycznie trudny do ustalenia i uzyskania dobrych wyników dla hobbystów) w celu uzyskania ruchów ust, które są dopasowane do dźwięku i tekstu dostarczonego przez użytkownika:

Posiada dźwięk. Kliknij, aby odtworzyć. Różne przykłady synchronizacji ust z witryny HunyuanCustom, edytowane razem.

W momencie pisania nie ma angielskich przykładów, ale wydają się one dość dobre – tym bardziej, jeśli metoda ich tworzenia jest łatwa do zainstalowania i dostępna.

Edycja istniejącego filmu

Nowy system oferuje bardzo imponujące wyniki dla edycji filmu z filmem (V2V, lub Vid2Vid), w której fragment istniejącego (rzeczywistego) filmu jest zamaskowany i inteligentnie zastąpiony przez obiekt podany w jednym obrazie referencyjnym. Poniżej znajduje się przykład z witryny materiałów dodatkowych:

Kliknij, aby odtworzyć. Tylko centralny obiekt jest celem, ale to, co pozostaje wokół niego, również zostaje zmienione w HunyuanCustom vid2vid.

Możemy zobaczyć, i jak to jest standardem w scenariuszu vid2vid, cały film jest w pewnym stopniu zmieniony przez proces, chociaż najbardziej zmieniony w regionie docelowym, czyli w pluszowym zabawce. Prawdopodobnie można by opracować potoki, które umożliwią takie transformacje podczas podejścia garbage matte, które pozostawiają większość zawartości filmu identyczną z oryginałem. To jest to, co robi Adobe Firefly pod powierzchnią, i robi to dość dobrze – ale jest to proces słabo zbadany w środowisku FOSS generatywnym.

Większość alternatywnych przykładów dostarczonych robi lepszą robotę w celu ukierunkowania tych integracji, jak możemy zobaczyć w skompilowanym zestawieniu poniżej:

Kliknij, aby odtworzyć. Różne przykłady wstrzyknięcia zawartości przy użyciu vid2vid w HunyuanCustom, wykazujące znaczący szacunek dla niecelowych materiałów.

Nowy start?

To przedsięwzięcie jest rozwinięciem projektu Hunyuan Video, a nie twardym zwrotem od tego strumienia rozwoju. Wprowadzenia projektu są wprowadzane jako dyskretne wstawienia architektoniczne, a nie jako zmiany strukturalne, mające na celu umożliwienie modelowi utrzymania wierności tożsamości w ramach klatek bez polegania na specyficznych dla obiektu dostosowaniach, takich jak LoRA lub podejścia inwersji tekstowej.

Abstrahując, HunyuanCustom nie jest szkolony od podstaw, ale raczej jest dostosowaniem podstawowego modelu HunyuanVideo z grudnia 2024.

Osoby, które opracowały LoRA dla HunyuanVideo, mogą się zastanawiać, czy nadal będą one działać z tym nowym wydaniem, czy będą musiały ponownie wymyślić koło jeszcze raz, jeśli chcą większych możliwości dostosowywania niż te, które są wbudowane w to nowe wydanie.

W ogóle, silnie dostosowane wydanie modelu hiperskali zmienia wagi modelu wystarczająco, aby LoRA utworzone dla poprzedniego modelu nie działały prawidłowo lub wcale z nowym, udoskonalonym modelem.

Czasami jednak popularność dostosowania może zakwestionować jego pochodzenie: jeden przykład dostosowania, które stało się skutecznym forkiem, z dedykowaną ekosystemą i zwolennikami, jest Pony Diffusion dostosowanie Stable Diffusion XL (SDXL). Pony ma obecnie 592 000+ pobrań w domenie CivitAI, z ogromną liczbą LoRA, które używają Pony (a nie SDXL) jako modelu podstawowego i które wymagają Pony w czasie inferencji.

Wydanie

Strona projektu dla nowego artykułu (który nosi tytuł HunyuanCustom: Wielomodalna architektura dla dostosowanego tworzenia filmów) zawiera linki do strony GitHub, która, w momencie pisania, właśnie stała się funkcjonalna i wydaje się zawierać wszystkie kod i niezbędne wagi do lokalnej implementacji, wraz z proponowanym harmonogramem (gdzie jedyną ważną rzeczą, która jeszcze się nie pojawiła, jest integracja ComfyUI).

W momencie pisania, obecność projektu na Hugging Face nadal jest 404. Istnieje jednak wersja oparta na API, gdzie można wypróbować system, pod warunkiem, że można dostarczyć kod skanowania WeChat.

Rzadko widziałem tak obszerny i wszechstronny wykorzystanie tak wielu projektów w jednej całości, jak to ma miejsce w HunyuanCustom – i można przypuszczać, że niektóre z licencji wymagałyby pełnego wydania.

Dwa modele są ogłoszone na stronie GitHub: wersja 720px1280px wymagająca 8 GB pamięci GPU, oraz wersja 512px896px wymagająca 60 GB pamięci GPU.

Repozytorium stwierdza ‘Minimalna wymagana pamięć GPU wynosi 24 GB dla 720px1280px129f, ale jest to bardzo wolne… Zalecamy korzystanie z GPU o 80 GB pamięci dla lepszej jakości generacji’ – i podkreśla, że system został przetestowany tylko na Linuksie.

Poprzedni model Hunyuan Video został skwantyzowany do rozmiarów, w których może być uruchomiony na mniej niż 24 GB VRAM, i wydaje się, że nowy model również zostanie zaadaptowany do bardziej przyjaznych dla konsumenta form przez społeczność, i że szybko zostanie zaadaptowany do użycia na systemach Windows.

Ze względu na ograniczenia czasowe i ogromną ilość informacji towarzyszących temu wydaniu, możemy tylko przyjrzeć się temu wydaniu w sposób ogólny, zamiast szczegółowy.

Spójrz na artykuł

Potok danych dla HunyuanCustom, który wydaje się być zgodny z ramami GDPR, obejmuje zarówno syntetyzowane, jak i otwarte zestawy danych wideo, w tym OpenHumanVid, z ośmioma podstawowymi kategoriami reprezentowanymi: ludzie, zwierzęta, rośliny, pejzaże, pojazdy, obiekty, architektura i anime.

Z artykułu, przegląd różnych pakietów w potoku konstrukcji danych HunyuanCustom. Źródło: https://arxiv.org/pdf/2505.04512

Z artykułu, przegląd różnych pakietów w potoku konstrukcji danych HunyuanCustom. Źródło: https://arxiv.org/pdf/2505.04512

Początkowe filtrowanie rozpoczyna się od PySceneDetect, który dzieli filmy na klipy jednej sceny. TextBPN-Plus-Plus jest następnie używany do usunięcia filmów zawierających nadmiar tekstu na ekranie, napisów, znaków wodnych lub logo.

Aby rozwiązać problemy ze spójnością rozdzielczości i czasu trwania, klipy są standaryzowane do pięciu sekund długości i zmieniane rozmiaru do 512 lub 720 pikseli po krótszej stronie. Filtrowanie estetyczne jest obsługiwane przez Koala-36M, z niestandardowym progiem 0,06 zastosowanym dla niestandardowego zestawu danych opracowanego przez autorów artykułu.

Proces ekstrakcji obiektu łączy Qwen7B duży model językowy (LLM), YOLO11X ramy rozpoznawania obiektów, oraz popularną InsightFace architekturę, w celu identyfikacji i walidacji tożsamości ludzkich.

Dla nie-ludzkich obiektów QwenVL i Grounded SAM 2 są używane do ekstrakcji odpowiednich prostokątów ograniczających, które są odrzucane, jeśli są zbyt małe.

Przykłady segmentacji semantycznej z Grounded SAM 2, używane w projekcie Hunyuan Control. Źródło: https://github.com/IDEA-Research/Grounded-SAM-2

Przykłady segmentacji semantycznej z Grounded SAM 2, używane w projekcie Hunyuan Control. Źródło: https://github.com/IDEA-Research/Grounded-SAM-2

Ekstrakcja wielu obiektów wykorzystuje Florence2 do adnotacji prostokątów ograniczających, oraz Grounded SAM 2 do segmentacji, po której następuje klastryzacja i segmentacja czasowa klatek szkoleniowych.

Przetworzone klipy są dalej wzbogacone za pomocą adnotacji, przy użyciu niestandardowego systemu etykietowania opracowanego przez zespół Hunyuan, który dostarcza warstwowe metadane, takie jak opisy i wskazówki ruchu kamery.

Mask augmentation strategie, w tym konwersja do prostokątów ograniczających, były stosowane podczas szkolenia w celu zmniejszenia przeuczenia i zapewnienia, że model dostosowuje się do różnych kształtów obiektów.

Dane dźwiękowe były synchronizowane za pomocą wspomnianego LatentSync, a klipy były odrzucane, jeśli wyniki synchronizacji spadły poniżej minimalnego progu.

Ramka oceny jakości obrazu HyperIQA była używana do wykluczenia filmów, które uzyskały wynik poniżej 40 (w skali HyperIQA). Ważne ścieżki dźwiękowe były następnie przetwarzane za pomocą Whisper w celu ekstrakcji cech do zadań downstream.

Autorzy włączają LLaVA model asystenta językowego w fazie adnotacji, i podkreślają centralną pozycję, jaką ten framework zajmuje w HunyuanCustom. LLaVA jest używany do generowania opisów obrazów i wspomagania wyrównania zawartości wizualnej z podpowiedziami tekstowymi, wspierając konstrukcję spójnego sygnału szkoleniowego w różnych modalnościach:

Ramka HunyuanCustom wspiera generację filmów spójnych z tożsamością, warunkowaną wejściami tekstowymi, obrazowymi, dźwiękowymi i filmowymi.

Ramka HunyuanCustom wspiera generację filmów spójnych z tożsamością, warunkowaną wejściami tekstowymi, obrazowymi, dźwiękowymi i filmowymi.

Dzięki możliwościom wyrównania wizji i języka LLaVA, potok zyskuje dodatkową warstwę spójności semantycznej między elementami wizualnymi a ich opisami tekstowymi – szczególnie cenną w scenariuszach z wieloma obiektami lub złożonymi scenami.

Wideo niestandardowe

Aby umożliwić generację filmów na podstawie obrazu referencyjnego i podpowiedzi, stworzono dwa moduły skupione wokół LLaVA, najpierw dostosowując strukturę wejściową HunyuanVideo, aby mogła ona przyjmować obraz wraz z tekstem.

To wymagało sformatowania podpowiedzi w taki sposób, aby osadzić obraz bezpośrednio lub oznaczyć go krótkim opisem tożsamości. Token separatora został użyty, aby powstrzymać osadzanie obrazu od przytłaczania zawartości podpowiedzi.

Ponieważ wizualny encoder LLaVA ma tendencję do kompresowania lub odrzucania drobnych szczegółów przestrzennych podczas wyrównania cech obrazu i tekstu (szczególnie podczas tłumaczenia jednego obrazu referencyjnego na ogólny zestaw semantyczny), włączono moduł wzmocnienia tożsamości. Ponieważ prawie wszystkie modele latentne difuzji filmów mają trudności z utrzymaniem tożsamości bez LoRA, nawet w klipie pięciosekundowym, wyniki tego modułu w testach społeczności mogą okazać się znaczące.

W każdym razie, obraz referencyjny jest następnie zmieniany rozmiaru i kodowany za pomocą przyczynowego 3D-VAE z oryginalnego modelu HunyuanVideo, a jego latent jest wstawiany do latentu filmu wzdłuż osi czasowej, z offsetem przestrzennym, aby powstrzymać obraz od bezpośredniej reprodukcji w wyjściu, jednocześnie kierując generację.

Model został przeszkolony za pomocą Flow Matching, z próbkami szumu pobranymi z logit-normal rozkładu – i sieć była przeszkolona do odzyskania poprawnego filmu z tych szumnych latentów. LLaVA i generator filmu zostały przeszkolone razem, aby umożliwić, że obraz i podpowiedź mogą płynnie kierować wyjściem i utrzymywać spójność tożsamości.

Dla podpowiedzi wielu obiektów, każda para obrazu i tekstu była osadzana oddzielnie i przypisywana odrębnej pozycji czasowej, umożliwiając rozróżnienie tożsamości i wspierając generację scen z wieloma interaktywnymi obiektami.

Dźwięk i wizja

HunyuanCustom warunkuje generację dźwięku/mowy za pomocą wejść dźwięku użytkownika i podpowiedzi tekstowej, umożliwiając postaciom mówienie w scenach, które odzwierciedlają opisaną sytuację.

Aby to wesprzeć, moduł Identity-disentangled AudioNet wprowadza cechy dźwiękowe bez zakłócania sygnałów tożsamości osadzonych z obrazu referencyjnego i podpowiedzi. Te cechy są wyrównane z skompresowanym harmonogramem filmu, podzielonym na segmenty poziome, i wstrzykiwane za pomocą mechanizmu cross-attention przestrzennego, który izoluje każdą klatkę, utrzymując spójność obiektu i unikając interferencji czasowej.

Drugi moduł wstrzyknięcia czasowego zapewnia bardziej precyzyjną kontrolę nad czasem i ruchem, pracując w tandemie z AudioNet, mapując cechy dźwiękowe na określone regiony sekwencji latentnej, i używając wielowarstwowego perceptronu (MLP), aby przekonwertować je na token-wise offsety ruchu. To pozwala na gesty i ruchy twarzy, które podążają za rytmem i akcentem wejścia mówionego z większą precyzją.

HunyuanCustom pozwala na edycję postaci w istniejących filmach bezpośrednio, zastępując lub wstawiając ludzi lub obiekty do sceny bez potrzeby odbudowywania całego klipu od podstaw. To sprawia, że jest on użyteczny do zadań, które obejmują zmianę wyglądu lub ruchu w ukierunkowany sposób.

Kliknij, aby odtworzyć. Kolejny przykład z witryny dodatkowej.

Aby ułatwić wydajną zamianę obiektu w istniejących filmach, nowy system unika zasobochłonnego podejścia stosowanego przez ostatnie metody, takie jak popularny VACE, lub te, które łączą całe sekwencje filmowe, faworyzując zamiast tego kompresję filmu referencyjnego za pomocą wstępnie przeszkolonego 3D-VAE – wyrównując go z wewnętrznymi latentami potoku generacji, a następnie dodając je. To utrzymuje proces w miarę lekki, jednocześnie pozwalając na kierowanie wyjściem przez zawartość filmu zewnętrzną.

Mała sieć neuronowa obsługuje wyrównanie między czystym wejściem filmu a szumnymi latentami używanymi w generacji. System testuje dwa sposoby wstrzyknięcia tej informacji: łącząc dwa zestawy cech przed ich ponowną kompresją; oraz dodając cechy klatka po klatce. Druga metoda działa lepiej, stwierdzają autorzy, i unika utraty jakości, jednocześnie utrzymując niezmieniony obciążenie obliczeniowe.

Dane i testy

W testach użyto następujących miar: moduł spójności tożsamości w ArcFace, który wyodrębnia osadzenia twarzy z obrazu referencyjnego i każdej klatki wygenerowanego filmu, a następnie oblicza średnią podobieństwo kosinusowe między nimi; podobieństwo obiektu, za pomocą wysyłania segmentów YOLO11x do Dino 2 do porównania; CLIP-B, wyrównanie tekstu i filmu, które mierzy podobieństwo między podpowiedzią a wygenerowanym filmem; CLIP-B ponownie, aby obliczyć podobieństwo między każdą klatką a sąsiadującymi klatkami i pierwszą klatką, a także spójność czasową; oraz stopień dynamiczny, zdefiniowany przez VBench.

Jak wspomniano wcześniej, systemy porównawcze były Hailuo; Vidu 2.0; Kling (1.6); i Pika. Porównywane ramy FOSS były VACE i SkyReels-A2.

Ocena wydajności modelu w porównaniu z HunyuanCustom i wiodącymi metodami dostosowywania filmów w różnych kategoriach.

Ocena wydajności modelu w porównaniu z HunyuanCustom i wiodącymi metodami dostosowywania filmów w różnych kategoriach.

Z tych wyników, autorzy stwierdzają:

‘Nasze [HunyuanCustom] osiąga najlepszą spójność tożsamości i spójność obiektu. Osiąga również porównywalne wyniki w podążaniu za podpowiedzią i spójności czasowej. [Hailuo] ma najlepszy wynik klipu, ponieważ dobrze podąża za instrukcjami tekstowymi z zachowaniem tylko spójności tożsamości, poświęcając spójność nie-ludzkich obiektów (najgorszy DINO-Sim). W kategoriach dynamiczności, [Vidu] i [VACE] wykonują się słabo, co może być spowodowane małym rozmiarem modelu.’

Chociaż strona projektu jest nasycona filmami porównawczymi (których układ wydaje się być zaprojektowany bardziej z myślą o estetyce strony niż o łatwym porównaniu), nie zawiera obecnie filmu równego wynikom statycznym upchanym w PDF, w odniesieniu do wstępnych testów jakościowych. Chociaż dołączam go tutaj, zachęcam czytelnika do dokładnego zbadania filmów na stronie projektu, ponieważ dają one lepsze wrażenie z wyników:

Z artykułu, porównanie w dostosowaniu filmu zorientowanym na obiekt. Chociaż czytelnik powinien (jak zawsze) odnieść się do źródłowego PDF dla lepszej rozdzielczości, filmy na stronie projektu mogą być bardziej iluminującym zasobem w tym przypadku.

Z artykułu, porównanie w dostosowaniu filmu zorientowanym na obiekt. Chociaż czytelnik powinien (jak zawsze) odnieść się do źródłowego PDF dla lepszej rozdzielczości, filmy na stronie projektu mogą być bardziej iluminującym zasobem w tym przypadku.

Autorzy komentują tutaj:

‘Widać, że [Vidu], [Skyreels A2] i nasza metoda osiągają względnie dobre wyniki w podążaniu za podpowiedzią i spójności obiektu, ale nasza jakość filmu jest lepsza niż Vidu i Skyreels, dzięki dobrej wydajności generacji filmu naszego modelu podstawowego, czyli [Hunyuanvideo-13B].

‘Wśród produktów komercyjnych, chociaż [Kling] ma dobrą jakość filmu, pierwsza klatka filmu ma problem kopiowania, a czasem obiekt porusza się zbyt szybko i [rozmazuje], prowadząc do złej jakości oglądania.’

Autorzy stwierdzają dalej, że Pika wykonuje się słabo w kategoriach spójności czasowej, wprowadzając artefakty napisów (efekty słabej kuracji danych, gdzie elementy tekstowe w klipach były dopuszczone do zanieczyszczenia podstawowych pojęć).

Hailuo utrzymuje tożsamość twarzy, stwierdzają oni, ale nie utrzymuje pełnej spójności ciała. Wśród metod otwartych, VACE, twierdzą badacze, nie jest w stanie utrzymać spójności tożsamości, podczas gdy twierdzą, że HunyuanCustom produkuje filmy z silną ochroną tożsamości, jednocześnie utrzymując jakość i różnorodność.

Następnie przeprowadzono testy dla dostosowywania filmu wielu obiektów przeciwko tym samym rywalom. Jak w poprzednim przykładzie, wyniki PDF są nieodłączne od wyników filmowych dostępnych na stronie projektu, ale są unikalne wśród wyników przedstawionych:

Porównania przy użyciu dostosowywania filmu wielu obiektów. Proszę zobaczyć PDF dla lepszych szczegółów i rozdzielczości.

Porównania przy użyciu dostosowywania filmu wielu obiektów. Proszę zobaczyć PDF dla lepszych szczegółów i rozdzielczości.

Artykuł stwierdza:

‘[Pika] może wygenerować określone obiekty, ale wykazuje niestabilność w klatkach filmu, z przypadkami, w których mężczyzna znika w jednej scenie, a kobieta nie udaje się otworzyć drzwi, jak nakazano. [Vidu] i [VACE] częściowo uchwytują tożsamość ludzką, ale tracą znaczące szczegóły nie-ludzkich obiektów, wskazując na ograniczenie w reprezentowaniu nie-ludzkich obiektów.

‘[SkyReels A2] doświadcza ciężkich niestabilności klatek, z zauważalnymi zmianami w chipach i licznymi artefaktami w prawej scenie.

‘Nasze HunyuanCustom skutecznie ujmuje zarówno tożsamość ludzką, jak i nie-ludzką, generuje filmy, które przestrzegają podanych podpowiedzi, i utrzymuje wysoką jakość wizualną i stabilność.’

Dalszy eksperyment był ‘wirtualna reklama ludzka’, w której ramy były zadane do integracji produktu z osobą:

Z rundy testów jakościowych, przykłady umieszczania produktu neuronalnego. Proszę zobaczyć PDF dla lepszych szczegółów i rozdzielczości.

Z rundy testów jakościowych, przykłady umieszczania produktu neuronalnego. Proszę zobaczyć PDF dla lepszych szczegółów i rozdzielczości.

Dla tej rundy autorzy stwierdzają:

‘Wyniki pokazują, że HunyuanCustom skutecznie utrzymuje tożsamość ludzką, jednocześnie zachowując szczegóły celowego produktu, w tym tekst na nim.

‘Ponadto interakcja między człowiekiem a produktem wydaje się naturalna, a film przestrzega ściśle podanej podpowiedzi, podkreślając znaczący potencjał HunyuanCustom w generowaniu filmów reklamowych.’

Jednym z obszarów, w którym wyniki filmowe byłyby bardzo przydatne, była runda jakościowa dla dostosowywania obiektu za pomocą dźwięku, gdzie postać mówi odpowiedni dźwięk z opisanego scenariusza i postawy.

Częściowe wyniki podane dla rundy dźwięku – chociaż wyniki filmowe byłyby preferowane w tym przypadku. Tylko górna połowa figury PDF jest odtworzona tutaj, ponieważ jest ona duża i trudna do umieszczenia w tym artykule. Proszę odnieść się do źródłowego PDF dla lepszych szczegółów i rozdzielczości.

Częściowe wyniki podane dla rundy dźwięku – chociaż wyniki filmowe byłyby preferowane w tym przypadku. Tylko górna połowa figury PDF jest odtworzona tutaj, ponieważ jest ona duża i trudna do umieszczenia w tym artykule. Proszę odnieść się do źródłowego PDF dla lepszych szczegółów i rozdzielczości.

Autorzy twierdzą:

‘Poprzednie metody animacji ludzkiej napędzane dźwiękiem wprowadzają obraz ludzki i dźwięk, gdzie postawa, strój i środowisko pozostają spójne z danym obrazem i nie mogą generować filmów w innych gestach i środowiskach, co może ograniczyć ich zastosowanie.

‘…[Nasze] HunyuanCustom umożliwia dostosowanie dźwięku ludzkiego, gdzie postać mówi odpowiedni dźwięk w opisanym scenariuszu i postawie, umożliwiając bardziej elastyczne i kontrolowane dostosowanie dźwięku ludzkiego.’

Dalsze testy (proszę zobaczyć PDF dla wszystkich szczegółów) obejmowały rundę, w której nowy system został poddany testowi przeciwko VACE i Kling 1.6 dla zamiany obiektu w trybie film-do-filmu:

Testowanie zamiany obiektu w trybie film-do-filmu. Proszę odnieść się do źródłowego PDF dla lepszych szczegółów i rozdzielczości.

Testowanie zamiany obiektu w trybie film-do-filmu. Proszę odnieść się do źródłowego PDF dla lepszych szczegółów i rozdzielczości.

Z tych testów, badacze twierdzą:

‘VACE cierpi z powodu artefaktów granicznych z powodu ścisłego przestrzegania maski wejściowej, wynikającej w nienaturalnych kształtach obiektów i zakłóconej ciągłości ruchu. [Kling], z drugiej strony, wykazuje efekt kopiowania, gdzie obiekty są nakładane bezpośrednio na film, prowadząc do słabej integracji z tłem.

‘W porównaniu, HunyuanCustom skutecznie unika artefaktów granicznych, osiąga płynną integrację z tłem filmu i utrzymuje silną ochronę tożsamości—demonstrując swoją wyższą wydajność w zadaniach edycji filmu.’

Wnioski

To jest fascynujące wydanie, nie tylko dlatego, że rozwiązuje coś, na co niezadowolona scena hobbystyczna skarżyła się coraz częściej – brak synchronizacji ust, tak aby zwiększona realizm możliwy w systemach takich jak Hunyuan Video i Wan 2.1 mógł zyskać nowy wymiar autentyczności.

Chociaż układ prawie wszystkich przykładowych filmów porównawczych na stronie projektu utrudnia porównanie możliwości HunyuanCustom z poprzednimi rywalami, trzeba zauważyć, że bardzo niewiele projektów w dziedzinie syntezy filmu ma odwagę, by poddać się testom przeciwko Kling, komercyjnej API difuzji filmu, która zawsze unosi się na, lub w pobliżu, szczytu list rankingowych; Tencent zdaje się zrobić postępy przeciwko temu rywalowi w dość imponujący sposób.

 

* Problem polega na tym, że niektóre filmy są tak szerokie, krótkie i wysokiej rozdzielczości, że nie będą odtwarzać się w standardowych odtwarzaczach filmów, takich jak VLC lub Windows Media Player, wyświetlając czarne ekrany.

Pierwotnie opublikowane w czwartek, 8 maja 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai