Kąt Andersona

Wzrost Hunyuan Video Deepfakes

mm
Dodaj Unite.AI do preferowanych źródeł w Google
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

Z powodu niektórych materiałów omawianych tutaj, ten artykuł zawiera mniej odniesień i ilustracji niż zwykle.

Ciekawa rzecz dzieje się obecnie w społeczności syntezowania AI, choć jej znaczenie może potrwać trochę, zanim stanie się jasne. Hobbyści szkolą generatywne modele wideo AI, aby odtwarzać podobieństwa ludzi, używając wideo-opartych LoRAs na niedawno wydanym otwartym źródle Hunyuan Video framework.*

Kliknij, aby odtworzyć. Różnorodne wyniki z Hunyuan-based LoRA customizations dostępne bezpłatnie w społeczności Civit. Dzięki szkoleniu modeli adaptacji o niskim ranku (LoRAs), problemy z stabilnością czasową, które dotykały generowania wideo AI przez dwa lata, są znacznie zmniejszone. Źródła: civit.ai

W powyższym filmie wideo, podobieństwa aktorek Natalie Portman, Christina Hendricks i Scarlett Johansson, wraz z liderem technologicznym Elonem Muskiem, zostały przeszkolone w stosunkowo małe pliki dodatkowe dla systemu generatywnego wideo Hunyuan, który może być zainstalowany bez filtrów zawartości (takich jak filtry NSFW) na komputerze użytkownika.

Twórca LoRA Christina Hendricks stwierdził, że do opracowania modelu potrzebowano tylko 16 obrazów z serialu Mad Men (co jest plikiem o wielkości 307mb); wiele postów z społeczności Stable Diffusion na Reddit i Discord potwierdza, że LoRAs tego rodzaju nie wymagają dużej ilości danych szkoleniowych ani długiego czasu szkolenia, w większości przypadków.

Kliknij, aby odtworzyć. Arnold Schwarzenegger został ożywiony w Hunyuan video LoRA, który można pobrać z Civit. Zobacz https://www.youtube.com/watch?v=1D7B9g9rY68, aby zobaczyć więcej przykładów Arnie, od entuzjasty AI Boba Doyle.

Hunyuan LoRAs mogą być szkolone na statycznych obrazach lub wideo, choć szkolenie na wideo wymaga większych zasobów sprzętowych i zwiększonego czasu szkolenia.

Model wideo Hunyuan posiada 13 miliardów parametrów, przewyższając 12 miliardów parametrów Sory i znacznie przewyższając mniej zdolny Hunyuan-DiT model, który został wydany na otwarte źródło latem 2024 roku i ma tylko 1,5 miliarda parametrów.

Podobnie jak dwa i pół roku temu ze Stable Diffusion i LoRA (zobacz przykłady Stable Diffusion 1.5 ‘native’ celebrities tutaj), model podstawowy ma znacznie ograniczoną wiedzę o osobowościach celebrytów w porównaniu z poziomem wierności, jaki można uzyskać za pomocą ‘ID-injected’ LoRA implementacji.

Skutecznie, dostosowana, ukierunkowana na osobowość LoRA otrzymuje ‘bezpłatną jazdę’ na znacznych zdolnościach syntetyzowania modelu Hunyuan, oferując znacznie bardziej skuteczną syntezę ludzką niż można uzyskać albo przez autoencoder deepfakes z 2017 roku, albo przez dodanie ruchu do statycznych obrazów za pomocą systemów takich jak LivePortrait.

Wszystkie LoRAs przedstawione tutaj mogą być pobrane bezpłatnie ze społeczności Civit, podczas gdy znacznie większa liczba starszych, dostosowanych ‘statycznych obrazów’ LoRAs może również potencjalnie tworzyć ‘nasiona’ obrazów dla procesu tworzenia wideo (tj. obraz-wideo, planowana wersja Hunyuan Video, choć są możliwe obejścia, na razie).

Kliknij, aby odtworzyć. Powyżej, próbki z ‘statycznego’ Flux LoRA; poniżej, przykłady z Hunyuan video LoRA z muzykiem Taylor Swift. Obie te LoRAs są dostępne bezpłatnie w społeczności Civit.

Gdy piszę, strona Civit oferuje 128 wyników wyszukiwania dla ‘Hunyuan’*. Niemal wszystkie z nich są w jakiś sposób modelami NSFW; 22 przedstawiają celebrytów; 18 są zaprojektowane do ułatwienia generowania hardcore pornografii; i tylko siedem z nich przedstawia mężczyzn, a nie kobiety.

Co Nowego?

Ze względu na ewoluującą naturę terminu deepfake i ograniczone publiczne zrozumienie (bardzo poważnych) ograniczeń frameworków syntezowania wideo AI do tej pory, znaczenie Hunyuan LoRA nie jest łatwe do zrozumienia dla osoby, która przypadkowo śledzi generatywną społeczność AI. Przeanalizujmy niektóre z kluczowych różnic między Hunyuan LoRAs a poprzednimi podejściami do generowania wideo AI opartego na tożsamości.

1: Nieograniczona Instalacja Lokalna

Najważniejszym aspektem Hunyuan Video jest fakt, że może być pobrany lokalnie i umieszcza bardzo potężny i niecenzurowany system generowania wideo AI w rękach użytkownika, a także społeczności VFX (w zakresie, w jakim zezwalają na to licencje, w różnych regionach geograficznych).

Ostatni raz zdarzyło się to latem 2022 roku, kiedy model Stable Diffusion został wydany na otwarte źródło. W tym czasie OpenAI’s DALL-E2 złapał publiczną wyobraźnię, choć DALLE-2 był usługą płatną z poważnymi ograniczeniami (które rosły z czasem).

Gdy Stable Diffusion stał się dostępny, a następnie Low-Rank Adaptation umożliwił generowanie obrazów tożsamości dowolnej osoby (celebryty lub nie), ogromne zainteresowanie społeczności deweloperskiej i konsumentów pomogło Stable Diffusion wyprzedzić popularność DALLE-2; choć ten ostatni był bardziej zdolnym systemem, jego rutyny cenzorskie były postrzegane jako uciążliwe przez wielu jego użytkowników, a dostosowanie nie było możliwe.

Można twierdzić, że ten sam scenariusz ma teraz zastosowanie między Sora a Hunyuan – lub, bardziej dokładnie, między Sora-grade generatywnymi systemami wideo a otwartymi rywalami, z których Hunyuan jest pierwszym – ale prawdopodobnie nie ostatnim (tu należy rozważyć, że Flux w końcu zyskał znaczną przewagę nad Stable Diffusion).

Użytkownicy, którzy chcą tworzyć Hunyuan LoRA output, ale którzy nie mają odpowiednio wydajnego sprzętu, mogą, jak zawsze, przenieść aspekt GPU szkolenia do usług obliczeniowych online takich jak RunPod. Nie jest to takie samo, jak tworzenie wideo AI na platformach takich jak Kaiber lub Kling, ponieważ nie ma tutaj semanticznego ani opartego na obrazie filtrowania (cenzurowania).

2: Brak Potrzeby ‘Host’ Wideo i Wysiłku

Gdy deepfakes pojawiły się na scenie pod koniec 2017 roku, anonimowo opublikowany kod rozwinął się w głównych forkach DeepFaceLab i FaceSwap (oraz DeepFaceLive systemie deepfakingu w czasie rzeczywistym).

Metoda ta wymagała mozolnego kuracji tysięcy obrazów twarzy każdej tożsamości, które miały być zamienione; im mniej wysiłku włożonego w tym etapie, tym mniej skuteczny był model. Dodatkowo, czasy szkolenia variovali od 2 do 14 dni, w zależności od dostępnego sprzętu, co stresowało nawet zdolne systemy w długim okresie.

Gdy model był w końcu gotowy, mógł tylko nakładać twarze na istniejące wideo i zwykle potrzebował ‘celu’ (tj. prawdziwej) tożsamości, która była podobna do nakładanej tożsamości.

Bardziej niedawno, ROOP, LivePortrait i liczne podobne frameworki zapewniły podobną funkcjonalność z znacznie mniejszym wysiłkiem i często z lepszymi wynikami – ale bez możliwości generowania dokładnych pełnych deepfakes – lub jakiegokolwiek innego elementu poza twarzami.

Przykłady ROOP Unleashed i LivePortrait (wstawka w lewym dolnym rogu), z Boba Doyle'a strumienia na YouTube. Źródła: https://www.youtube.com/watch?v=i39xeYPBAAM i https://www.youtube.com/watch?v=QGatEItg2Ns

Przykłady ROOP Unleashed i LivePortrait (wstawka w lewym dolnym rogu), z Boba Doyle’a strumienia na YouTube. Źródła: https://www.youtube.com/watch?v=i39xeYPBAAM i https://www.youtube.com/watch?v=QGatEItg2Ns

Przeciwnie, Hunyuan LoRAs (i podobne systemy, które nieuchronnie będą następować) pozwalają na nieograniczoną twórczość całych światów, w tym pełnych symulacji ciał ludzkich.

3: Znakomicie Poprawiona Spójność Czasowa

Spójność czasowa była Świętym Graalem wideo dyfuzyjnego przez kilka lat. Użycie LoRA, wraz z odpowiednimi podpowiedziami, daje Hunyuan generowaniu wideo stałą odniesienie tożsamości, do którego może się odnosić. Teoretycznie (to są wczesne dni), można by przeszkolić wiele LoRAs określonej tożsamości, każdej noszącej określony strój.

W takich okolicznościach strój jest mniej prawdopodobny, aby ‘mutować’ w trakcie generowania wideo (ponieważ system generujący opiera się na bardzo ograniczonym oknie poprzednich klatek).

(Alternatywnie, jak w przypadku systemów opartych na obrazach LoRA, można po prostu zastosować wiele LoRAs, takich jak tożsamość + LoRAs kostiumu, do jednej generacji wideo)

4: Dostęp do ‘Eksperymentu Ludzkiego’

Jak niedawno zauważyłem, sektor generatywnej AI na poziomie FAANG wydaje się teraz tak niepewny potencjalnej krytyki dotyczącej zdolności syntezowania ludzi w swoich projektach, że rzeczywiste osoby rzadko pojawiają się na stronach projektów w głównych ogłoszeniach i wydaniach. Zamiast tego, literatura związana z tymi ogłoszeniami coraz częściej pokazuje ‘słodkie’ i ‘niewinne’ tematy w syntetyzowanych wynikach.

Z pojawieniem się Hunyuan LoRAs, po raz pierwszy społeczność ma okazję przekroczyć granice syntezowania wideo ludzi opartego na LDM w bardzo zdolnym (a nie marginalnym) systemie i w pełni zbadania przedmiotu, który najbardziej interesuje większość z nas – ludzi.

Implikacje

Ponieważ wyszukiwanie ‘Hunyuan’ w społeczności Civit pokazuje głównie LoRAs celebrytów i ‘hardcore’ LoRAs, centralną implikacją pojawienia się Hunyuan LoRAs jest to, że będą one używane do tworzenia AI pornograficznych (lub innych zniesławiających) wideo rzeczywistych ludzi – celebrytów i nieznanych osób.

Dla celów zgodności, hobbystów, którzy tworzą Hunyuan LoRAs i którzy eksperymentują z nimi na różnych serwerach Discord, są ostrożni, aby zabronić przykładów rzeczywistych osób z ich postów. Rzeczywistość jest taka, że nawet obrazowe deepfakes są teraz znacznie uzbrojone; i perspektywa dodania realistycznych wideo do tego mixu może w końcu uzasadnić nasilone obawy, które były powtarzane w mediach przez ostatnie siedem lat i które spowodowały nowe przepisy.

Napędzająca Siła

Jak zawsze, pornografia pozostaje napędzającą siłą technologii. Niezależnie od naszej opinii na temat takiego użycia, ten nieustanny silnik impetu napędza postępy w stanie sztuki, które mogą ostatecznie przynieść korzyści bardziej mainstreamowemu przyjęciu.

W tym przypadku jest możliwe, że cena będzie wyższa niż zwykle, ponieważ otwarte źródło hyperrealistycznego tworzenia wideo ma oczywiste implikacje dla kryminalnego, politycznego i etycznego nadużycia.

Jeden z grup Reddit (którego nie będę nazywał tutaj) poświęcony generowaniu NSFW wideo AI ma związaną z nim otwartą serwer Discord, gdzie użytkownicy udoskonalają ComfyUI przepływy pracy dla generowania wideo pornograficznego na podstawie Hunyuan. Codziennie, użytkownicy publikują przykłady klipów NSFW – wiele z nich można uznać za ‘ekstremalne’ lub przynajmniej napinające ograniczenia określone w zasadach forum.

Ta społeczność również utrzymuje znaczące i dobrze rozwinięte repozytorium GitHub, zawierające narzędzia, które mogą pobrać i przetworzyć wideo pornograficzne, aby zapewnić dane szkoleniowe dla nowych modeli.

Ponieważ najpopularniejszy trener LoRA, Kohya-ss, teraz obsługuje szkolenie Hunyuan LoRA, bariery wejścia do nieograniczonego szkolenia wideo są obniżane codziennie, wraz z wymaganiami sprzętowymi dla szkolenia i generowania wideo Hunyuan.

Kluczowym aspektem dedykowanych schematów szkoleniowych dla AI pornograficznej (a nie tożsamości-opartych modeli, takich jak celebryci) jest to, że standardowy model podstawowy, taki jak Hunyuan, nie jest specjalnie szkolony na danych wyjściowych NSFW i może więc albo słabo generować treści NSFW, albo nie być w stanie rozłączyć nauczone pojęcia i skojarzenia w sposób wydajny lub przekonywujący.

Poprzez rozwijanie wyrafinowanych modeli NSFW i LoRAs, będzie coraz bardziej możliwe rzutowanie przeszkolonych tożsamości na dedykowaną dziedzinę ‘pornograficznego’ wideo; przecież jest to tylko wersja wideo czegoś, co już się wydarzyło dla statycznych obrazów przez ostatnie dwa i pół roku.

VFX

Ogromny wzrost spójności czasowej, jaki oferują Hunyuan Video LoRAs, jest oczywistym bonusem dla przemysłu AI efektów wizualnych, który bardzo silnie opiera się na adaptacji oprogramowania open source.

Chociaż podejście Hunyuan Video LoRA generuje całą klatkę i środowisko, firmy VFX prawdopodobnie już zaczęły eksperymentować z izolowaniem spójnych czasowo twarzy ludzkich, które można uzyskać tym sposobem, w celu nałożenia lub zintegrowania twarzy z prawdziwego źródłowego materiału wideo.

Podobnie jak społeczność hobbystów, firmy VFX muszą czekać na funkcjonalność image-to-video i video-to-video Hunyuan Video, która jest potencjalnie najbardziej przydatnym mostem między LoRA-napędzanym, ID-opartym ‘deepfake’ treścią; albo improwizować i użyć przerwy, aby zbadać zewnętrzne możliwości frameworka i potencjalnych adaptacji, a nawet wewnętrznych forków Hunyuan Video.

Chociaż warunki licencyjne Hunyuan Video technicznie zezwalają na przedstawienie prawdziwych osób, o ile jest udzielone pozwolenie, zabraniają one ich użycia w UE, Wielkiej Brytanii i Korei Południowej. Na zasadzie ‘co się dzieje w Vegas, zostaje w Vegas’, niekoniecznie oznacza to, że Hunyuan Video nie będzie używany w tych regionach; jednakże perspektywa zewnętrznych audytów danych, w celu egzekwowania rozwijających się regulacji wokół generatywnej AI, mogłaby uczynić takie nielegalne użycie ryzykownym.

Innym potencjalnie niejasnym obszarem warunków licencyjnych jest:

‘Jeśli, w dniu wydania wersji Tencent Hunyuan, miesięczna liczba aktywnych użytkowników wszystkich produktów lub usług udostępnionych przez lub dla Licencjobiorcy przekracza 100 milionów miesięcznych aktywnych użytkowników w poprzednim miesiącu kalendarzowym, musisz poprosić o licencję u Tencent, którą Tencent może udzielić Ci według własnego uznania, i nie masz prawa do wykonywania żadnych praw na mocy tej Umowy, chyba że i dopóki Tencent nie udzieli Ci takich praw w sposób wyraźny.’

To klauzula jest wyraźnie skierowana do wielu firm, które prawdopodobnie ‘pośredniczyć’ w Hunyuan Video dla dość technologicznie nieświadomej grupy użytkowników i które będą musiały włączyć Tencent do akcji, powyżej pewnego progu użytkowników.

Czy szerokie sformułowanie może również obejmować pośrednie użycie (tj. za pośrednictwem świadczenia efektów wizualnych Hunyuan w popularnych filmach i serialach telewizyjnych) może wymagać wyjaśnienia.

Podsumowanie

Ponieważ wideo deepfake istnieje już od dawna, łatwo byłoby zlekceważyć znaczenie Hunyuan Video LoRA jako podejścia do syntezowania tożsamości i deepfakingu; i założyć, że rozwijające się wysiłki w społeczności Civit i na powiązanych Discordach i subredditach reprezentują tylko niewielki krok w kierunku w pełni kontrolowanego syntezowania wideo ludzi.

Bardziej prawdopodobne jest to, że bieżące wysiłki reprezentują tylko ułamek potencjału Hunyuan Video do tworzenia w pełni przekonywujących pełnych deepfakes ciał i środowisk; kiedy składnik image-to-video zostanie wydany (plotkowane, że nastąpi to w tym miesiącu), znacznie bardziej szczegółowy poziom generatywnej mocy stanie się dostępny zarówno dla społeczności hobbystów, jak i profesjonalistów.

Gdy Stability.ai wydał Stable Diffusion w 2022 roku, wielu obserwatorów nie mogło ustalić, dlaczego firma po prostu oddałaby tak cenną i potężną generatywną system; z Hunyuan Video, motyw zysku jest wbudowany bezpośrednio w licencję – choć może okazać się trudne dla Tencent, aby określić, kiedy firma wyzwala schemat podziału zysków.

W każdym razie wynik jest taki sam, jak w 2022 roku: dedykowane społeczności deweloperskie uformowały się natychmiast i z intensywnym zapałem wokół wydania. Niektóre z dróg, które te wysiłki będą podążać w ciągu najbliższych 12 miesięcy, są pewnie skazane na to, aby wywołać nowe nagłówki.

 

* Do 136 w momencie publikacji.

Pierwotnie opublikowane we wtorek, 7 stycznia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai