Kąt Andersona

Walka o zero-shot customization w generatywnym AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

Jeśli chcesz umieścić się w popularnym narzędziu do generowania obrazów lub filmów, ale nie jesteś wystarczająco sławny, aby model podstawowy rozpoznał Cię, musisz przeszkolić model niskiej rangi adaptacji (LoRA) przy użyciu kolekcji Twoich własnych zdjęć. Po utworzeniu tego spersonalizowanego modelu LoRA, generatywny model może uwzględnić Twoją tożsamość w przyszłych danych wyjściowych.

To jest powszechnie nazywane customizacją w sektorze badań nad syntezą obrazów i filmów. Pojawiło się to kilka miesięcy po pojawieniu się Stable Diffusion latem 2022 roku, kiedy projekt DreamBooth firmy Google Research zaproponował modele customizacji o wysokiej pojemności, w zamkniętym schemacie, który został szybko zaadaptowany przez entuzjastów i udostępniony społeczności.

Modele LoRA szybko się pojawiły i zapewniły łatwiejsze szkolenie i znacznie mniejsze rozmiary plików, przy minimalnym lub żadnym koszcie jakości, szybko dominując scenę customizacji dla Stable Diffusion i jego następców, późniejszych modeli, takich jak Flux, a teraz nowe generatywne modele wideo, takie jak Hunyuan Video i Wan 2.1.

Powtarzaj i powtarzaj

Problem polega na tym, że jak już wcześniej zauważyliśmy, każde nowe pojawienie się nowego modelu wymaga nowej generacji LoR, co stanowi znaczne tarcie dla producentów LoR, którzy mogą przeszkolić wiele modeli niestandardowych, aby tylko odkryć, że aktualizacja modelu lub popularniejszy nowy model oznacza, że muszą zacząć wszystko od nowa.

Dlatego też podejścia zero-shot do customizacji stały się silnym nurtem w literaturze. W tym scenariuszu, zamiast konieczności tworzenia zestawu danych i szkolenia własnego podmodelu, po prostu dostarczasz jedno lub więcej zdjęć obiektu, który ma być wstrzyknięty do generacji, a system interpretuje te źródła wejściowe w celu uzyskania połączonego wyjścia.

Poniżej widzimy, że oprócz face-swapping, system tego typu (tu używający PuLID) może również uwzględnić wartości ID w stylu transferu:

Przykłady przenoszenia ID twarzy przy użyciu systemu PuLID. Źródło: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Przykłady przenoszenia ID twarzy przy użyciu systemu PuLID. Źródło: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Podczas gdy zastąpienie pracochłonnego i kruchego systemu LoRA ogólnym adapterem jest świetnym (i popularnym) pomysłem, jest to również wyzwanie; ekstremalna uwaga do szczegółów i pokrycia uzyskanych w procesie szkolenia LoRA jest bardzo trudna do naśladowania w modelu typu IP-Adapter, który musi dopasować poziom szczegółów i elastyczności LoRA bez wcześniejszej przewagi analizy kompletnego zestawu obrazów tożsamości.

HyperLoRA

Mając to na uwadze, istnieje interesujący nowy artykuł z ByteDance, proponujący system, który generuje rzeczywiste kodowanie LoRA na żywo, co jest obecnie unikalne wśród rozwiązań zero-shot:

Po lewej, obrazy wejściowe. Po prawej, elastyczny zakres wyjściowy na podstawie obrazów źródłowych, efektywnie produkując deepfake'ów aktorów Anthony'ego Hopkinsa i Anne Hathaway. Źródło: https://arxiv.org/pdf/2503.16944

Po lewej, obrazy wejściowe. Po prawej, elastyczny zakres wyjściowy na podstawie obrazów źródłowych, efektywnie produkując deepfake’ów aktorów Anthony’ego Hopkinsa i Anne Hathaway. Źródło: https://arxiv.org/pdf/2503.16944

Artykuł stwierdza:

‘Techniki oparte na adapterach, takie jak IP-Adapter, zamykają parametry modelu podstawowego i wykorzystują architekturę wtyczek, aby umożliwić inferencję zero-shot, ale często wykazują brak naturalności i autentyczności, które nie mogą być zignorowane w zadaniach syntezy portretu.

‘[My] wprowadzamy parametryczną adaptacyjną metodę generacji, nazwaną HyperLoRA, która wykorzystuje adaptacyjną sieć wtyczek, aby wygenerować wagi LoRA, łącząc wyższą wydajność LoRA z możliwością zero-shot adaptera.

‘Przez naszą starannie zaprojektowaną strukturę sieci i strategię szkolenia, osiągamy zero-shot generację portretów z wysoką photorealizmem, wiernością i edytowalnością.’

Najbardziej przydatne jest to, że system, po przeszkoleniu, może być użyty z istniejącym ControlNet, umożliwiając wysoki poziom szczegółowości w generowaniu:

Timothy Chalomet pojawia się w nieoczekiwanie wesołym wydaniu filmu 'The Shining' (1980), na podstawie trzech zdjęć wejściowych w HyperLoRA.

Timothy Chalomet pojawia się w nieoczekiwanie wesołym wydaniu filmu ‘The Shining’ (1980), na podstawie trzech zdjęć wejściowych w HyperLoRA, z maską ControlNet określającą wyjście (wraz z podpowiedzią tekstową).

Co do tego, czy nowy system zostanie kiedyś udostępniony użytkownikom końcowym, ByteDance ma rozsądną passę w tym zakresie, mając na koncie wydanie bardzo potężnego LatentSync frameworku do synchronizacji ust, oraz niedawno wydanego InfiniteYou frameworku.

Negatywnie, artykuł nie daje żadnych wskazówek co do zamiaru wydania, a wymagania sprzętowe potrzebne do odtworzenia pracy są tak wygórowane, że byłoby to wyzwaniem dla społeczności entuzjastów, aby to odtworzyć (jak to zrobiono z DreamBooth).

Nowy artykuł nosi tytuł HyperLoRA: Parametryczna adaptacyjna generacja dla syntezy portretu, i pochodzi od siedmiu badaczy z ByteDance i dedykowanego departamentu Intelligent Creation.

Metoda

Nowa metoda wykorzystuje model latentnej dyfuzji Stable Diffusion (LDM) SDXL jako model podstawowy, chociaż zasady wydają się stosowalne do modeli dyfuzyjnych w ogóle (chociaż wymagania szkoleniowe – patrz poniżej – mogą utrudnić zastosowanie do modeli generatywnych wideo).

Proces szkolenia HyperLoRA jest podzielony na trzy etapy, każdy zaprojektowany, aby izolować i zachować określone informacje w nauczonych wagach. Celem tego procederu jest zapobieganie zanieczyszczeniu cech tożsamości przez nieistotne elementy, takie jak ubranie lub tło, jednocześnie osiągając szybką i stabilną konwergencję.

Schemat koncepcyjny dla HyperLoRA. Model jest podzielony na 'Hyper ID-LoRA' dla cech tożsamości i 'Hyper Base-LoRA' dla tła i ubrania. To rozdzielenie redukuje przeciekanie cech. Podczas szkolenia, podstawa SDXL i kodery są zamrożone, a tylko moduły HyperLoRA są aktualizowane. Podczas inferencji, tylko ID-LoRA jest wymagane do generowania spersonalizowanych obrazów.

Schemat koncepcyjny dla HyperLoRA. Model jest podzielony na ‘Hyper ID-LoRA’ dla cech tożsamości i ‘Hyper Base-LoRA’ dla tła i ubrania. To rozdzielenie redukuje przeciekanie cech. Podczas szkolenia, podstawa SDXL i kodery są zamrożone, a tylko moduły HyperLoRA są aktualizowane. Podczas inferencji, tylko ID-LoRA jest wymagane do generowania spersonalizowanych obrazów.

Pierwszy etap koncentruje się wyłącznie na nauce ‘Base-LoRA’ (lewy dolny w powyższym obrazie schematu), który przechwytuje szczegóły nieistotne dla tożsamości.

Aby wymusić to rozdzielenie, badacze celowo rozmyli twarz w obrazach szkoleniowych, pozwalając modelowi zwrócić uwagę na takie rzeczy, jak tło, oświetlenie i pozycja – ale nie tożsamość. Ten etap “rozgrzewki” działa jako filtr, usuwając niskopoziomowe rozpraszacze przed rozpoczęciem nauki specyficznej dla tożsamości.

W drugim etapie wprowadzony jest ‘ID-LoRA’ (górny lewy w powyższym obrazie schematu). Tutaj tożsamość twarzy jest zakodowana przy użyciu dwóch równoległych ścieżek: CLIP Vision Transformer (CLIP ViT) dla cech strukturalnych i InsightFace AntelopeV2 encoder dla bardziej abstrakcyjnych reprezentacji tożsamości.

Podejście przejściowe

Cechy CLIP pomagają modelowi zbiec szybko, ale narażają na przeuczenie, podczas gdy osadzanie Antelope jest bardziej stabilne, ale wolniejsze w szkoleniu. Dlatego system zaczyna od silniejszego polegania na CLIP, a następnie stopniowo włącza Antelope, aby uniknąć niestabilności.

W ostatnim etapie warstwy uwagi kierowanej przez CLIP są zamrożone całkowicie. Tylko moduły uwagi połączone z AntelopeV2 kontynuują szkolenie, pozwalając modelowi na udoskonalenie zachowania tożsamości bez pogorszenia wierności lub ogólności wcześniej nauczonych składników.

Ten fazowy układ jest podstawowo próbą rozłączenia. Cechy tożsamości i nie-tożsamości są najpierw rozdzielone, a następnie udoskonalane niezależnie. Jest to metodyczna odpowiedź na typowe tryby awarii personalizacji: dryf tożsamości, niska edytowalność i przeuczenie się na przypadkowe cechy.

Podczas ważenia

Po tym, jak CLIP ViT i AntelopeV2 wyodrębnią zarówno strukturalne, jak i specyficzne dla tożsamości cechy z danego portretu, uzyskane cechy są następnie przekazywane do perceiver resampler (pochodzącego z wyżej wymienionego projektu IP-Adapter) – modułu opartego na transformatorze, który mapuje cechy na zestaw współczynników.

Dwa oddzielne resamplery są używane: jeden do generowania wag Base-LoRA (które kodują tło i elementy nie-tożsamości) i inny do wag ID-LoRA (które koncentrują się na tożsamości twarzy).

Schemat struktury sieci HyperLoRA.

Schemat struktury sieci HyperLoRA.

Wynikowe współczynniki są następnie łączone liniowo z zestawem nauczonych macierzy podstawowych LoRA, wytwarzając pełne wagi LoRA bez potrzeby dokształcania modelu podstawowego.

Ten podejście pozwala systemowi generować spersonalizowane wagi całkowicie na żywo, używając tylko encoderów obrazów i lekkiego projekcji, jednocześnie wykorzystując możliwość LoRA do modyfikowania zachowania modelu podstawowego bezpośrednio.

Dane i testy

Aby przeszkolić HyperLoRA, badacze użyli podzbioru 4,4 miliona obrazów twarzy z LAION-2B (obecnie najlepiej znanego jako źródło danych dla oryginalnych modeli Stable Diffusion z 2022 roku).

InsightFace został użyty do filtrowania twarzy nieportretowych i wielu obrazów. Obrazy zostały następnie opisane systemem BLIP-2.

W kwestii rozszerzenia danych, obrazy były losowo przycięte wokół twarzy, ale zawsze koncentrowały się na regionie twarzy.

Odpowiednie rangi LoRA musiały dostosować się do dostępnej pamięci w ustawieniach szkoleniowych. Dlatego rangę LoRA dla ID-LoRA ustalono na 8, a rangę dla Base-LoRA na 4, podczas gdy użyto ośmiostopniowej akumulacji gradientu, aby symulować większy rozmiar partii niż ten, który był możliwy na sprzęcie.

Badacze przeszkolili moduły Base-LoRA, ID-LoRA (CLIP) i ID-LoRA (osadzanie tożsamości) sekwencyjnie przez 20 000, 15 000 i 55 000 iteracji, odpowiednio. Podczas szkolenia ID-LoRA, próbkowano z trzech warunków kondycjonowania z prawdopodobieństwami 0,9, 0,05 i 0,05.

System został zaimplementowany przy użyciu PyTorch i Diffusers, a cały proces szkolenia trwał około dziesięciu dni na 16 procesorach NVIDIA A100 GPU*.

Testy ComfyUI

Autorzy zbudowali przepływy pracy w ComfyUI platformie syntezy, aby porównać HyperLoRA z trzema rywalizującymi metodami: InstantID; wyżej wymieniony IP-Adapter, w postaci IP-Adapter-FaceID-Portrait frameworku; oraz wyżej wymieniony PuLID. Użyto spójnych nasion, podpowiedzi i metod próbkowania we wszystkich frameworkach.

Autorzy zauważają, że metody oparte na adapterze (a nie LoRA) zwykle wymagają niższych skal Classifier-Free Guidance (CFG), podczas gdy LoRA (w tym HyperLoRA) jest bardziej tolerancyjny w tym zakresie.

Dlatego badacze użyli wersji punktu kontrolnego LEOSAM’s Hello World we wszystkich testach. Do testów ilościowych użyto Unsplash-50 zestawu obrazów.

Metryki

Do pomiaru podobieństwa twarzy, autorzy zmierzyli podobieństwo twarzy przy użyciu odległości cosinusowych między osadzaniem obrazu CLIP (CLIP-I) i oddzielnymi osadzaniem tożsamości (ID Sim) wyodrębnionymi za pomocą CurricularFace, modelu, który nie był używany podczas szkolenia.

Każda metoda generowała cztery obrazy głowy o wysokiej rozdzielczości na tożsamość w zestawie testowym, a wyniki zostały następnie uśrednione.

Edytowalność została oceniona zarówno przez porównanie wyników CLIP-I między wyjściami z i bez modułów tożsamości (aby zobaczyć, jak bardzo ograniczenia tożsamości zmieniły obraz); jak i przez pomiar wyrównania obrazu i tekstu CLIP (CLIP-T) w dziesięciu wariacjach podpowiedzi, obejmujących stylizacje fryzur, akcesoria, ubranie i tło.

Autorzy uwzględnili Arc2Face model podstawowy w porównaniach – model podstawowy przeszkolony na ustalonych podpisach i wyciętych regionach twarzy.

Dla HyperLoRA, przetestowano dwie wersje: jedną używającą tylko modułu ID-LoRA i inną używającą zarówno ID-, jak i Base-LoRA, z tym ostatnim ważonym na 0,4. Podczas gdy Base-LoRA poprawił wierność, nieco ograniczył edytowalność.

Wyniki początkowego porównania ilościowego.

Wyniki początkowego porównania ilościowego.

Z ilościowych testów, autorzy komentują:

‘Base-LoRA pomaga poprawić wierność, ale ogranicza edytowalność. Chociaż nasz projekt rozłącza cechy obrazu na różne LoRA, trudno uniknąć wzajemnego przeciekania. Możemy więc dostosować wagę Base-LoRA, aby dostosować się do różnych scenariuszy aplikacyjnych.

‘Nasza HyperLoRA (Pełna i ID) osiąga najlepsze i drugie najlepsze podobieństwo twarzy, podczas gdy InstantID wykazuje wyższość w podobieństwie ID twarzy, ale niższe podobieństwo twarzy.

‘Obie te metryki powinny być brane pod uwagę razem, aby ocenić wierność, ponieważ podobieństwo ID twarzy jest bardziej abstrakcyjne, a wierność twarzy odzwierciedla więcej szczegółów.’

W testach jakościowych, różne kompromisy wynikające z istotnej propozycji stają się widoczne (proszę zauważyć, że nie mamy miejsca, aby odtworzyć wszystkie obrazy wyników jakościowych, i odsyłamy czytelnika do oryginalnego artykułu, aby zobaczyć więcej obrazów w lepszej rozdzielczości):

Porównanie jakościowe. Od góry do dołu, użyto następujących podpowiedzi: biała koszula i uszy wilka (patrz artykuł źródłowy, aby zobaczyć więcej przykładów).

Porównanie jakościowe. Od góry do dołu, użyto następujących podpowiedzi: ‘biała koszula’ i ‘uszy wilka’ (patrz artykuł źródłowy, aby zobaczyć więcej przykładów).

Tutaj autorzy komentują:

‘Skóra portretów wygenerowanych przez IP-Adapter i InstantID ma wyraźny, sztucznie wygenerowany teksturę, który jest nieco przezroczysty i znacznie odbiega od photorealizmu.

‘Jest to powszechna wada metod opartych na adapterach. PuLID poprawia ten problem, osłabiając ingerencję w model podstawowy, przewyższając IP-Adapter i InstantID, ale nadal cierpiąc na rozmycie i brak szczegółów.

‘W przeciwieństwie do tego, LoRA modyfikuje bezpośrednio wagi modelu podstawowego, zamiast wprowadzać dodatkowe moduły uwagi, zwykle generując obrazy o wysokiej szczegółowości i photorealizmie.’

Autorzy twierdzą, że ponieważ HyperLoRA modyfikuje wagi modelu podstawowego bezpośrednio, zamiast polegać na zewnętrznych modułach uwagi, zachowuje nieliniową pojemność tradycyjnych metod opartych na LoRA, potencjalnie oferując przewagę w wierności i umożliwiając lepsze przechwytywanie subtelnych szczegółów, takich jak kolor źrenic.

W porównaniach jakościowych, artykuł twierdzi, że układy HyperLoRA były bardziej spójne i lepiej wyrównane z podpowiedziami, podobnie jak te wytwarzane przez PuLID, podczas gdy znacznie silniejsze niż InstantID lub IP-Adapter (które czasami nie przestrzegały podpowiedzi lub wytwarzały nienaturalne kompozycje).

Kolejne przykłady generacji ControlNet z HyperLoRA.

Kolejne przykłady generacji ControlNet z HyperLoRA.

Wnioski

Ciągły strumień różnych systemów personalizacji zero-shot w ciągu ostatnich 18 miesięcy przybrał charakter desperacji. Bardzo niewiele z tych ofert zrobiło znaczący postęp w stanie sztuki; i te, które zrobiły, mają wygórowane wymagania szkoleniowe i/lub bardzo złożone lub zasobożerne wymagania inferencyjne.

Podczas gdy reżim szkoleniowy HyperLoRA jest równie zachłanny, jak wiele innych ostatnich wpisów, przynajmniej kończy się modelem, który może obsłużyć ad hoc personalizację bezpośrednio po wyjęciu z pudełka.

Z materiału uzupełniającego artykułu zauważamy, że prędkość inferencji HyperLoRA jest lepsza niż IP-Adapter, ale gorsza niż dwa pozostałe metody – i że te liczby opierają się na procesorze NVIDIA V100 GPU, który nie jest typowym sprzętem konsumenckim (chociaż nowsze ‘domowe’ procesory NVIDIA mogą dopasować lub przewyższyć ten maksymalny limit 32 GB VRAM).

Prędkości inferencji rywalizujących metod, w milisekundach.

Prędkości inferencji rywalizujących metod, w milisekundach.

Można powiedzieć, że personalizacja zero-shot pozostaje nierozwiązanym problemem z praktycznego punktu widzenia, ponieważ znaczne wymagania sprzętowe HyperLoRA są prawdopodobnie sprzeczne z jego zdolnością do produkcji prawdziwie długoterminowego pojedynczego modelu podstawowego.

 

* Reprezentując albo 640 GB, albo 1280 GB VRAM, w zależności od tego, który model został użyty (nie jest to określone)

Opublikowane po raz pierwszy w poniedziałek, 24 marca 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai