Modele i platformy AI
InstantID: Generacja obrazu z zachowaniem tożsamości w ciągu kilku sekund
Technologia generacji obrazu za pomocą sztucznej inteligencji (AI) odnotowała znaczący wzrost w ciągu ostatnich kilku lat, odkąd duże modele dyfuzyjne, takie jak DALL-E, GLIDE, Stable Diffusion, Imagen i wiele innych, pojawiły się na scenie. Pomimo tego, że modele generacji obrazu AI mają unikalną architekturę i metody szkolenia, wszystkie mają wspólny punkt odniesienia: dostosowaną i spersonalizowaną generację obrazu, której celem jest tworzenie obrazów o spójnej tożsamości postaci, przedmiotu i stylu na podstawie obrazów referencyjnych. Dzięki ich zdolnościom generatywnym, nowoczesne ramy generacji obrazu AI znalazły zastosowanie w dziedzinach takich jak animacja obrazu, rzeczywistość wirtualna, e-commerce, portrety AI i wiele innych. Jednak pomimo ich zdolności generatywnych, te ramy wszystkie mają wspólną przeszkodę, większość z nich nie jest w stanie generować dostosowanych obrazów, zachowując delikatne szczegóły tożsamości obiektów ludzkich.
Generowanie dostosowanych obrazów, zachowując szczegóły, jest szczególnie ważne w zadaniach tożsamości twarzy, które wymagają wysokiego poziomu wierności i szczegółowości, a także nuansów semantyki w porównaniu z ogólnymi zadania generacji obrazu obiektów, które koncentrują się głównie na teksturach i kolorach. Ponadto, ramy syntezy obrazu spersonalizowanego w ostatnich latach, takie jak LoRA, DreamBooth, Textual Inversion i wiele innych, znacznie się rozwinęły. Jednak modele generatywne AI spersonalizowane nie są jeszcze idealne do wdrożenia w rzeczywistych scenariuszach, ponieważ mają wysokie wymagania dotyczące przechowywania, wymagają wielu obrazów referencyjnych i często mają długi proces dostrajania. Z drugiej strony, chociaż istniejące metody oparte na ID-embedding wymagają tylko jednej referencji, albo brakuje im kompatybilności z publicznie dostępnymi modelami wstępnie nauczonymi, albo wymagają nadmiernego procesu dostrajania na licznych parametrach, albo nie są w stanie utrzymać wysokiej wierności twarzy.
Aby rozwiązać te wyzwania i dalej poprawić możliwości generacji obrazu, w tym artykule będziemy rozmawiać o InstantID, rozwiązaniu opartym na modelu dyfuzyjnym do generacji obrazu. InstantID jest modułem plug and play, który radzi sobie z generacją i personalizacją obrazu w różnych stylach z tylko jednym obrazem referencyjnym i zapewnia wysoką wierność. Głównym celem tego artykułu jest zapewnienie czytelnikom dogłębnego zrozumienia technicznych podstaw i składników ramy InstantID, gdyż będziemy mieli szczegółowy przegląd architektury modelu, procesu szkolenia i scenariuszy zastosowania. Zatem zacznijmy.
InstantID: Generacja obrazu z zachowaniem tożsamości w ciągu kilku sekund
Pojawienie się modeli dyfuzyjnych tekstu na obraz przyczyniło się znacznie do rozwoju technologii generacji obrazu. Głównym celem tych modeli jest generacja dostosowana i spersonalizowana, a także tworzenie obrazów o spójnej tożsamości postaci, stylu i przedmiotu przy użyciu jednego lub więcej obrazów referencyjnych. Możliwość tych ram generowania spójnych obrazów stworzyła potencjalne zastosowania w różnych branżach, w tym animacji obrazu, generacji portretów AI, e-commerce, rzeczywistości wirtualnej i augmentowanej, i wiele innych.
Jednak pomimo ich zdolności, te ramy generacji obrazu stają przed podstawowym wyzwaniem: często mają trudności z generowaniem dostosowanych obrazów, które zachowują delikatne szczegóły obiektów ludzkich. Warto zauważyć, że generowanie dostosowanych obrazów z szczegółami jest zadaniem wyzwaniem, szczególnie w zadaniach tożsamości twarzy, które wymagają wysokiego poziomu wierności i szczegółowości, a także nuansów semantyki w porównaniu z ogólnymi zadania generacji obrazu obiektów, które koncentrują się głównie na teksturach i kolorach. Istniejące modele tekstu na obraz opierają się na szczegółowych opisach tekstowych i mają trudności w osiąganiu silnej relewancji semantycznej dla generacji obrazu dostosowanego. Ponadto, niektóre duże ramy tekstu na obraz dodają kontrolę warunkową przestrzenną, aby poprawić sterowalność, ułatwiając kontrolę strukturalną przy użyciu elementów takich jak pozy body, mapy głębi, rysunki użytkownika, mapy segmentacji semantycznej i wiele innych. Jednak pomimo tych dodatków i usprawnień, te ramy są w stanie osiągnąć tylko częściową wierność wygenerowanego obrazu do obrazu referencyjnego.
Aby pokonać te wyzwania, rama InstantID koncentruje się na generacji obrazu z zachowaniem tożsamości, a także próbuje zredukować lukę między wydajnością a wysoką wiernością, wprowadzając prosty moduł plug and play, który pozwala ramie na obsługę personalizacji obrazu przy użyciu tylko jednego obrazu twarzy, zachowując wysoką wierność. Ponadto, aby zachować tożsamość twarzy z obrazu referencyjnego, rama InstantID wdraża nowy enkoder twarzy, który zachowuje szczegóły obrazu, dodając słabe warunki przestrzenne i silne warunki semantyczne, które kierują procesem generacji obrazu, łącząc podpowiedzi tekstowe, obraz odniesienia i obraz twarzy.
Istnieją trzy wyróżniające się cechy, które odróżniają ramę InstantID od istniejących ram generacji obrazu tekstu.
- Kompatybilność i wtyczka: Zamiast szkolenia na pełnych parametrach ramy UNet, rama InstantID koncentruje się na szkoleniu lekkiego adaptera. W rezultacie, rama InstantID jest kompatybilna i wtyczkowa z istniejącymi modelami wstępnie nauczonymi.
- Bez dostrajania: Metodologia ramy InstantID eliminuje wymóg dostrajania, ponieważ potrzebuje tylko jednej propagacji do przodu do wnioskowania, co sprawia, że model jest bardzo praktyczny i ekonomiczny do dostrajania.
- Wyższa wydajność: Rama InstantID demonstruje wysoką elastyczność i wierność, ponieważ jest w stanie dostarczyć wyniki na poziomie stanu techniki, używając tylko jednego obrazu referencyjnego, porównywalnego do metod opartych na szkoleniu, które polegają na wielu obrazach referencyjnych.
Ogólnie, wkład ramy InstantID można podzielić na następujące punkty.
- Rama InstantID jest innowacyjną, zachowującą tożsamość metodą adaptacji dla wstępnie nauczonych modeli dyfuzyjnych tekstu na obraz, mającą na celu zredukowanie luki między wydajnością a wiernością.
- Rama InstantID jest kompatybilna i wtyczkowa z niestandardowymi modelami dostrajanymi, używając tego samego modelu dyfuzyjnego w swojej architekturze, co pozwala na zachowanie tożsamości w modelach wstępnie nauczonych bez dodatkowych kosztów.
InstantID: Metodologia i Architektura
Jak wcześniej wspomniano, rama InstantID jest wydajnym, lekkim adapterem, który nadaje wstępnie nauczonym modelom dyfuzyjnym tekstu na obraz możliwości zachowania tożsamości bez wysiłku.
Mówiąc o architekturze, rama InstantID jest zbudowana na podstawie modelu Stable Diffusion, znanego ze swojej zdolności do wykonywania procesu dyfuzyjnego z wysoką wydajnością obliczeniową w niskowymiarowej przestrzeni latentnej zamiast w przestrzeni pikseli z auto-encoderem. Dla wejściowego obrazu, enkoder najpierw mapuje obraz na reprezentację latentną z czynnikiem próbkowania i wymiarami latentnymi. Ponadto, aby usunąć szum normalnie rozłożony z hałasem latentnym, warunkiem i bieżącym czasem, proces dyfuzyjny przyjmuje składnik denoising UNet. Warunek jest wektorzem wejściowym podpowiedzi tekstowych, które są generowane przy użyciu wstępnie nauczonych składników CLIP.
Ponadto, rama InstantID wykorzystuje również składnik ControlNet, który jest w stanie dodać kontrolę przestrzenną do wstępnie nauczonych modeli dyfuzyjnych jako warunek, rozszerzając się poza tradycyjne możliwości podpowiedzi tekstowych. Składnik ControlNet integruje architekturę UNet z ramy Stable Diffusion, używając wstępnie nauczonych replik składników UNet. Replika składników UNet ma zero warstw konwolucyjnych w bloku środkowym i bloku enkodera. Pomimo ich podobieństwa, składnik ControlNet różni się od modelu Stable Diffusion; różnią się one w pozostałych elementach. Składnik ControlNet koduje informacje warunkowe przestrzenne, takie jak pozy, mapy głębi, szkice i wiele innych, dodając pozostałości do bloku UNet, a następnie osadzając te pozostałości w oryginalnej sieci.
Rama InstantID czerpie również inspirację z IP-Adaptera lub Image Prompt Adaptera, który wprowadza nowy sposób osiągnięcia możliwości podpowiedzi obrazu, działającej równolegle z podpowiedziami tekstowymi bez konieczności modyfikacji oryginalnych modeli tekstu na obraz. Składnik IP-Adapter wykorzystuje unikalną strategię uwagi krzyżowej, która wykorzystuje dodatkowe warstwy uwagi, aby osadzić cechy obrazu, pozostawiając inne parametry niezmienione.
Metodologia
Aby dać krótkie podsumowanie, rama InstantID ma na celu generowanie dostosowanych obrazów z różnymi stylami lub pozami, używając tylko jednego obrazu referencyjnego z wysoką wiernością. Poniższy rysunek daje krótkie podsumowanie ramy InstantID.

Jak można zauważyć, rama InstantID ma trzy podstawowe składniki:
- Składnik ID-embedding, który przechwytuje silne informacje semantyczne cech twarzy w obrazie.
- Lekki adapter z składnikiem uwagi krzyżowej, który ułatwia użycie obrazu jako podpowiedzi wizualnej.
- Składnik IdentityNet, który koduje szczegółowe cechy z obrazu referencyjnego, używając dodatkowej kontroli przestrzennej.
ID-embedding
W przeciwieństwie do istniejących metod, takich jak FaceStudio, PhotoMaker, IP-Adapter i wiele innych, które polegają na wstępnie nauczonym enkoderze CLIP, aby wyodrębnić podpowiedzi wizualne, rama InstantID koncentruje się na poprawionej wierności i silniejszych szczegółach semantycznych w zadaniu zachowania tożsamości. Warto zauważyć, że wewnętrzne ograniczenia składnika CLIP leżą głównie w procesie szkolenia na słabo wyrównanych danych, co oznacza, że zakodowane cechy enkodera CLIP przechwytują głównie ogólne i niejasne informacje semantyczne, takie jak kolory, styl i kompozycja. Chociaż te cechy mogą działać jako ogólne uzupełnienie wektorów tekstowych, nie są one odpowiednie do precyzyjnych zadań zachowania tożsamości, które kładą duży nacisk na silną semantykę i wysoką wierność. Ponadto, niedawne badania nad modelami reprezentacji twarzy, szczególnie wokół rozpoznawania twarzy, wykazały skuteczność reprezentacji twarzy w złożonych zadaniach, w tym w rekonstrukcji i rozpoznawaniu twarzy. Biorąc to pod uwagę, rama InstantID próbuje wykorzystać wstępnie nauczony model twarzy, aby wykryć i wyodrębnić wektory ID-embedding z obrazu referencyjnego, kierując procesem generacji obrazu.
Image Adapter
Możliwości wstępnie nauczonych modeli tekstu na obraz w zadaniach podpowiedzi obrazu znacznie poprawiają podpowiedzi tekstowe, szczególnie w scenariuszach, które nie mogą być opisane wystarczająco przez podpowiedzi tekstowe. Rama InstantID przyjmuje strategię podobną do tej użytej w modelu IP-Adapter, która wprowadza lekki adapter z składnikiem uwagi krzyżowej, aby obsłużyć obrazy jako dane wejściowe. Jednak w przeciwieństwie do nieostro wyrównanych wektorów CLIP, rama InstantID odbiega, wykorzystując wektory ID-embedding jako podpowiedzi obrazu, aby osiągnąć bogatsze i bardziej nuansowane integrowanie podpowiedzi.
IdentityNet
Chociaż istniejące metody są w stanie zintegrować podpowiedzi obrazu z podpowiedziami tekstowymi, rama InstantID twierdzi, że te metody tylko poprawiają cechy ogólne, a poziom integracji jest niewystarczający do generacji obrazu z zachowaniem tożsamości. Ponadto, dodawanie tokenów obrazu i tekstu w warstwach uwagi krzyżowej bezpośrednio osłabia kontrolę tokenów tekstowych, a próba wzmocnienia tokenów obrazu może osłabić zdolności tokenów tekstowych w zadaniach edycyjnych. Aby przeciwdziałać tym wyzwaniom, rama InstantID wybiera ControlNet, alternatywną metodę osadzania cech, która wykorzystuje informacje przestrzenne jako dane wejściowe do modułu sterowanego, co pozwala na utrzymanie spójności z ustawieniami UNet w modelach dyfuzyjnych.
Rama InstantID wprowadza dwie zmiany w tradycyjnej architekturze ControlNet: dla danych wejściowych warunkowych, rama InstantID wybiera 5 punktów kluczowych twarzy zamiast drobnych punktów kluczowych OpenPose; po drugie, rama InstantID wykorzystuje wektory ID-embedding zamiast podpowiedzi tekstowych jako warunki dla warstw uwagi krzyżowej w architekturze ControlNet.
Szkolenie i wnioskowanie
Podczas fazy szkolenia, rama InstantID optymalizuje parametry składników IdentityNet i Image Adapter, zamykając parametry wstępnie nauczonych modeli dyfuzyjnych. Cała rama InstantID jest szkolona na parach obrazu i tekstu, które zawierają obiekty ludzkie, i wykorzystuje cel szkolenia podobny do tego użytego w ramie Stable Diffusion z warunkami obrazu specyficznych dla zadania. Wyróżniającą się cechą metody szkolenia InstantID jest separacja między warstwami uwagi krzyżowej obrazu i tekstu w adapterze podpowiedzi obrazu, co pozwala ramie InstantID na elastyczne i niezależne dostosowanie wag tych warunków obrazu, zapewniając bardziej ukierunkowany i kontrolowany proces szkolenia i wnioskowania.
InstantID: Eksperymenty i wyniki
Rama InstantID wdraża model Stable Diffusion i szkoli go na LAION-Face, dużej, otwartej bazie danych, składającej się z ponad 50 milionów par obrazu i tekstu. Ponadto, rama InstantID zbiera ponad 10 milionów obrazów ludzi, generowanych automatycznie przez model BLIP2, aby dalej poprawić jakość generacji obrazu. Rama InstantID koncentruje się głównie na obrazach jednej osoby i wykorzystuje wstępnie nauczony model twarzy, aby wykryć i wyodrębnić wektory ID-embedding z obrazów ludzi, a zamiast szkolenia na obciętych zbiorach danych twarzy, szkoli oryginalne obrazy ludzi. Ponadto, podczas szkolenia, rama InstantID zamyka wstępnie nauczony model tekstu na obraz i aktualizuje tylko parametry składników IdentityNet i Image Adapter.
Generacja obrazu tylko
Model InstantID wykorzystuje pusty podpowiedź, aby kierować procesem generacji obrazu, używając tylko obrazu referencyjnego, a wyniki bez podpowiedzi są pokazane na poniższym rysunku.

Generacja z «pustym podpowiedzią» pokazana na powyższym rysunku demonstruje zdolność ramy InstantID do utrzymania bogatych cech semantycznych, takich jak tożsamość, wiek i wyraz twarzy, w sposób elastyczny. Jednak warto zauważyć, że użycie pustych podpowiedzi może nie być w stanie odtworzyć wyników na innych semantykach, takich jak płeć. Ponadto, w powyższym rysunku, kolumny 2-4 wykorzystują obraz i podpowiedź, a jak można zauważyć, wygenerowany obraz nie wykazuje żadnego pogorszenia zdolności kontroli tekstu, a także zapewnia spójność tożsamości. Wreszcie, kolumny 5-9 wykorzystują obraz, podpowiedź i kontrolę przestrzenną, demonstrując kompatybilność modelu z wstępnie nauczonymi modelami kontroli przestrzennej, pozwalając ramie InstantID na elastyczne wprowadzanie kontroli przestrzennych przy użyciu wstępnie nauczonych składników ControlNet.

Warto również zauważyć, że liczba obrazów referencyjnych ma znaczący wpływ na wygenerowany obraz, jak pokazano na powyższym rysunku. Chociaż rama InstantID jest w stanie dostarczyć dobre wyniki, używając tylko jednego obrazu referencyjnego, wiele obrazów referencyjnych produkuje obraz o lepszej jakości, ponieważ rama InstantID bierze średnią ważoną wektorów ID-embedding jako podpowiedź obrazu. Przechodząc dalej, jest istotne porównać ramę InstantID z poprzednimi metodami, które generują obrazy spersonalizowane, używając tylko jednego obrazu referencyjnego. Poniższy rysunek porównuje wyniki generowane przez ramę InstantID i istniejące modele stanu techniki dla generacji obrazu spersonalizowanego z jednym obrazem referencyjnym.

Jak można zauważyć, rama InstantID jest w stanie zachować cechy twarzy, dzięki temu, że wektory ID-embedding zawierają bogate informacje semantyczne, takie jak tożsamość, wiek i płeć. Można bezpiecznie powiedzieć, że rama InstantID przewyższa istniejące ramy w generacji obrazu spersonalizowanego, ponieważ jest w stanie zachować tożsamość ludzką, utrzymując kontrolę i elastyczność stylistyczną.

Końcowe myśli
W tym artykule omówiliśmy ramę InstantID, rozwiązanie oparte na modelu dyfuzyjnym do generacji obrazu. Rama InstantID jest modułem plug and play, który radzi sobie z generacją i personalizacją obrazu w różnych stylach z tylko jednym obrazem referencyjnym i zapewnia wysoką wierność. Rama InstantID koncentruje się na generacji obrazu z zachowaniem tożsamości, a także próbuje zredukować lukę między wydajnością a wysoką wiernością, wprowadzając prosty moduł plug and play, który pozwala ramie na obsługę personalizacji obrazu przy użyciu tylko jednego obrazu twarzy, zachowując wysoką wierność.












