Modely a platformy AI
InstantID: Zero-Shot Identity-Preserving Image Generation in Seconds
Technologie generování obrazů pomocí umělé inteligence zažila v posledních letech pozoruhodný růst, a to od chvíle, kdy se na scéně objevily velké text-to-image difuzní modely, jako jsou DALL-E, GLIDE, Stable Diffusion, Imagen a další. Přes skutečnost, že modely generování obrazů pomocí umělé inteligence mají jedinečnou architekturu a metody školení, všechny sdílejí společný cíl: přizpůsobené a personalizované generování obrazů, jehož cílem je vytvářet obrazy se stálou identitou objektu, subjektem a stylem na základě referenčních obrazů. Díky svým pozoruhodným generativním schopnostem našly moderní rámce generování obrazů pomocí umělé inteligence aplikace v oblastech, jako je animace obrazů, virtuální realita, e-commerce, portréty pomocí umělé inteligence a další. Nicméně, přes své pozoruhodné generativní schopnosti, všechny tyto rámce sdílejí společnou překážku, většina z nich není schopna generovat přizpůsobené obrazy, zatímco zachovává jemné detaily lidských objektů.
Generování přizpůsobených obrazů, zatímco zachovává jemné detaily, je zásadně důležité, zejména u úkolů lidské obličeje, které vyžadují vysoký standard věrnosti a detailů a nuancovaných sémantik ve srovnání s úkoly generování obrazů obecných objektů, které se zaměřují primárně na hrubozrnné textury a barvy. Kromě toho, personalizované rámce syntézy obrazů v posledních letech, jako LoRA, DreamBooth, Textual Inversion a další, pokročily výrazně. Nicméně, personalizované modely generování obrazů pomocí umělé inteligence nejsou dosud dokonalé pro nasazení v reálných scénářích, protože mají vysoké požadavky na úložiště, vyžadují multiple referenční obrazy a často mají dlouhou fázi jemného ladění. Na druhou stranu, ačkoli stávající metody založené na ID-embedding vyžadují pouze jednu referenční obraz, buď postrádají kompatibilitu s veřejně dostupnými předškolními modely, nebo vyžadují nadměrnou fázi jemného ladění přes mnoho parametrů, nebo selhávají při zachování vysoké věrnosti obličeje.
Aby se tyto výzvy překonaly a dále zlepšily schopnosti generování obrazů, v tomto článku budeme mluvit o InstantID, řešení založeném na difuzním modelu pro generování obrazů. InstantID je modul plug and play, který zpracovává generování obrazů a personalizaci zručně napříč různými styly s pouze jednou referenční obrazovou a také zajišťuje vysokou věrnost. Primárním cílem tohoto článku je poskytnout našim čtenářům komplexní pochopení technických principů a komponent InstantID rámce, protože budeme mít detailní pohled na architekturu modelu, proces školení a scénáře aplikací. Takže pojďme začít.
InstantID: Zero-Shot Identity-Preserving Image Generation
Vývoj text-to-image difuzních modelů přispěl výrazně k pokroku technologie generování obrazů. Primárním cílem těchto modelů je přizpůsobená a personalizovaná generace, a vytváření obrazů se stálou identitou subjektu, stylem a charakterem pomocí jedné nebo více referenčních obrazů. Schopnost těchto rámců vytvářet konzistentní obrazy vytvořila potenciální aplikace v různých odvětvích, včetně animace obrazů, generování portrétů pomocí umělé inteligence, e-commerce, virtuální a rozšířené reality a mnoho dalších.
Nicméně, přes své pozoruhodné schopnosti, tyto rámce čelí základní výzvě: často se potýkají s generováním přizpůsobených obrazů, které zachovávají jemné detaily lidských subjektů přesně. Je důležité poznamenat, že generování přizpůsobených obrazů s vnitřními detaily je složitý úkol, protože lidská obličejová identita vyžaduje vyšší stupeň věrnosti a detailů a pokročilejších sémantik ve srovnání s obecnými objekty nebo styly, které se zaměřují primárně na barvy nebo hrubozrnné textury. Stávající text-to-image modely závisí na podrobných textových popisech a potýkají se s dosažením silné sémantické relevance pro přizpůsobenou generaci obrazů. Kromě toho, některé velké předškolní text-to-image rámce přidávají prostorové řídicí prvky, aby zlepšily ovladatelnost, usnadňující jemnou strukturální kontrolu pomocí prvků, jako jsou pozice těla, hloubkové mapy, uživatelské kresby, semantické segmentační mapy a další. Nicméně, přes tyto doplňky a vylepšení, tyto rámce jsou schopny dosáhnout pouze částečné věrnosti generovaného obrazu k referenčnímu obrazu.
Aby se tyto překážky překonaly, InstantID rámec se zaměřuje na okamžitou identitu-zachovávající syntézu obrazů a snaží se překlenout mezеру mezi efektivitou a vysokou věrností zavedením jednoduchého modulu plug and play, který umožňuje rámcům zpracovávat personalizaci obrazů pomocí pouze jedné obličejové obrazové, zatímco zachovává vysokou věrnost. Kromě toho, aby se zachovala obličejová identita z referenční obrazové, InstantID rámec implementuje novou obličejovou kódovací jednotku, která zachovává jemné detaily obrazu přidáním slabých prostorových a silných sémantických podmínek, které řídí proces generování obrazů zahrnutím textových podnětů, obrazových podnětů a obličejových obrazových.
Existují tři rozlišovací rysy, které odlišují InstantID rámec od stávajících text-to-image generativních rámců.
- Kompatibilita a Pluggability: Místo školení na plné parametry UNet rámce, InstantID rámec se zaměřuje na školení lehkého adaptéru. Jako výsledek, InstantID rámec je kompatibilní a pluggable s existujícími předškolními modely.
- Ladění-Free: Metodologie InstantID rámce eliminuje požadavek na jemné ladění, protože potřebuje pouze jednu vpřed propagaci pro inference, což dělá model vysoce praktickým a ekonomickým pro jemné ladění.
- Vyšší Výkon: InstantID rámec demonstruje vysokou flexibilitu a věrnost, protože je schopen dodávat státní výkon pomocí pouze jedné referenční obrazové, srovnatelný s trénovacími metodami, které spoléhají na multiple referenční obrazy.
Celkově, příspěvky InstantID rámce lze kategorizovat do následujících bodů.
- InstantID rámec je inovativní, ID-zachovávající adaptivní metoda pro předškolní text-to-image difuzní modely s cílem překlenout mezéru mezi efektivitou a věrností.
- InstantID rámec je kompatibilní a pluggable s customizovanými fine-tuned modely pomocí stejného difuzního modelu v jeho architektuře, umožňující ID zachování v předškolních modelech bez jakýchkoli dalších nákladů.
InstantID: Metodologie a Architektura
Jak bylo zmíněno dříve, InstantID rámec je efektivní lehký adaptér, který vybavuje předškolní text-to-image difuzní modely s ID zachovávajícími schopnostmi bez námahy.
Mluvící o architektuře, InstantID rámec je postaven na základě Stable Diffusion modelu, proslulého svou schopností provádět difuzní proces s vysokou výpočetní efektivitou v nízkorozměrném latentním prostoru místo pixelového prostoru s autoencoderem. Pro vstupní obraz, encoder nejprve mapuje obraz na latentní reprezentaci s downsampling faktorem a latentními dimenzemi. Kromě toho, aby se odhlukoval normálně distribuovaný hluk s hlukem latentním, podmínkou a aktuálním časovým krokem, difuzní proces přijímá denoising UNet komponent. Podmínka je embedding textových podnětů, které jsou generovány pomocí předškolního CLIP textového encoder komponentu.
Kromě toho, InstantID rámec také využívá ControlNet komponent, který je schopen přidat prostorovou kontrolu k předškolnímu difuznímu modelu jako jeho podmínka, sahající daleko za tradiční schopnosti textových podnětů. ControlNet komponent také integruje UNet architekturu ze Stable Diffusion rámce pomocí trénovaného repliky UNet komponentu. Replika UNet komponentu má nulové konvoluční vrstvy ve středních blocích a encoder blocích. Přes jejich podobnosti, ControlNet komponent se liší od Stable Diffusion modelu; oba se liší v posledním reziduálním položce. ControlNet komponent kóduje prostorové podmínkové informace, jako pozice, hloubkové mapy, kresby a další, přidáním reziduí do UNet bloku, a poté vkládá tato rezidua do původní sítě.
InstantID rámec také čerpá inspiraci z IP-Adapteru nebo Image Prompt Adapteru, který představuje novou metodu pro dosažení image prompt schopností běžících paralelně s textovými podněty bez potřeby modifikace původních text-to-image modelů. IP-Adapter komponent také využívá jedinečnou decoupled cross-attention strategii, která používá další cross-attention vrstvy pro vložení image funkcí, zatímco ponechává ostatní parametry nezměněné.
Metodologie
Abychom vám poskytli stručný přehled, InstantID rámec se zaměřuje na generování přizpůsobených obrazů s různými styly nebo pozicemi pomocí pouze jedné referenční ID obrazové s vysokou věrností. Následující obrázek poskytuje stručný přehled InstantID rámce.

Jak je vidět, InstantID rámec má tři základní komponenty:
- ID embedding komponent, který zachycuje robustní sémantické informace o obličejových funkcích v obrazu.
- Lehký adaptér s decoupled cross-attention komponentem, který usnadňuje použití obrazu jako vizuálního podnětu.
- IdentityNet komponent, který kóduje detailní funkce z referenční obrazové pomocí dalších prostorových kontrol.
ID Embedding
Na rozdíl od stávajících metod, jako FaceStudio, PhotoMaker, IP-Adapter a další, které spoléhají na předškolní CLIP image encoder pro extrakci vizuálních podnětů, InstantID rámec se zaměřuje na vylepšenou věrnost a silnější sémantické detaily v ID zachovávajícím úkolu. Je důležité poznamenat, že vnitřní omezení CLIP komponenty spočívají primárně ve svém tréninkovém procesu na slabě zarovnaných datech, což znamená, že zakódované funkce CLIP encoderu zachycují široké a nejednoznačné sémantické informace, jako barvy, styl a kompozice. Ačkoli tyto funkce mohou sloužit jako obecné doplnění textových embeddingů, nejsou vhodné pro přesné ID zachovávající úkoly, které kladou silný důraz na silné sémantiky a vysokou věrnost.
Image Adapter
Schopnost předškolních text-to-image difuzních modelů v image prompting úkolech zlepšuje textové podněty výrazně, zejména pro scénáře, které nelze dostatečně popsat pomocí textových podnětů. InstantID rámec přijímá strategii podobnou té, která je použita v IP-Adapter modelu pro image prompting, která představuje lehký adaptivní modul spojený s decoupled cross-attention komponentem pro podporu obrazů jako vstupních podnětů.
IdentityNet
Ačkoli stávající metody jsou schopny integrovat image podněty s textovými podněty, InstantID rámec tvrdí, že tyto metody pouze zlepšují hrubozrnné funkce s úrovní integrace, která je nedostatečná pro ID zachovávající generaci obrazů. Kromě toho, přidání image a textových tokenů v cross-attention vrstvách přímo tenduje oslabit kontrolu textových tokenů, a pokus o zlepšení image tokenů může vést k poškození schopností textových tokenů na editačních úkolech.
InstantID rámec volí ControlNet, alternativní metodu embeddingu funkcí, která využívá prostorové informace jako vstup pro kontrolovatelný modul, umožňující mu zachovat konzistenci s UNet nastavením v difuzních modelech.
Školení a Inference
Během fáze školení, InstantID rámec optimalizuje parametry IdentityNet a Image Adapter, zatímco zmrazí parametry předškolního difuzního modelu. Celý InstantID pipeline je školen na image-text párech, které obsahují lidské subjekty, a využívá školicí cíl podobný tomu, který je použit v stable difuzním rámci s úkolově specifickými image podmínkami.
InstantID: Experimenty a Výsledky
InstantID rámec implementuje Stable Diffusion a školení jej na LAION-Face, velké otevřené datové sadě, která obsahuje více než 50 milionů image-text párech. Kromě toho, InstantID rámec shromažďuje více než 10 milionů lidských obrazů s automaty generovanými automaticky pomocí BLIP2 modelu, aby dále vylepšil kvalitu generování obrazů.
Image Only Generation
InstantID model používá prázdný podnět pro řízení procesu generování obrazů pomocí pouze referenční obrazové, a výsledky bez podnětů jsou demonstrovány v následujícím obrázku.

Generování pomocí “prázdného podnětu” демонструje schopnost InstantID rámce zachovat bohaté sémantické obličejové funkce, jako identita, věk a výraz robustně. Nicméně, je důležité poznamenat, že použití prázdných podnětů nemusí být schopno replikovat výsledky na jiných sémantikách, jako je pohlaví, přesně.
Závěrečné Myšlenky
V tomto článku jsme mluvili o InstantID, řešení založeném na difuzním modelu pro generování obrazů. InstantID je modul plug and play, který zpracovává generování obrazů a personalizaci zručně napříč různými styly s pouze jednou referenční obrazovou a také zajišťuje vysokou věrnost. InstantID rámec se zaměřuje na okamžitou identitu-zachovávající syntézu obrazů a snaží se překlenout mezéru mezi efektivitou a vysokou věrností zavedením jednoduchého modulu plug and play, který umožňuje rámcům zpracovávat personalizaci obrazů pomocí pouze jedné obličejové obrazové, zatímco zachovává vysokou věrnost.












