Modely a platformy AI

InstantStyle: Zachování stylu v generaci textu na obrázek

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V posledních letech prokázaly modely založené na tunech a difuzi pozoruhodný pokrok v široké škále úkolů personalizace a přizpůsobení obrazů. Nicméně, navzdory jejich potenciálu, současné modely založené na tunech a difuzi stále čelí řadě složitých výzev při generování a produkci obrazů konzistentního stylu, a to z několika důvodů. První důvod spočívá v tom, že koncept stylu zůstává široce nedefinován a neurčen, a zahrnuje kombinaci prvků, včetně atmosféry, struktury, designu, materiálu, barvy a mnoha dalších. Druhý důvod spočívá v tom, že metody založené na inverzi jsou náchylné ke stylu degradaci, což vede k časté ztrátě jemných detailů. Třetím důvodem je, že přístupy založené na adaptorech vyžadují časté úpravy parametrů pro každou referenční obraz, aby se udržela rovnováha mezi kontrolou textu a intenzitou stylu.

Dalším cílem většiny přístupů k přenosu stylu nebo generaci stylizovaných obrazů je použít referenční obraz a aplikovat jeho konkrétní styl z dané podmnožiny nebo referenčního obrazu na cílový obsahový obraz. Nicméně, široká škála atributů stylu činí tuto úlohu obtížnou pro výzkumníky, kteří potřebují shromáždit stylizované datové sady, reprezentovat styl správně a hodnotit úspěch přenosu. Předchozí modely a rámce, které se zabývají jemným laděním založeným na difuzi, jemně ladí datové sady obrazů, které sdílejí společný styl, což je proces, který je časově náročný a omezený v reálných úkolech, protože je obtížné shromáždit podmnožinu obrazů, které sdílejí stejný nebo téměř identický styl.

V tomto článku budeme hovořit o InstantStyle, rámci navrženého s cílem řešit problémy, kterým čelí současné modely založené na tunech a difuzi pro generování a přizpůsobení obrazů. Budeme hovořit o dvou hlavních strategiích implementovaných rámcem InstantStyle:

  1. Jednoduchý, ale efektivní přístup k oddělení stylu a obsahu z referenčních obrazů v prostoru funkcí, předpovězený na základě předpokladu, že funkce v rámci stejného prostoru funkcí lze buď přidat nebo odečíst od sebe navzájem.
  2. Prevence úniku stylu injekcí funkcí referenčního obrazu výhradně do bloků specifických pro styl a úmyslné vyhnutí se potřebě používat zbytečné parametry pro jemné ladění, které často charakterizují více parametrů.

Tento článek si klade za cíl pokrýt rámec InstantStyle v hloubce a prozkoumáme mechanismus, metodologii, architekturu rámce a jeho srovnání se stávajícími rámci. Budeme také hovořit o tom, jak rámec InstantStyle prokazuje pozoruhodné vizuální výsledky stylizace a dosahuje optimální rovnováhy mezi kontrolou textu a intenzitou stylu. Takže pojďme začít.

InstantStyle: Zachování stylu v generaci textu na obrázek

Rámce založené na difuzi pro generování obrazů z textu získaly pozoruhodný úspěch v široké škále úkolů personalizace a přizpůsobení, zejména v úkolech generování konzistentních obrazů, včetně přizpůsobení objektů, zachování obrazů a přenosu stylu. Nicméně, navzdory nedávnému úspěchu a zvýšení výkonu, přenos stylu zůstává výzvou pro výzkumníky kvůli nedefinované a neurčené povaze stylu, která často zahrnuje řadu prvků, včetně atmosféry, struktury, designu, materiálu, barvy a mnoha dalších. S tím řečeno, primárním cílem generování stylizovaných obrazů nebo přenosu stylu je aplikovat konkrétní styl z dané referenční obraz nebo referenční podmnožiny obrazů na cílový obsahový obraz. Nicméně, široká škála atributů stylu činí tuto úlohu obtížnou pro výzkumníky, kteří potřebují shromáždit stylizované datové sady, reprezentovat styl správně a hodnotit úspěch přenosu. Předchozí modely a rámce, které se zabývají jemným laděním založeným na difuzi, jemně ladí datové sady obrazů, které sdílejí společný styl, což je proces, který je časově náročný a omezený v reálných úkolech, protože je obtížné shromáždit podmnožinu obrazů, které sdílejí stejný nebo téměř identický styl.

S výzvami, kterým čelí současné přístupy, výzkumníci se zajímají o vývoj jemných přístupů pro přenos stylu nebo generování stylizovaných obrazů, a tyto rámce lze rozdělit do dvou různých skupin:

  • Přístupy bez adaptéru: Přístupy a rámce bez adaptéru využívají sílu sebe-pozornosti v procesu difuze, a implementací sdílené operace pozornosti, tyto modely jsou schopny extrahovat základní funkce, včetně klíčů a hodnot z daného referenčního stylu obrazu přímo.
  • Přístupy založené na adaptéru: Přístupy a rámce založené na adaptéru inkorporují lehký model navržen pro extrakci podrobných obrazových reprezentací z referenčního stylu obrazu. Rámec pak integruje tyto reprezentace do procesu difuze pomocí mechanismů křížové pozornosti. Primárním cílem integračního procesu je vést proces generování a zajistit, aby výsledný obraz byl v souladu s požadovanými stylistickými nuancemi referenčního obrazu.

Nicméně, navzdory slibům, metody bez tunech často čelí několika výzvám. První výzvou je, že přístup bez adaptéru vyžaduje výměnu klíčů a hodnot v rámci vrstev sebe-pozornosti, a předem zachytí klíčové a hodnotové matice odvozené z referenčního stylu obrazu. Když je implementován na přirozených obrazech, přístup bez adaptéru vyžaduje inverzi obrazu zpět na latentní šum pomocí technik, jako je DDIM nebo Denoising Diffusion Implicit Models inverze. Nicméně, použití DDIM nebo jiných inverzních přístupů může vést ke ztrátě jemných detailů, jako je barva a textura, a tím snižuje styl informaci v generovaných obrazech. Kromě toho, další krok, který je introdukován těmito přístupy, je časově náročný proces a může představovat významné nevýhody v praktických aplikacích. Na druhé straně, primární výzvou pro metody založené na adaptéru je nalezení správné rovnováhy mezi únikem kontextu a intenzitou stylu. Únik kontextu nastává, když zvýšení intenzity stylu vede k výskytu ne-stylových prvků z referenčního obrazu v generovaném výstupu, s primárním bodem obtížnosti spočívajícím v oddělení stylu od obsahu v referenčním obraze účinně. Pro řešení této výzvy, některé rámce konstruují párové datové sady, které reprezentují stejný objekt v různých stylech, usnadňující extrakci reprezentace obsahu a odděleného stylu. Nicméně, díky inherentně nedefinované reprezentaci stylu, úloha vytváření velkých párových datových sad je omezená vzhledem k rozmanitosti stylů, které může zachytit, a je to zdrojově náročný proces.

Pro řešení těchto omezení, rámec InstantStyle je introdukován, který je novým mechanismem bez tunech založeným na existujících metodách založených na adaptéru s možností bezproblémové integrace s jinými metodami založenými na pozornosti a dosažením efektivní decouplingu obsahu a stylu. Kromě toho, rámec InstantStyle introdukuje ne jednu, ale dvě efektivní metody pro dokončení decouplingu stylu a obsahu, dosahující lepší migrace stylu bez potřeby introdukovat další metody pro decoupling nebo vytváření párových datových sad.

Navíc, předchozí rámce založené na adaptéru byly široce používány v metodách založených na CLIP jako extraktor obrazových funkcí, některé rámce prozkoumaly možnost implementace decouplingu funkcí v prostoru funkcí, a když je srovnáno s nedefinovanými atributy stylu, je snazší popsat obsah pomocí textu. Protože obrazy a texty sdílejí prostor funkcí v metodách založených na CLIP, jednoduchá operace odečtení funkcí textu obsahu a obrazových funkcí může snížit únik obsahu významně. Kromě toho, ve většině modelů difuze, existuje konkrétní vrstva v jeho architektuře, která injektuje informaci stylu, a dosahuje decouplingu obsahu a stylu injekcí obrazových funkcí pouze do specifických bloků stylu. Implementací těchto dvou jednoduchých strategií, rámec InstantStyle je schopen řešit problémy s únikem obsahu, kterým čelí většina existujících rámců, zatímco udržuje sílu stylu.

Shrnutí, rámec InstantStyleemploys dvě jednoduché, ale efektivní mechanismy pro efektivní decoupling stylu a obsahu z referenčních obrazů. Rámec InstantStyle je model nezávislý a bez tunech, který prokazuje pozoruhodný výkon v úkolech přenosu stylu s velkým potenciálem pro downstream úkoly.

Instant-Style: Metodologie a architektura

Jak bylo prokázáno předchozími přístupy, existuje rovnováha v injekci stylu podmínek v tunech-free modelech difuze. Pokud je intenzita obrazové podmínky příliš vysoká, může vést k úniku obsahu, zatímco pokud intenzita obrazové podmínky klesne příliš nízko, styl nemusí být dostatečně zřetelný. Hlavním důvodem tohoto pozorování je, že v obraze, styl a obsah jsou propojeny, a kvůli inherentně nedefinovaným atributům stylu, je obtížné decoupling stylu a záměru. Jako výsledek, pečlivé parametry jsou často upraveny pro každou referenční obraz v pokusu o nalezení rovnováhy mezi kontrolou textu a silou stylu. Kromě toho, pro daný vstupní referenční obraz a jeho odpovídající textovou popis v inverzních metodách, inverzní přístupy, jako je DDIM, jsou adoptovány nad obrazem, aby se získala inverzní difuzní trajektorie, proces, který aproximuje inverzní rovnici pro transformaci obrazu na latentní šumovou reprezentaci. Na základě toho a začínající od inverzní difuzní trajektorie spolu s novou sadou promptů, tyto metody generují nový obsah se stylem, který se shoduje s vstupem. Nicméně, jako je ukázáno v následující obraz, přístup DDIM inverze pro reálné obrazy je často nestabilní, protože se spoléhá na lokální linearizaci, což vede k propagaci chyb a ztrátě obsahu a nesprávné rekonstrukci obrazu.

Přecházející k metodologii, místo implementace složitých strategií pro decoupling obsahu a stylu z obrazů, rámec InstantStyle bere nejjednodušší přístup pro dosažení podobného výkonu. Když je srovnáno s nedefinovanými atributy stylu, obsah může být reprezentován přirozeným textem, umožňující rámcu InstantStyle použít textový encoder z CLIP pro extrakci charakteristik textu obsahu jako kontextové reprezentace. Současně, rámec InstantStyle implementuje obrazový encoder CLIP pro extrakci funkcí referenčního obrazu. Využívající charakterizace globálních funkcí CLIP a po odečtení funkcí textu obsahu z obrazových funkcí, rámec InstantStyle je schopen decoupling stylu a obsahu explicitně. Ačkoli je to jednoduchá strategie, pomáhá rámcu InstantStyle být efektivní v minimalizaci úniku obsahu.

Kromě toho, každá vrstva v hluboké síti je odpovědná za zachycení různých sémantických informací, a klíčovým pozorováním z předchozích modelů je, že existují dvě vrstvy pozornosti, které jsou odpovědné za zpracování stylu. Konkrétně, je to blocks.0.attentions.1 a down blocks.2.attentions.1 vrstvy odpovědné za zachycení stylu, jako je barva, materiál, atmosféra, a vrstva prostorového rozložení zachycuje strukturu a kompozici. Rámec InstantStyle využívá tyto vrstvy implicitně pro extrakci stylu informací a prevenci úniku obsahu bez ztráty síly stylu. Strategie je jednoduchá, ale efektivní, protože model nalezl bloky stylu, které mohou injektovat obrazové funkce do těchto bloků pro dosažení bezproblémového přenosu stylu. Kromě toho, protože model výrazně snižuje počet parametrů adaptéru, schopnost kontroly textu rámcu je vylepšena a mechanismus je také aplikovatelný na jiné modely založené na pozornosti pro úpravy a další úkoly.

Instant-Style: Experimenty a výsledky

Rámec InstantStyle je implementován na rámcu Stable Diffusion XL a využívá běžně přijímaný předem trénovaný IR-adapter jako jeho exemplář pro validaci své metodologie, a mutuje všechny bloky kromě bloků stylu pro obrazové funkce. Model InstantStyle také trénuje IR-adapter na 4 milionech velkých datových sad text-obraz párových dat z počátku, a místo trénování všech bloků, aktualizuje pouze bloky stylu.

Pro provedení jeho generalizačních schopností a robustnosti, rámec InstantStyle provádí řadu experimentů s přenosy stylu s různými styly napříč různým obsahem, a výsledky lze pozorovat v následujících obrazech. Daný jediný referenční obraz stylu spolu s různými prompty, rámec InstantStyle dodává vysoké kvality, konzistentní styl generování obrazů.

Kromě toho, protože model injektuje obrazové informace pouze do bloků stylu, je schopen minimalizovat problém úniku obsahu významně, a proto, nemusí provádět úpravy parametrů.

Pokračujícím, rámec InstantStyle také adoptuje architekturu ControlNet pro dosažení obrazového stylizace se prostorovou kontrolou, a výsledky jsou demonstrovány v následujícím obraze.

Když je srovnán s předchozími metodami, včetně StyleAlign, B-LoRA, Swapping Self Attention a IP-Adapter, rámec InstantStyle prokazuje nejlepší vizuální efekty.

Závěrečné myšlenky

V tomto článku, jsme hovořili o InstantStyle, obecném rámcu, který využívá dvě jednoduché, ale efektivní strategie pro efektivní decoupling stylu a obsahu z referenčních obrazů. Rámec InstantStyle je navržen s cílem řešit problémy, kterým čelí současné modely založené na tunech a difuzi pro generování a přizpůsobení obrazů. Rámec InstantStyle implementuje dvě vitální strategie: Jednoduchý, ale efektivní přístup pro decoupling stylu a obsahu z referenčních obrazů v prostoru funkcí, předpovězený na základě předpokladu, že funkce v rámci stejného prostoru funkcí lze buď přidat nebo odečíst od sebe navzájem. Druhým je prevence úniku stylu injekcí referenčních obrazových funkcí výhradně do bloků specifických pro styl a úmyslné vyhnutí se potřebě používat zbytečné parametry pro jemné ladění, které často charakterizují více parametrů.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.