Modely a platformy AI

Konceptuální posuvníky: Přesná kontrola v difuzních modelech s adaptéry LoRA

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Díky svým schopnostem se text-to-image difuzní modely staly nesmírně populární v umělecké komunitě. Nicméně, současné modely, včetně těch nejmodernějších, často zápasí s udržením kontroly nad vizuálními koncepty a atributy v generovaných obrazech, což vede k nevyhovujícím výsledkům. Většina modelů se spoléhá pouze na textové podněty, což klade výzvy při modulaci kontinuálních atributů, jako je intenzita počasí, ostrost stínů, mimické výrazy nebo věk osoby přesně. To činí obtížným pro koncové uživatele upravit obrázky podle svých specifických potřeb. Kromě toho, přestože tyto generativní rámce produkují vysoce kvalitní a realistické obrázky, jsou náchylné k deformacím, jako jsou zkreslené tváře nebo chybějící prsty.

Aby se tyto omezení překonala, vývojáři navrhli použití interpretabilních Konceptuálních posuvníků. Tyto posuvníky slibují větší kontrolu pro koncové uživatele nad vizuálními atributy, zlepšující generování a úpravu obrazů v difuzních modelech. Konceptuální posuvníky v difuzních modelech fungují tak, že identifikují směr parametru odpovídající jednotlivému konceptu, zatímco minimalizují interferenci s ostatními atributy. Rámec vytváří tyto posuvníky pomocí vzorových obrazů nebo sady podnětů, a tak vytváří směry pro textové i vizuální koncepty.

Nakonec, použití Konceptuálních posuvníků v text-to-image difuzních modelech může vést k generování obrazů s minimální mírou interference a zvýšenou kontrolou nad konečným výstupem, zatímco také zvyšuje vnímanou realističnost bez změny obsahu obrazů, a tak generuje realistické obrázky. V tomto článku budeme diskutovat o konceptu použití Konceptuálních posuvníků v text-to-image rámcích podrobněji a analyzovat, jak jejich použití může vést k vyšší kvalitě AI generovaných obrazů.

Úvod do Konceptuálních posuvníků

Jak již bylo zmíněno, současné text-to-image difuzní rámce často zápasí s kontrolou vizuálních konceptů a atributů v generovaných obrazech, což vede k nevyhovujícím výsledkům. Kromě toho, mnoho z těchto modelů nachází obtížné modulovat kontinuální atributy, což dále přispívá k nevyhovujícím výsledkům. Konceptuální posuvníky mohou pomoci zmírnit tyto problémy, vybavující tvůrce obsahu a koncové uživatele s lepší kontrolou nad procesem generování obrazů a řešením problémů současných rámců.

Většina současných text-to-image difuzních modelů se spoléhá na přímou modifikaci textového podnětu pro kontrolu atributů obrazu. Zatímco tento přístup umožňuje generování obrazů, není optimální, protože změna podnětu může dramaticky změnit strukturu obrazu. Další přístup používaný těmito rámci zahrnuje Post-hoc techniky, které invertují difuzní proces a modifikují cross-attentions pro úpravu vizuálních konceptů. Nicméně, Post-hoc techniky mají omezení, podporující pouze omezený počet současných úprav a vyžadující individuální interferenční průchody pro každý nový koncept. Kromě toho, mohou zavést konceptuální spleť, pokud nejsou pečlivě navrženy.

Naproti tomu, Konceptuální posuvníky nabízejí efektivnější řešení pro generování obrazů. Tyto lehké, snadno použitelné adaptéry lze aplikovat na předem trénované modely, zlepšující kontrolu a přesnost nad požadovanými koncepty v jediném interferenčním průchodu s minimální interferencí. Konceptuální posuvníky také umožňují úpravu vizuálních konceptů, které nejsou pokryty textovými popisy, funkce, která je odlišuje od textově založených úprav. Zatímco image-based přizpůsobovací metody mohou efektivně přidat tokeny pro image-based koncepty, jsou obtížné na implementaci pro úpravu obrazů. Konceptuální posuvníky, na druhé straně, umožňují koncovým uživatelům poskytnout malé množství párových obrazů definujících požadovaný koncept. Posuvníky pak generalizují tento koncept a automaticky jej aplikují na ostatní obrázky, snažící se zlepšit realističnost a opravit deformace, jako jsou ty v rukou.

Konceptuální posuvníky se snaží naučit a řešit problémy společné čtyřem generativním AI a difuzním rámcům: Image Editing, Guidance-based Methods, Model Editing a Semantic Directions.

Úprava obrazu

Současné AI rámce se buď zaměřují na použití podmíněného vstupu pro vedení struktury obrazu, nebo manipulují cross-attentions zdrojového obrazu s jeho cílovým podnětem pro umožnění úpravy jediného obrazu v text-to-image difuzních rámcích. Výsledkem jsou tyto přístupy implementovatelné pouze na jednom obrazu a také vyžadují latentní základnu optimalizaci pro každý obraz v důsledku evoluce geometrické struktury přes časové kroky.

Guidance-based metody

Použití klasifikátorů-free guidance založených metod indikovalo jejich schopnost zlepšit kvalitu generovaných obrazů a zvýšit text-obrázek zarovnání. Incorporací guidance termínů během interference, metoda zlepšuje omezenou kompozici zděděnou difuzními rámcemi, a mohou být použity pro vedení přes nebezpečné koncepty v difuzních rámcích.

Úprava modelu

Použití Konceptuálních posuvníků lze také považovat za úpravu modelu, která využívá nízkorozměrového adaptéru pro výstup jediného sémantického atributu, který vytváří prostor pro kontinuální kontrolu, která se shoduje s atributem. Fine-tuning založené přizpůsobovací metody jsou poté použity pro personalizaci rámce pro přidání nových konceptů. Kromě toho, Custom Diffusion technika navrhuje způsob, jak fine-tuning cross-attentions vrstev pro začlenění nových vizuálních konceptů do předem trénovaných difuzních modelů. Naopak, Textual Diffusion technika navrhuje optimalizaci embedding vektoru pro aktivaci modelových schopností a zavedení textových konceptů do rámce.

Sémantický směr v GAN

Manipulace sémantických atributů je jedním z klíčových atributů Generativních Adversarial Networks s latentními prostorovými trajektoriemi, které jsou nalezeny v samo-supervizovaném způsobem. V difuzních rámcích, tyto latentní prostorové trajektorie existují ve středních vrstvách U-Net architektury, a hlavní směr latentních prostor v difuzních rámcích zachycuje globální sémantiku. Konceptuální posuvníky trénují nízkorozměrové podprostory odpovídající speciálním atributům přímo, a získávají přesné a lokalizované úpravy směrů pomocí textových nebo image párových optimalizací globálních směrů.

Konceptuální posuvníky: Architektura a fungování

Difuzní modely a LoRA nebo nízkorozměrové adaptéry

Difuzní modely jsou vlastně podtřídou generativních AI rámců, které fungují na principu syntézy dat reverzováním difuzního procesu. Forward difuzní proces inicializuje přidáním šumu k datům, a tak přechází z organizovaného stavu do kompletního Gaussova šumu. Hlavním cílem difuzních modelů je reverzovat difuzní proces postupným odstraněním šumu a výběrem náhodného Gaussova šumu pro generování obrazu. V reálných aplikacích, hlavním cílem Difuzních rámců je předpovědět skutečný šum, když je kompletní Gaussov šum zaveden jako vstup s dalšími vstupy, jako je podmínění a časový krok.

LoRA nebo nízkorozměrové adaptéry technika dekomponuje aktualizace váhy během fine-tuningu pro umožnění efektivní adaptace velkých předem trénovaných rámců na downstream úkoly. LoRA technika dekomponuje aktualizace váhy pro předem trénovanou modelovou vrstvu vzhledem k jak vstupním, tak výstupním rozměrům, a omezuje aktualizaci na nízkorozměrový podprostor.

Konceptuální posuvníky

Hlavním cílem Konceptuálních posuvníků je sloužit jako přístup k fine-tuningu LoRA adaptérů na difuzním rámci pro umožnění větší kontroly nad konceptem-cílenými obrázky, a to je demonstrováno v následujícím obrazu.

Když jsou podmíněny na cílové koncepty, Konceptuální posuvníky se učí nízkorozměrové parametry směrů pro zvýšení nebo snížení projevu specifických atributů. Pro model a jeho cílový koncept, hlavním cílem Konceptuálních posuvníků je získat vylepšený model, který modifikuje pravděpodobnost zvýšení a potlačení atributů pro obraz, když je podmíněn na cílovém konceptu pro zvýšení pravděpodobnosti zvýšení atributů a snížení pravděpodobnosti potlačení atributů. Použitím reparametrizace a Tweedieovy formule, rámec zavádí časově proměnný šumový proces a vyjadřuje každý skór jako denoisovací předpověď. Kromě toho, disentanglement objektivní funkce fine-tuningu modulů v Konceptuálních posuvnících, zatímco udržuje předem trénované váhy konstantní, a měřítko faktoru zavedeného během LoRA formulace je modifikováno během interference. Měřítko faktoru také usnadňuje úpravu síly editace a dělá editace silnější bez nutnosti re-trénovat rámec, jak je demonstrováno v následujícím obrazu.

Úpravné metody používané dříve rámcimi usnadňovaly silnější úpravy re-trénováním rámce s zvýšeným vedením. Nicméně, měřítko měřítkového faktoru během interference produkuje stejné úpravné výsledky bez zvýšení re-trénovacího nákladu a času.

Naučení vizuálních konceptů

Konceptuální posuvníky jsou navrženy tak, aby kontrolovaly vizuální koncepty, které textové podněty nejsou schopny definovat dobře, a tyto posuvníky využívají malé datové sady, které jsou buď párové před nebo po trénování na těchto konceptech. Kontrast mezi image páry umožňuje posuvníkům naučit se vizuální koncepty. Kromě toho, trénovací proces Konceptuálních posuvníků optimalizuje LoRA komponentu implementovanou v obou forward a reverse směrech. Jako výsledek, LoRA komponenta se shoduje se směrem, který způsobuje vizuální efekty v obou směrech.

Konceptuální posuvníky: Implementační výsledky

Aby se analyzoval zisk v výkonu, vývojáři vyhodnotili použití Konceptuálních posuvníků primárně na Stable Diffusion XL, vysokorozměrovém 1024-pixelovém rámci s dalšími experimenty provedenými na Stable Diffusion v1.4 rámci s modely trénovanými po 500 epochách.

Textové Konceptuální posuvníky

Aby se vyhodnotil výkon textových Konceptuálních posuvníků, je ověřen na sadě 30 textových konceptů, a metoda je porovnávána s dvěma základními, které využívají standardní textový podnět pro pevný počet časových kroků, a poté začíná kompozicí přidáním podnětů pro řízení obrazu. Jak je vidět v následujícím obrázku, použití Konceptuálních posuvníků vede k neustále vyšším CLIP skóre a stálému snížení LPIPS skóre ve srovnání s původním rámcem bez Konceptuálních posuvníků.

Jak je vidět v výše uvedeném obrázku, použití Konceptuálních posuvníků usnadňuje přesnou úpravu atributů požadovaných během procesu generování obrazu, zatímco udržuje celkovou strukturu obrazu.

Vizuální Konceptuální posuvníky

Text-to-image difuzní modely, které využívají pouze textové podněty, často nacházejí obtížné udržet vyšší stupeň kontroly nad vizuálními atributy, jako je například vlasová linie nebo tvar očí. Aby se zajistila lepší kontrola nad granulárními atributy, Konceptuální posuvníky využívají volitelné textové vedené image datové sady. Jak je vidět v následujícím obrázku, Konceptuální posuvníky vytvářejí jednotlivé posuvníky pro „velikost očí“ a „tvar obočí“, které zachycují požadované transformace pomocí image párových dat.

Výsledky lze dále upřesnit poskytováním specifických textů, aby se směr zaměřil na tu část obličeje, a vytváří posuvníky se stupňovitou kontrolou nad cíleným atributem.

Kompozice posuvníků

Jednou z hlavních výhod použití Konceptuálních posuvníků je jejich kompozice, která umožňuje uživatelům kombinovat více posuvníků pro zvýšení kontroly, spíše než se zaměřovat na jeden koncept najednou, což lze připsat nízkorozměrovým směrům posuvníků. Kromě toho, protože Konceptuální posuvníky jsou lehké LoRA adaptéry, jsou snadno sdílitelné a mohou být snadno překryty na difuzní modely. Uživatelé mohou také upravit více knoflíků současně pro řízení komplexních generací stažením zajímavých sad posuvníků.

Následující obrázek demonstruje kompoziční schopnosti konceptuálních posuvníků, a více posuvníků je komponováno postupně v každém řádku zleva doprava, umožňující procházení vysokorozměrových konceptů s zvýšenou kontrolou nad koncepty.

Zlepšení kvality obrazu

Ačkoli současné text-to-image difuzní rámce a velkorysé generativní modely, jako je Stable Diffusion XL model, jsou schopny generovat realistické a vysoce kvalitní obrázky, často trpí obrazovými deformacemi, jako jsou rozmazané nebo zkreslené objekty, i když parametry těchto rámců jsou vybaveny latentní schopností generovat vysoce kvalitní výstup s menším počtem generací. Použití Konceptuálních posuvníků může vést k generování obrazů s menším počtem deformací, odemknutím skutečných schopností těchto modelů identifikací nízkorozměrových parametrů směrů.

Oprava rukou

Generování obrazů s realisticky vypadajícími rukama bylo vždy výzvou pro difuzní rámce, a použití Konceptuálních posuvníků má přímou kontrolu nad tendencí zkreslit ruce. Následující obrázek demonstruje efekt použití „oprava rukou“ Konceptuálních posuvníků, které umožňují rámcům generovat obrázky s více realisticky vypadajícími rukama.

Opravné posuvníky

Použití Konceptuálních posuvníků může nejen vést k generování více realisticky vypadajících rukou, ale také ukázalo svůj potenciál při zlepšování celkové realističnosti obrazů generovaných rámcem. Konceptuální posuvníky také identifikují jediný nízkorozměrový parametr směru, který umožňuje posunout obrázky z běžných deformací, a výsledky jsou demonstrovány v následujícím obrázku.

Závěrečné myšlenky

V tomto článku, jsme diskutovali o Konceptuálních posuvnících, jednoduchém, ale škálovatelném novém paradigmatu, které umožňuje interpretabilní kontrolu nad generovaným výstupem v difuzních modelech. Použití Konceptuálních posuvníků má za cíl řešit problémy, se kterými se potýkají současné text-to-image difuzní rámce, které mají obtížné udržet požadovanou kontrolu nad vizuálními koncepty a atributy zahrnutými v generovaném obraze, což často vede k nevyhovujícím výsledkům. Kromě toho, většina text-to-image difuzních modelů nachází obtížné modulovat kontinuální atributy v obraze, což často vede k nevyhovujícím výsledkům. Použití Konceptuálních posuvníků může umožnit text-to-image difuzním rámcům zmírnit tyto problémy a vybavit tvůrce obsahu a koncové uživatele s lepší kontrolou nad procesem generování obrazů a řešením problémů současných rámců.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.