Modele și platforme AI

Concept Sliders: Control Precis în Modelele de Difuzie cu Adaptoare LoRA

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Mulțumită capacităților lor, modelele de difuzie text-imagine au devenit extrem de populare în comunitatea artistică. Cu toate acestea, modelele actuale, inclusiv cadrele de ultimă generație, se confruntă adesea cu dificultăți în menținerea controlului asupra conceptelor și atributele vizuale din imaginile generate, ceea ce duce la rezultate nesatisfăcătoare. Majoritatea modelelor se bazează exclusiv pe prompturi text, ceea ce ridică provocări în modularea atributelor continue, cum ar fi intensitatea vremii, claritatea umbrelor, expresiile faciale sau vârsta unei persoane, în mod precis. Acest lucru face dificilă pentru utilizatorii finali ajustarea imaginilor pentru a îndeplini nevoile lor specifice. Mai mult, deși aceste cadre generative produc imagini de înaltă calitate și realiste, ele sunt predispuse la distorsionări, cum ar fi fețe deformate sau degete lipsă.

Pentru a depăși aceste limitări, dezvoltatorii au propus utilizarea Concept Sliders interpretabile. Aceste slider-uri promit un control mai mare pentru utilizatorii finali asupra atributele vizuale, îmbunătățind generarea și editarea imaginilor în cadrul modelelor de difuzie. Concept Sliders în modelele de difuzie funcționează prin identificarea unei direcții de parametru corespunzătoare unui concept individual, minimizând interferența cu alte atribute. Cadrele creează aceste slider-uri utilizând imagini de exemplu sau un set de prompturi, stabilind astfel direcții pentru concepte atât textuale, cât și vizuale.

În cele din urmă, utilizarea Concept Sliders în modelele de difuzie text-imagine poate rezulta în generarea de imagini cu un grad minim de interferență și un control îmbunătățit asupra rezultatului final, fără a altera conținutul imaginilor, și generând astfel imagini realiste. În acest articol, vom discuta conceptul de utilizare a Concept Sliders în cadrele text-imagine în mai multe detalii și vom analiza cum utilizarea lor poate rezulta în imagini generate de calitate superioară.

Introducere în Concept Sliders

Așa cum am menționat anterior, cadrele actuale de difuzie text-imagine se confruntă adesea cu dificultăți în controlul conceptelor și atributele vizuale din imaginile generate, ceea ce duce la rezultate nesatisfăcătoare. Mai mult, multe dintre aceste modele găsesc dificil să moduleze atributele continue, contribuind și mai mult la rezultate nesatisfăcătoare. Concept Sliders pot ajuta la mitigarea acestor probleme, oferind creatorilor de conținut și utilizatorilor finali un control îmbunătățit asupra procesului de generare a imaginilor și abordând provocările cu care se confruntă cadrele actuale.

Majoritatea modelelor actuale de difuzie text-imagine se bazează pe modificarea directă a prompturilor text pentru a controla atributele imaginilor. Deși această abordare permite generarea de imagini, nu este optimă, deoarece modificarea promptului poate altera drastic structura imaginii. O altă abordare utilizată de aceste cadre implică tehnici post-hoc, care inversează procesul de difuzie și modifică atențiile încrucișate pentru a edita concepte vizuale. Cu toate acestea, tehniciile post-hoc au limitări, susținând doar un număr limitat de editări simultane și necesitând treceri individuale de interferență pentru fiecare nou concept. Mai mult, ele pot introduce încurcături conceptuale dacă nu sunt proiectate cu atenție.

În contrast, Concept Sliders oferă o soluție mai eficientă pentru generarea de imagini. Aceste adaptoare ușoare și ușor de utilizat pot fi aplicate la modele pre-antrenate, îmbunătățind controlul și precizia asupra conceptelor dorite într-o singură trecere de interferență, cu un minimum de încurcături. Concept Sliders permit, de asemenea, editarea conceptelor vizuale care nu sunt acoperite de descrieri textuale, o caracteristică care le diferențiază de metodele de editare bazate pe prompturi text. Deși metodele de personalizare bazate pe imagini pot adăuga tokeni pentru concepte bazate pe imagini, ele sunt dificil de implementat pentru editarea imaginilor. Concept Sliders, pe de altă parte, permit utilizatorilor să furnizeze un număr mic de imagini pereche pentru a defini un concept dorit. Slider-urile generalizează apoi acest concept și îl aplică automat la alte imagini, încercând să îmbunătățească realismul și să corecteze distorsionări, cum ar fi cele de la mâini.

Concept Sliders își propun să învețe și să abordeze problemele comune celor patru concepte de inteligență artificială generativă și cadre de difuzie: Editare de imagini, Metode bazate pe îndrumare, Editare de modele și Direcții semantice.

Editare de imagini

Cadrele actuale de inteligență artificială se concentrează fie pe utilizarea unei intrări condiționale pentru a ghida structura imaginii, fie manipulează atențiile încrucișate ale imaginii sursă cu promptul țintă pentru a permite editarea imaginilor în cadrele de difuzie text-imagine. Rezultatul este că aceste abordări pot fi implementate doar pe imagini individuale și necesită, de asemenea, optimizarea bazei latente pentru fiecare imagine, ca urmare a evoluției structurii geometrice pe parcursul timpului și a prompturilor.

Metode bazate pe îndrumare

Utilizarea metodelor de îndrumare bazate pe clasificatori a indicat capacitatea lor de a îmbunătăți calitatea imaginilor generate și de a spori alinierea text-imagine. Prin incorporarea termenilor de îndrumare în timpul interferenței, metoda îmbunătățește compoziția limitată moștenită de cadrele de difuzie și poate fi utilizată pentru a ghida prin concepte nesigure în cadrele de difuzie.

Editare de modele

Utilizarea Concept Sliders poate fi văzută și ca o tehnică de editare a modelului care utilizează un adaptor de rang mic pentru a produce un singur atribut semantic care permite controlul continuu care se aliniază cu atributul. Metodele de personalizare bazate pe fine-tuning sunt apoi utilizate pentru a personaliza cadrul și a adăuga noi concepte. Mai mult, tehnica de difuzie personalizată propune o modalitate de a ajusta straturile de atenție încrucișate pentru a incorpora noi concepte vizuale în modelele de difuzie pre-antrenate. În schimb, tehnica de difuzie text propune să optimizeze un vector de încorporare pentru a activa capacitățile modelului și a introduce concepte textuale în cadrul.

Direcții semantice în GAN

Manipularea atributelor semantice este una dintre caracteristicile cheie ale rețelelor generative adverse, iar traiectoriile spațiului latent fiind aliniate în mod autosupervizat. În cadrele de difuzie, aceste traiectorii ale spațiului latent există în straturile medii ale arhitecturii U-Net, iar direcția principală a spațiului latent în cadrele de difuzie capturează semanticile globale. Concept Sliders antrenează subspații de rang mic corespunzătoare atributelor speciale direct și obține direcții de editare precise și localizate prin utilizarea perechilor de text sau imagini pentru a optimiza direcțiile globale.

Concept Sliders: Arhitectură și Funcționare

Modele de difuzie și Adaptoare LoRA sau de Rang Mic

Modelele de difuzie sunt esențialmente o subclassă a cadrului de inteligență artificială generativă care funcționează pe principiul sintetizării datelor prin inversarea unui proces de difuzie. Procesul de difuzie inițial adaugă zgomot datelor, astfel încât trecerea de la o stare organizată la un zgomot gaussian complet. Obiectivul principal al modelelor de difuzie este de a inversa procesul de difuzie prin denumirea graduală a imaginii și prin eșantionarea unui zgomot gaussian aleator pentru a genera o imagine. În aplicațiile din lumea reală, obiectivul principal al cadrului de difuzie este de a prezice zgomotul real atunci când zgomotul gaussian complet este furnizat ca intrare, împreună cu intrări suplimentare, cum ar fi condiționarea și timpul.

Tehnica LoRA sau a adaptoarelor de rang mic descompune actualizările greutății în timpul fine-tuningului pentru a permite adaptarea eficientă a cadrului pre-antrenat pe sarcini descendente. Tehnica LoRA descompune actualizările greutății pentru un strat pre-antrenat al modelului în raport cu atât dimensiunile de intrare, cât și cu cele de ieșire și constrânge actualizarea la un subspațiu de dimensiune mică.

Concept Sliders

Obiectivul principal al Concept Sliders este de a servi ca o abordare pentru a ajusta adaptoarele LoRA pe un cadru de difuzie pentru a facilita un grad mai mare de control asupra imaginilor țintă, așa cum se demonstrează în imaginea următoare.

Atunci când sunt condiționate pe concepte țintă, Concept Sliders învață direcții de parametru de rang mic pentru a crește sau diminua expresia anumitor atribute. Pentru un model și conceptul său țintă, obiectivul principal al Concept Sliders este de a obține un model îmbunătățit care modifică probabilitatea de a crește și diminua atributele pentru o imagine atunci când este condiționată pe conceptul țintă, pentru a crește probabilitatea de a crește atributele și a diminua probabilitatea de a diminua atributele. Utilizând reparametrizarea și formula lui Tweedie, cadrul introduce un proces de zgomot variabil în timp și exprimă fiecare scor ca o predicție de denumire. Mai mult, obiectivul de dezlegare ajustează modulele în Concept Sliders, păstrând greutățile pre-antrenate constante, iar factorul de scară introdus în timpul formulării LoRA este modificat în timpul interferenței. Factorul de scară permite, de asemenea, ajustarea puterii editării și face editările mai puternice fără a reantrena cadrul, așa cum se demonstrează în imaginea următoare.

Metodele de editare utilizate anterior de cadre facilitau editări mai puternice prin reantrenarea cadrului cu o îndrumare crescută. Cu toate acestea, scalarea factorului de scară în timpul interferenței produce aceleași rezultate de editare fără a crește costul de reantrenare și timp.

Învățarea Conceptelor Vizuale

Concept Sliders sunt proiectate pentru a controla concepte vizuale pe care prompturile text nu le pot defini bine și acestea folosesc seturi de date mici care sunt fie perechi înainte, fie perechi după, pentru a învăța aceste concepte. Contrastele dintre perechile de imagini permit slider-urilor să învețe conceptele vizuale. Mai mult, procesul de antrenare al Concept Sliders optimizează componenta LoRA implementată atât în direcția directă, cât și în cea inversă. Ca rezultat, componenta LoRA se aliniază cu direcția care provoacă efectele vizuale în ambele direcții.

Concept Sliders: Rezultate ale Implementării

Pentru a analiza creșterea performanței, dezvoltatorii au evaluat utilizarea Concept Sliders în principal pe cadrul Stable Diffusion XL, un cadru de înaltă rezoluție de 1024 de pixeli, cu experimente suplimentare efectuate pe cadrul Stable Diffusion v1.4, modelele fiind antrenate timp de 500 de epoci fiecare.

Concept Sliders Textuale

Pentru a evalua performanța Concept Sliders textuale, aceasta a fost validată pe un set de 30 de concepte textuale și metoda a fost comparată cu două linii de bază care utilizează un prompt text standard pentru un număr fix de timpi și apoi începe compoziția prin adăugarea de prompturi pentru a direcționa imaginea. Așa cum se poate vedea în figura următoare, utilizarea Concept Sliders rezultă într-un scor CLIP constant mai mare și o reducere constantă a scorului LPIPS în comparație cu cadrul original fără Concept Sliders.

Așa cum se poate vedea în imaginea de mai sus, utilizarea Concept Sliders facilitează editarea precisă a atributelor dorite în timpul procesului de generare a imaginilor, menținând în același timp structura generală a imaginii.

Concept Sliders Vizuale

Modelele de difuzie text-imagine care utilizează doar prompturi textuale găsesc adesea dificil să mențină un grad mai mare de control asupra atributelor vizuale, cum ar fi părul facial sau forma ochilor. Pentru a asigura un control mai bun asupra atributelor granulare, Concept Sliders utilizează îndrumarea textuală opțională, împerecheată cu seturi de date de imagini. Așa cum se poate vedea în figura de mai jos, Concept Sliders creează slider-uri individuale pentru “mărimea ochilor” și “forma sprâncenelor” care capturează transformările dorite utilizând perechile de imagini.

Rezultatele pot fi refinate și mai mult prin furnizarea de texte specifice, astfel încât direcția să se concentreze asupra acelei regiuni faciale și să creeze slider-uri cu control treptat asupra atributului țintă.

Combinarea Slider-urilor

Una dintre principalele avantaje ale utilizării Concept Sliders este capacitatea lor de a combina multiple slider-uri pentru a obține un control îmbunătățit, în loc de a se concentra asupra unui singur concept la un moment dat, ceea ce se datorează direcțiilor de rang mic utilizate în Concept Sliders. Mai mult, deoarece Concept Sliders sunt adaptoare LoRA ușoare, ele sunt ușor de partajat și pot fi suprapuse cu ușurință pe modele de difuzie. Utilizatorii pot ajusta, de asemenea, multiple manete simultan pentru a direcționa generații complexe, prin descărcarea seturilor de slider-uri interesante.

Imaginea următoare demonstrează capacitățile de combinare ale conceptelor slider, iar multiple slider-uri sunt combinate progresiv în fiecare rând de la stânga la dreapta, permițând astfel parcurgerea spațiilor de concepte de înaltă dimensiune cu un control îmbunătățit asupra conceptelor.

Îmbunătățirea Calității Imaginilor

Deși cadrele de difuzie text-imagine de ultimă generație și modelele generative de mare scară, cum ar fi modelul Stable Diffusion XL, sunt capabile să genereze imagini realiste și de înaltă calitate, ele suferă adesea de distorsionări ale imaginilor, cum ar fi obiecte blurate sau deformate, chiar dacă parametrii acestor cadre de ultimă generație sunt echipați cu capacitatea latentă de a genera ieșiri de înaltă calitate cu mai puține generații. Utilizarea Concept Sliders poate rezulta în generarea de imagini cu mai puține distorsionări, deblocând capacitățile reale ale acestor modele prin identificarea direcțiilor de parametru de rang mic.

Corectarea Mâinilor

Generarea de imagini cu mâini realiste a fost întotdeauna o provocare pentru cadrele de difuzie, iar utilizarea Concept Sliders are un control direct asupra tendinței de a distorsiona mâinile. Imaginea următoare demonstrează efectul utilizării Concept Sliders “corectarea mâinilor”, care permite cadrului să genereze imagini cu mâini mai realiste.

Slider-urile de Reparare

Utilizarea Concept Sliders nu numai că poate rezulta în generarea de imagini cu mâini mai realiste, dar a demonstrat și potențialul de a îmbunătăți realismul general al imaginilor generate de cadrul. Concept Sliders identifică, de asemenea, o singură direcție de parametru de rang mic care permite deplasarea imaginilor de la problemele de distorsionare comune, iar rezultatele sunt demonstrate în imaginea următoare.

Gânduri Finale

În acest articol, am discutat despre Concept Sliders, un nou paradigma simplu, dar scalabil, care permite controlul interpretabil asupra ieșirilor generate în modelele de difuzie. Utilizarea Concept Sliders are ca scop rezolvarea problemelor cu care se confruntă cadrele actuale de difuzie text-imagine, care găsesc dificil să mențină controlul asupra conceptelor și atributele vizuale incluse în imaginea generată, ceea ce duce adesea la rezultate nesatisfăcătoare. Mai mult, majoritatea modelelor de difuzie text-imagine găsesc dificil să moduleze atributele continue, ceea ce duce la rezultate nesatisfăcătoare. Utilizarea Concept Sliders poate permite cadrului de difuzie text-imagine să mitigeze aceste probleme și să ofere creatorilor de conținut și utilizatorilor finali un control îmbunătățit asupra procesului de generare a imaginilor, rezolvând astfel problemele cu care se confruntă cadrele actuale.

Kunal Kejriwal este un inginer backend specializat în Python, PostgreSQL, Redis și infrastructură cloud pe GCP și AWS. Cu trei ani de experiență în construirea și scalarea sistemelor de producție, el scrie despre infrastructura AI, sistemele distribuite și arhitectura din spatele implementării sarcinilor de învățare automată.