Modele și platforme AI

InstantID: Generare de Imagine cu Păstrarea Identității Zero-Shot în Secunde

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Tehnologia de generare de imagini bazată pe inteligență artificială a cunoscut o creștere remarcabilă în ultimii ani, de când modelele de difuzie text-imagine, cum ar fi DALL-E, GLIDE, Stable Diffusion, Imagen și altele, au apărut pe scena tehnologică. În ciuda faptului că modelele de generare de imagini AI au arhitecturi și metode de antrenare unice, toate au un punct comun: generarea personalizată și customizată de imagini care vizează crearea de imagini cu caracteristici de subiect, stil și identitate consecvente pe baza unor imagini de referință. Datorită capacităților lor generative remarcabile, cadrele moderne de generare de imagini AI au găsit aplicații în domenii precum animația de imagini, realitatea virtuală, comerțul electronic, portretele AI și multe altele. Cu toate acestea, în ciuda capacităților lor generative remarcabile, aceste cadre toate au o provocare comună, majoritatea lor fiind incapabile să genereze imagini personalizate care să păstreze detaliile delicate ale obiectelor umane.

Generarea de imagini personalizate care să păstreze detaliile intrinseci este de o importanță critică, în special în sarcinile de identitate facială umană care necesită un standard ridicat de fidelitate și detalii, precum și semantici nuanțate, comparativ cu sarcinile de generare de imagini de obiecte generale care se concentrează în principal pe texturi și culori grosiere. În plus, cadrele de sinteză de imagini personalizate din ultimii ani, cum ar fi LoRA, DreamBooth, Textual Inversion și altele, au evoluat semnificativ. Cu toate acestea, modelele de generare de imagini personalizate AI nu sunt încă perfecte pentru implementarea în scenarii reale, deoarece au o cerință mare de stocare, necesită multiple imagini de referință și au adesea un proces de reglare lung. Pe de altă parte, deși metodele bazate pe încorporarea ID necesită doar o singură referință, ele fie lipsesc de compatibilitate cu modelele preantrenate disponibile public, fie necesită un proces de reglare excesiv pe parametri multipli, fie nu reușesc să mențină o fidelitate ridicată a feței.

Pentru a aborda aceste provocări și a îmbunătăți în continuare capacitățile de generare de imagini, în acest articol, vom discuta despre InstantID, o soluție bazată pe modelul de difuzie pentru generarea de imagini. InstantID este un modul plug-and-play care gestionează generarea și personalizarea de imagini cu ușurință, pe diverse stiluri, cu doar o singură imagine de referință și asigură, de asemenea, o fidelitate ridicată. Scopul principal al acestui articol este de a oferi cititorilor noștri o înțelegere profundă a fundamentelor tehnice și a componentelor cadrelor InstantID, examinând în detaliu arhitectura modelului, procesul de antrenare și scenariile de aplicare. Deci, să începem.

InstantID: Generare de Imagine cu Păstrarea Identității Zero-Shot


Apariția modelelor de difuzie text-imagine a contribuit semnificativ la progresul tehnologiei de generare de imagini. Scopul principal al acestor modele este generarea personalizată și customizată, și crearea de imagini cu subiect, stil și identitate consecvente, folosind una sau mai multe imagini de referință. Capacitatea acestor cadre de a crea imagini consecvente a generat aplicații potențiale în diverse industrii, inclusiv animația de imagini, generarea de portrete AI, comerțul electronic, realitatea virtuală și multe altele.

Cu toate acestea, în ciuda capacităților lor remarcabile, aceste cadre se confruntă cu o provocare fundamentală: adesea au dificultăți în a genera imagini personalizate care să păstreze detaliile intrinseci ale subiectelor umane. Este important de remarcat că generarea de imagini personalizate cu detaliile intrinseci este o sarcină dificilă, deoarece identitatea facială umană necesită un nivel ridicat de fidelitate și detalii, precum și semantici avansate, comparativ cu obiectele generale sau stilurile care se concentrează în principal pe culori sau texturi grosiere. Modelele text-imagine existente depind de descrieri textuale detaliate și au dificultăți în a obține o relevanță semantică puternică pentru generarea de imagini personalizate. În plus, unele cadre de text-imagine preantrenate adaugă controale de condiționare spațială pentru a îmbunătăți controlabilitatea, facilitând controlul structural fin, folosind elemente precum poziții corporale, hărți de adâncime, schițe desenate de utilizator, hărți de segmentare semantică și multe altele. Cu toate acestea, în ciuda acestor adăugări și îmbunătățiri, aceste cadre pot obține doar o fidelitate parțială a imaginii generate față de imaginea de referință.

Pentru a depăși aceste provocări, cadrul InstantID se concentrează pe sinteza de imagini care păstrează identitatea instantaneu și încearcă să acopere golul dintre eficiență și fidelitate ridicată, introducând un modul simplu plug-and-play care permite cadrului să gestioneze personalizarea de imagini folosind doar o singură imagine facială, menținând, de asemenea, o fidelitate ridicată. În plus, pentru a păstra identitatea facială din imaginea de referință, cadrul InstantID implementează un nou codator de fețe care reține detaliile intrinseci ale imaginii, adăugând condiții spațiale slabe și condiții semantice puternice care ghidează procesul de generare de imagini, integrând prompturi textuale, imagini de referință și imagini faciale.

Există trei caracteristici distincte care separă cadrul InstantID de cadrele existente de generare de imagini text-imagine.

  • Compatibilitate și Pluggability: În loc să se antreneze pe parametrii completi ai cadrului UNet, cadrul InstantID se concentrează pe antrenarea unui adaptor ușor. Ca rezultat, cadrul InstantID este compatibil și pluggable cu modelele preantrenate existente.
  • Reglare Liberă: Metodologia cadrului InstantID elimină necesitatea reglării, deoarece necesită doar o singură propagare înainte pentru inferență, făcând modelul foarte practic și economic pentru reglare.
  • Performanță Superioară: Cadrul InstantID demonstrează o flexibilitate și fidelitate ridicată, deoarece este capabil să ofere performanțe de ultimă generație, folosind doar o singură imagine de referință, comparabil cu metodele bazate pe antrenare care se bazează pe multiple imagini de referință.

În general, contribuțiile cadrului InstantID pot fi categorisite în următoarele puncte.

  1. Cadrul InstantID este o metodă inovatoare de adaptare care păstrează identitatea pentru modelele de difuzie text-imagine preantrenate, cu scopul de a acoperi golul dintre eficiență și fidelitate.
  2. Cadrul InstantID este compatibil și pluggable cu modelele personalizate reglate, folosind același model de difuzie în arhitectura sa, permițând păstrarea identității în modelele preantrenate fără costuri suplimentare.

InstantID: Metodologie și Arhitectură

Așa cum s-a menționat anterior, cadrul InstantID este un adaptor ușor și eficient care conferă modelelor de difuzie text-imagine preantrenate capacități de păstrare a identității, fără efort.

Vorbind despre arhitectură, cadrul InstantID se bazează pe modelul de difuzie stabilă, cunoscut pentru capacitatea sa de a efectua procesul de difuzie cu eficiență computațională ridicată într-un spațiu latent de dimensiune redusă, în loc de spațiul pixelilor, cu un codator auto. Pentru o imagine de intrare, codatorul mappează imaginea la o reprezentare latentă cu un factor de eșantionare și dimensiuni latente. În plus, pentru a denumi o zgomot normal distribuit cu zgomot latent, condiție și timp de pause, procesul de difuzie adoptă o componentă de denoising UNet. Condiția este o încorporare a prompturilor textuale generate folosind un codator de text CLIP preantrenat.

În plus, cadrul InstantID utilizează, de asemenea, o componentă ControlNet care este capabilă să adauge control spațial la un model de difuzie preantrenat, ca o condiție, extinzându-se mult dincolo de capacitățile tradiționale ale prompturilor textuale. Componenta ControlNet integrează, de asemenea, arhitectura UNet din cadrul de difuzie stabilă, folosind o replică antrenată a componentei UNet. Replica componentei UNet prezintă zero straturi de convoluție în blocurile medii și blocurile codatorului. În ciuda similarităților, componenta ControlNet se diferențiază de modelul de difuzie stabilă; ele diferă în articolul residual ulterioară. Componenta ControlNet încorporează informații de condiționare spațială, cum ar fi poziții, hărți de adâncime, schițe și multe altele, adăugând reziduurile la blocul UNet și apoi încorporând aceste reziduuri în rețeaua originală.

Cadrul InstantID se inspiră, de asemenea, din IP-Adapter sau Image Prompt Adapter, care introduce o abordare nouă pentru a obține capacități de prompt de imagine, care rulează în paralel cu prompturile textuale, fără a necesita modificarea modelelor text-imagine originale. Componenta IP-Adapter utilizează, de asemenea, o strategie de atenție decuplată care folosește straturi de atenție suplimentare pentru a încorpora caracteristicile imaginii, lăsând celelalte parametri nemodificați.

Metodologie

Pentru a oferi o imagine de ansamblu, cadrul InstantID își propune să genereze imagini personalizate cu diverse stiluri sau poziții, folosind doar o singură imagine de referință cu identitate, cu fidelitate ridicată. Următoarea figură oferă o imagine de ansamblu a cadrului InstantID.

Așa cum se poate observa, cadrul InstantID are trei componente esențiale:

  1. O componentă de încorporare a identității care captează informații semantice robuste ale caracteristicilor faciale din imagine.
  2. Un modul ușor adoptat cu o componentă de atenție decuplată pentru a facilita utilizarea unei imagini ca prompt vizual.
  3. O componentă IdentityNet care încorporează caracteristicile detaliate din imaginea de referință, folosind control spațial suplimentar.

Încorporarea Identității

Diferit de metodele existente, cum ar fi FaceStudio, PhotoMaker, IP-Adapter și altele, care se bazează pe un codator de imagine CLIP preantrenat pentru a extrage prompturi vizuale, cadrul InstantID se concentrează pe fidelitate îmbunătățită și detalii semantice puternice în sarcina de păstrare a identității. Este important de remarcat că limitările intrinseci ale componentei CLIP se află în principal în procesul de antrenare pe date slab aliniate, ceea ce înseamnă că caracteristicile încorporate ale codatorului CLIP captează în principal informații semantice largi și ambigue, cum ar fi culori, stil și compoziție. Deși aceste caracteristici pot acționa ca un supliment general pentru încorporarea textului, ele nu sunt potrivite pentru sarcini de păstrare a identității precise care pun accent puternic pe semantici puternice și fidelitate ridicată. În plus, cercetările recente în modelele de reprezentare a feței, în special în recunoașterea facială, au demonstrat eficiența reprezentării feței în sarcini complexe, cum ar fi reconstrucția și recunoașterea facială. Pe baza acestor cercetări, cadrul InstantID își propune să utilizeze un model de față preantrenat pentru a detecta și extrage încorporări de identitate din imaginea de referință, ghidând modelul pentru generarea de imagini.

Adaptor de Imagine

Capacitatea modelelor de difuzie text-imagine preantrenate de a îmbunătăți prompturile textuale, în special în scenariile care nu pot fi descrise adecvat de prompturile textuale, este îmbunătățită semnificativ. Cadrul InstantID adoptă o strategie asemănătoare cu cea utilizată de modelul IP-Adapter pentru prompturi de imagine, care introduce un modul adaptiv ușor, împerecheat cu o componentă de atenție decuplată, pentru a susține imagini ca prompturi de intrare. Cu toate acestea, contrar încorporărilor CLIP aliniate grosier, cadrul InstantID se abate prin utilizarea încorporărilor de identitate ca prompturi de imagine, în încercarea de a obține o integrare de prompturi semantice bogate și mai nuanțate.

IdentityNet

Deși metodele existente sunt capabile să integreze prompturile de imagine cu prompturile textuale, cadrul InstantID argumentează că aceste metode îmbunătățesc doar caracteristicile grosiere, cu un nivel de integrare care este insuficient pentru generarea de imagini care păstrează identitatea. În plus, adăugarea tokenurilor de imagine și text în straturile de atenție direct poate slăbi controlul tokenurilor de text, și o încercare de a îmbunătăți puterea tokenurilor de imagine poate rezulta în deteriorarea capacităților tokenurilor de text în sarcinile de editare. Pentru a contracara aceste provocări, cadrul InstantID optează pentru ControlNet, o metodă alternativă de încorporare a caracteristicilor care utilizează informații spațiale ca intrare pentru modulul controlabil, permițându-i să mențină consistența cu setările UNet în modelele de difuzie.

Cadrul InstantID face două modificări ale arhitecturii tradiționale ControlNet: pentru intrările condiționale, cadrul InstantID optează pentru 5 puncte cheie faciale, în loc de puncte cheie faciale OpenPose fine. În al doilea rând, cadrul InstantID utilizează încorporări de identitate în loc de prompturi textuale ca condiții pentru straturile de atenție în arhitectura ControlNet.

Antrenare și Inferență

În faza de antrenare, cadrul InstantID optimizează parametrii componentei IdentityNet și ai modulului de adaptare, înghețând parametrii modelului de difuzie preantrenat. Întregul flux de lucru InstantID este antrenat pe perechi de imagini-text care prezintă subiecți umani și utilizează un obiectiv de antrenare similar cu cel utilizat în cadrul de difuzie stabilă, cu condiții de imagine specifice. Punctul forte al metodei de antrenare InstantID este separarea dintre straturile de atenție pentru imagine și text în adaptorul de imagine, o alegere care permite cadrului InstantID să ajusteze greutățile acestor condiții de imagine în mod flexibil și independent, asigurând astfel un proces de inferență și antrenare mai țintit și controlat.

InstantID: Experimente și Rezultate

Cadrul InstantID implementează modelul de difuzie stabilă și îl antrenează pe LAION-Face, o bază de date deschisă de peste 50 de milioane de perechi de imagini-text. În plus, cadrul InstantID colectează peste 10 milioane de imagini umane cu automatizări generate automat de modelul BLIP2, pentru a îmbunătăți în continuare calitatea generării de imagini. Cadrul InstantID se concentrează în principal pe imagini cu o singură persoană și utilizează un model de față preantrenat pentru a detecta și extrage încorporări de identitate din imagini umane, și, în loc de a antrena seturile de date recortate, antrenează imagini umane originale. În plus, în timpul antrenării, cadrul InstantID îngheță modelul de text-imagine preantrenat și actualizează doar parametrii componentei IdentityNet și ai modulului de adaptare.

Generare de Imagine Numai

Modelul InstantID utilizează un prompt gol pentru a ghida procesul de generare de imagini, folosind doar imaginea de referință, și rezultatele fără prompturi sunt demonstrate în imaginea de mai jos.

Generarea cu „prompt gol” demonstrează capacitatea cadrului InstantID de a menține caracteristici faciale semantice bogate, cum ar fi identitatea, vârsta și expresia, robust. Cu toate acestea, este important de remarcat că utilizarea prompturilor goale nu poate reproduce rezultatele pe alte semantici, cum ar fi sexul, cu acuratețe. În plus, în imaginea de mai sus, coloanele 2-4 utilizează o imagine și un prompt, și, așa cum se poate vedea, imaginea generată nu demonstrează nicio deteriorare a capacităților de control al textului, și, de asemenea, asigură consistența identității. În cele din urmă, coloanele 5-9 utilizează o imagine, un prompt și control spațial, demonstrând compatibilitatea modelului cu modelele de control spațial preantrenate, permițând modelului InstantID să introducă control spațial flexibil, folosind o componentă ControlNet preantrenată.

Este, de asemenea, important de remarcat că numărul de imagini de referință are un impact semnificativ asupra imaginii generate, așa cum se demonstrează în imaginea de mai sus. Deși cadrul InstantID poate oferi rezultate bune folosind o singură imagine de referință, multiple imagini de referință produc o imagine de calitate superioară, deoarece cadrul InstantID ia media încorporărilor de identitate ca prompt de imagine. În continuare, este esențial să se compare cadrul InstantID cu metodele anterioare care generează imagini personalizate folosind o singură imagine de referință. Următoarea figură compară rezultatele generate de cadrul InstantID și de modelele de ultimă generație pentru generarea de imagini personalizate cu o singură referință.

Așa cum se poate vedea, cadrul InstantID este capabil să păstreze caracteristicile faciale datorită încorporării de identitate care conține informații semantice bogate, cum ar fi identitatea, vârsta și sexul. Se poate spune cu siguranță că cadrul InstantID depășește cadrele existente în generarea de imagini personalizate, deoarece este capabil să păstreze identitatea umană, menținând, în același timp, controlul și flexibilitatea stilistică.

Gânduri Finale

În acest articol, am discutat despre InstantID, o soluție bazată pe modelul de difuzie pentru generarea de imagini. InstantID este un modul plug-and-play care gestionează generarea și personalizarea de imagini cu ușurință, pe diverse stiluri, cu doar o singură imagine de referință, și asigură, de asemenea, o fidelitate ridicată. Cadrul InstantID se concentrează pe sinteza de imagini care păstrează identitatea instantaneu și încearcă să acopere golul dintre eficiență și fidelitate ridicată, introducând un modul simplu plug-and-play care permite cadrului să gestioneze personalizarea de imagini folosind doar o singură imagine facială, menținând, de asemenea, o fidelitate ridicată.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.