Modele și platforme AI
Zero123++: Un model de difuziune cu condiționare pe imagine pentru generarea de imagini multi-vizuale consistente

Ultimii ani au fost martori ai unei avansări rapide a performanței, eficienței și capacităților generative ale noilor modele de inteligență artificială generativă care folosesc seturi de date extinse și practici de generare de difuziune 2D. Astăzi, modelele de inteligență artificială generativă sunt extrem de capabile să genereze diferite forme de conținut media 2D și, într-o anumită măsură, 3D, inclusiv text, imagini, videoclipuri, GIF-uri și multe altele.
În acest articol, vom discuta despre framework-ul Zero123++, un model de inteligență artificială generativă condiționat de imagine, cu scopul de a genera imagini multi-vizuale consistente utilizând o singură imagine de intrare. Pentru a maximiza avantajul obținut din modelele generative pre-antrenate, framework-ul Zero123++ implementează numeroase scheme de antrenare și condiționare pentru a minimiza efortul necesar pentru a ajusta modelele de difuziune de imagine de la stoc. Vom face o analiză mai profundă a arhitecturii, funcționării și rezultatelor framework-ului Zero123++ și vom analiza capacitățile sale de a genera imagini multi-vizuale consistente de înaltă calitate dintr-o singură imagine. Deci, să începem.
Zero123 și Zero123++: O introducere
Framework-ul Zero123++ este un model de inteligență artificială generativă condiționat de imagine, care are ca scop generarea de imagini multi-vizuale consistente utilizând o singură imagine de intrare. Framework-ul Zero123++ este o continuare a framework-ului Zero123 sau Zero-1-la-3, care folosește tehnica de sinteză de imagine nouă pentru a pioniera conversiile de la o singură imagine la 3D deschise. Deși framework-ul Zero123++ oferă performanțe promițătoare, imaginile generate de framework au inconsistente geometrice vizibile, și acesta este motivul principal pentru care există încă un decalaj între scenele 3D și imaginile multi-vizuale.
Framework-ul Zero-1-la-3 servește ca fundament pentru mai multe alte framework-uri, inclusiv SyncDreamer, One-2-3-45, Consistent123 și multe altele, care adaugă straturi suplimentare framework-ului Zero123 pentru a obține rezultate mai consistente la generarea de imagini 3D. Alte framework-uri, cum ar fi ProlificDreamer, DreamFusion, DreamGaussian și multe altele, urmează o abordare bazată pe optimizare pentru a obține imagini 3D prin distilarea unei imagini 3D din diverse modele inconsistente. Deși aceste tehnici sunt eficiente și generează imagini 3D satisfăcătoare, rezultatele ar putea fi îmbunătățite prin implementarea unui model de difuziune de bază capabil să genereze imagini multi-vizuale în mod constant. Prin urmare, framework-ul Zero123++ ia framework-ul Zero-1-la-3 și ajustează un nou model de difuziune multi-vizual de la Stable Diffusion.
În framework-ul Zero-1-la-3, fiecare vedere nouă este generată independent, și această abordare conduce la inconsistente între imaginile generate, deoarece modelele de difuziune au o natură de eșantionare. Pentru a aborda această problemă, framework-ul Zero123++ adoptă o abordare de layout de tip tiling, cu obiectul fiind înconjurat de șase vederi într-o singură imagine, și asigură modelarea corectă a distribuției conjuncte a imaginilor multi-vizuale ale unui obiect.
O altă provocare majoră cu care se confruntă dezvoltatorii care lucrează la framework-ul Zero-1-la-3 este că acesta subutilizează capacitățile oferite de Stable Diffusion, ceea ce duce la ineficiență și costuri suplimentare. Există două motive principale pentru care framework-ul Zero-1-la-3 nu poate maximiza capacitățile oferite de Stable Diffusion
- Atunci când se antrenează cu condiții de imagine, framework-ul Zero-1-la-3 nu incorporează mecanismele de condiționare locală sau globală oferite de Stable Diffusion în mod eficient.
- În timpul antrenării, framework-ul Zero-1-la-3 folosește o rezoluție redusă, o abordare în care rezoluția de ieșire este redusă sub rezoluția de antrenare, ceea ce poate reduce calitatea generării de imagini pentru modelele Stable Diffusion.
Pentru a aborda aceste probleme, framework-ul Zero123++ implementează o serie de tehnici de condiționare care maximizează utilizarea resurselor oferite de Stable Diffusion și menține calitatea generării de imagini pentru modelele Stable Diffusion.
Îmbunătățirea condiționării și a consistenței
În încercarea de a îmbunătăți condiționarea de imagine și consistența imaginilor multi-vizuale, framework-ul Zero123++ a implementat diferite tehnici, cu obiectivul principal de a reutiliza tehnici pre-antrenate din modelul Stable Diffusion.
Generarea multi-vizuală
Calitatea indispensabilă a generării de imagini multi-vizuale consistente constă în modelarea corectă a distribuției conjuncte a mai multor imagini. În framework-ul Zero-1-la-3, corelația dintre imaginile multi-vizuale este ignorată, deoarece pentru fiecare imagine, framework-ul modelează distribuția marginală condiționată independent și separat. Cu toate acestea, în framework-ul Zero123++, dezvoltatorii au optat pentru o abordare de layout de tip tiling, care încadrează șase imagini într-o singură imagine pentru generarea multi-vizuală consistentă, și procesul este demonstrat în imaginea următoare.

Mai mult, s-a observat că orientările obiectelor tind să se ambiguitizeze atunci când se antrenează modelul pe poze de cameră, și pentru a preveni această ambiguitate, framework-ul Zero-1-la-3 se antrenează pe poze de cameră cu unghiuri de elevație și azimut relativ la intrare. Pentru a implementa această abordare, este necesar să se cunoască unghiul de elevație al vederii de intrare, care este apoi utilizat pentru a determina poza relativă între vederile noi de intrare. În încercarea de a cunoaște acest unghi de elevație, framework-urile adesea adaugă un modul de estimare a elevației, și această abordare adesea vine la un cost suplimentar de erori în flux.
Programul de zgomot
Programul liniar scalat, programul de zgomot original pentru Stable Diffusion, se concentrează în primul rând pe detalii locale, dar, așa cum se poate vedea în imaginea următoare, are foarte puține pași cu un raport semnal-zgomot (SNR) scăzut.

Acești pași cu un raport semnal-zgomot scăzut apar devreme în timpul etapei de denoizare, o etapă crucială pentru determinarea structurii globale de joată frecvență. Reducerea numărului de pași în timpul etapei de denoizare, fie în timpul interferenței sau al antrenării, duce adesea la o variație structurală mai mare. Deși această configurație este ideală pentru generarea de imagini simple, limitează capacitatea framework-ului de a asigura consistența globală între diferitele vederi. Pentru a depăși acest obstacol, framework-ul Zero123++ ajustează un model LoRA pe framework-ul Stable Diffusion 2 v-prediction pentru a efectua o sarcină de joacă, și rezultatele sunt demonstrate mai jos.

Cu programul liniar scalat, modelul LoRA nu se suprantrenează, dar doar albăstrește ușor imaginea. În schimb, atunci când se lucrează cu programul liniar de zgomot, framework-ul LoRA generează o imagine goală cu succes, indiferent de promptul de intrare, ceea ce semnifică impactul programului de zgomot asupra capacității framework-ului de a se adapta la noi cerințe globale.
Atenția de referință scalată pentru condiții locale
Intrarea de imagine unică sau imaginile de condiționare în framework-ul Zero-1-la-3 sunt concatenate cu intrările zgomotoase în dimensiunea caracteristicilor pentru a fi zgomotite pentru condiționarea de imagine.
Această concatenare conduce la o corespondență spațială pixel cu pixel incorectă între imaginea țintă și imaginea de intrare. Pentru a oferi o condiționare locală corectă, framework-ul Zero123++ utilizează o atenție de referință scalată, o abordare în care se rulează un model de denoizare UNet pe o imagine de referință suplimentară, urmată de adăugarea matricelor de valoare și a cheilor de auto-atenție de la imaginea de referință la straturile de atenție respective atunci când intrarea modelului este denoizată, și este demonstrat în figura următoare.

Abordarea de atenție de referință este capabilă să ghideze modelul de difuziune pentru a genera imagini care împărtășesc o textură asemănătoare cu imaginea de referință și conținut semantic fără niciun fel de ajustare. Cu ajustare, abordarea de atenție de referință oferă rezultate superioare cu latența scalată.

Condiționarea globală: FlexDiffuse
În abordarea originală Stable Diffusion, încorporările de text sunt singura sursă pentru încorporări globale, și abordarea folosește framework-ul CLIP ca encoder de text pentru a efectua examinări încrucișate între încorporările de text și latențele modelului. Rezultatul este că dezvoltatorii pot utiliza alinierea dintre spațiile de text și imaginile CLIP rezultate pentru a le folosi pentru condiționarea globală de imagine.
Framework-ul Zero123++ propune să utilizeze o variantă antrenabilă a mecanismului de ghidare liniară pentru a încorpora condiționarea globală de imagine în framework cu un minim de ajustare necesară, și rezultatele sunt demonstrate în imaginea următoare. Așa cum se poate vedea, în absența condiționării globale de imagine, calitatea conținutului generat de framework este satisfăcătoare pentru regiunile vizibile care corespund imaginii de intrare. Cu toate acestea, calitatea imaginii generate de framework pentru regiunile nevăzute suferă o deteriorare semnificativă, care este în principal din cauza incapacității modelului de a infera semanticile globale ale obiectului.

Arhitectura modelului
Framework-ul Zero123++ este antrenat cu modelul Stable Diffusion 2v ca bază, utilizând diferitele abordări și tehnici menționate în articol. Framework-ul Zero123++ este pre-antrenat pe setul de date Objaverse, care este redat cu iluminare HDRI aleatorie. Framework-ul adoptă, de asemenea, abordarea de programare fazică utilizată în framework-ul Stable Diffusion Image Variations în încercarea de a minimiza și mai mult cantitatea de ajustare necesară și de a păstra cât mai mult din cunoștințele anterioare ale modelului Stable Diffusion.
Funcționarea sau arhitectura framework-ului Zero123++ poate fi împărțită în etape sau faze secvențiale. Prima fază implică ajustarea matricelor KV ale straturilor de atenție încrucișate și ale straturilor de auto-atenție ale modelului Stable Diffusion, cu AdamW ca optimizer, 1000 de pași de încălzire și un program de învățare cosinusoidal care maximizează la 7×10-5. În a doua fază, framework-ul utilizează o rată de învățare constantă foarte conservatoare, cu 2000 de seturi de încălzire și utilizează abordarea Min-SNR pentru a maximiza eficiența în timpul antrenării.
Zero123++: Rezultate și comparație de performanță
Performanță calitativă
Pentru a evalua performanța framework-ului Zero123++ pe baza calității generate, acesta este comparat cu SyncDreamer și Zero-1-la-3-XL, două dintre cele mai bune framework-uri de stat de artă pentru generarea de conținut. Framework-urile sunt comparate cu patru imagini de intrare cu scopuri diferite. Prima imagine este o pisică de jucărie electrică, luată direct din setul de date Objaverse și care are o incertitudine mare la capătul din spate al obiectului. A doua imagine este o imagine a unui stingător de incendiu, iar a treia este o imagine a unui câine așezat pe o rachetă, generată de modelul SDXL. Ultima imagine este o ilustrație de anime. Pașii necesari de elevație pentru framework-uri sunt obținuți utilizând metoda de estimare a elevației framework-ului One-2-3-4-5, iar eliminarea fundalului este realizată utilizând framework-ul SAM. Așa cum se poate vedea, framework-ul Zero123++ generează imagini multi-vizuale de înaltă calitate în mod constant și este capabil să se generalizeze la ilustrații 2D din afara domeniului și la imagini generate de inteligență artificială la fel de bine.


Analiză cantitativă
Pentru a compara cantitativ framework-ul Zero123++ cu framework-urile de stat de artă Zero-1-la-3 și Zero-1-la-3-XL, dezvoltatorii evaluează scorul de similaritate a patch-urilor de imagine perceptuale învățate (LPIPS) al acestor modele pe setul de date de validare, un subset al setului de date Objaverse. Pentru a evalua performanța modelului la generarea de imagini multi-vizuale, dezvoltatorii încadrează imaginile de referință și cele șase imagini generate, respectiv, și calculează scorul LPIPS. Rezultatele sunt demonstrate mai jos și, așa cum se poate vedea clar, framework-ul Zero123++ obține cea mai bună performanță pe setul de date de validare.

Evaluarea de la text la multi-vizual
Pentru a evalua capacitatea framework-ului Zero123++ de a genera conținut de la text la multi-vizual, dezvoltatorii folosesc mai întâi framework-ul SDXL cu prompturi de text pentru a genera o imagine și apoi utilizează framework-ul Zero123++ pe imaginea generată. Rezultatele sunt demonstrate în imaginea următoare, și, așa cum se poate vedea, atunci când este comparat cu framework-ul Zero-1-la-3, care nu poate garanta generarea de imagini multi-vizuale consistente, framework-ul Zero123++ returnează imagini multi-vizuale consistente, realiste și foarte detaliate prin implementarea abordării sau a pipeline-ului de text-la-imagine-la-multi-vizual.

Zero123++ Depth ControlNet
În plus față de framework-ul de bază Zero123++, dezvoltatorii au lansat și framework-ul Depth ControlNet Zero123++, o versiune controlată de adâncime a framework-ului original, construit utilizând arhitectura ControlNet. Imaginile liniare normalizate sunt redatate în raport cu imaginile RGB ulterioare, și un framework ControlNet este antrenat pentru a controla geometria framework-ului Zero123++ utilizând percepția de adâncime.

Concluzie
În acest articol, am discutat despre Zero123++, un model de inteligență artificială generativă condiționat de imagine, cu scopul de a genera imagini multi-vizuale consistente utilizând o singură imagine de intrare. Pentru a maximiza avantajul obținut din modelele generative pre-antrenate, framework-ul Zero123++ implementează numeroase scheme de antrenare și condiționare pentru a minimiza efortul necesar pentru a ajusta modelele de difuziune de imagine de la stoc. Am discutat, de asemenea, despre diferitele abordări și îmbunătățiri implementate de framework-ul Zero123++ care îi permit să obțină rezultate comparabile cu, și chiar depășind cele obținute de framework-urile de stat de artă actuale.
Cu toate acestea, în ciuda eficienței și capacității sale de a genera imagini multi-vizuale de înaltă calitate în mod constant, framework-ul Zero123++ încă are spațiu de îmbunătățire, cu posibile domenii de cercetare fiind un model de rafinare în două etape care ar putea rezolva incapacitatea framework-ului Zero123++ de a îndeplini cerințele globale de consistență.
- Model de rafinare în două etape care ar putea rezolva incapacitatea framework-ului Zero123++ de a îndeplini cerințele globale de consistență.
- Extinderi suplimentare pentru a îmbunătăți și mai mult capacitatea framework-ului Zero123++ de a genera imagini de calitate și mai înaltă.












