Modele și platforme AI
Imaginea Splatter: O încercare de reconstrucție 3D ultra-rapidă a unei singure imagini
Reconstrucția 3D a obiectelor cu rețele convoluționale a demonstrat capacități remarcabile. Modelele de reconstrucție 3D cu o singură vedere generează modelul 3D al oricărui obiect folosind o singură imagine ca referință, făcând-o una dintre cele mai fierbinți subiecte de cercetare în domeniul viziunii computaționale.

De exemplu, să considerăm motocicleta din imaginea de mai sus. Generarea structurii sale 3D necesită o conductă complexă care combină indicii de la imagini de nivel scăzut cu informații semantice de nivel înalt și cunoștințe despre aranjamentul structural al părților.
Datorită procesului complex, reconstrucția 3D cu o singură vedere a fost o provocare majoră în viziunea computațională. În încercarea de a îmbunătăți eficiența reconstrucției 3D cu o singură vedere, dezvoltatorii au lucrat la Imaginea Splatter, o metodă care își propune să atingă reconstrucția ultra-rapidă a formei și aspectului 3D al obiectelor. La nivelul său central, cadrul Imaginea Splatter utilizează metoda de stropire Gaussiană pentru a analiza reprezentările 3D, beneficiind de viteza și calitatea pe care le oferă.
Recent, metoda de stropire Gaussiană a fost implementată de numeroase modele de reconstrucție multi-vizuală pentru rendering în timp real, escaladare îmbunătățită și antrenament rapid. Cu toate acestea, Imaginea Splatter este primul cadru care implementează metoda de stropire Gaussiană pentru sarcini de reconstrucție cu o singură vedere.
În acest articol, vom explora cum cadrul Imaginea Splatter utilizează stropirea Gaussiană pentru a atinge reconstrucția 3D ultra-rapidă cu o singură vedere. Așadar, să începem.
Imaginea Splatter: O încercare de reconstrucție 3D ultra-rapidă a unei singure imagini
Așa cum s-a menționat anterior, Imaginea Splatter este o abordare ultra-rapidă pentru reconstrucția 3D a obiectelor cu o singură vedere, bazată pe metoda de stropire Gaussiană. Imaginea Splatter este primul cadru de viziune computațională care implementează stropirea Gaussiană pentru generarea monoculară a obiectelor 3D, deoarece, în mod tradițional, stropirea Gaussiană a fost alimentată de cadrele de reconstrucție 3D multi-vizuală. Cu toate acestea, ceea ce separă cadrul Imaginea Splatter de metodele anterioare este faptul că este o abordare bazată pe învățare, iar reconstrucția în timpul testării necesită doar evaluarea feed-forward a rețelei neuronale.
Imaginea Splatter se bazează fundamental pe calitățile de rendering ale stropirii Gaussiane și pe viteza de procesare ridicată pentru a genera reconstrucții 3D. Cadrul Imaginea Splatter are un design simplu: cadrul utilizează o rețea neuronală imagine-la-imagine 2D pentru a prezice un Gaussian 3D pentru fiecare pixel de imagine de intrare și cartografiază imaginea de intrare la un Gaussian 3D pe pixel. Rezultatul Gaussianilor 3D are forma unei imagini, cunoscute sub numele de Imaginea Splatter, iar Gaussianii oferă, de asemenea, o reprezentare de 360 de grade a imaginii. Procesul este demonstrat în imaginea de mai jos.

Deși procesul este simplu și direct, există câteva provocări cheie cu care se confruntă cadrul Imaginea Splatter atunci când utilizează stropirea Gaussiană pentru a genera Gaussiani 3D pentru reprezentări 3D cu o singură vedere. Prima provocare majoră constă în proiectarea unei rețele neuronale care acceptă imaginea unui obiect ca intrare și generează o corespondentă amestec de Gaussiane care reprezintă toate părțile imaginii ca ieșire. Pentru a aborda această provocare, Imaginea Splatter profită de faptul că, deși amestecul de Gaussiane generate este un set sau o colecție neordonată de articole, acesta poate fi stocat totuși într-o structură de date ordonată. Prin urmare, cadrul utilizează o imagine 2D ca container pentru Gaussianii 3D, ca urmare a faptului că fiecare pixel din container conține parametrii unui Gaussian, inclusiv proprietățile sale, cum ar fi formă, opacitate și culoare.
Prin stocarea seturilor de Gaussiani 3D într-o imagine, cadrul Imaginea Splatter este capabil să reducă obstacolele de reconstrucție cu care se confruntă atunci când se învață o rețea neuronală imagine-la-imagine. Prin utilizarea acestei abordări, procesul de reconstrucție poate fi implementat doar prin utilizarea operatorilor 2D eficienți, în loc de a se baza pe operatori 3D. Mai mult, în cadrul Imaginea Splatter, reprezentarea 3D este un amestec de Gaussiani 3D, ceea ce îi permite să exploateze avantajele de viteza și eficiență a memoriei oferite de stropirea Gaussiană, care îmbunătățește eficiența atât în antrenament, cât și în inferență. Continuând, cadrul Imaginea Splatter nu numai că generează reprezentări 3D cu o singură vedere, dar demonstrează, de asemenea, o eficiență remarcabilă, deoarece poate fi antrenat chiar și pe o singură unitate de procesare grafică pe benchmark-uri standard de obiecte 3D. Mai mult, cadrul Imaginea Splatter poate fi extins pentru a accepta mai multe imagini ca intrare. Acesta reușește să facă acest lucru prin înregistrarea amestecurilor individuale de Gaussiane la o referință comună și, ulterior, prin combinarea amestecurilor de Gaussiane prezise din vedere individuală. Cadrul injectează, de asemenea, straturi ușoare de atenție reciprocă în arhitectura sa, care permite diferitelor vedere să comunice între ele în timpul prezicerii.
Din punct de vedere empiric, este demn de remarcat faptul că cadrul Imaginea Splatter poate produce reconstrucții 3D la 360 de grade ale obiectului, chiar dacă vede doar o parte a obiectului. Cadrul alocă apoi Gaussiani diferiți într-un vecinătate 2D la diferite părți ale obiectului 3D pentru a codifica informațiile generate 3D în imaginea 2D. Mai mult, cadrul setează opacitatea mai multor Gaussiani la zero, ceea ce îi dezactivează, permițându-le să fie eliminate în timpul post-procesării.
Pentru a rezuma, cadrul Imaginea Splatter este
- O abordare nouă pentru a genera reconstrucții 3D ale obiectelor cu o singură vedere prin portarea metodei de stropire Gaussiană.
- Extinde metoda pentru reconstrucția 3D a obiectelor cu mai multe vedere.
- Atinge performanța de reconstrucție 3D a obiectelor de stat cu o viteză și calitate excepționale pe benchmark-uri standard.
Imaginea Splatter: Metodologie și Arhitectură
Stropire Gaussiană
Așa cum s-a menționat anterior, stropirea Gaussiană este metoda principală implementată de cadrul Imaginea Splatter pentru a genera reconstrucții 3D ale obiectelor cu o singură vedere. În termeni simpli, stropirea Gaussiană este o metodă de rasterizare pentru reconstrucția imaginilor 3D și rendering în timp real, care are multiple puncte de vedere. Spațiul 3D din imagine este referit ca Gaussiani, iar tehnici de învățare automată sunt implementate pentru a învăța parametrii fiecărui Gaussian. Stropirea Gaussiană nu necesită antrenament în timpul renderingului, ceea ce facilitează timpul de rendering mai rapid. Imaginea de mai jos rezumă arhitectura stropirii Gaussiane 3D.

Stropirea Gaussiană 3D utilizează mai întâi setul de imagini de intrare pentru a genera un nor de puncte. Stropirea Gaussiană utilizează apoi imaginile de intrare pentru a estima parametrii externi ai camerei, cum ar fi înclinația și poziția, prin potrivirea pixelilor între imagini, iar acești parametri sunt ulterior utilizați pentru a calcula norul de puncte. Utilizând diferite metode de învățare automată, stropirea Gaussiană optimizează patru parametri pentru fiecare Gaussian, și anume: Poziție (unde este localizat), Covarianță (extinderea sa de întindere sau scalare într-o matrice 3×3), Culoare (ce este schema de culori RGB) și Alfa (măsurarea transparenței). Procesul de optimizare renderizează imaginea pentru fiecare poziție a camerei și o utilizează pentru a determina parametrii mai aproape de imaginea originală. Ca rezultat, ieșirea stropirii Gaussiane 3D este o imagine, numită Imaginea Splatter, care seamănă cel mai mult cu imaginea originală de la poziția camerei din care a fost capturată.

Mai mult, funcția de opacitate și funcția de culoare din stropirea Gaussiană oferă un câmp de radianță cu direcția de vedere a punctului 3D. Cadrul renderizează apoi câmpul de radianță pe o imagine prin integrarea culorilor observate de-a lungul razei care trece prin pixel. Stropirea Gaussiană reprezintă aceste funcții ca o combinație de Gaussiani colorați, unde media Gaussiană sau centrul, împreună cu covarianța Gaussiană, ajută la determinarea formei și mărimii sale. Fiecare Gaussian are, de asemenea, o proprietate de opacitate și o culoare dependentă de vedere care, împreună, definesc câmpul de radianță.
Imaginea Splatter
Componenta de renderizare mapă setul de Gaussiani 3D la o imagine. Pentru a efectua reconstrucția 3D cu o singură vedere, cadrul caută o funcție inversă pentru Gaussiani 3D care reconstruiește amestecul de Gaussiani 3D dintr-o imagine. Incluziunea cheie aici este de a propune un design eficient, dar simplu, pentru funcția inversă. În special, pentru o imagine de intrare, cadrul prezice un Gaussian pentru fiecare pixel individual utilizând o arhitectură de rețea neuronală imagine-la-imagine pentru a produce o imagine de ieșire, Imaginea Splatter. Rețeaua prezice, de asemenea, forma, opacitatea și culoarea.
Acum, s-ar putea specula cum poate cadrul Imaginea Splatter reconstrui reprezentarea 3D a unui obiect, chiar dacă are acces doar la una dintre priveliștile sale? În timp real, cadrul Imaginea Splatter învață să utilizeze unele dintre Gaussiani disponibili pentru a reconstrui priveliștea și utilizează restul Gaussianilor pentru a reconstrui automat părțile nevăzute ale imaginii. Pentru a-și maximiza eficiența, cadrul poate dezactiva automat orice Gaussiani prin prezicerea opacității zero. Dacă opacitatea este zero, Gaussianii sunt dezactivați, iar cadrul nu renderizează aceste puncte și sunt eliminate în post-procesare.
Pierdere la nivel de imagine
Un avantaj major al exploatării vitezei și eficienței oferite de metoda de stropire Gaussiană este acela că facilitează cadrului să renderizeze toate imaginile la fiecare iterație, chiar și pentru loturi cu dimensiuni relativ mari. Mai mult, aceasta implică faptul că cadrul nu numai că poate utiliza pierderi descompuse, dar poate utiliza, de asemenea, pierderi la nivel de imagine care nu se descompun în pierderi pe pixel.
Normalizare de scară
Este dificil să se estimeze mărimea unui obiect prin vizualizarea unei singure priveliști, iar această sarcină este dificilă de rezolvat atunci când este antrenată cu o pierdere. Aceeași problemă nu este observată în seturile de date sintetice, deoarece toate obiectele sunt renderizate cu intrinseci de cameră identice și obiectele sunt la o distanță fixă de cameră, ceea ce ajută în cele din urmă la rezolvarea ambiguității. Cu toate acestea, în seturile de date cu imagini din viața reală, ambiguitatea este evidentă, iar cadrul Imaginea Splatter utilizează mai multe metode de pre-procesare pentru a fixa aproximativ scala tuturor obiectelor.
Culoare dependentă de vedere
Pentru a reprezenta culorile dependente de vedere, cadrul Imaginea Splatter utilizează armonici sferice pentru a generaliza culorile dincolo de modelul de culoare Lambertian. Pentru orice Gaussian specific, modelul definește coeficienți care sunt prezisați de rețea și armonicii sferice. Schimbarea punctului de vedere transformă o direcție de vedere în sursa camerei în direcția de vedere corespunzătoare în cadrul de referință. Modelul găsește apoi coeficienții corespunzători pentru a găsi funcția de culoare transformată. Modelul este capabil să facă acest lucru deoarece, sub rotație, armonicii sferice sunt închise, împreună cu orice altă ordine.
Arhitectură de rețea neuronală
Majoritatea arhitecturii predictorului care mapă imaginea de intrare la amestecul de Gaussiane este identică cu procesul utilizat în cadrul SongUNet. Stratul final din arhitectură este înlocuit cu un strat de convoluție 1×1 cu modelul de culoare care determină lățimea canalelor de ieșire. Dată imaginea de intrare, rețeaua produce un tensor de canal de ieșire ca ieșire, iar pentru fiecare canal de pixel, codifică parametrii care sunt ulterior transformați în offset, opacitate, rotație, adâncime și culoare. Cadrul utilizează apoi funcții neliniare pentru a activa parametrii și a obține parametrii Gaussiani.
Pentru a reconstrui reprezentări 3D cu mai multe vedere, cadrul Imaginea Splatter aplică aceeași rețea la fiecare vedere de intrare și, ulterior, utilizează abordarea punctului de vedere pentru a combina reconstrucțiile individuale. Mai mult, pentru a facilita coordonarea și schimbul eficient de informații între vedere în rețea, cadrul Imaginea Splatter face două modificări în rețea. Prima, cadrul condiționează modelul cu poziția camerei și trece vectori prin codarea fiecărui intrării utilizând o încorporare pozițională sinusoidală, rezultând multiple dimensiuni. A doua, cadrul adaugă straturi de atenție reciprocă pentru a facilita comunicarea între caracteristicile diferitelor vedere.
Imaginea Splatter: Experimente și Rezultate
Cadrul Imaginea Splatter măsoară calitatea reconstrucțiilor sale prin evaluarea calității sintezei de vedere nouă, deoarece cadrul utilizează priveliștea sursă și renderizează forma 3D pentru a vizualiza priveliștile țintă pentru a efectua reconstrucții. Cadrul evaluează performanța sa prin măsurarea scorurilor SSIM sau asemănării structurale, a raportului semnal-zgomot sau PSNR și a scorurilor de calitate perceptuală sau LPIPS.
Performanța reconstrucției 3D cu o singură vedere
Tabelul de mai jos demonstrează performanța modelului Imaginea Splatter în sarcina de reconstrucție 3D cu o singură vedere pe benchmark-ul ShapeNet.

Așa cum se poate observa, cadrul Imaginea Splatter depășește toate metodele de reconstrucție deterministice în ceea ce privește scorurile LPIPS și SSIM. Scorurile indică faptul că modelul Imaginea Splatter generează imagini cu reconstrucții mai clare. Mai mult, modelul Imaginea Splatter depășește, de asemenea, toate metodele de bază deterministice în ceea ce privește scorul PSNR, ceea ce indică faptul că reconstrucțiile generate sunt, de asemenea, mai precise. Mai mult, pe lângă faptul că depășește toate metodele deterministe, cadrul Imaginea Splatter necesită doar poziții de cameră relative pentru a-și îmbunătăți eficiența atât în faza de antrenament, cât și în faza de testare.
Imaginea de mai jos demonstrează puterea calitativă a cadrului Imaginea Splatter, iar, așa cum se poate vedea, modelul generează reconstrucții cu geometrii subțiri și interesante și capturează detaliile priveliștilor condiționate.

Imaginea de mai jos arată că reconstrucțiile generate de cadrul Imaginea Splatter nu numai că sunt mai clare, dar au și o precizie mai bună decât modelele anterioare, în special în condiții neconvenționale cu structuri subțiri și vizibilitate limitată.

Reconstrucția 3D multi-vizuală
Pentru a evalua capacitățile sale de reconstrucție 3D multi-vizuală, cadrul Imaginea Splatter este antrenat pe setul de date SpaneNet-SRN Cars pentru predicții cu două vedere. Metodele existente utilizează condiționarea poziției absolute a camerei pentru sarcini de reconstrucție 3D multi-vizuală, ceea ce înseamnă că modelul învață să se bazeze în primul rând pe orientarea canonică a obiectului în obiect. Deși face treaba, limitează aplicabilitatea modelelor, deoarece poziția absolută a camerei este adesea necunoscută pentru o nouă imagine a unui obiect.

Gânduri finale
În acest articol, am discutat despre Imaginea Splatter, o metodă care își propune să atingă reconstrucția ultra-rapidă a formei și aspectului 3D al obiectelor. La nivelul său central, cadrul Imaginea Splatter utilizează metoda de stropire Gaussiană pentru a analiza reprezentările 3D, beneficiind de viteza și calitatea pe care le oferă. Cadrul Imaginea Splatter procesează imagini utilizând o arhitectură 2D CNN standard pentru a prezice o imagine pseudo care conține un Gaussian colorat pentru fiecare pixel. Prin utilizarea metodei de stropire Gaussiană, cadrul Imaginea Splatter este capabil să combine renderingul rapid cu inferența rapidă, ceea ce duce la antrenament rapid și evaluare mai rapidă pe benchmark-uri reale și sintetice.












