Modele i platformy AI
Obraz Rozpryskowy: Próba Ultra-Szybkiej Rekonstrukcji 3D z Jednego Widoku
Rekonstrukcja 3D obiektów z jednego widoku z użyciem sieci konwolucyjnych wykazała zdumiewające możliwości. Modele rekonstrukcji 3D z jednego widoku generują model 3D dowolnego obiektu przy użyciu jednego obrazu jako odniesienia, co czyni ją jednym z najgorętszych tematów badań w dziedzinie widzenia komputerowego.

Na przykład, rozważmy motocykl na powyższym obrazie. Generowanie jego struktury 3D wymaga złożonego potoku, który najpierw łączy sygnały z niskopoziomowych obrazów z informacjami semantycznymi na wysokim poziomie, a także wiedzą o strukturalnym układzie części.
Ze względu na złożony proces, rekonstrukcja 3D z jednego widoku była głównym wyzwaniem w dziedzinie widzenia komputerowego. W celu poprawy wydajności rekonstrukcji 3D z jednego widoku, deweloperzy pracowali nad Obrazem Rozpryskowym, metodyką, która ma na celu osiągnięcie ultra-szybkiej rekonstrukcji kształtu 3D i wyglądu 3D obiektów. Podstawą ramy Obrazu Rozpryskowego jest metoda rozpryskiwania Gaussa, która wykorzystuje szybkość i jakość, jakie oferuje.
Ostatnio metoda rozpryskiwania Gaussa została zaimplementowana przez wiele modeli rekonstrukcji wielowidokowej w celu renderowania w czasie rzeczywistym, zwiększenia skali i szybkiego treningu. Jednakże, Obraz Rozpryskowy jest pierwszą ramą, która implementuje metodę rozpryskiwania Gaussa dla zadań rekonstrukcji z jednego widoku.
W tym artykule będziemy eksplorować, jak rama Obrazu Rozpryskowego wykorzystuje metodę rozpryskiwania Gaussa do osiągnięcia ultra-szybkiej rekonstrukcji 3D z jednego widoku. Zatem, zacznijmy.
Obraz Rozpryskowy: Próba Ultra-Szybkiej Rekonstrukcji 3D z Jednego Widoku
Jak wcześniej wspomniano, Obraz Rozpryskowy jest ultra-szybkim podejściem do rekonstrukcji 3D obiektów z jednego widoku opartym na metodzie rozpryskiwania Gaussa. Obraz Rozpryskowy jest pierwszą ramą wizji komputerowej, która implementuje rozpryskiwanie Gaussa dla generacji monocularnej 3D, ponieważ tradycyjnie rozpryskiwanie Gaussa napędzało ramy rekonstrukcji 3D z wielu widoków. Jednak to, co odróżnia ramę Obrazu Rozpryskowego od poprzednich metod, jest to, że jest to podejście oparte na uczeniu, a rekonstrukcja podczas testowania wymaga tylko feed-forward oceny sieci neuronowej.
Obraz Rozpryskowy opiera się fundamentalnie na jakości renderowania rozpryskiwania Gaussa i wysokiej szybkości przetwarzania do generowania rekonstrukcji 3D. Rama Obrazu Rozpryskowego ma prosty design: rama używa sieci neuronowej obrazu do obrazu 2D, aby przewidzieć 3D Gaussa na każdy piksel wejściowego obrazu, a następnie mapuje wejściowy obraz na jeden 3D Gaussa na piksel. Wynikowe 3D Gaussy mają postać obrazu, zwanego Obrazem Rozpryskowym, a także zapewniają reprezentację 360 stopni obrazu. Proces jest pokazany na poniższym obrazie.

Chociaż proces jest prosty i bezpośredni, istnieją pewne kluczowe wyzwania, z którymi rama Obrazu Rozpryskowego musi się zmierzyć przy użyciu rozpryskiwania Gaussa do generowania 3D Gaussów dla reprezentacji 3D z jednego widoku. Pierwszą główną przeszkodą jest zaprojektowanie sieci neuronowej, która akceptuje obraz obiektu jako wejście i generuje odpowiednią mieszaninę Gaussa reprezentującą wszystkie strony obrazu jako wyjście. Aby rozwiązać ten problem, Obraz Rozpryskowy wykorzystuje fakt, że nawet jeśli wygenerowana mieszanina Gaussa jest zestawem lub nieuporządkowaną kolekcją elementów, może być nadal przechowywana w uporządkowanej strukturze danych. Stąd rama używa obrazu 2D jako pojemnika dla 3D Gaussów, w wyniku czego każdy piksel w pojemniku zawiera parametry jednego Gaussa, w tym jego właściwości, takie jak kształt, nieprzezroczystość i kolor.
Przechowywując zestawy 3D Gaussa w obrazie, rama Obrazu Rozpryskowego jest w stanie zmniejszyć przeszkody rekonstrukcyjne, z którymi mamy do czynienia podczas uczenia sieci neuronowej obrazu do obrazu. Używając tego podejścia, proces rekonstrukcji może być zaimplementowany tylko przy użyciu wydajnych operatorów 2D, zamiast polegania na operatorach 3D. Ponadto, w ramie Obrazu Rozpryskowego reprezentacja 3D jest mieszaniną 3D Gaussów, co pozwala na wykorzystanie szybkości renderowania i efektywności pamięci oferowanych przez rozpryskiwanie Gaussa, co zwiększa wydajność zarówno w treningu, jak i w inferencji. Przechodząc dalej, rama Obrazu Rozpryskowego nie tylko generuje reprezentacje 3D z jednego widoku, ale także wykazuje zdumiewającą wydajność, ponieważ może być trenowana nawet na jednej karcie graficznej na standardowych benchmarkach 3D obiektów. Ponadto, rama Obrazu Rozpryskowego może być rozszerzona do przyjmowania kilku obrazów jako wejścia. Może to osiągnąć, rejestrując indywidualne mieszaniny Gaussa w odniesieniu do wspólnego odniesienia, a następnie łącząc mieszaniny Gaussa przewidywane z poszczególnych widoków. Rama wstrzykuje również lekkie warstwy uwagi krzyżowej w swojej architekturze, co pozwala różnym widokom komunikować się ze sobą podczas predykcji.
Z empirycznego punktu widzenia, warto zauważyć, że rama Obrazu Rozpryskowego może wygenerować rekonstrukcję 360 stopni obiektu, nawet jeśli widzi tylko jedną stronę obiektu. Rama przydziela różne Gaussy w sąsiedztwie 2D do różnych części 3D obiektu, aby zakodować wygenerowaną informację 360 stopni w obrazie 2D. Ponadto, rama ustawia nieprzezroczystość kilku Gaussów na zero, co dezaktywuje je, umożliwiając ich wycięcie podczas post-processingu.
Podsumowując, rama Obrazu Rozpryskowego jest
- Nowatorskim podejściem do generowania rekonstrukcji 3D obiektów z jednego widoku poprzez przeniesienie podejścia rozpryskiwania Gaussa.
- Rozszerza tę metodę na rekonstrukcję 3D obiektów z wielu widoków.
- Osiąga najlepsze wyniki w rekonstrukcji 3D obiektów na standardowych benchmarkach z wyjątkową szybkością i jakością.
Obraz Rozpryskowy: Metodologia i Architektura
Rozpryskiwanie Gaussa
Jak wcześniej wspomniano, rozpryskiwanie Gaussa jest podstawową metodą zaimplementowaną przez ramę Obrazu Rozpryskowego do generowania rekonstrukcji 3D obiektów z jednego widoku. W prostych słowach, rozpryskiwanie Gaussa jest metodą rasteryzacji do rekonstrukcji obrazów 3D i renderowania w czasie rzeczywistym, a także renderowania obrazów z wielu punktów widzenia. Przestrzeń 3D w obrazie jest odniesiona do Gaussów, a techniki uczenia maszynowego są zaimplementowane, aby nauczyć parametry każdego Gaussa. Rozpryskiwanie Gaussa nie wymaga treningu podczas renderowania, co ułatwia szybsze czasy renderowania. Poniższy obraz podsumowuje architekturę 3D rozpryskiwania Gaussa.

3D rozpryskiwanie Gaussa najpierw używa zestawu obrazów wejściowych do wygenerowania chmury punktów. Rozpryskiwanie Gaussa następnie używa obrazów wejściowych do oszacowania parametrów zewnętrznych kamery, takich jak nachylenie i położenie, poprzez dopasowanie pikseli między obrazami, a następnie używa tych parametrów do obliczenia chmury punktów. Używając różnych metod uczenia maszynowego, rozpryskiwanie Gaussa optymalizuje cztery parametry dla każdego Gaussa, a mianowicie: położenie (gdzie się znajduje), kowariancję (rozciąganie lub skalowanie w macierzy 3×3), kolor (jaki jest schemat kolorów RGB) i alfa (mierzącą przezroczystość). Proces optymalizacji renderuje obraz dla każdej pozycji kamery i używa go do określenia parametrów bliższych oryginalnemu obrazowi. W wyniku tego, wynikowy wyjściowy 3D rozpryskiwanie Gaussa jest obrazem, zwanym Obrazem Rozpryskowym, który najbardziej przypomina oryginalny obraz w pozycji kamery, z której został przechwycony.

Ponadto, funkcja nieprzezroczystości i funkcja koloru w rozpryskiwaniu Gaussa dają pole promieniowania z kierunkiem widzenia 3D punktu. Rama następnie renderuje pole promieniowania na obrazie, integrując kolory obserwowane wzdłuż promienia, który przechodzi przez piksel. Rozpryskiwanie Gaussa reprezentuje te funkcje jako kombinację kolorowych Gaussów, gdzie średnia Gaussa lub centrum wraz z kowariancją Gaussa pomaga w określeniu jego kształtu i rozmiaru. Każdy Gauss ma również właściwość nieprzezroczystości i właściwość koloru zależnego od widoku, które razem definiują pole promieniowania.
Obraz Rozpryskowy
Komponent renderujący mapuje zestaw 3D Gaussów na obraz. Aby wykonać rekonstrukcję 3D z jednego widoku, rama następnie szuka odwrotną funkcję dla 3D Gaussów, która rekonstruuje mieszaninę 3D Gaussów z obrazu. Kluczowym elementem jest tu zaproponowanie skutecznego, ale prostego projektu odwrotnej funkcji. W szczególności, dla obrazu wejściowego, rama przewiduje Gaussa dla każdego indywidualnego piksela przy użyciu architektury sieci neuronowej obrazu do obrazu, aby wygenerować obraz, Obraz Rozpryskowy. Sieć również przewiduje kształt, nieprzezroczystość i kolor.
Teraz można się spodziewać, jak rama Obrazu Rozpryskowego może wygenerować reprezentację 3D obiektu, nawet jeśli ma dostęp tylko do jednego z jego widoków? W czasie rzeczywistym, rama Obrazu Rozpryskowego uczy się używać niektórych dostępnych Gaussów do rekonstrukcji widoku i używa pozostałych Gaussów do automatycznego rekonstruowania niewidocznych części obrazu. Aby maksymalizować swoją wydajność, rama może automatycznie wyłączyć dowolne Gaussy, przewidując, czy nieprzezroczystość jest równa zero. Jeśli nieprzezroczystość jest równa zero, Gaussy są wyłączone, a rama nie renderuje tych punktów i są wycięte podczas post-processingu.
Strata na poziomie obrazu
Jedną z głównych zalet wykorzystania szybkości i efektywności oferowanych przez metodę rozpryskiwania Gaussa jest to, że umożliwia ramie wyrenderować wszystkie obrazy w każdej iteracji, nawet dla partii o stosunkowo większym rozmiarze partii. Ponadto, oznacza to, że rama może nie tylko używać strat rozłożonych, ale również strat na poziomie obrazu, które nie rozkładają się na straty na piksel.
Normalizacja skali
Jest to trudne do oszacowania rozmiaru obiektu, patrząc na jeden widok, i jest to trudne zadanie, aby rozwiązać tę niejasność, gdy jest trenowany z stratą. Ten sam problem nie jest obserwowany w zbiorach syntetycznych, ponieważ wszystkie obiekty są renderowane z identycznymi parametrami wewnętrznymi kamery i obiekty są w stałej odległości od kamery, co ostatecznie pomaga w rozwiązaniu niejasności. Jednak w zbiorach z obrazami rzeczywistymi niejasność jest dość wyraźna, a rama Obrazu Rozpryskowego zastosowała kilka metod wstępnego przetwarzania, aby przybliżyć skalę wszystkich obiektów.
Kolor zależny od widoku
Aby reprezentować kolory zależne od widoku, rama Obrazu Rozpryskowego używa harmonik sferycznych, aby uogólnić kolory poza modelem koloru lambertowskiego. Dla każdego konkretnego Gaussa, model definiuje współczynniki, które są przewidywane przez sieć i harmoniki sferyczne. Zmiana punktu widzenia przekształca kierunek widzenia 3D punktu w kierunek odniesienia. Model znajduje odpowiednie współczynniki, aby znaleźć przekształconą funkcję koloru. Model może to zrobić, ponieważ harmoniki sferyczne są zamknięte podczas rotacji, wraz z każdym innym porządkiem.
Architektura sieci neuronowej
Większość architektury przewidywania, która mapuje obraz wejściowy na mieszaninę Gaussa, jest identyczna z procesem używanym w ramie SongUNet. Ostatnia warstwa w architekturze jest zastąpiona przez warstwę konwolucyjną 1×1 z modelem koloru, który określa szerokość kanałów wyjściowych. Dla danego obrazu wejściowego, sieć wytwarza tensor kanałów wyjściowych jako wyjście, a dla każdego kanału pikselowego koduje parametry, które są następnie przekształcane w przesunięcie, nieprzezroczystość, rotację, głębokość i kolor. Rama następnie używa nieliniowych funkcji, aby aktywować parametry i uzyskać parametry Gaussa.
Do rekonstrukcji 3D z wielu widoków, rama Obrazu Rozpryskowego stosuje tę samą sieć do każdego widoku wejściowego, a następnie używa podejścia punktu widzenia, aby połączyć indywidualne rekonstrukcje. Ponadto, aby ułatwić efektywną koordynację i wymianę informacji między widokami w sieci, rama Obrazu Rozpryskowego wprowadza dwie modyfikacje w sieci. Po pierwsze, rama warunkuje model jego odpowiednim położeniem kamery i przechodzi wektory, kodując każdy wpis przy użyciu sinusoidalnego osadzania pozycyjnego, co skutkuje wieloma wymiarami. Po drugie, rama dodaje warstwy uwagi krzyżowej, aby umożliwić komunikację między cechami różnych widoków.
Obraz Rozpryskowy: Eksperymenty i Wyniki
Rama Obrazu Rozpryskowego mierzy jakość swoich rekonstrukcji, oceniając jakość syntezy nowego widoku, ponieważ rama używa widoku źródłowego i renderuje kształt 3D, aby wykonać rekonstrukcję do niewidocznych celów. Rama ocenia swoją wydajność, mierząc SSIM lub podobieństwo strukturalne, PSNR lub współczynnik sygnału do szumu i jakość percepcyjną lub wyniki LPIPS.
Wydajność rekonstrukcji 3D z jednego widoku
Poniższa tabela pokazuje wyniki ramy Obrazu Rozpryskowego w zadaniu rekonstrukcji 3D z jednego widoku na benchmarku ShapeNet.

Jak można zobaczyć, rama Obrazu Rozpryskowego przewyższa wszystkie metody rekonstrukcji deterministycznych w wynikach LPIPS i SSIM. Wyniki wskazują, że model Obrazu Rozpryskowego generuje obrazy z ostrzejszymi rekonstrukcjami. Ponadto, model Obrazu Rozpryskowego przewyższa wszystkie metody rekonstrukcji deterministyczne pod względem wyniku PSNR, co wskazuje, że wygenerowane rekonstrukcje są również bardziej dokładne. Ponadto, oprócz przewyższania wszystkich metod deterministycznych, rama Obrazu Rozpryskowego wymaga tylko względnych pozycji kamery, aby zwiększyć swoją wydajność zarówno w treningu, jak i w fazie testowej.
Poniższy obraz pokazuje jakościową wydajność ramy Obrazu Rozpryskowego, a jak można zobaczyć, model generuje rekonstrukcje z cienkimi i interesującymi geometriami, a także ujmuje szczegóły widoku warunkowego.

Poniższy obraz pokazuje, że rekonstrukcje wygenerowane przez ramę Obrazu Rozpryskowego nie tylko są ostrzejsze, ale również mają lepszą dokładność niż poprzednie modele, szczególnie w nietypowych warunkach z cienkimi strukturami i ograniczoną widocznością.

Rekonstrukcja 3D z wielu widoków
Aby ocenić swoje możliwości rekonstrukcji 3D z wielu widoków, rama Obrazu Rozpryskowego jest trenowana na zbiorze danych SpaneNet-SRN Cars do predykcji z dwóch widoków. Istniejące metody używają warunkowania absolutnej pozycji kamery dla zadań rekonstrukcji 3D z wielu widoków, co oznacza, że model uczy się polegać głównie na kanonicznym ukierunkowaniu obiektu w obiekcie. Chociaż to działa, ogranicza to stosowalność modeli, ponieważ absolutna pozycja kamery jest często nieznana dla nowego obrazu obiektu.

Końcowe myśli
W tym artykule omawialiśmy Obraz Rozpryskowy, metodę, która ma na celu osiągnięcie ultra-szybkiej rekonstrukcji kształtu 3D i wyglądu 3D obiektów. Podstawą ramy Obrazu Rozpryskowego jest metoda rozpryskiwania Gaussa, która wykorzystuje szybkość i jakość, jakie oferuje. Rama Obrazu Rozpryskowego przetwarza obrazy przy użyciu standardowej architektury 2D CNN, aby przewidzieć pseudo-obraz, który zawiera jeden kolorowy Gauss dla każdego piksela. Używając metody rozpryskiwania Gaussa, rama Obrazu Rozpryskowego jest w stanie połączyć szybkie renderowanie z szybką inferencją, co skutkuje szybkim treningiem i szybszą oceną na rzeczywistych i syntetycznych benchmarkach.












