Modele i platformy AI

Części Neuronowe: Rozbijanie Prymitywów dla Znaczącej Wywnioskowanej Geometrii

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Pomimo że systemy zdolne do generowania geometrii 3D z pojedynczych statycznych obrazów rozprzestrzeniły się w ostatnich latach, obiekty, które uzyskują, mają tendencję do być “połączone”, bez żadnej prawdziwej semantycznej schemy, która odzwierciedla, jak części przyczyniają się do całości.

Istnieje wiele dobrych powodów, aby generować hierarchiczne wywnioskowane modele z znaczącym podziałem części, w tym analizę przemysłową, badania medyczne i aplikacje obrazowania, automatyczne generowanie geometrii dla gier wideo, symulatorów i środowisk VR/AR, oraz rigging efektów wizualnych, między innymi.

Wiele metod opracowanych w ostatnich latach, takich jak Superquadrics shape parsing, daje mniej niż satysfakcjonujące wyniki i mają trudności z postępem stanu sztuki poza cuboid-style indicative slicing.

Segmentacja przez Superquadrics i inne podejścia dostarczają gruboziarniste lub szeroko reprezentatywne podczęści do wywnioskowanego obrazu. Źródło: https://www.youtube.com/watch?v=6WK3B0IZJsw

Segmentacja przez Superquadrics i inne podejścia dostarczają gruboziarniste lub szeroko reprezentatywne podczęści do wywnioskowanego obrazu. Źródło: https://www.youtube.com/watch?v=6WK3B0IZJsw

Jednak nowe badania z Max Planck Institute, zatytułowane Części Neuronowe: Uczenie Wyrażonych Abstrakcji Kształtu 3D z Odwracalnymi Sieciami Neuronowymi, oferują nowy system reprezentacji prymitywnej 3D, który tworzy semantycznie użyteczne sekcje.

Poprzednie metody mogą rozkładać duże wywnioskowane obiekty, ale nie w sposób semantycznie użyteczny. Po prawej stronie, metoda Części Neuronowych tworzy bardziej praktyczne fragmenty. Źródło: https://paschalidoud.github.io/neural_parts

Poprzednie metody mogą rozkładać duże wywnioskowane obiekty, ale nie w sposób semantycznie użyteczny. Po prawej stronie, metoda Części Neuronowych tworzy bardziej praktyczne fragmenty. Źródło: https://paschalidoud.github.io/neural_parts

Segmentacja jest osiągana za pomocą Odwracalnej Sieci Neuronowej (INN), która używa warunkowej homeomorfizmu do deformacji podstawowego kształtu geometrycznego w prymitywy i odwrotnie, obliczając hierarchię topologiczną w obu kierunkach. W ten sposób każda prymitywna forma jest skojarzona z nauczalnym prymitywnym osadzeniem w celu wygenerowania osadzenia kształtu dla tej prymitywy.

Architektura

Części Neuronowe muszą znaleźć równowagę między jakością rekonstrukcji a integralnością prymitywów, ponieważ złożone prymitywy będą skłaniać system w kierunku złożonych dekonstrukcji. Dlatego architektura Części Neuronowych została zaprojektowana w taki sposób, aby godzić te sprzeczne rozważania w elegancki sposób.

Architektura Części Neuronowych składa się z ekstraktora cech, który mapuje wejście wektora, oraz składowej warunkowej homeomorfizmu, która uczy homeomorficznych mapowań warunkowanych przez osadzenie kształtu.

Początkowa sekcja ekstraktora cech używa komponentu ResNet-18 do wyodrębnienia obrazów cech. Składowa warunkowej homeomorfizmu używa modułu transformacji o wartościach rzeczywistych niezachowujących objętość (real NVP).

Ocena

System został przetestowany na trzech zestawach danych – Dynamic FAUST z 2017 roku (D-FAUST), FreiHAND (2019) oraz popularny zestaw danych Stanford University z 2015 roku ShapeNet. D-FAUST zawiera 38 640 ludzkich centrów siatkowych, co okazało się odpowiednie do porównania, podczas gdy pierwsze 5000 pozycji dłoni w FreiHAND zostało użytych do wygenerowania siatek. Dla ShapeNet, badacze postępowali zgodnie z tą samą specyfikacją kategorii szkoleniowych, jak opisali badacze z Stanfordu w 2016 roku.

Testy zostały przeprowadzone wobec metod opartych na prymitywach, w tym superkwadratów, CvxNet oraz H-SQs.

W przypadku ShapeNet, badacze stwierdzili, że model Części Neuronowych daje bardziej dokładne rekonstrukcje niż CvxNet na poziomie 5 i 25 prymitywów. Niektóre z prostszych obiektów w bazie danych, takich jak krzesła, nie zawierały wystarczającej ilości geometrii do znaczącej dekonstrukcji.

Dla FreiHAND, Części Neuronowe dają bardziej geometrycznie dokładne rekonstrukcje, z lepszym uchwyceniem drobnych szczegółów, takich jak położenie kciuka. Badacze zauważają, że w porównaniu z CvxNet i SQ, brakuje im tych szczegółów.

Dla Dynamic FAUST, CvxNet i SQ zostały porównane z wynikami Części Neuronowych przy użyciu pięciu prymitywów do uchwycenia integralności ludzkiego ciała, początkowo wywnioskowanego z danych. Części Neuronowe były w stanie osiągnąć gładkie segmentacje, bez poświęcania podstawowych elementów topologii.

Przyszła Praca

Badacze zamierzają rozszerzyć Części Neuronowe do badań, które nie oferują bezpośrednio docelowych siatek, za pomocą techniki renderowania różniczkowego. Ponieważ bieżąca prymitywna forma jest obecnie wykorzystywana w ramach Części Neuronowych, badacze rozważają również użycie bardziej złożonych i wyrazistych prymitywów geometrycznych.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai