AI-modeller og plattformer

Neurale deler: Nedbryting av primitiver for meningsfull inferert geometri

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Mens systemer som kan generere 3D-geometri fra statiske enkeltbilder har blitt mer vanlige de siste årene, tenderer objektene de får til å være “sammenslått” uten noen virkelig semantisk skjema som reflekterer hvordan delene bidrar til helheten.

Det finnes flere gode grunner til å generere hierarkiske infererte modeller med en meningsfull oppdeling av deler, inkludert industriell analyse, medisinsk forskning og bildeapplikasjoner, automatisk generering av geometri for videospill, simulatorer og VR/AR-miljøer, og visuelle effekter, blant andre.

Mange metoder som er utviklet de siste årene, som Superquadrics-formparsning, har gitt mindre tilfredsstillende resultater og har slitt med å fremme tilstanden for kunsten utover cuboid-stil indikativt skjæring.

Segmentering ved Superquadrics og andre tilnærminger gir grove eller bredt representasjonelle underdeler til en inferert bilde. Kilde: https://www.youtube.com/watch?v=6WK3B0IZJsw

Segmentering ved Superquadrics og andre tilnærminger gir grove eller bredt representasjonelle underdeler til en inferert bilde. Kilde: https://www.youtube.com/watch?v=6WK3B0IZJsw

Men ny forskning fra Max Planck-instituttet, med tittelen Neurale deler: Læring av uttrykksfulle 3D-formabstraksjoner med invertible neurale nettverk, tilbyr et nytt neuralt primitivt 3D-representasjonssystem som skaper semantisk nyttige seksjoner.

Tidligere metoder kan dekomponere store infererte objekter, men ikke på en semantisk nyttig måte. Til høyre, Neurale deler-metoden skaper mer praktiske fragmenter. Kilde: https://paschalidoud.github.io/neural_parts

Tidligere metoder kan dekomponere store infererte objekter, men ikke på en semantisk nyttig måte. Til høyre, Neurale deler-metoden skaper mer praktiske fragmenter. Kilde: https://paschalidoud.github.io/neural_parts

Segmenteringen oppnås via et invertiblet neuralt nettverk (INN), som bruker betinget homeomorfisme for å deformere en basisgeometrisk form til primitiver, og vice versa, og beregner den topologiske hierarkiet i begge retninger. På denne måten assosieres hver primitiv form med en lærbart primitiv innlegg for å generere forminnlegget for den primitive.

Arkitektur

Neurale deler må finne en balanse mellom rekonstruksjonskvalitet og primitiv integritet, siden komplekse primitiver vil tendere systemet mot komplekse dekonstruksjoner. Derfor er arkitekturen til Neurale deler designet for å straddle disse motsigelser i en elegant måte.

Neurale deler-arkitekturen består av en funksjonsuttrekker som kartlegger inndata til en vektor, og en betinget homeomorfikomponent som lærer homeomorfiske kartlegginger som er betinget av forminnlegget.

Den første delen av funksjonsuttrekkeren bruker en ResNet-18-komponent for å trekke ut funksjonsbilder. Den betingede homeomorfikomponenten bruker en realverdi non-volume-bevarende (real NVP)-transformasjonsmodul.

Evaluering

Systemet ble testet mot tre datasett – 2017s Dynamisk FAUST (D-FAUST), FreiHAND (2019) og Stanford Universitys populære 2015 ShapeNet. D-FAUST inneholder 38 640 menneskesentriske nett, som viste seg å være egnet for sammenligningen, mens de første 5000 håndposisjonene i FreiHAND ble brukt til å generere nett. For ShapeNet fulgte forskerne den samme kategorispecifikke trening som Stanford-forskerne i 2016.

Testene ble kjørt mot primitivbaserte metoder, inkludert superquadrics, CvxNet og H-SQs.

Under ShapeNet fant forskerne at Neurale deler-modellen resulterte i mer nøyaktige rekonstruksjoner enn CvxNet på et nivå av både 5 og 25 primitiver. Noen av de enklere objektene i databasen, som stoler, inneholdt ikke nok geometri for en meningsfull dekonstruksjon.

For FreiHAND resulterte Neurale deler i mer geometrisk nøyaktige rekonstruksjoner, med bedre fanging av fine detaljer som tommelposisjon. Forskerne bemerker at i sammenligning er CvxNet og SQs mer fokusert på den generelle kjernestrukturen og mangler disse detaljene.

For Dynamisk FAUST ble CvxNet og SQs sammenlignet med utgangen av Neurale deler ved å bruke fem primitiver for å fange integriteten av den menneskelige kroppen som ble inferert fra dataene. Neurale deler kunne oppnå glattere segmentering uten å ofre essensiell topologi.

Fremtidig arbeid

Forskerne har til hensikt å utvide Neurale deler til studier som ikke direkte tilbyr målnett, ved å bruke differensierbar renderingsteknikker. Siden en basekule er den nåværende primitive som brukes i Neurale deler-rammeverket, vurdere forskerne også å bruke mer komplekse og uttrykksfulle geometriske primitiver.

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai