Modele și platforme AI

Părți Neuronale: Descompunerea Primitivelor pentru Geometrie Inferată Semnificativă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În timp ce sistemele capabile să genereze geometrie 3D din imagini statice au proliferat în ultimii ani, obiectele pe care le obțin tendință să fie “fuzionate” împreună, fără niciun schema semantică reală pentru a reflecta modul în care părțile contribuie la întreg.

Există multe motive bune pentru a genera modele ierarhice inferate cu o diviziune semnificativă a părților, inclusiv analiza industrială, cercetarea medicală și aplicațiile de imagistică, generarea automată a geometriei pentru jocuri video, simulatoare și medii VR/AR, precum și efecte vizuale de asamblare, printre altele.

Multe metode dezvoltate în ultimii ani, cum ar fi Superquadrics shape parsing, produc rezultate mai puțin satisfăcătoare și au luptat pentru a face progrese în stadiul actual dincolo de tăierea indicativă cuboidă.

Segmentarea prin Superquadrics și alte abordări oferă sub-părți grosiere sau reprezentative pentru o imagine inferată. Sursă: https://www.youtube.com/watch?v=6WK3B0IZJsw

Segmentarea prin Superquadrics și alte abordări oferă sub-părți grosiere sau reprezentative pentru o imagine inferată. Sursă: https://www.youtube.com/watch?v=6WK3B0IZJsw

Însă, o nouă cercetare de la Institutul Max Planck, intitulată Părți Neuronale: Învățarea de Abstracții de Forme 3D Expresive cu Rețele Neuronale Inversabile, oferă un nou sistem de reprezentare neurală a primitivelor 3D care creează secțiuni semantic utilă.

Metodele anterioare pot descompune obiecte mari inferate, dar nu într-un mod semantic util. La dreapta, metoda Părți Neuronale creează fragmente mai practice. Sursă: https://paschalidoud.github.io/neural_parts

Metodele anterioare pot descompune obiecte mari inferate, dar nu într-un mod semantic util. La dreapta, metoda Părți Neuronale creează fragmente mai practice. Sursă: https://paschalidoud.github.io/neural_parts

Segmentarea se realizează prin intermediul unei rețele neuronale inversabile (INN), care utilizează homeomorfism condițional pentru a deforma o formă geometrică de bază în primitive și viceversa, calculând ierarhia topologică în ambele direcții. În acest fel, fiecare formă primitivă este asociată cu o încorporare primitivă invățabilă pentru a genera încorporarea formei pentru acea primitivă.

Arhitectură

Părți Neuronale trebuie să găsească un echilibru între calitatea reconstrucției și integritatea primitivelor, deoarece primitivele complexe vor tendința sistemului către deconstrucții complexe. Prin urmare, arhitectura Părților Neuronale a fost proiectată pentru a străbate aceste considerații contradictorii într-un mod elegant.

Arhitectura Părților Neuronale constă dintr-un extractor de caracteristici care mapăază intrarea unui vector și o componentă de homeomorfism condițional care învață homeomorfisme condiționate de încorporarea formei.

Prima secțiune a extractorului de caracteristici utilizează o componentă ResNet-18 pentru a extrage imagini de caracteristici. Componenta de homeomorfism condițional utilizează un modul de transformare reală non-volum-păstrătoare (real NVP).

Evaluare

Sistemul a fost testat împotriva a trei seturi de date – 2017’s Dynamic FAUST (D-FAUST), FreiHAND (2019) și setul de date popular al Universității Stanford din 2015 ShapeNet. D-FAUST conține 38.640 de rețele umane centrate, care s-au dovedit a fi potrivite pentru comparație, în timp ce primele 5000 de poziții ale mâinii din FreiHAND au fost utilizate pentru a genera rețele. Pentru ShapeNet, cercetătorii au urmat aceeași procedură de antrenament specifică categoriilor, așa cum au făcut cercetătorii de la Stanford în 2016.

Testele au fost efectuate împotriva metodelor bazate pe primitive, inclusiv superquadrics, CvxNet și H-SQs.

Sub ShapeNet, cercetătorii au constatat că modelul Părți Neuronale a rezultat în reconstrucții mai precise decât CvxNet la un nivel de 5 și 25 de primitive. Unele dintre obiectele mai simple din baza de date, cum ar fi scaunele, nu conțineau suficientă geometrie pentru o deconstrucție semnificativă.

Pentru FreiHAND, Părți Neuronale au rezultat în reconstrucții geometric mai precise, cu o captură mai bună a detaliilor fine, cum ar fi poziția degetului mare. Cercetătorii notează că, în comparație, CvxNet și SQs se concentrează mai mult pe structura de bază generală și lipsesc aceste detalii.

Pentru Dynamic FAUST, CvxNet și SQs au fost comparate cu rezultatele Părților Neuronale utilizând cinci primitive pentru a captura integritatea corpului uman inițial inferat din date. Părți Neuronale au reușit să obțină o segmentare mai netedă, fără a sacrifica esența topologiei.

Lucrări Viitoare

Cercetătorii intenționează să extindă Părți Neuronale la studii care nu oferă direct rețele țintă, prin utilizarea tehniciilor de randare diferențiabile. Deoarece o sferă de bază este primitiva curentă utilizată în cadrul Părților Neuronale, cercetătorii examinează, de asemenea, utilizarea unor primitive geometrice mai complexe și mai expresive.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai