Andersons vinkel

Mot sanntids AI-mennesker med Neural Lumigraph Rendering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Neural Lumigraph Rendering

Til tross for den nåværende bølgen av interesse for Neural Radiance Fields (NeRF), en teknologi som kan lage AI-genererte 3D-miljøer og objekter, krever denne nye tilnærmingen til bildesynthese-teknologi fortsatt en stor del trenings tid, og mangler en implementering som muliggjør sanntids-, høyresponsive grensesnitt.

Likevel tilbyr et samarbeid mellom noen imponerende navn i industri og akademia en ny tilnærming til denne utfordringen (generisk kjent som Novel View Synthesis, eller NVS).

Forsknings artikkelen, med tittelen Neural Lumigraph Rendering, hevder en forbedring på nåværende tilstand på om lag to størrelsesordener, og representerer flere skritt mot sanntids CG-rendering via maskinlæringsrørledninger.

Neural Lumigraph Rendering (høyre) tilbyr bedre oppløsning av blandingseffekter og forbedret håndtering av okklusjon enn tidligere metoder. Kilde: https://www.youtube.com/watch?v=maVF-7x9644

Neural Lumigraph Rendering (høyre) tilbyr bedre oppløsning av blandingseffekter og forbedret håndtering av okklusjon enn tidligere metoder. Kilde.

Selv om kreditter for artikkelen bare nevner Stanford University og holografisk displayteknologiselskapet Raxium (nåværende opererer i stealth-modus), inkluderer bidragsyterne en hovedmaskinlærings arkitekt i Google, en datavitenskapsmann i Adobe, og CTO i StoryFile (som nylig lagde overskrifter med en AI-versjon av William Shatner).

I forhold til den nylige Shatner-publisitetsblitz, ser det ut til at StoryFile anvender NLR i sin nye prosess for å lage interaktive, AI-genererte enheter basert på karakteristika og narrativer til enkeltpersoner.

StoryFile ser for seg bruken av denne teknologien i museumsutstillinger, online interaktive narrativer, holografiske skjermer, augmented reality (AR) og kulturarv-dokumentasjon – og ser også ut til å vurdere potensielle nye anvendelser av NLR i rekrutteringsintervjuer og virtuelle datingapplikasjoner:

Forslag til anvendelser fra en onlinevideo av StoryFile. Kilde: https://www.youtube.com/watch?v=2K9J6q5DqRc

Forslag til anvendelser fra en onlinevideo av StoryFile. Kilde: https://www.youtube.com/watch?v=2K9J6q5DqRc

Volumetrisk fangst for nytt synsintese-grensesnitt og video

Prinsippet om volumetrisk fangst, over hele rekken av artikler som samler på dette emnet, er ideen om å ta stillbilder eller videoer av et objekt, og bruke maskinlæring til å “fylle ut” de synsvinklene som ikke var dekket av den opprinnelige kameraarrayen.

Kilde: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Kilde: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

I bildet over, tatt fra Facebooks AI-forskning i 2019 (se nedenfor), ser vi de fire stadiene av volumetrisk fangst: flere kamere tar bilder/filmer; encoder/decoder-arkitektur (eller andre arkitekturer) beregner og konkatenerer relativiteten av synsvinkler; ray-marching-algoritmer beregner voxelene (eller andre XYZ-romgeometriske enheter) for hvert punkt i det volumetriske rommet; og (i de fleste nyere artikler) trening skjer for å syntetisere en fullstendig enhet som kan manipuleres i sanntid.

Det er denne ofte omfattende og data-tyngde treningsfasen som har, til nå, holdt nytt synsintese utenfor sanntids- eller høyresponsiv fangst.

Faktum at nytt synsintese lager en fullstendig 3D-kart over et volumetrisk rom betyr at det er relativt enkelt å sy sammen disse punktene til en tradisjonell datagenerert mesh, og effektivt fange og artikulere en CGI-menneske (eller noe annet relativt begrenset objekt) på fly.

Tilnærmingene som bruker NeRF avhenger av punktskyer og dybdekarter for å generere interpolasjonene mellom de sparsomme synsvinklene til fangstenehetene:

NeRF kan generere volumetrisk dybde gjennom beregning av dybdekarter, snarere enn generering av CG-mesh. Kilde: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF kan generere volumetrisk dybde gjennom beregning av dybdekarter, snarere enn generering av CG-mesh. Kilde: https://www.youtube.com/watch?v=JuH79E8rdKc

Selv om NeRF er i stand til å beregne mesh, bruker de fleste implementeringer ikke dette for å generere volumetriske scener.

I motsetning til dette bruker Implicit Differentiable Renderer (IDR)-tilnærmingen, publisert av Weizmann Institute of Science i oktober 2020, utnytter 3D-mesh-informasjon som automatisk genereres fra fangstarrayene:

Eksempler på IDR-fangster omgjort til interaktive CGI-mesh. Kilde: https://www.youtube.com/watch?v=C55y7RhJ1fE

Eksempler på IDR-fangster omgjort til interaktive CGI-mesh. Kilde: https://www.youtube.com/watch?v=C55y7RhJ1fE

mens NeRF mangler IDRs evne til formestimering, kan IDR ikke matche NeRFs bildekvalitet, og begge krever omfattende ressurser for å trene og samle (selv om nyere innovasjoner i NeRF begynner å adresse dette).

NLRs tilpassede kamerarigging med 16 GoPro HERO7 og 6 sentrale Back-Bone H7PRO-kamere. For 'sanntids'-rendering, opererer disse med en minimumsfrekvens på 60fps. Kilde: https://arxiv.org/pdf/2103.11571.pdf

NLRs tilpassede kamerarigging med 16 GoPro HERO7 og 6 sentrale Back-Bone H7PRO-kamere. For ‘sanntids’-rendering, opererer disse med en minimumsfrekvens på 60fps. Kilde: https://arxiv.org/pdf/2103.11571.pdf

I stedet bruker Neural Lumigraph Rendering SIREN (Sinusoidal Representation Networks) for å inkorporere styrkene til hver tilnærming i sin egen ramme, som er ment å generere utdata som er direkte brukbar i eksisterende sanntids-grafikk-rørledninger.

SIREN har blitt brukt i lignende implementeringer over det siste året, og representerer nå en populær API-kall for hobbyist-Colabs i bildesynthese-samfunn; likevel er NLRs innovasjon å bruke SIRENer til todimensjonal multi-view-bildeovervåking, som er problematisk på grunn av hvor mye SIREN produserer over-justert snarere enn generalisert utdata.

Etter at CG-meshen er ekstrahert fra array-bildene, rasteriseres meshen via OpenGL, og vertexposisjonene til meshen kartlegges til de respektive pikslene, etterfulgt av at blandingen av de ulike bidragende kartene beregnes.

Det resulterende meshet er mer generalisert og representativt enn NeRFs (se bildet nedenfor), krever mindre beregning, og påfører ikke eksessiv detalj til områder (slik som glatte ansiktsskinn) som ikke kan dra nytte av det:

Kilde: https://arxiv.org/pdf/2103.11571.pdf

Kilde: https://arxiv.org/pdf/2103.11571.pdf

På negativ side har NLR ennå ingen kapasitet for dynamisk lys eller relighting, og utdata er begrenset til skyggekart og andre lys-hensyn som er oppnådd på tidspunktet for fangst. Forskerne planlegger å adresse dette i fremtidig arbeid.

I tillegg innrømmer artikkelen at formene som genereres av NLR ikke er like nøyaktige som noen alternative tilnærminger, som Pixelwise View Selection for Unstructured Multi-View Stereo, eller Weizmann Institute-forskningen nevnt tidligere.

Oppblomstringen av volumetrisk bildesynthese

Idéen om å lage 3D-entiteter fra en begrenset rekke bilder med neurale nettverk forutser NeRF, med visjonære artikler som går tilbake til 2007 eller tidligere. I 2019 produserte Facebooks AI-forskningsavdeling en seminal forskningsartikkel, Neural Volumes: Learning Dynamic Renderable Volumes from Images, som først muliggjorde responsieve grensesnitt for syntetiske mennesker generert av maskinlæringsbasert volumetrisk fangst.

Facebooks forskning i 2019 muliggjorde skapingen av et responsivt brukergrensesnitt for en volumetrisk person. Kilde: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Facebooks forskning i 2019 muliggjorde skapingen av et responsivt brukergrensesnitt for en volumetrisk person. Kilde: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai