Andersons vinkel

Mot riktiga tidsbaserade AI-människor med Neural Lumigraph Rendering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Neural Lumigraph Rendering

Trots den nuvarande vågen av intresse för Neural Radiance Fields (NeRF), en teknik som kan skapa AI-genererade 3D-miljöer och objekt, kräver denna nya tillvägagångssätt för bildsyntesteknik fortfarande en stor mängd träningsdata och saknar en implementering som möjliggör realtids-, högt responsiva gränssnitt.

En samarbetsinsats mellan några imponerande namn inom industri och akademi erbjuder dock ett nytt perspektiv på denna utmaning (generiskt känd som Novel View Synthesis, eller NVS).

Forskningsrapporten paper, med titeln Neural Lumigraph Rendering, hävdar en förbättring av den nuvarande tekniken med cirka två storleksordningar, vilket representerar flera steg mot realtids-CG-rendering via maskinlärningspipeliner.

Neural Lumigraph Rendering (höger) erbjuder bättre upplösning av blandningsartefakter och förbättrad hantering av ocklusion jämfört med tidigare metoder. Källa: https://www.youtube.com/watch?v=maVF-7x9644

Neural Lumigraph Rendering (höger) erbjuder bättre upplösning av blandningsartefakter och förbättrad hantering av ocklusion jämfört med tidigare metoder. Källa.

Även om endast Stanford University och holografisk displayteknikföretaget Raxium (för närvarande verksamt i stealth-läge) nämns i rapporten, inkluderar bidragsgivarna en huvudmaskinlärningsarkitekt på Google, en datavetare på Adobe och VD på StoryFile (som nyligen gjorde rubriker med en AI-version av William Shatner).

I samband med den nyliga Shatner-reklamkampanjen verkar StoryFile använda NLR i sin nya process för skapande av interaktiva, AI-genererade entiteter baserade på egenskaper och berättelser om enskilda personer.

StoryFile ser användning av denna teknik i museisamlingar, online-interaktiva berättelser, holografiska visningar, förstärkt verklighet (AR) och kulturarvsdokumentation – och verkar också undersöka potentiella nya tillämpningar av NLR i rekryteringsintervjuer och virtuella dejtingsapplikationer:

Föreslagna användningar från en onlinevideo av StoryFile. Källa: https://www.youtube.com/watch?v=2K9J6q5DqRc

Föreslagna användningar från en onlinevideo av StoryFile. Källa: https://www.youtube.com/watch?v=2K9J6q5DqRc

Volymskapning för Novel View Synthesis-gränssnitt och video

Principen för volymskapning, över hela spektrumet av papper som ackumuleras på ämnet, är idén att ta stillbilder eller videor av ett föremål och använda maskinlärning för att “fylla i” vyerna som inte täcktes av den ursprungliga kameramatriken.

Källa: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Källa: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

I bilden ovan, tagen från Facebooks AI-forskning 2019 (se nedan), ser vi de fyra stadierna av volymskapning: flera kameror erhåller bilder/filmer; encoder/decoder-arkitektur (eller andra arkitekturer) beräknar och sammanfogar vyernas relativitet; ray-marching-algoritmer beräknar voxel (eller andra XYZ-geometriska enheter) för varje punkt i volymutrymmet; och (i de flesta nyliga papperen) utbildning sker för att syntetisera en fullständig entitet som kan manipuleras i realtid.

Det är denna ofta omfattande och dataintensiva utbildningsfasen som hittills har hållit novel view synthesis utanför realtids- eller högt responsivt område.

Faktum är att Novel View Synthesis skapar en fullständig 3D-karta av ett volymutrymme, vilket gör det relativt enkelt att sy ihop dessa punkter till en traditionell datorgenererad mesh, vilket i princip fångar och artikulerar en CGI-människa (eller något annat relativt begränsat föremål) på plats.

Tillvägagångssätt som använder NeRF förlitar sig på punktmoln och djupkartor för att generera interpoleringar mellan de glesa vyerna hos kamerorna:

NeRF kan generera volymetrisk djup genom beräkning av djupkartor, snarare än generering av CG-nät. Källa: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF kan generera volymetrisk djup genom beräkning av djupkartor, snarare än generering av CG-nät. Källa: https://www.youtube.com/watch?v=JuH79E8rdKc

Även om NeRF kan beräkna nät, använder de flesta implementationer inte detta för att generera volymetriska scener.

I kontrast använder Implicit Differentiable Renderer (IDR)-tillvägagångssättet, publicerat av Weizmann Institute of Science i oktober 2020, utnyttjar 3D-nätinformation som automatiskt genereras från kameramatriken:

Exempel på IDR-fångst som omvandlats till interaktiva CGI-nät. Källa: https://www.youtube.com/watch?v=C55y7RhJ1fE

Exempel på IDR-fångst som omvandlats till interaktiva CGI-nät. Källa: https://www.youtube.com/watch?v=C55y7RhJ1fE

Medan NeRF saknar IDRs förmåga att uppskatta former, kan IDR inte matcha NeRFs bildkvalitet, och båda kräver omfattande resurser för utbildning och sammanställning (även om nyliga innovationer inom NeRF börjar adressera detta).

NLRs anpassade kamerarig med 16 GoPro HERO7 och 6 centrala Back-Bone H7PRO-kameror. För 'realtidsrendering' opererar dessa med en minimumhastighet på 60fps. Källa: https://arxiv.org/pdf/2103.11571.pdf

NLRs anpassade kamerarig med 16 GoPro HERO7 och 6 centrala Back-Bone H7PRO-kameror. För ‘realtidsrendering’ opererar dessa med en minimumhastighet på 60fps. Källa: https://arxiv.org/pdf/2103.11571.pdf

Istället använder Neural Lumigraph Rendering SIREN (Sinusoidal Representation Networks) för att inkorporera styrkorna i varje tillvägagångssätt i sin egen ram, som är avsedd att generera utdata som direkt kan användas i befintliga realtidsgrafikpipeliner.

SIREN har använts för liknande implementationer under det senaste året och representerar nu ett populär API-anrop för hobby-Colabs i bildsyntes-samhällen; men NLRs innovation är att tillämpa SIREN på tvådimensionell multi-vy-bildsupervision, vilket är problematiskt på grund av den utsträckning till vilken SIREN producerar överanpassad snarare än generaliserad utdata.

Efter att CG-nätet har extraherats från arraybilderna, rasteriseras nätet via OpenGL, och nätets vertexpositioner mappas till lämpliga pixlar, varefter blandning av de olika bidragande kartorna beräknas.

Det resulterande nätet är mer generaliserat och representativt än NeRFs (se bild nedan), kräver mindre beräkning och applicerar inte överdriven detalj på områden (såsom släta ansikts hud) som inte kan dra nytta av det:

Källa: https://arxiv.org/pdf/2103.11571.pdf

Källa: https://arxiv.org/pdf/2103.11571.pdf

På negativ sida har NLR ännu inte någon kapacitet för dynamisk belysning eller omlysning, och utdata är begränsad till skuggkartor och andra belysningshänsyn som erhållits vid tidpunkten för fångst. Forskarna avser att adressera detta i framtida arbete.

Utöver detta medger rapporten att formerna som genereras av NLR inte är lika exakta som vissa alternativa tillvägagångssätt, såsom Pixelwise View Selection for Unstructured Multi-View Stereo, eller Weizmann Institute-forskningen som nämns tidigare.

Upptaget av volymetrisk bildsyntes

Idén att skapa 3D-entiteter från en begränsad serie foton med neurala nätverk föregår NeRF, med visionära papper som går tillbaka till 2007 eller tidigare. 2019 producerade Facebooks AI-forskningsavdelning en banbrytande forskningsrapport, Neural Volumes: Learning Dynamic Renderable Volumes from Images, som först möjliggjorde responsiva gränssnitt för syntetiska människor genererade av maskinlärningsbaserad volymskapning.

Facebooks forskning 2019 möjliggjorde skapandet av ett responsivt användargränssnitt för en volymetrisk person. Källa: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Facebooks forskning 2019 möjliggjorde skapandet av ett responsivt användargränssnitt för en volymetrisk person. Källa: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai