Andersons vinkel
Kan Apples HDR-forstærkede virkeligheds-miljøer løse refleksionsproblemer for neuralt rendering?

Apples kraftige og langsigtede investering i Augmented Reality-teknologier accelererer i år, med en ny række udviklerværktøjer til at fange og konvertere virkelige verdensobjekter til AR-facetter, og en voksende industriel overbevisning om, at dedikeret AR-briller kommer til at støtte de immersive oplevelser, som denne snestorm af forskning og udvikling kan aktivere.
Blandt en række nye oplysninger om Apples indsats i Augmented Reality, afslører en ny artikel fra virksomhedens computer vision-forskningsafdeling en metode til at bruge 360-graders panoramiske billeder med høj dynamisk rækkevidde (HDR) til at give scene-specifikke refleksioner og belysning til objekter, der indsættes i forstærkede virkelighedsscener.
Artiklen, der hedder HDR Environment Map Estimation for Real-Time Augmented Reality, foreslår, at man kan oprette dynamiske HDR-miljøer i realtid via en convolutional neural network (CNN), der køres i en mobil procesmiljø. Resultatet er, at reflekterende objekter kan spejle nye, usete miljøer påkrævet:

I Apples nye AR-objektgenereringsworkflow er en trykkoger instanceret af fotogrammetri sammen med dets omgivelsesmiljø, hvilket resulterer i overbevisende refleksioner, der ikke er ‘bagt’ ind i teksturen. Kilde: https://docs-assets.developer.apple.com/
Metoden, der blev præsenteret på CVPR 2021, tager et snapshot af hele scenen og bruger EnvMapNet-CNN til at estimere et visuelt komplet panoramisk HDR-billede, også kendt som en ‘lydsponder’.

Det resulterende kort identificerer kraftige lyskilder (omkranset i slutningen af ovenstående animation) og tager hensyn til dem ved rendering af virtuelle objekter.

Arkitekturen af EnvMapNet, der behandler begrænsede billeder til fuldscenerings-HDR-lydsponder. Kilde: https://arxiv.org/pdf/2011.10687.pdf
Algoritmen kan køre på under 9 ms på en iPhone XS og kan rendre refleksionsbevidste objekter i realtid med reduceret retningfejl på 50% sammenlignet med tidligere og forskellige tilgange til problemet.

Lysponder
HDR-belysningsmiljøer har været en faktor i visuelle effekter siden billeder med høj dynamisk rækkevidde (opfundet i 1986) blev en bemærkelsesværdig kraft gennem fremskridt i computerteknologi i 1990’erne. Enhver, der har set bagomscener fra filmoptagelser, har måske bemærket den surrealistiske tilstedeværelse af teknikere, der holder oplyste kugler på stænger – referencebilleder, der skal indarbejdes som miljøfaktorer, når man genskaber CGI-elementer til scenen.

Kilde: https://beforesandafters.com/
Men brugen af kromkugler til refleksionskort teksturer går tilbage til 1983, hvor SIGGRAPH-papiret Pyramidal Parametrics blev præsenteret, der indeholdt stille billeder af en reflekterende CGI-robot i en stil, der blev berømt næsten et årti senere gennem ‘flydende metal’-effekterne i James Camerons Terminator 2: Dommedag.
HDR-miljøer i neuralt rendering?
Neuralt rendering tilbyder muligheden for at generere fotorealistiske video fra meget sparsomme input, herunder grove segmenteringskort.

Intel ISL’s segmentation>image neural rendering (2017). Kilde: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
I maj afslørede Intel (INTC ) -forskere en ny initiativ i neuralt billedsyn, hvor billeder fra Grand Theft Auto V blev brugt til at generere fotorealistiske output baseret på datasæt af tyske gadebilleder.

Kilde: https://www.youtube.com/watch?v=0fhUJT21-bs
Udfordringen ved at udvikle neurale renderingsmiljøer, der kan tilpasses til forskellige belysningsforhold, er at adskille objektindholdet fra de miljøfaktorer, der påvirker det.
Som det er nu, er refleksioner og anisotrope effekter enten en funktion af det oprindelige datasæt (hvilket gør dem infleksible) eller kræver den samme type skema, som Intel-forskerne anvendte, der genererer semi-fotorealistiske output fra en grov (spil) engine, udfører segmentering på den og derefter anvender stiloverføring fra et ‘bagt’ datasæt (såsom det tyske Mapillary-gademiljøsæt, der blev brugt i den seneste forskning).

I denne neurale rendering (GTA V-billeder er til venstre), demonstrerer køretøjet foran overbevisende glans og mætter endda sensoren på den fiktive virtuelle kamera med refleksioner fra solen. Men denne lysaspekt er afledt fra den oprindelige spilmotor, da de neurale aspekter i scenen ikke har nogen selvstændige og selvhenvisende lysstrukturer, der kan ændres.
Refleksion i NeRF
Billeder, der er afledt fra Neural Radiance Fields (NeRF), er ligeledes udfordret. Selv om ny forskning i NeRF har gjort fremskridt i at adskille de elementer, der udgør en neural scene (f.eks. MIT/Google samarbejdet om NeRFactor), er refleksioner forblevet et hinder.

MIT og Google NeRFactor-tilgangen adskiller normals, synlighed (skygge), tekstur og lokal albedo, men den reflekterer ikke et miljø, fordi den findes i et vakuum. Kilde: https://arxiv.org/pdf/2106.01970.pdf
NeRF kan løse dette problem med den samme type HDR-kort, som Apple (AAPL ) bruger. Hver pixel i en neural lysfelt er beregnet på en trajektorie fra en virtuel kamera op til det punkt, hvor ‘strålen’ kan rejse ikke længere, ligesom ray-tracing i traditionel CGI. Tilføjelse af HDR-input til beregningen af denne stråle er en potentiel metode til at opnå ægte miljørefleksion, og er i virkeligheden en analog til CGI’s ‘global illumination’ eller radiositetsrendering, hvor en scene eller et objekt delvist oplyses af opfattede refleksioner af dets eget miljø.
Selv om det er garanteret, at en HDR-matrix ikke vil gøre noget for at lette NeRF’s bemærkelsesværdige beregningsmæssige byrder, er der en stor mængde forskning på dette område lige nu, der koncentrerer sig om at tackle dette aspekt af behandlingspipeline. Uundgåeligt er refleksion en af de mange faktorer, der venter i kulissen for at genopfylde og udfordre den nyoptimerede arkitektur. Men NeRF kan ikke opnå sin fulde potentiale som en diskret neural billed- og videosyntese-metode uden at antage en måde at tage hensyn til et omgivelsesmiljø.
Refleksion i neurale renderingspipelines
I en hypotetisk HDR-aktiveret version af Intel GTA V-neurale renderingscenario kan en enkelt HDR ikke rumme de dynamiske refleksioner, der skal udtrykkes i bevægelige objekter. For eksempel, for at se sin egen bil reflekteret i bilen foran, da den kører op til lysene, kan bilen foran have sin egen animerede HDR-lydsponder, hvis opløsning ville aftage gradvist, efterhånden som den fjerner sig fra brugerens synspunkt, og blive lavopløst og kun repræsentativ, da den kører væk i afstand – en nærhedsbaseret LOD-lignende ‘tegneafstandsdelimitør’ i videospil.
Det virkelige potentiale i Apples arbejde med HDR-belysning og refleksionskort ligger ikke i, at det er særlig innovativt, da det bygger på tidligere arbejde i generel billedsyn og i AR-scenudvikling. Snarere repræsenterer det mulige gennembrud den måde, hvorpå strenge lokale beregningsbegrænsninger har kombineret med Apples M-serie maskinelæringshardware-innovationer til at producere letvægts-, lavforsinkelses-HDR-kort, der er designet til at fungere under begrænsede ressourcer.
Hvis dette problem kan løses økonomisk, kan begivenheden om semantisk segmentering > fotorealistisk video-syntese komme et betydeligt skridt nærmere.
Kilde: https://docs-assets.developer.apple.com/












