Andersons vinkel

Kan Apples HDR-forstÃĶrkede virkeligheds-miljÃļer lÃļse refleksionsproblemer for neuralt rendering?

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Apples kraftige og langsigtede investering i Augmented Reality-teknologier accelererer i ÃĨr, med en ny rÃĶkke udviklervÃĶrktÃļjer til at fange og konvertere virkelige verdensobjekter til AR-facetter, og en voksende industriel overbevisning om, at dedikeret AR-briller kommer til at stÃļtte de immersive oplevelser, som denne snestorm af forskning og udvikling kan aktivere.

Blandt en rÃĶkke nye oplysninger om Apples indsats i Augmented Reality, afslÃļrer en ny artikel fra virksomhedens computer vision-forskningsafdeling en metode til at bruge 360-graders panoramiske billeder med hÃļj dynamisk rÃĶkkevidde (HDR) til at give scene-specifikke refleksioner og belysning til objekter, der indsÃĶttes i forstÃĶrkede virkelighedsscener.

Artiklen, der hedder HDR Environment Map Estimation for Real-Time Augmented Reality, foreslÃĨr, at man kan oprette dynamiske HDR-miljÃļer i realtid via en convolutional neural network (CNN), der kÃļres i en mobil procesmiljÃļ. Resultatet er, at reflekterende objekter kan spejle nye, usete miljÃļer pÃĨkrÃĶvet:

I Apples nye AR-objektgenereringsworkflow er en trykkoger instanceret af fotogrammetri sammen med dets omgivelsesmiljÃļ, hvilket resulterer i overbevisende refleksioner, der ikke er 'bagt' ind i teksturen. Kilde: https://docs-assets.developer.apple.com/

I Apples nye AR-objektgenereringsworkflow er en trykkoger instanceret af fotogrammetri sammen med dets omgivelsesmiljÃļ, hvilket resulterer i overbevisende refleksioner, der ikke er ‘bagt’ ind i teksturen. Kilde: https://docs-assets.developer.apple.com/

Metoden, der blev prÃĶsenteret pÃĨ CVPR 2021, tager et snapshot af hele scenen og bruger EnvMapNet-CNN til at estimere et visuelt komplet panoramisk HDR-billede, ogsÃĨ kendt som en ‘lydsponder’.

Det resulterende kort identificerer kraftige lyskilder (omkranset i slutningen af ovenstÃĨende animation) og tager hensyn til dem ved rendering af virtuelle objekter.

Arkitekturen af EnvMapNet, der behandler begrÃĶnsede billeder til fuldscenerings-HDR-lydsponder. Kilde: https://arxiv.org/pdf/2011.10687.pdf

Arkitekturen af EnvMapNet, der behandler begrÃĶnsede billeder til fuldscenerings-HDR-lydsponder. Kilde: https://arxiv.org/pdf/2011.10687.pdf

Algoritmen kan kÃļre pÃĨ under 9 ms pÃĨ en iPhone XS og kan rendre refleksionsbevidste objekter i realtid med reduceret retningfejl pÃĨ 50% sammenlignet med tidligere og forskellige tilgange til problemet.

Lysponder

HDR-belysningsmiljÃļer har vÃĶret en faktor i visuelle effekter siden billeder med hÃļj dynamisk rÃĶkkevidde (opfundet i 1986) blev en bemÃĶrkelsesvÃĶrdig kraft gennem fremskridt i computerteknologi i 1990’erne. Enhver, der har set bagomscener fra filmoptagelser, har mÃĨske bemÃĶrket den surrealistiske tilstedevÃĶrelse af teknikere, der holder oplyste kugler pÃĨ stÃĶnger – referencebilleder, der skal indarbejdes som miljÃļfaktorer, nÃĨr man genskaber CGI-elementer til scenen.

Kilde: https://beforesandafters.com/

Kilde: https://beforesandafters.com/

Men brugen af kromkugler til refleksionskort teksturer gÃĨr tilbage til 1983, hvor SIGGRAPH-papiret Pyramidal Parametrics blev prÃĶsenteret, der indeholdt stille billeder af en reflekterende CGI-robot i en stil, der blev berÃļmt nÃĶsten et ÃĨrti senere gennem ‘flydende metal’-effekterne i James Camerons Terminator 2: Dommedag.

HDR-miljÃļer i neuralt rendering?

Neuralt rendering tilbyder muligheden for at generere fotorealistiske video fra meget sparsomme input, herunder grove segmenteringskort.

Intel ISL’s segmentation>image neural rendering (2017). Kilde: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

Intel ISL’s segmentation>image neural rendering (2017). Kilde: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

I maj afslÃļrede Intel-forskere en ny initiativ i neuralt billedsyn, hvor billeder fra Grand Theft Auto V blev brugt til at generere fotorealistiske output baseret pÃĨ datasÃĶt af tyske gadebilleder.

Kilde: https://www.youtube.com/watch?v=0fhUJT21-bs

Kilde: https://www.youtube.com/watch?v=0fhUJT21-bs

Udfordringen ved at udvikle neurale renderingsmiljÃļer, der kan tilpasses til forskellige belysningsforhold, er at adskille objektindholdet fra de miljÃļfaktorer, der pÃĨvirker det.

Som det er nu, er refleksioner og anisotrope effekter enten en funktion af det oprindelige datasÃĶt (hvilket gÃļr dem infleksible) eller krÃĶver den samme type skema, som Intel-forskerne anvendte, der genererer semi-fotorealistiske output fra en grov (spil) engine, udfÃļrer segmentering pÃĨ den og derefter anvender stiloverfÃļring fra et ‘bagt’ datasÃĶt (sÃĨsom det tyske Mapillary-gademiljÃļsÃĶt, der blev brugt i den seneste forskning).

I denne neurale rendering (GTA V-billeder er til venstre), demonstrerer kÃļretÃļjet foran overbevisende glans og mÃĶtter endda sensoren pÃĨ den fiktive virtuelle kamera med refleksioner fra solen. Men denne lysaspekt er afledt fra den oprindelige spilmotor, da de neurale aspekter i scenen ikke har nogen selvstÃĶndige og selvhenvisende lysstrukturer, der kan ÃĶndres.

I denne neurale rendering (GTA V-billeder er til venstre), demonstrerer kÃļretÃļjet foran overbevisende glans og mÃĶtter endda sensoren pÃĨ den fiktive virtuelle kamera med refleksioner fra solen. Men denne lysaspekt er afledt fra den oprindelige spilmotor, da de neurale aspekter i scenen ikke har nogen selvstÃĶndige og selvhenvisende lysstrukturer, der kan ÃĶndres.

Refleksion i NeRF

Billeder, der er afledt fra Neural Radiance Fields (NeRF), er ligeledes udfordret. Selv om ny forskning i NeRF har gjort fremskridt i at adskille de elementer, der udgÃļr en neural scene (f.eks. MIT/Google samarbejdet om NeRFactor), er refleksioner forblevet et hinder.

MIT og Google NeRFactor-tilgangen adskiller normals, synlighed (skygge), tekstur og lokal albedo, men den reflekterer ikke et miljÃļ, fordi den findes i et vakuum. Kilde: https://arxiv.org/pdf/2106.01970.pdf

MIT og Google NeRFactor-tilgangen adskiller normals, synlighed (skygge), tekstur og lokal albedo, men den reflekterer ikke et miljÃļ, fordi den findes i et vakuum. Kilde: https://arxiv.org/pdf/2106.01970.pdf

NeRF kan lÃļse dette problem med den samme type HDR-kort, som Apple bruger. Hver pixel i en neural lysfelt er beregnet pÃĨ en trajektorie fra en virtuel kamera op til det punkt, hvor ‘strÃĨlen’ kan rejse ikke lÃĶngere, ligesom ray-tracing i traditionel CGI. TilfÃļjelse af HDR-input til beregningen af denne strÃĨle er en potentiel metode til at opnÃĨ ÃĶgte miljÃļrefleksion, og er i virkeligheden en analog til CGI’s ‘global illumination’ eller radiositetsrendering, hvor en scene eller et objekt delvist oplyses af opfattede refleksioner af dets eget miljÃļ.

Selv om det er garanteret, at en HDR-matrix ikke vil gÃļre noget for at lette NeRF’s bemÃĶrkelsesvÃĶrdige beregningsmÃĶssige byrder, er der en stor mÃĶngde forskning pÃĨ dette omrÃĨde lige nu, der koncentrerer sig om at tackle dette aspekt af behandlingspipeline. UundgÃĨeligt er refleksion en af de mange faktorer, der venter i kulissen for at genopfylde og udfordre den nyoptimerede arkitektur. Men NeRF kan ikke opnÃĨ sin fulde potentiale som en diskret neural billed- og videosyntese-metode uden at antage en mÃĨde at tage hensyn til et omgivelsesmiljÃļ.

Refleksion i neurale renderingspipelines

I en hypotetisk HDR-aktiveret version af Intel GTA V-neurale renderingscenario kan en enkelt HDR ikke rumme de dynamiske refleksioner, der skal udtrykkes i bevÃĶgelige objekter. For eksempel, for at se sin egen bil reflekteret i bilen foran, da den kÃļrer op til lysene, kan bilen foran have sin egen animerede HDR-lydsponder, hvis oplÃļsning ville aftage gradvist, efterhÃĨnden som den fjerner sig fra brugerens synspunkt, og blive lavoplÃļst og kun reprÃĶsentativ, da den kÃļrer vÃĶk i afstand – en nÃĶrhedsbaseret LOD-lignende ‘tegneafstandsdelimitÃļr’ i videospil.

Det virkelige potentiale i Apples arbejde med HDR-belysning og refleksionskort ligger ikke i, at det er sÃĶrlig innovativt, da det bygger pÃĨ tidligere arbejde i generel billedsyn og i AR-scenudvikling. Snarere reprÃĶsenterer det mulige gennembrud den mÃĨde, hvorpÃĨ strenge lokale beregningsbegrÃĶnsninger har kombineret med Apples M-serie maskinelÃĶringshardware-innovationer til at producere letvÃĶgts-, lavforsinkelses-HDR-kort, der er designet til at fungere under begrÃĶnsede ressourcer.

Hvis dette problem kan lÃļses Ãļkonomisk, kan begivenheden om semantisk segmentering > fotorealistisk video-syntese komme et betydeligt skridt nÃĶrmere.

Kilde: https://docs-assets.developer.apple.com/

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]