Andersons vinkel

Strømme AI-avatarer som om det var 1999

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Montage of images related to Gaussian Avatar streaming, featuring 3DGS faces. Source: https://ustc3dv.github.io/ProgressiveAvatars/

Ny forskning presenterer en måte å strømme livlige 3D-avatarer som dukker opp nesten umiddelbart og skjerper i sanntid, i stedet for å tvinge brukerne til å vente på massive nedlastinger som skal fullføres.

 

På mange måter har de enorme ressurskravene til generativ AI og AI-assisterte renderingssystemer ført forbrukerklarheten tilbake tjue eller flere år. Bare i 2023 syntes en 64 GB RAM-tilordning i en bærbar PC eller stasjonær PC å være overkill; nå, med den økende populariteten av RAM og/eller CPU-offloading, er 64 GB ganske beskjedent for lokale AI-behov; og disse en gang så vanlige og rimelige elementene i PC-er fortsetter å rakette i pris mens bedrifter sliter med å møte etterspørselen etter AI-tjenester.

Skalene og grådigheten til AI og dens prosesser og miljøer overstiger vanligvis forbruker-nivå-hardware, og selv å kjøre “slanke” lokale-orienterte modeller som GGUF-versjoner vil vanligvis belaste det gjennomsnittlige systemet.

Even tekst-baserte AI-tjenester som ChatGPT er utsatt for betydelig belastning både på klient- og servernivå. Derfor, når AI blir bedt om å levere online multimediainnhold i sanntid, kan vi forvente noen ganske alvorlige kompromisser i latency og/eller kvalitet – lignende internettets tidlige kamp med strømming av multimedia, og de meget hate animerte “buffering”-ikonene fra RealPlayer og QuickTime.

Siste gang multimedia og nettverksproblemer skapte friksjon i brukeropplevelsen, var forbruker-nivå-hardware fortsatt under utvikling gjennom Moores lov, og ble nesten eksponentielt bedre hvert år, selv om operativsystemer, nettverk og andre støttende infrastrukturer utviklet seg for å møte etterspørselen; og for de siste ti årene har kapasiteten til forbrukerteknologi overskredet multimediakravene (kanskje sogar til det punktet hvor omlastning trengtes for å vedlikeholde salg).

Men denne overfloden av lokale evner kan være på vei mot slutten snart, ettersom lokale hardware blir lavere-spekket og mer dyrt, og AI-baserte tjenester krever høyere server-side og lokale ressurser.

Få et hode

Tilbake i pre-bredbånd-tiden, før den tidligste brukbare strømming av video, var web-brukerne vant til at bilder langsomt kom i fokus, da progressive JPEG-er tillot den bandwidth-sværtede brukeren å se bildet som lastes ned, noen ganger smertefullt langsomt, mens mer av bildedata ble lastet ned lokalt.

Nå synes det som om vi kan være på vei mot en lignende erfaring med AI-hjulpet Gaussian Splat-avatarer:

Klikk for å spille.  Fra det nye ProgressiveAvatars-prosjektet, en sammenligning av strømming av Gaussian-avatarer. På venstre side, det eldre GaussianAvatars-prosjektet får langsomt ny data, men ser dårlig ut mens data bygges opp; på høyre side, den nye Progressive Avatars-versjonen bygger også detalj langsomt, men gjør det på en intelligent måte som gir en grunnleggende menneskelig likhet fra starten. Kilde

Ovenfor ser vi to versjoner av en Gaussian Splat-basert (GSplat) avatar – en menneskelig representasjon som er delvis aktivert av en ikke-AI-renderingsteknikk som stammer fra tidlig på 1990-tallet, og også av mer moderne metoder, som FLAME-parametriske menneskelige modeller, og AI-baserte treningstilnærminger:

Gaussian Splatting bruker en Gaussian-representasjon av farge og 3D-informasjon i stedet for en piksel eller en voxel, og kartlegger denne ultrarealistiske teksturen over en mer tradisjonell type CGI-mesh, som i seg selv er fasilitert av en 'parametrisk menneske', en CGI-ansikt og/eller kropp, i systemer som FLAME og STARR. Kilde - https://arxiv.org/pdf/2312.02069.pdf

Gaussian Splatting bruker en Gaussian-representasjon av farge og 3D-informasjon i stedet for en piksel eller en voxel, og kartlegger denne ultrarealistiske teksturen over en mer tradisjonell type CGI-mesh, som i seg selv er fasilitert av en ‘parametrisk menneske’, en CGI-ansikt og/eller kropp, i systemer som FLAME og STAR Kilde

På venstre side i videoen ovenfor kan vi se at en tradisjonell implementering av en Gaussian splat-avatrar ser ganske forferdelig ut mens vi venter på at data skal lastes ned. På høyre side, en ny implementering fra Kina, kalt ProgressiveAvatars, kan løse opp detaljene mye mer elegant mens data lastes ned, og presenterer et ikke-alarmende menneskebilde fra starten.

Forfatterne hevder at deres metode er den første som virkelig “strømmer” en Gaussian-avatrar, og sannsynligvis den første som gjør det på en progressiv måte, hvor bildet bygges opp elegant, og de viktigste områdene – som øyne og lepper – kan prioriteres, så avataren kan bli samtalevennlig selv når den bare er delvis lastet ned:

Click to play. Fra ProgressiveAvatars-prosjektets nettsted, en illustrasjon av oppmerksomhets-avhengig lasting.

Før dette har en “nivå av detalj”-tilnærming (LOD) blitt brukt i tidligere forsøk på å stramme ned ‘GSplat’-avatarer, lignende videospill-optimaliseringer, hvor suksessivt mer detaljerte versjoner av en person lastes ned avhengig av om de okkuperer nok av viewporten eller brukerens oppmerksomhet til å være verdt arbeidet.

Selvfølgelig innebærer dette en betydelig mengde redundante “reserve”-avatarer, og forfatterne rammer sin tilnærming som et mer rasjonelt system. Ved implikasjon tillater en metode av denne typen også endringer i en GSplat-figur (dvs. tilpasning) uten å måtte propagere slike endringer gjennom en rekke av forskjellige LOD-“tvillinger”.

En oppdyrkende domene

Hvis dette ser ut som et nisjeproblem, så var strømming av video også et nisjeproblem tilbake i dagene da det å få de tidligste pluginene til å fungere ble overført til den nærmeste tilgjengelige nerd. Videre, potensialet for AI-baserte strømmingsrepresentasjoner går langt utenfor menneskelige avatarer, og omfatter bygenerering, spill, og 3D-baserte* versjoner av praktisk talt enhver online-domene – som Virtual Try-On, for kleshandel:

Klikk for å spille. Fra et prosjekt fra 2024, en grov titt på fremtiden for online ‘prøv-på’. Andre prosjekter søker å legge til bevegelse og interaktivitet – kravende aspekter å strømme og håndtere. Kilde

Bare som LOD-baserte tilnærminger har blitt brukt i videospill, er det sannsynlig at mange andre overveielser som en gang var videospillutviklingens eget område, vil komme inn i splat-baserte representasjoner. For eksempel, de fleste av disse tidlige GSplat-utgavene avbilder en enkel menneskelig gurning og mugging, eller kanskje snakker; men mange situasjoner vil være nødvendige som inneholder flere mennesker, samt miljømessige egenskaper og atmosfære – en scenario hvor høyt performant “triage”-systemer vil bestemme hvor strømningsdataene må prioriteres, for å holde brukeren i øyeblikket.

Den nye artikkelen har tittelen ProgressiveAvatars: Progressiv Animatable 3D Gaussian Avatars, og kommer fra tre forskere ved University of Science and Technology of China i Hefei.

Metode

Tilnærmingen utnytter initialt video av en persons hode. For hvert bilde, blir en standard FLAME-parametrisk ansiktsmodell passet, så at formen og uttrykket endrer seg over tid, mens den underliggende mesh-strukturen forblir uendret. Fordi basistopologien ikke endrer seg, kan en stabil FLAME-mal bli gjenbrukt og forbedret i stedet for å bli bygget opp fra scratch hver gang, som skjer i lignende tidligere arbeid:

Hodevideo blir først passet med en sporet FLAME-mesh, etterfulgt av at 3D-Gaussianer blir festet til hver ansikt og vokser hierarkisk der skjerm-romsgradienter indikerer manglende detalj. Under trening, bygger denne adaptive inndelingen en multi-nivå-representasjon under multi-viewport-overvåking, og ved inferens bestemmer per-ansikts viktighetsskår hvilke Gaussianer som strømmes først, og tillater avataren å dukke opp raskt og forbedre seg progressivt mens høyere detaljnivåer legges til.

Hodevideo blir først passet med en sporet FLAME-mesh, etterfulgt av at 3D-Gaussianer blir festet til hver ansikt og vokser hierarkisk der skjerm-romsgradienter indikerer manglende detalj. Under trening, bygger denne adaptive inndelingen en multi-nivå-representasjon under multi-viewport-overvåking, og ved inferens bestemmer per-ansikts viktighetsskår hvilke Gaussianer som strømmes først, og tillater avataren å dukke opp raskt og forbedre seg progressivt mens høyere detaljnivåer legges til.

Over denne basisstrukturen legges detaljer til i lag; overflaten blir implisitt inndelt i en hierarki, og små tre-dimensjonale Gaussianer blir festet til ansiktene på hver detaljnivå.

Selv om de første, grovere lagene fanger den generelle hodeformen og bevegelsen, gir de påfølgende finere lagene rynker, subtile deformasjoner og høyfrekvent tekstur. Bilder blir deretter renderet fra disse Gaussianerne ved hjelp av en differensierbar Gaussian-rasterisator og trent mot multi-viewport-grunntruth-bilder, så avataren lærer å gjenskape den virkelige personens utseende.

Under trening vokser denne hierarkien automatisk: områder som trenger mer detalj blir inndelt ytterligere, guidet av skjerm-romssignaler, så at beregningsinnsatsen konsentreres der brukerens øye mest sannsynlig vil merke feil.

Under inferens muliggjør denne samme hierarki progressiv strømming, hvor en grov versjon av en avatar kan vises først, og, mens ytterligere lag blir lastet, kan nye Gaussianer legges til uten å endre det som allerede vises, og muliggjør en animert hode-avatrar som dukker opp raskt, og blir skarpere og mer detaljert mens mer data ankommer.

Forfatterne observerer at hele systemet henger sammen av prioriteringen av innkommende data:

Når alle Gaussianer på et gitt nivå er tilgjengelige, blir den fullstendige modellen renderet med maksimal trofasthet; men under strømming, sender de høyeste bidrags-Gaussianerne først, tillater tidlige delresultater å matche den endelige bildet nært, mens overføring av lav-bidrags-Gaussianer først forvrenger fargebalansen og understreker mindre komponenter.

Når alle Gaussianer på et gitt nivå er tilgjengelige, blir den fullstendige modellen renderet med maksimal trofasthet; men under strømming, sender de høyeste bidrags-Gaussianerne først, tillater tidlige delresultater å matche den endelige bildet nært, mens overføring av lav-bidrags-Gaussianer først forvrenger fargebalansen og understreker mindre komponenter.

Data og tester

For tester ble den nye metoden evaluert på NeRSemble-datasetten, som består av multi-viewport-videoer for hver enkelt subjekt, med kalibrerte parametre over alle visninger:

Eksempler på ulike tolkninger av subjekter inkludert i NeRSemble-datasettet brukt i tester for ProgressiveAvatars. Kilde - https://tobias-kirschstein.github.io/nersemble/

Eksempler på ulike tolkninger av subjekter inkludert i NeRSemble-datasettet brukt i tester for ProgressiveAvatars. Kilde

I linje med den opprinnelige GaussianAvatars-metodikken, ble bildene nedskalert til 802x550px, og en forgrunnsmask generert, og det opprinnelige prosjektets trening/test split ble adoptert.

Adam-optimizeren ble brukt for parameteroppdateringer, med en læringsrate på 1×10-2 på alle barysentriske koordinater. Treningen ble kjørt i 60 000 iterasjoner, med hierarkiet automatisk utvidet hver 2 000. iterasjon.

Initialt testet forfatterne for rekonstruksjon og animasjon – oppgaven med å konvertere flat video til et 3D-bevisst (x/y/x)-system, ved hjelp av FLAMEs kanoniske CGI-representasjon som den ankrende meshen. For dette ble alle baseline-modellene trent fra scratch, og rivaliserende rammer testet var det ovennevnte GaussianAvatars, og PointAvatar.

For disse testene ble følgende metrikker brukt: Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM), og Lærte Perceptuelle Bilde-Patch-Lignende (LPIPS):

Kvalitativ sammenligning på ny-viewport- og ny-uttrykks-syntese. Baseline GaussianAvatars sliter med fine detaljer rundt øyne, rynker og hudtekstur, mens den foreslåtte metoden allerede bevarer nøkkelansiktsstruktur ved omtrent fem prosent overført data og konvergerer mot grunntruth mens flere Gaussianer strømmes, og nært matcher den fullstendige modellen og referansebildene (grunntruth).

Kvalitativ sammenligning på ny-viewport- og ny-uttrykks-syntese. Baseline GaussianAvatars sliter med fine detaljer rundt øyne, rynker og hudtekstur, mens den foreslåtte metoden allerede bevarer nøkkelansiktsstruktur ved omtrent fem prosent overført data og konvergerer mot grunntruth mens flere Gaussianer strømmes, og nært matcher den fullstendige modellen og referansebildene (grunntruth).

Angående disse resultater, hevder forfatterne:

‘[Vår] metode rekonstruerer skarpere detaljer i flere regioner, spesielt rundt halsen, skuldrene og klærne. Disse områdene er relativt grovt tessellert i FLAME-malen sammenlignet med høy-saliens ansiktsområder (f.eks. periokulært område).

‘Derfor allokerer tidligere metoder ofte for få 3D-Gaussianer til disse områdene for å fange deres fin-skala detalj. I motsetning øker vår adaptive vekststrategi antallet Gaussianer og forbedrer hierarkiet bare der det er nødvendig, og gjør allokering uavhengig av FLAMEs ikke-uniforme tessellering.’

Forfatterne merker også at deres tilnærming er på linje med state-of-the-art-metoder, og gir en fungerende avatar med en trivial 5% båndbredde-tillatelse:

Kvantitativ sammenligning på ny-viewport-syntese og ny-uttrykks-syntese ved hjelp av PSNR, SSIM og LPIPS. Ved full overføring oppnår den foreslåtte metoden den høyeste PSNR på begge oppgaver og forblir konkurransedyktig med GaussianAvatars på perceptuelle metrikker, mens 5%-innstillingen illustrerer kvalitets-avtalen under ekstreme båndbredde-begrensninger.

Kvantitativ sammenligning på ny-viewport-syntese og ny-uttrykks-syntese ved hjelp av PSNR, SSIM og LPIPS. Ved full overføring oppnår den foreslåtte metoden den høyeste PSNR på begge oppgaver og forblir konkurransedyktig med GaussianAvatars på perceptuelle metrikker, mens 5%-innstillingen illustrerer kvalitets-avtalen under ekstreme båndbredde-begrensninger.

Neste, testet forskerne den progressive renderingen selv. Dette ble gjennomført på en NVIDIA RTX 4090, med 24 Gb VRAM, i 550x802px-oppløsning. I denne scenariot, merker forfatterne at en 25% budsjettert bruk ville bruke opp alle ‘nivå 1’-Gaussianer, samt en undergruppe av nivå 2-Gaussianer, som gir en grov oversikt over hvordan Gaussian-grupper bygger detalj i de høyere nummergruppene, og at de lavere nummergruppene i hovedsak bygger den grundleggende canvasen:

Ytelse under ulike overføringsbudsjetter for ny-viewport- og ny-uttrykks-syntese, som viser at kvaliteten stadig nærmer seg eller overgår GaussianAvatars mens flere Gaussianer og data strømmes, mens sanntids-hastigheter opprettholdes, på en RTX 4090.

Ytelse under ulike overføringsbudsjetter for ny-viewport- og ny-uttrykks-syntese, som viser at kvaliteten stadig nærmer seg eller overgår GaussianAvatars mens flere Gaussianer og data strømmes, mens sanntids-hastigheter opprettholdes, på en RTX 4090.

Forfatterne kommenterer:

‘Med bare 2,60 MB overført (5% budsjettert), har avataren allerede oppnådd rimelig kvalitet. Mens høyere-nivå-Gaussianer strømmes, skjerper fine strukturer som skjorteknapper, tenner og hår gradvis, mens tidsstabilisering opprettholdes.

‘Ved 100% overføring, oppnår vår tilnærming renderingkvalitet sammenlignbar med SOTA-metoder. Merkelig, synker rammeraten ikke betydelig, sannsynligvis fordi 3DGS-arbeidsbelastningen ennå ikke har mettet GPUen.’

Men forfatterne merker også at i multi-bruker-VR-scenarier vil antallet 3D-Gaussianer raskt vokse til et punkt hvor GPU-rasterisering blir en flaskehals. I disse tyngre scenariene tilbyr den foreslåtte tilnærmingen en fordel ved å tillate systemet å avveie antallet primitiver mot visuell kvalitet, og lette belastningen uten å kollapse renderingen.

Selv om artikkelen ikke detaljerer det, viser prosjektets nettsted ytterligere test-sammenligninger, som også inkluderer MeGA-Hybrid mesh-Gaussian-avatrar-prosjektet:

Klikk for å spille. En av en rekke supplmentære videoer fra artikkelenes tilhørende prosjekt-nettsted, denne sammenligner den nye tilnærmingen i forhold til ny-viewport-syntese.

Konklusjon

Gaussian Splatting kan eller kan ikke vare, eller bli husket mye mer enn RealPlayer nå er, i forhold til begynnelsen av interaktiv strømming: AI-drevne eller AI-assisterte 3D-bevisste representative erfaringer, inkludert video-samtale, virtuell handel, rute-navigasjon og diverse underholdningsapplikasjoner. Det kan hende at alternative teknologier eller tilnærminger seirer, eller at GSplat-proven er den mest pålitelige AI-video-representasjonen.

Hvis ikke annet, kunngjør denne interessante nye artikkelen en del av omfanget av denne nye domenen, og minner oss, kanskje nostalgisk, om den båndbredde-sværtede internett fra gamle dager.

 

* Ved ‘3D’, mener jeg ikke den type erfaring som krever spesielle briller, men snarere erfaringer hvor multimediainnholdet har en slags forståelse av X/Y/Z-koordinater.

Først publisert onsdag, 18. mars 2026

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai