Unghiul lui Anderson

Difuzarea avatarelor 3D cu inteligență artificială, ca în 1999

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Montage of images related to Gaussian Avatar streaming, featuring 3DGS faces. Source: https://ustc3dv.github.io/ProgressiveAvatars/

Cercetarea recentă prezintă o modalitate de a difuza avatare 3D realiste care apar aproape instantaneu și se clarifică în timp real, în loc de a forța utilizatorii să aștepte terminarea descărcărilor masive.

 

În multe feluri, cerințele uriașe de resurse ale inteligenței artificiale și ale sistemelor de renderizare asistate de inteligență artificială au readus disponibilitatea pentru consumatori cu douăzeci de ani sau mai mult în urmă. Abia în 2023, o alocare de 64 GB RAM într-un laptop sau un computer de birou părea a fi excesivă; acum, odată cu creșterea popularității RAM și/sau a delegării CPU, 64 GB este destul de modest pentru nevoile locale de inteligență artificială; și aceste elemente odată banale și accesibile ale calculatoarelor continuă să crească în preț pe măsură ce corporațiile se luptă să îndeplinească cererea de servicii de inteligență artificială.

Scara și lăcomia inteligenței artificiale și a proceselor și mediilor sale sunt, de obicei, mult mai mari decât hardware-ul de nivel consumator, iar chiar și rularea unor modele “slabite” orientate local, sub formă de versiuni GGUF, va, de obicei, solicita puternic sistemul mediu.

Chiar și serviciile de inteligență artificială bazate pe text, cum ar fi ChatGPT, sunt supuse unor solicitări semnificative atât la nivelul clientului, cât și la nivelul serverului. Prin urmare, odată ce inteligența artificială este însărcinată cu furnizarea de experiențe multimedia online în timp real, putem anticipa cu încredere câteva compromisuri serioase în ceea ce privește latența și/sau calitatea – similare cu luptele internetului din perioada de început cu difuzarea media și cu iconele animate “în așteptare” urâte ale RealPlayer și QuickTime.

Ultima dată când problemele multimedia și de rețea au creat fricțiuni în experiența utilizatorului, hardware-ul de nivel consumator se afla încă în evoluție prin Legea lui Moore, devenind aproape exponențial mai bun în fiecare an, chiar și pe măsură ce sistemele de operare, rețelele și alte infrastructuri de suport evoluau pentru a îndeplini cererea; și, în ultimii zece ani, aproximativ, capacitățile tehnologiei de consum au depășit cerințele multimedia (poate chiar până la punctul în care a fost nevoie de o reîmprospătare pentru a menține vânzările).

Dar acest surplus de capacitate locală poate să se încheie curând, pe măsură ce hardware-ul local devine mai puțin performant și mai scump, și pe măsură ce serviciile bazate pe inteligență artificială solicită resurse mai mari la nivelul serverului și local.

Obținerea unui cap

În perioada pre-broadband, chiar înainte de apariția primului video streaming utilizabil, utilizatorii de internet erau obișnuiți cu imaginile care apăreau încet în focus, pe măsură ce JPEG-urile progresive permiteau utilizatorului să vadă imaginea care se descărca, formându-se uneori foarte lent, pe măsură ce se încărcau mai multe date ale imaginii local.

Acum, pare că ne putem aștepta la o experiență similară cu avatarele Gaussian Splat:

Faceți clic pentru a reda. De pe site-ul proiectului ProgressiveAvatars, o comparație a avatarelor Gaussian difuzate. În stânga, proiectul mai vechi GaussianAvatars primește date noi, dar arată teribil pe măsură ce datele se adună; în dreapta, versiunea Progressive Avatars se construiește și ea lent, dar o face într-un mod inteligent care oferă o aparență umană de bază de la început. Sursă

În imaginea de mai sus, vedem două versiuni ale unui avatar Gaussian Splat – o reprezentare umană facilitată parțial de o tehnică de renderizare non-AI care datează din anii ’90 și, de asemenea, de metode mai moderne, cum ar fi modelul parametric uman FLAME și abordări de antrenare bazate pe inteligență artificială:

Gaussian Splatting folosește o reprezentare gaussiană a culorii și a informațiilor 3D în locul unui pixel sau voxel și le mappează pe o rețea CGI mai tradițională, care la rândul ei este facilitată de un 'om parametric', o față și/sau corp CGI, în sisteme cum ar fi FLAME și STAR. Sursă - https://arxiv.org/pdf/2312.02069.pdf

Gaussian Splatting folosește o reprezentare gaussiană a culorii și a informațiilor 3D în locul unui pixel sau voxel și le mappează pe o rețea CGI mai tradițională, care la rândul ei este facilitată de un ‘om parametric’, o față și/sau corp CGI, în sisteme cum ar fi FLAME și STAR. Sursă

În imaginea de mai sus, în stânga, putem vedea că o implementare tradițională a unui avatar Gaussian Splat arată destul de îngrozitor pe măsură ce datele se încarcă. În dreapta, o nouă implementare din China, numită ProgressiveAvatars, poate să se rezolve mult mai elegant pe măsură ce datele se încarcă, prezentând o imagine umană neînspăimântătoare de la început.

Autorii susțin că metoda lor este prima care difuzează cu adevărat un avatar Gaussian și, cu siguranță, prima care o face într-un mod progresiv, în care imaginea se construiește elegant, iar zonele cele mai importante – cum ar fi ochii și buzele – pot fi prioritizate, astfel încât avatarul poate deveni conversațional chiar și atunci când este încărcat doar parțial:

Faceți clic pentru a reda. De pe site-ul proiectului ProgressiveAvatars, o ilustrare a încărcării atente.

Înainte de aceasta, o abordare “nivel de detaliu” (LOD) a fost utilizată în încercările anterioare de a slăbi avatarele “GSplat”, asemănătoare cu optimizările din jocurile video, în care versiuni din ce în ce mai detaliate ale unei persoane sunt încărcate în funcție de cât de mult ocupă ele viewportul sau atenția utilizatorului pentru a fi demne de efort:

Un domeniu emergent

Dacă aceasta pare a fi o problemă de nișă, ei bine, la fel a fost și difuzarea video, în zilele în care obținerea funcționării primelor plug-in-uri era delegată celui mai apropiat nerd disponibil. Mai mult, potențialul pentru reprezentări de streaming bazate pe inteligență artificială merge dincolo de avatare umane, extinzându-se la generarea orașelor, jocuri și versiuni 3D* ale practic oricărui domeniu online – cum ar fi Încercarea virtuală, pentru cumpărături de îmbrăcăminte:

Faceți clic pentru a reda. De la un proiect din 2024, o privire asupra viitorului încercării online ‘încercări’. Alte proiecte încearcă să adauge mișcare și interactivitate – aspecte solicitante pentru a difuza și gestiona. Sursă

La fel ca abordările bazate pe LOD, care au fost până acum utilizate în principal de jocuri, multe alte considerații care au fost odată domeniul exclusiv al dezvoltării de jocuri sunt probabil să pătrundă în reprezentările bazate pe Splat. De exemplu, majoritatea acestor prime apariții GSplat arată o persoană unică care face grimase și vorbește; dar multe situații vor necesita mai multe persoane, precum și caracteristici de mediu și ambient – un scenariu în care sistemele de “triagă” cu performanță ridicată vor determina unde datele de difuzare trebuie să fie prioritizate, pentru a menține utilizatorul în moment:

Articolul nou se intitulează ProgressiveAvatars: Avatare 3D Gaussian animabile progresive și provine de la trei cercetători de la Universitatea Științei și Tehnologiei din China, din Hefei.

Metodă

Abordarea inițială se bazează pe un video al capului unei persoane. Pentru fiecare cadru, un model de față parametric standard FLAME este adaptat, astfel încât forma și expresia se schimbă în timp, în timp ce structura de bază a rețelei rămâne fixă. Deoarece topologia de bază nu se schimbă, un șablon FLAME stabil poate fi reutilizat și rafinat în loc să fie reconstruit de la zero la fiecare moment, așa cum se întâmplă în lucrările anterioare similare:

Video-ul capului este mai întâi adaptat cu o rețea FLAME urmărită, după care gaussiene 3D sunt atașate la fiecare față și cresc ierarhic acolo unde gradientul spațiului de ecran indică detalii lipsă. În timpul antrenamentului, această subdiviziune adaptivă construiește o reprezentare multi-nivel sub supraveghere multi-vizuală, iar la inferență, scorurile de importanță per față determină care gaussiene sunt difuzate mai întâi, permițând avatarului să apară rapid și să se rafineze progresiv pe măsură ce se adaugă niveluri de detaliu mai mare.

Video-ul capului este mai întâi adaptat cu o rețea FLAME urmărită, după care gaussiene 3D sunt atașate la fiecare față și cresc ierarhic acolo unde gradientul spațiului de ecran indică detalii lipsă. În timpul antrenamentului, această subdiviziune adaptivă construiește o reprezentare multi-nivel sub supraveghere multi-vizuală, iar la inferență, scorurile de importanță per față determină care gaussiene sunt difuzate mai întâi, permițând avatarului să apară rapid și să se rafineze progresiv pe măsură ce se adaugă niveluri de detaliu mai mare.

Peste această structură de bază, se adaugă detalii în straturi; suprafața este implicit subdivizată într-o ierarhie, iar gaussiene mici tridimensionale sunt atașate la fețele de la fiecare nivel de detaliu.

Deși straturile inițiale mai grosiere capturează forma generală a capului și mișcarea, straturile ulterioare mai fine oferă riduri, deformări subtile și textură de înaltă frecvență. Imaginile sunt apoi renderizate din aceste gaussiene folosind un rasterizator gaussian diferențial și antrenat împotriva unor imagini de referință cu adevărat tridimensionale, astfel încât avatarul învață să reproducă aspectul real al persoanei.

În timpul antrenamentului, această ierarhie crește automat: regiunile care necesită mai multe detalii sunt subdivizate suplimentar, conduse de semnalele spațiului de ecran, astfel încât efortul computațional se concentrează acolo unde ochiul utilizatorului este cel mai probabil să observe erorile.

În timpul inferenței, această ierarhie permite difuzarea progresivă, în care o versiune aproximativă a avatarului poate fi afișată mai întâi, iar, pe măsură ce se încarcă straturi suplimentare, noi gaussiene pot fi adăugate fără a altera ceea ce este deja afișat, permițând un avatar de cap animabil care apare rapid și devine mai clar și mai detaliat pe măsură ce sosesc mai multe date:

Autorii observă că întregul sistem se bazează pe prioritizarea datelor care sosesc:

Când toate gaussienele de la un anumit nivel sunt disponibile, modelul complet este renderizat cu fidelitate maximă; dar în timpul difuzării, trimiterea gaussienelor cu contribuție cea mai mare mai întâi permite rezultate parțiale inițiale să se potrivească îndeaproape cu imaginea finală, în timp ce transmiterea gaussienelor cu contribuție scăzută mai întâi distorsionează echilibrul culorilor și accentuează componente minore.

Când toate gaussienele de la un anumit nivel sunt disponibile, modelul complet este renderizat cu fidelitate maximă; dar în timpul difuzării, trimiterea gaussienelor cu contribuție cea mai mare mai întâi permite rezultate parțiale inițiale să se potrivească îndeaproape cu imaginea finală, în timp ce transmiterea gaussienelor cu contribuție scăzută mai întâi distorsionează echilibrul culorilor și accentuează componente minore.

Date și teste

Pentru teste, noua metodă a fost evaluată pe setul de date NeRSemble, care constă în videouri cu multiple viziuni pentru fiecare subiect acoperit, cu parametri calibrați pe toate viziunile:

Exemple de interpretări diverse ale subiecților incluși în setul de date NeRSemble utilizat în teste pentru ProgressiveAvatars. Sursă - https://tobias-kirschstein.github.io/nersemble/

Exemple de interpretări diverse ale subiecților incluși în setul de date NeRSemble utilizat în teste pentru ProgressiveAvatars. Sursă

În conformitate cu metodologia GaussianAvatars originală, imaginile au fost redimensionate la 802x550px, s-a generat o mască de prim plan și s-a adoptat împărțirea originală a proiectului de antrenare/testare împărțire.

Optimizerul Adam a fost utilizat pentru actualizarea parametrilor, cu o rată de învățare de 1×10-2 pentru toate coordonatele baricentrice. Antrenamentul a durat 60.000 de iterații, cu ierarhia extinsă automat la fiecare 2.000 de iterații.

Inițial, autorii au testat pentru reconstrucție și animație – sarcina de a converti un video plat într-un sistem 3D conștient (x/y/z), folosind reprezentarea CGI canonică FLAME ca rețea de ancorare. Pentru aceasta, toate liniile de bază au fost antrenate de la zero, iar cadrele rivale testate au fost menționate anterior GaussianAvatars și PointAvatar.

Pentru aceste teste, metricile utilizate au fost Raportul maxim de semnal la zgomot (PSNR), Indexul de similaritate structurală (SSIM) și Similaritatea perceptuală a imaginilor învățate (LPIPS):

Comparație calitativă pe sinteză de vedere și expresie nouă. GaussianAvatars de bază se luptă cu detalii fine în jurul ochilor, riduri și textură a pielii, în timp ce metoda propusă păstrează deja structura facială cheie la aproximativ cinci procente din datele transmise și converge către imaginea de referință pe măsură ce se adaugă mai multe gaussiene, potrivindu-se îndeaproape cu modelul complet și imaginile de referință (adevărul).

Comparație calitativă pe sinteză de vedere și expresie nouă. GaussianAvatars de bază se luptă cu detalii fine în jurul ochilor, riduri și textură a pielii, în timp ce metoda propusă păstrează deja structura facială cheie la aproximativ cinci procente din datele transmise și converge către imaginea de referință pe măsură ce se adaugă mai multe gaussiene, potrivindu-se îndeaproape cu modelul complet și imaginile de referință (adevărul).

În legătură cu aceste rezultate, autorii afirmă:

‘[Metoda noastră] reconstruieste detalii mai clare în mai multe regiuni, în special în jurul gâtului, umerilor și îmbrăcămintei. Aceste zone sunt relativ grosier tessellate în șablonul FLAME comparativ cu zonele faciale cu saliență ridicată (de exemplu, regiunea perioculară).

‘Prin urmare, metodele anterioare alocă adesea prea puține gaussiene 3D în aceste regiuni pentru a captura cu fidelitate detaliile lor de scară fină. În contrast, strategia noastră de creștere adaptivă crește numărul de gaussiene și rafinează ierarhia doar acolo unde este necesar, făcând alocarea insensibilă la tesselația neuniformă a lui FLAME.’

Autorii mai observă că abordarea lor este la nivelul metodelor de ultimă generație, oferind un avatar funcțional cu o alocare de bandă trivială de 5%:

Comparație cantitativă pe sinteză de vedere nouă și sinteză de expresie nouă utilizând PSNR, SSIM și LPIPS. La transmisie completă, metoda propusă obține cel mai ridicat PSNR pentru ambele sarcini și rămâne competitivă cu GaussianAvatars pe metrici perceptuale, în timp ce setarea de 5% ilustrează compromisul de calitate în condiții de constrângere severă a benzii.

Comparație cantitativă pe sinteză de vedere nouă și sinteză de expresie nouă utilizând PSNR, SSIM și LPIPS. La transmisie completă, metoda propusă obține cel mai ridicat PSNR pentru ambele sarcini și rămâne competitivă cu GaussianAvatars pe metrici perceptuale, în timp ce setarea de 5% ilustrează compromisul de calitate în condiții de constrângere severă a benzii.

Următorul, cercetătorii au testat renderingul progresiv în sine. Acesta a fost efectuat pe un NVIDIA RTX 4090, cu 24 Gb de VRAM, la o rezoluție de 550x802px. În acest scenariu, autorii subliniază că un buget de 25% ar utiliza toate gaussienele de nivel 1, precum și un subset de gaussiene de nivel 2, ceea ce oferă o imagine de ansamblu a modului în care grupările gaussiene acumulează detalii în grupurile cu numere mai mari, și că grupurile cu numere mai mici construiesc în esență canvasul de bază:

Performanță sub diferite bugete de transmisie pentru sinteză de vedere și expresie nouă, arătând că calitatea se apropie sau depășește GaussianAvatars pe măsură ce se difuzează mai multe gaussiene și date, în timp ce se mențin vitezele de timp real, pe un RTX 4090.

Performanță sub diferite bugete de transmisie pentru sinteză de vedere și expresie nouă, arătând că calitatea se apropie sau depășește GaussianAvatars pe măsură ce se difuzează mai multe gaussiene și date, în timp ce se mențin vitezele de timp real, pe un RTX 4090.

Autorii comentează:

‘Cu doar 2,60 MB transmise (5% buget), avatarul atinge deja o calitate rezonabilă. Pe măsură ce se difuzează gaussiene de nivel superior, structuri fine precum butoanele de la cămașă, dinții și părul se clarifică treptat, în timp ce se menține stabilitatea temporală.

‘La 100% transmisie, abordarea noastră atinge o calitate de renderizare comparabilă cu metodele de ultimă generație. În mod remarcabil, ratele de cadre nu scad semnificativ, probabil pentru că sarcina 3DGS nu a saturat încă GPU-ul.’

Cu toate acestea, autorii subliniază că, în scenarii de realitate virtuală multi-utilizator, numărul de gaussiene 3D ar crește rapid până la punctul în care rasterizarea GPU devine un blocaj. În acele scenarii mai grele, abordarea propusă oferă un avantaj prin faptul că permite sistemului să facă un compromis între numărul de primitive și calitatea vizuală, reducând încărcarea fără a prăbuși renderul.

Deși articolul nu o detaliază, site-ul proiectului prezintă comparații de test suplimentare, care includ și proiectul MeGA hibrid de avatar Gaussian-rețea:

Faceți clic pentru a reda. Una dintre seria de videoclipuri suplimentare de pe site-ul proiectului, aceasta compară noua abordare în ceea ce privește sinteza de vedere nouă.

Concluzie

Splatting-ul Gaussian poate sau nu să dureze, sau să fie amintit mult mai mult decât RealPlayer acum, în ceea ce privește zorii difuzării interactive: experiențe reprezentative 3D conduse de inteligență artificială, incluzând chat video, cumpărături virtuale, navigare pe trasee și diverse aplicații de divertisment. Este posibil ca tehnologii alternative sau abordări să câștige teren, sau ca GSplat să se dovedească a fi cea mai fiabilă reprezentare video cu inteligență artificială.

Dacă nu este nimic altceva, acest articol interesant anunță puțin din domeniul acesta nou, în timp ce ne amintește, poate nostalgic, de internetul sărac în bandă din trecut.

 

* Prin ‘3D’, nu înțeleg experiența care necesită ochelari speciali, ci mai degrabă experiențele în care conținutul multimedia are o anumită înțelegere a coordonatelor X/Y/Z.

Publicat pentru prima dată miercuri, 18 martie 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai