Andersonův úhel

Streamování AI avatarů jako v roce 1999

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Montage of images related to Gaussian Avatar streaming, featuring 3DGS faces. Source: https://ustc3dv.github.io/ProgressiveAvatars/

Nový výzkum představuje způsob, jak streamovat realistické 3D avatary, které se objevují téměř okamžitě a zostřují v reálném čase, místo aby uživatelé museli čekat na dokončení masivních stažení.

 

V mnoha ohledech mají enormní nároky generativní AI a AI-pomocných renderovacích systémů vráceny spotřebitelskou připravenost zpět o dvacet nebo více let. Již v roce 2023 se 64GB RAM v laptopu nebo stolním počítači zdálo jako přebytek; nyní, s rostoucí popularitou RAM a/nebo CPU offloading, je 64GB poměrně skromné pro lokální potřeby AI; a tyto dříve banální a dostupné prvky počítačů pokračují v raketovém růstu cen, protože korporace zápasí o splnění poptávky po službách AI.

Rozsah a chamtivost AI a jejích procesů a prostředí obvykle převyšují spotřebitelskou hardwarovou vybavenost, a dokonce i běh “štíhlých” lokálních modelů jako GGUF verzí bude obvykle zatěžovat průměrný systém.

Even text-based AI služby, jako je ChatGPT, jsou vystaveny významnému zatížení jak na straně klienta, tak na straně serveru. Proto, když je AI povinna dodávat online multimediální zkušenosti v reálném čase, můžeme rozumně očekávat některé velmi vážné kompromisy v latenci a/nebo kvalitě – podobně jako internetové počáteční potíže se streamováním médií a much-hated animované “buffering” ikony RealPlayer a QuickTime.

Poslední dobou, kdy multimediální a síťové problémy vytvářely tření v uživatelském rozhraní, spotřebitelská hardwarová vybavenost stále procházela evolucí podle Mooreova zákona, stávala se téměř exponenciálně lepší každý rok, i když operační systémy, sítě a další podpůrné infrastruktury se vyvíjely, aby splnily poptávku; a za posledních deset let spotřebitelská technologie překračovala multimediální požadavky (možná i do té míry, že potřebuje restartovat, aby udržela prodej).

Ale tento nadbytek lokální schopnosti může brzy skončit, protože lokální hardwarová vybavenost se stává nižší a dražší, a protože AI-založené služby vyžadují vyšší serverové a lokální zdroje.

Získání hlavy

V před-broadband éře, dokonce i před nejranějšími použitelnými streamovacími videi, byli uživatelé zvyklí na to, že obrázky se pomalu dostávaly do ostrosti, protože progresivní JPEG umožňovaly uživatelům s omezenou šířkou pásma sledovat stažení obrázků, někdy bolestivě pomalu, protože se načítala více dat lokálně.

Nyní se zdá, že můžeme být svědky podobné zkušenosti s AI-pomocnými Gaussian Splat avatary:

Kliknutím spustíte přehrávání.  Ze nového projektu ProgressiveAvatars, srovnání streamování Gaussian avatarů. Vlevo, starší projekt GaussianAvatars se pomalu načítá nová data, ale vypadá hrozně, zatímco se data načítají; vpravo, nová implementace z Číny, nazvaná ProgressiveAvatars, je schopná rozlišovat mnohem elegantněji, zatímco se data načítají, a představuje základní lidský obraz hned od začátku. Zdroj

Nahoře vidíme dvě verze Gaussian Splat-based (GSplat) Avatar – lidskou reprezentaci, která je částečně umožněna ne-AI renderovací technikou, která pochází z počátku 90. let, a také modernějšími metodami, jako je FLAME parametrický lidský model, a AI-založenými trénovacími přístupy:

Gaussian Splatting používá Gaussian reprezentaci barev a 3D informací místo pixelu nebo voxelu a mapuje tuto ultra-realistickou texturu na tradiční typ CGI mřížky, který je sám o sobě umožněn 'parametrickým člověkem', CGI obličejem a/nebo tělem, v systémech jako FLAME a STARR. Zdroj - https://arxiv.org/pdf/2312.02069.pdf

Gaussian Splatting používá Gaussian reprezentaci barev a 3D informací místo pixelu nebo voxelu a mapuje tuto ultra-realistickou texturu na tradiční typ CGI mřížky, který je sám o sobě umožněn ‘parametrickým člověkem’, CGI obličejem a/nebo tělem, v systémech jako FLAME a STAR Zdroj

Vlevo na videu výše vidíme, že tradiční implementace Gaussian splat avataru vypadá khá hrozně, zatímco se data načítají. Vpravo, nová implementace z Číny, nazvaná ProgressiveAvatars, je schopná rozlišovat mnohem elegantněji, zatímco se data načítají, a představuje základní lidský obraz hned od začátku.

Autoři tvrdí, že jejich metoda je první, která skutečně “streamuje” Gaussian avatar, a jistě první, která to dělá progresivně, kde obraz se postupně zostřuje, a nejvýznamnější oblasti – jako oči a rty – mohou být prioritizovány, aby avatar mohl být konverzační, i když je pouze částečně načtený:

Click to play. Ze stránky projektu ProgressiveAvatars, ilustrace pozornost-závislého načítání.

Předtím byla použita “level of detail” (LOD) přístup, podobná videoherním optimalizacím, kde se postupně načítají více detailní verze osoby, v závislosti na tom, zda obsazují dostatek viewportu nebo pozornosti diváka, aby stálo za to úsilí.

Samozřejmě, to vyžaduje značné množství redundantních “záložních” avatarů, a autoři rámcují svůj přístup jako více racionální systém. Tímto způsobem lze také měnit avatary (tj. přizpůsobovat) bez nutnosti propagovat tyto změny prostřednictvím řetězce různých LOD “dvojčat”.

Emergentní doména

Pokud to vypadá jako nikový problém, tak to bylo i u streamování videa, kdy se první pluginy musely dostat k nejbližšímu dostupnému nerdovi. Kromě toho, potenciál pro AI-založené streamovací reprezentace jde za hranice lidských avatarů, sahá až k generování měst, hrám a 3D-založeným verzím prakticky jakéhokoli online domény – jako je Virtual Try-On, pro nákup oblečení:

Kliknutím spustíte přehrávání. Ze projektu z roku 2024, hrubý pohled na budoucnost online “try-on”. Jiné projekty se snaží přidat pohyb a interaktivitu – náročné aspekty pro streamování a správu. Zdroj

Jen jako LOD-založené přístupy byly dosud většinou využívány videohrami, mnoho dalších úvah, které byly dříve výhradně doménou herního vývoje, pravděpodobně budou mít dopad na založené reprezentace. Například, většina těchto raných GSplat výstupů zobrazuje jednu osobu grimasující a gestikulující, nebo možná mluvení; ale mnoho situací bude vyžadovat více osob, stejně jako environmentální prvky a atmosféru – scénář, kde vysoce výkonné “triážní” systémy budou určovat, kde je třeba prioritizovat streamovaná data, aby divák zůstal ve hře.

Nová práce je nazvaná ProgressiveAvatars: Progresivní animovatelné 3D Gaussian Avatary, a pochází od tří výzkumníků z Univerzity vědy a technologie Číny v Hefei.

Metoda

Přístup最初 využívá video osoby. Pro každou snímek je standardní FLAME parametrický obličejový model přizpůsoben, aby se tvar a výraz měnily v čase, zatímco základní struktura mřížky zůstává pevná. Protože základní topologie se nemění, stabilní FLAME šablona může být znovu použita a upravena místo toho, aby byla postavena od začátku každým okamžikem, jako se to děje v podobných předchozích pracích:

Video osoby je nejprve přizpůsobeno sledovaným FLAME mřížkou, poté jsou 3D Gaussovy křivky připojeny k obličeji a rostou hierarchicky tam, kde prostorové gradienty ukazují chybějící detail. Během trénování, tato adaptivní dělení vytváří multi-úrovňovou reprezentaci pod multi-záběrovým dohledem, a při inferenci, per-obličejové důležitostní skóre určují, které Gaussovy křivky jsou streamovány první, umožňující avataru objevit se rychle a postupně zostřit, zatímco se přidávají vyšší úrovně detailů.

Video osoby je nejprve přizpůsobeno sledovaným FLAME mřížkou, poté jsou 3D Gaussovy křivky připojeny k obličeji a rostou hierarchicky tam, kde prostorové gradienty ukazují chybějící detail. Během trénování, tato adaptivní dělení vytváří multi-úrovňovou reprezentaci pod multi-záběrovým dohledem, a při inferenci, per-obličejové důležitostní skóre určují, které Gaussovy křivky jsou streamovány první, umožňující avataru objevit se rychle a postupně zostřit, zatímco se přidávají vyšší úrovně detailů.

Přes tuto základní strukturu je přidán detail ve vrstvách; povrch je implicitně rozdělen do hierarchie, a malé třídimenzionální Gaussovy křivky jsou připojeny k obličeji na každé úrovni detailu.

Although the initial coarser layers capture the overall head shape and motion, the subsequent finer layers provide wrinkles, subtle deformations, and high frequency texture. Images are then rendered from these Gaussians using a differentiable Gaussian rasterizer and trained against multi-view ground truth footage, so that the avatar learns to reproduce the real person’s appearance.

Během trénování, tato hierarchie roste automaticky: oblasti, které potřebují více detailů, jsou dále rozděleny, řízené prostorovými signály, aby se výpočetní úsilí soustředilo tam, kde je nejpravděpodobnější, že divákovy oči zaznamenají chyby.

Během inferenci, tato hierarchie umožňuje progresivní streamování, kde hrubá verze avatara může být zobrazena první, a jak se načítají další vrstvy, nové Gaussovy křivky mohou být přidány bez změny toho, co je již zobrazeno, umožňující animovatelný avatar, který se objeví rychle a stane se ostřejším a detailnějším, jakmile se načtou více dat.

Autoři pozorují, že celý systém závisí na prioritizaci příchozích dat:

Když jsou všechny Gaussovy křivky na dané úrovni k dispozici, je celý model vykreslen s maximální věrností; ale během streamování, odesílání Gaussových křivek s nejvyšší prioritou první umožňuje rané částečné výsledky, aby se blížily finálnímu obrazu, zatímco přenos Gaussových křivek s nízkou prioritou zkresluje barevnou rovnováhu a zdůrazňuje menší komponenty.

Když jsou všechny Gaussovy křivky na dané úrovni k dispozici, je celý model vykreslen s maximální věrností; ale během streamování, odesílání Gaussových křivek s nejvyšší prioritou první umožňuje rané částečné výsledky, aby se blížily finálnímu obrazu, zatímco přenos Gaussových křivek s nízkou prioritou zkresluje barevnou rovnováhu a zdůrazňuje menší komponenty.

Data a testy

Pro testy, nová metoda byla vyhodnocena na NeRSemble dataset, který se skládá z multi-záběrových videí pro každého subjektu, s kalibrovanými parametry napříč všemi zobrazeními:

Příklad různých interpretací subjektů zahrnutých v NeRSemble datasetu, který se používá pro testy ProgressiveAvatars. Zdroj - https://tobias-kirschstein.github.io/nersemble/

Příklad různých interpretací subjektů zahrnutých v NeRSemble datasetu, který se používá pro testy ProgressiveAvatars. Zdroj

V souladu s původní GaussianAvatars metodologií, byly obrázky downsampleny na 802x550px, vygenerována přední maska, a původní projektova trénovací/test dělení bylo přijato.

Adam optimizer byl použit pro aktualizace parametrů, s learning rate 1×10-2 na všech barycentrických souřadnicích. Trénování proběhlo po 60 000 iteracích, s hierarchií automaticky rozšířenou každých 2 000 iterací.

Původně autoři testovali rekonstrukci a animaci – úkol konverze plochého videa na 3D-aware (x/y/x) systém, pomocí FLAMEova kanonického CGI reprezentace jako kotvy.

Pro tyto testy, metriky použité byly Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM), a Learned Perceptual Image Patch Similarity (LPIPS):

Kvalitativní srovnání na novém-záběrovém a novém-výrazovém syntéze. Základ GaussianAvatars zápasí s jemnými detaily kolem očí, vráskami a kůží, zatímco navrhovaná metoda již zachovává klíčovou obličejovou strukturu na přibližně pět procent přenesených dat a konverguje k ground truth, zatímco se streamují další Gaussovy křivky, blížící se plnému modelu a referenčním obrázkům (ground truth).

Kvalitativní srovnání na novém-záběrovém a novém-výrazovém syntéze. Základ GaussianAvatars zápasí s jemnými detaily kolem očí, vráskami a kůží, zatímco navrhovaná metoda již zachovává klíčovou obličejovou strukturu na přibližně pět procent přenesených dat a konverguje k ground truth, zatímco se streamují další Gaussovy křivky, blížící se plnému modelu a referenčním obrázkům (ground truth).

Ohledně těchto výsledků, autoři prohlašují:

‘[Naše] metoda rekonstruuje ostřejší detaily v několika oblastech, zejména kolem krku, ramen a oblečení. Tyto oblasti jsou relativně hrubě rozděleny v FLAME šabloně ve srovnání s vysokou saliencí obličejových zón (například periokulární oblast).

‘Předchozí metody často přidělují příliš málo 3D Gaussových křivek k těmto oblastem, aby věrně zachytily jejich jemné detaily. Naopak, naše adaptivní růstová strategie zvyšuje počet Gaussových křivek a rozšiřuje hierarchii pouze tam, kde je to potřeba, což činí přidělování nezávislým na FLAMEově neuniformní rozdělení.’

Autoři dále poznamenávají, že jejich přístup je na stejné úrovni jako stávající metody, poskytující funkční avatar s triviální 5% šířkou pásma:

Kvantitativní srovnání na novém-záběrovém a novém-výrazovém syntéze pomocí PSNR, SSIM a LPIPS. Při plném přenosu, navrhovaná metoda dosahuje nejvyšší PSNR na obou úkolech a zůstává konkurenceschopná s GaussianAvatars na percepčních metrikách, zatímco 5% nastavení ilustruje kvalitativní kompromis pod extrémními omezeními šířky pásma.

Kvantitativní srovnání na novém-záběrovém a novém-výrazovém syntéze pomocí PSNR, SSIM a LPIPS. Při plném přenosu, navrhovaná metoda dosahuje nejvyšší PSNR na obou úkolech a zůstává konkurenceschopná s GaussianAvatars na percepčních metrikách, zatímco 5% nastavení ilustruje kvalitativní kompromis pod extrémními omezeními šířky pásma.

Dále výzkumníci testovali progresivní vykreslování. To bylo provedeno na NVIDIA RTX 4090, s 24Gb VRAM, při rozlišení 550x802px. V tomto scénáři, autoři poukazují na to, že 25% rozpočtu by využilo všechny “úroveň 1” Gaussovy křivky, stejně jako podmnožinu úrovně 2 Gaussových křivek, což dává hrubý přehled o tom, jak se Gaussovy skupiny přidávají detaily v vyšších číslech skupin, a že nižší čísla skupin vlastně budují základní plátno:

Výkon pod různými přenosovými rozpočty pro novém-záběrovém a novém-výrazovém syntéze, ukazující, že kvalita postupně dosahuje nebo překračuje GaussianAvatars, zatímco se streamují další Gaussovy křivky a data, a reálné rychlosti jsou udržovány, na RTX 4090.

Výkon pod různými přenosovými rozpočty pro novém-záběrovém a novém-výrazovém syntéze, ukazující, že kvalita postupně dosahuje nebo překračuje GaussianAvatars, zatímco se streamují další Gaussovy křivky a data, a reálné rychlosti jsou udržovány, na RTX 4090.

Autoři komentují:

‘S pouhými 2,60 MB přenesenými (5% rozpočet), avatar již dosahuje rozumné kvality. Jakmile jsou streamovány vyšší úrovně Gaussových křivek, jemné struktury, jako jsou knoflíky, zuby a vlasy, se postupně zostřují, zatímco se zachovává temporální stabilita.

‘Při 100% přenosu, náš přístup dosahuje vykreslovací kvality srovnatelné s nejlepšími metodami. Zajímavé je, že snímková frekvence neklesá významně, pravděpodobně proto, že 3DGS pracovní zátěž ještě nesaturuje GPU.’

Nicméně, autoři poukazují na to, že v multi-uživatelských VR scénářích, počet 3D Gaussových křivek by rychle narostl do bodu, kde by se GPU rasterizace stala úzkým místem. V těch těžších scénářích, navrhovaná metoda nabízí výhodu, umožňující systému obchodovat počet primitiv proti vizuální kvalitě, snižující zátěž bez kolapsu vykreslování.

Although the paper does not detail it, the project site features additional test comparisons, also featuring the MeGA Hybrid mesh-Gaussian avatar project:

Kliknutím spustíte přehrávání. Jedna ze série doplňkových videí ze stránky projektu, toto srovnání nové metody v novém-záběrovém syntéze.

Závěr

Gaussian Splatting může nebo nemusí přetrvat, nebo být zapomenut stejně jako RealPlayer nyní, pokud jde o úsvit interaktivního streamování: AI-poháněné nebo AI-pomocné 3D-aware reprezentace, včetně videohovorů, virtuálního nákupu, navigace tras a různých zábavních aplikací. Může se stát, že alternativní technologie nebo přístupy zvítězí, nebo že GSplat prokáže být nejvěrnějším AI-videem.

Jestliže nic jiného, tato zajímavá nová práce ohlašuje malou část tohoto nového domény, zatímco připomíná, možná nostalgicky, šířku pásma-hladový internet minulosti.

 

* Když říkám ‘3D’, nemyslím typ zkušenosti, který vyžaduje speciální brýle, ale spíše zkušenosti, kde multimediální obsah má nějaký druh porozumění X/Y/Z souřadnic.

Poprvé publikováno ve středu, 18. března 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai