Kąt Andersona
Transmisja awatarów AI jak w 1999 roku

Naukowcy przedstawili sposób transmisji fotorealistycznych awatarów 3D, które pojawiają się prawie natychmiast i stają się ostrzejsze w czasie rzeczywistym, zamiast zmuszać użytkowników do oczekiwania na zakończenie ogromnych pobierania.
W wielu aspektach ogromne wymagania zasobowe generatywnej sztucznej inteligencji i systemów wspomaganych przez sztuczną inteligencję cofnęły gotowość konsumentów o dwadzieścia lub więcej lat. Jeszcze w 2023 roku, 64 GB pamięci RAM w laptopie lub komputerze stacjonarnym wydawało się nadmiarem; teraz, ze względu na rosnącą popularność offloadingu pamięci RAM i/lub CPU, 64 GB jest dość skromne dla lokalnych potrzeb sztucznej inteligencji; a te niegdyś banalne i tanie elementy komputerów nadal szybko rosną w cenie, ponieważ korporacje walczą o zaspokojenie popytu na usługi sztucznej inteligencji.
Skala i chciwość sztucznej inteligencji oraz jej procesów i środowisk zwykle przewyższają sprzęt konsumentów, a nawet uruchamianie “zredukowanych” modeli lokalnych jako wersje GGUF będzie zwykle obciążać przeciętny system.
Nawet usługi sztucznej inteligencji oparte na tekście, takie jak ChatGPT, są narażone na znaczne obciążenie zarówno na poziomie klienta, jak i serwera. Dlatego też, gdy sztuczna inteligencja jest zmuszona do dostarczania online doświadczeń multimedialnych w czasie rzeczywistym, możemy rozsądnie oczekiwać pewnych poważnych kompromisów w opóźnieniu i/lub jakości – podobnie jak w przypadku wczesnych problemów internetu ze strumieniowaniem mediów i nienawistnych animowanych ikon “buforowania” w programach RealPlayer i QuickTime.
Ostatni raz, gdy problemy multimedialne i sieciowe tworzyły tarcie w doświadczeniu użytkownika, sprzęt konsumentów był nadal ewoluował zgodnie z prawem Moore’a, stając się prawie wykładniczo lepszym każdego roku, nawet gdy systemy operacyjne, sieci i inne infrastruktury wspierające ewoluowały, aby zaspokoić popyt; a przez ostatnie dziesięć lat, możliwości technologii konsumentów przewyższały wymagania multimedialne (może nawet do punktu, w którym konieczne było zainicjowanie wymiany, aby utrzymać sprzedaż).
Ale ten nadmiar lokalnej możliwości może wkrótce dojść do końca, ponieważ lokalny sprzęt staje się mniej wydajny i droższy, a usługi oparte na sztucznej inteligencji wymagają większych zasobów po stronie serwera i lokalnej.
Pozyskanie głowy
W erze przed szerokopasmową, nawet przed pierwszymi użytecznymi strumieniami wideo, użytkownicy internetu byli przyzwyczajeni do obrazów, które powoli się klarowały, gdy postępowe JPEG pozwalały użytkownikom obserwować pobieranie obrazu, czasem bardzo powoli, gdy więcej danych obrazu było ładowanych lokalnie.
Teraz wydaje się, że możemy mieć podobne doświadczenie z awatarami Gaussian Splat:
Kliknij, aby odtworzyć. Z nowego projektu ProgressiveAvatars, porównanie strumieniowania awatarów Gaussian. Po lewej, starszy projekt GaussianAvatars powoli otrzymuje nowe dane, ale wygląda źle, gdy dane są budowane; po prawej, wersja Progressive Avatars również buduje szczegóły powoli, ale robi to w sposób inteligentny, który daje podstawową ludzką podobiznę od samego początku. Źródło
Powyżej widzimy dwie wersje awatarów opartych na FLAME i innych nowoczesnych metodach, takich jak FLAME i STAR:

Gaussian Splatting używa reprezentacji Gaussa koloru i informacji 3D zamiast piksela lub vokselu i mapuje tę ultra-realistyczną teksturę na bardziej tradycyjną siatkę CGI, która jest ułatwiona przez ‘parametrycznego człowieka’, CGI twarz i/lub ciało, w systemach takich jak FLAME i STAR. Źródło
Na lewej stronie w powyższym filmie widać, że tradycyjna implementacja awatarów Gaussian wygląda dość okropnie, gdy czekamy na pobranie danych. Na prawej stronie nowa implementacja z Chin, nazwana ProgressiveAvatars, jest w stanie rozwiązać ten problem w sposób bardziej elegancki, prezentując niezbyt alarmujący obraz ludzki od samego początku.
Autorzy twierdzą, że ich metoda jest pierwszą, która naprawdę “strumieniuje” awatar Gaussian, i z pewnością pierwszą, która robi to w sposób postępowy, gdzie obraz buduje się elegancko, a najważniejsze obszary – takie jak oczy i usta – mogą być priorytetowe, aby awatar mógł stać się rozmowny, nawet gdy jest tylko częściowo załadowany:
Kliknij, aby odtworzyć. Z witryny projektu ProgressiveAvatars, ilustracja załadunku z uwzględnieniem uwagi.
Poprzednio stosowano podejście “poziomu szczegółowości” (LOD) w poprzednich próbach zredukowania awatarów GSplat, podobnie do optymalizacji gier wideo, gdzie sukcesywnie bardziej szczegółowe wersje osoby są ładowane w zależności od tego, czy zajmują wystarczająco dużo miejsca w viewport lub uwagi widza, aby było to warte wysiłku.
Wygrywający obszar
Jeśli to wydaje się niszowym problemem, to tak samo było ze strumieniowaniem wideo w czasach, gdy uzyskanie pierwszych wtyczek do pracy było zlecone najbliższemu dostępnemu nerdowi. Co więcej, potencjał reprezentacji opartych na sztucznej inteligencji sięga poza awatary ludzkie, obejmując generowanie miast, gry i wersje 3D niemal każdego domeny online – takie jak Virtual Try-On do zakupów odzieży:
Kliknij, aby odtworzyć. Z projektu z 2024 roku, surowy wygląd przyszłości zakupów online. Inne projekty starają się dodać ruch i interaktywność – wymagające aspekty do strumieniowania i zarządzania. Źródło
Wiele z tych wczesnych awatarów GSplat przedstawia jednego człowieka grymaszącego i mrużącego, lub perhaps mówiącego; ale wiele sytuacji będzie wymagało kilku ludzi, a także cech środowiskowych i atmosfery – scenariusz, w którym bardzo wydajne systemy “triage” będą decydować, gdzie dane strumieniowania powinny być priorytetowe, aby utrzymać widza w momencie.
Nowy artykuł nosi tytuł ProgressiveAvatars: Postępowe animowalne awatary 3D Gaussian i pochodzi od trzech badaczy z Uniwersytetu Nauki i Technologii Chin w Hefei.
Metoda
Podejście początkowo wykorzystuje wideo głowy osoby. Dla każdej klatki, standardowy model twarzy FLAME jest dopasowany, tak aby kształt i wyraz twarzy zmieniały się w czasie, podczas gdy podstawowa struktura siatki pozostaje niezmieniona. Ponieważ podstawowa topologia nie ulega zmianie, stabilny szablon FLAME może być ponownie wykorzystany i udoskonalony zamiast odbudowany od podstaw w każdej chwili, jak to ma miejsce w podobnych poprzednich pracach:

Wideo głowy jest najpierw dopasowane do śledzonej siatki FLAME, po czym 3D Gaussowskie są dołączone do każdej twarzy i rosną hierarchicznie tam, gdzie gradienty przestrzeni ekranu wskazują brak szczegółów. Podczas szkolenia, ta adaptacyjna podział builds wielopoziomową reprezentację pod nadzorem wielu widoków, a podczas wnioskowania, wyniki ważności twarzy określają, które Gaussowskie są strumieniowane jako pierwsze, pozwalając awatarowi pojawiać się szybko i ulegać postępowej poprawie, gdy dodawane są wyższe poziomy szczegółowości.
Nad tą podstawową strukturą dodawane są szczegóły warstwami; powierzchnia jest niejawnie podzielona na hierarchię, a małe trójwymiarowe Gaussowskie są dołączone do twarzy na każdym poziomie szczegółowości.
Chociaż początkowe grubszą warstwy ujmują ogólny kształt głowy i ruch, następne cienkie warstwy dostarczają zmarszczki, subtelne deformacje i wysokoczęstotliwościową teksturę. Obrazy są następnie renderowane z tych Gaussowskich przy użyciu różniczkowalnego rasterizera Gaussowskiego i szkolone przeciwko wielowidokowym zdjęciom odniesienia, tak aby awatar nauczył się odtwarzać wygląd prawdziwej osoby.
Podczas szkolenia, ta hierarchia rośnie automatycznie: regiony, które wymagają więcej szczegółów, są dalej podzielone, kierowane przez sygnały przestrzeni ekranu, tak aby wysiłek obliczeniowy koncentrował się tam, gdzie oko widza jest najbardziej prawdopodobne, aby zauważyć błędy.
Podczas wnioskowania, ta sama hierarchia umożliwia postępowe strumieniowanie, gdzie wstępna wersja awataru może być wyświetlona jako pierwsza, a gdy dodawane są dodatkowe warstwy, nowe Gaussowskie mogą być dodawane bez zmiany tego, co już jest wyświetlane, umożliwiając animowany awatar głowy, który pojawia się szybko i staje się ostrzejszy i bardziej szczegółowy, gdy przybywa więcej danych.
Autorzy zauważają, że cały system opiera się na priorytetowaniu przychodzących danych:

Gdy wszystkie Gaussowskie na danym poziomie są dostępne, pełny model jest renderowany z maksymalną wiernością; ale podczas strumieniowania, wysyłanie Gaussowskich o największym wkładzie jako pierwsze pozwala na wczesne częściowe wyniki, które są bardzo podobne do końcowego obrazu, podczas gdy transmisja Gaussowskich o niskim wkładzie jako pierwsze odkształca balans koloru i podkreśla mniejsze składniki.
Dane i testy
Do testów, nowa metoda została oceniona na NeRSemble, który składa się z wielowidokowych wideo dla każdej osoby, z skalibrowanymi parametrami we wszystkich widokach:

Przykłady różnych interpretacji osób zawartych w NeRSemble użytych w testach dla ProgressiveAvatars. Źródło
Zgodnie z oryginalną metodologią GaussianAvatars, obrazy zostały pomniejszone do 802x550px, wygenerowano maskę pierwszego planu i przyjęto oryginalny podział danych szkoleniowych i testowych.
Optymalizator Adam został użyty do aktualizacji parametrów, z współczynnikiem uczenia 1×10-2 we wszystkich współrzędnych barycentrycznych. Trening trwał 60 000 iteracji, a hierarchia była automatycznie rozszerzana co 2 000 iteracji.
Początkowo autorzy testowali rekonstrukcję i animację – zadanie konwersji płaskiego wideo w system 3D (x/y/x), używając kanonicznej reprezentacji CGI FLAME jako kotwicy. Dla tego, wszystkie podstawy były szkolone od podstaw, a rywalizujące ramy były testowane wraz z PointAvatar.
Dla tych testów, użyto następujących miar: Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) i Learned Perceptual Image Patch Similarity (LPIPS):

Jakościowa porównanie na nowe widoki i nowe syntezy wyrażania. Podstawowy GaussianAvatars ma trudności z drobnymi szczegółami wokół oczu, zmarszczkami i skórą, podczas gdy proponowana metoda zachowuje kluczową strukturę twarzy już przy około pięciu procentach przesłanych danych i zbliża się do prawdziwego obrazu, gdy więcej Gaussowskich jest strumieniowanych, ściśle dopasowując pełny model i obrazy odniesienia (prawdziwe).
Co do tych wyników, autorzy twierdzą:
‘[Nasza] metoda odtwarza ostrzejsze szczegóły w kilku regionach, szczególnie wokół szyi, ramion i ubrania. Te obszary są dość grubo siatkowane w szablonie FLAME w porównaniu z wysokimi strefami saliency (np. okolicą oczu).
‘W związku z tym, poprzednie metody często przydzielają zbyt mało 3D Gaussowskich do tych obszarów, aby wiernie uchwycić ich drobne szczegóły. Natomiast nasza strategia adaptacyjnego wzrostu zwiększa liczbę Gaussowskich i udoskonala hierarchię tylko tam, gdzie jest to potrzebne, czyniąc przydział niezależnym od nierównomiernej siatki FLAME.’
Autorzy zauważają ponadto, że ich podejście jest na równi z najlepszymi metodami, dającą funkcjonalny awatar z trywialnym 5% limitem przepustowości:

Ilościowa porównanie na nową syntezę widoku i nową syntezę wyrażania przy użyciu PSNR, SSIM i LPIPS. Przy pełnej transmisji, proponowana metoda osiąga najwyższy PSNR w obu zadaniach i pozostaje konkurencyjna z GaussianAvatars w percepcyjnych miarach, podczas gdy ustawienie 5% ilustruje kompromis jakości przy ekstremalnych ograniczeniach przepustowości.
Następnie badacze przetestowali samo postępowe renderowanie. To było przeprowadzone na NVIDIA RTX 4090, z 24 GB pamięci VRAM, przy rozdzielczości 550x802px. W tym scenariuszu, autorzy zauważają, że 25% budżetu zużyłoby wszystkie “poziom 1” Gaussowskie, a także podzbiór Gaussowskich poziomu 2, co daje ogólne pojęcie o tym, jak grupy Gaussowskich gromadzą szczegóły w wyższych grupach, i że niższe numery grup budują podstawową kanwę:

Wydajność pod różnymi budżetami transmisji dla nowej syntezy widoku i nowej syntezy wyrażania, pokazując, że jakość stopniowo zbliża się lub przewyższa GaussianAvatars, gdy więcej Gaussowskich i danych jest strumieniowanych, przy zachowaniu prędkości w czasie rzeczywistym, na RTX 4090.
Autorzy komentują:
‘Z tylko 2,60 MB przesłanych (5% budżet), awatar już osiąga rozsądną jakość. Gdy wyższe poziomy Gaussowskich są strumieniowane, drobne struktury, takie jak guziki koszuli, zęby i włosy, stopniowo stają się ostrzejsze, podczas gdy stabilność czasowa jest utrzymana.
‘Przy 100% transmisji, nasze podejście osiąga jakość renderowania porównywalną z najlepszymi metodami. Godne uwagi jest to, że szybkość klatek nie spada znacznie, co sugeruje, że obciążenie 3DGS jeszcze nie nasyciło GPU.’
Jednak autorzy zauważają, że w scenariuszach wielu użytkowników VR, liczba 3D Gaussowskich szybko wzrośnie do punktu, w którym rasterizacja GPU stanie się wąskim gardłem. W tych cięższych scenariuszach, proponowane podejście oferuje przewagę, pozwalając systemowi na kompromis pomiędzy liczbą prymitywów a jakością wizualną, co ułatwia obciążenie bez załamania renderowania.
Chociaż artykuł nie opisuje tego, witryna projektu zawiera dodatkowe porównania testowe, również zawierające projekt awatarów hybrydowych MeGA:
Kliknij, aby odtworzyć. Jeden z serii dodatkowych filmów z witryny artykułu, ten porównuje nowe podejście w zakresie nowej syntezy widoku.
Wnioski
Awatary Gaussian Splatting mogą lub nie mogą przetrwać, lub być pamiętane bardziej niż RealPlayer teraz, w odniesieniu do początków interaktywnego strumieniowania: doświadczenia 3D oparte na sztucznej inteligencji, w tym wideoczat, wirtualne zakupy, nawigacja tras i różne aplikacje rozrywkowe. Mogło by być tak, że alternatywne technologie lub podejścia okazują się zwycięzcami, lub że GSplat okazuje się najbardziej niezawodną reprezentacją wideo opartą na sztucznej inteligencji.
Jeśli nic innego, to ten interesujący nowy artykuł zwiastuje nieco zakresu tego nowego obszaru, przypominając nam, być może z nostalgią, o przepustowości-głodnym internecie dawnych czasów.
* Przez ‘3D’ nie mam na myśli rodzaj doświadczenia, które wymaga specjalnych okularów, ale raczej doświadczenia, w których treści multimedialne mają pewne zrozumienie współrzędnych X/Y/Z.
Pierwotnie opublikowane w środę, 18 marca 2026










