Anderson’un Açısı
1999 Gibi Akışkan AI Avatarları

Yeni bir araştırma, neredeyse anında ortaya çıkan ve gerçek zamanlı olarak keskinleşen gerçekçi 3D avatarları akışlaştırmak için bir yöntem sunuyor ve böylece kullanıcıların büyük indirme işlemlerinin tamamlanmasını beklemek zorunda kalmıyor.
Çok yönlü olarak, yapay zeka ve yapay zeka destekli işleme sistemlerinin devasa kaynak talepleri, tüketici hazırlığını yirmi yılı aşkın bir süre geri götürdü. 2023’te, bir dizüstü veya masaüstü bilgisayarda 64GB RAM tahsisi aşırı görünüyordu; şimdi, artan RAM ve/veya CPU offloading popülerliği ile, 64GB yerel AI ihtiyaçları için oldukça mütevazı; ve bu bir zamanlar sıradan ve ucuz PC bileşenleri, AI hizmetleri talebini karşılamak için mücadele eden şirketler nedeniyle fiyatlarını roket gibi artırıyor.
Yapay zeka ve işlemlerinin ölçeği ve açgözlülüğü genellikle tüketici seviyesindeki donanımı gölgede bırakıyor ve hatta yerel olarak yönlendirilmiş modelleri GGUF sürümleri olarak çalıştırmak bile ortalama sistemi zorluyor.
Metin tabanlı AI hizmetleri gibi ChatGPT bile önemli bir yük altındadır, hem istemci hem de sunucu düzeyinde. Dolayısıyla, bir kez AI, gerçek zamanlı olarak çevrimiçi çoklu ortam deneyimleri sunmaya görevlendirildiğinde, bazı ciddi uzatma ve/veya kalite tavizleri bekleyebiliriz – internetin erken dönemlerindeki çoklu ortam akışı mücadeleleri ve RealPlayer ve QuickTime gibi canavarlı “buförleme” simgeleri gibi.
Son kez çoklu ortam ve ağ sorunlarının kullanıcı deneyiminde sürtüşme yaratması, tüketici seviyesindeki donanımın hala Moore Yasası yoluyla evrimleştiği bir zamandı, her yıl neredeyse üssel olarak iyileştiriliyor, işletim sistemleri, ağlar ve diğer altyapılar da talebi karşılamak için evrimleşiyordu; ve son on yıl boyunca, tüketici teknolojisinin yetenekleri çoklu ortam taleplerini aştı (belki satışları desteklemek için çevrimi yeniden başlatmak gerekiyordu).
Ama bu yerel yetenek fazlası possibly yakında sona erebilir, çünkü yerel donanım daha düşük özellikli ve daha pahalı hale geliyor ve AI tabanlı hizmetler daha yüksek sunucu tarafı ve yerel kaynaklar talep ediyor.
Bir Başlangıç
Geniş bant öncesi dönemde, hatta en erken kullanılabilir video akışı öncesi, web kullanıcıları, ilerleyici JPEG’ler sayesinde, indirilen görüntünün yavaş yavaş odaklanmasını izleyebiliyordu, bazen acı verici bir şekilde yavaş olarak, daha fazla görüntü verisi yerel olarak yükleniyordu.
Şimdi, sanki benzer bir deneyime AI destekli Gaussian Splat avatarları ile gireceğiz:
Tıklatarak oynatın. Yeni ProgressiveAvatars projesinden, akışkan Gaussian avatarların karşılaştırması. Solda, eski GaussianAvatars projesi yavaş yavaş yeni veri alıyor, ancak veri birikebilirken kötü görünüyor; sağda, Progressive Avatars sürümü de yavaş yavaş ayrıntı kazanıyor, ancak bunu akıllı bir şekilde yapıyor ve başlangıçta temel bir insan benzerliği sunuyor. Kaynak
Üstte, iki Gaussian Splat tabanlı (GSplat) Avatar görüyoruz – bir insan temsilcisi, kısmen 1990’ların başlarından kalma bir işleme tekniği ve daha modern yöntemler ile ermögülen, FLAME parametrik insan modeli ve AI tabanlı eğitim yaklaşımları:

Gaussian Splatting, bir piksel veya voksel yerine renk ve 3B bilgi için Gaussian bir temsil kullanır ve bu ultra-gerçekçi dokuyu daha geleneksel bir CGI ağza haritalar, ki bu da FLAME ve STAR gibi sistemlerdeki ‘parametrik insan’ tarafından sağlanır. Kaynak
Solda, videoda geleneksel bir Gaussian splat avatarın, veri yüklenirken nasıl korkunç göründüğünü görebiliriz. Sağda, Çin’den yeni bir uygulama, ProgressiveAvatars, veri yüklenirken çok daha zarif bir şekilde çözülüyor ve başlangıçta alarm verici olmayan bir insan görüntüsü sunuyor.
Yazarlar, yöntemlerinin真正 olarak akışkan Gaussian avatarları sunmaya yönelik olduğunu ve ilk kez ilerleyici bir şekilde yapıldığını iddia ediyorlar, yani görüntü elegan bir şekilde inşa ediliyor ve en önemli alanlar, yani gözler ve dudaklar, önceliklendirilebiliyor, böylece avatar kısmen yüklenmeden önce bile sohbet edebilir:
Tıklatarak oynatın. ProgressiveAvatars projesi sitesinden, dikkatli yüklemenin bir illüstrasyonu.
Öncesinde, ‘ayrıntı seviyesi’ (LOD) yaklaşımı, önceki Gaussian Splat avatarlarını inceltmek için kullanılmıştır, benzer şekilde video oyunu optimizasyonlarında olduğu gibi,Successively daha ayrıntılı versiyonlar yüklenmiştir.
Tabii ki, bu, çok fazla冗余 ‘yedek’ avatarların oluşmasına neden olur ve yazarlar, yaklaşımını daha mantıklı bir sistem olarak tanımlarlar. Bu yöntemin bir sonucu olarak, GSplat figüründe (örneğin, özelleştirme) değişiklikler yapılabiliyor ve bu değişikliklerin çeşitli LOD ‘ikizleri’ aracılığıyla yayılmasına gerek kalmıyor.
Yeni Bir Alan
Eğer bu bir niş problem gibi görünüyorsa, iyi, öyleydi video akışı da, en erken eklentilerin çalışmasını sağlamak için en yakın available nerd’e görevlendirilmişti. Ayrıca, AI tabanlı akışkan temsil possibilities, insan avatarlarından öteye, şehir oluşturma, oyunlar ve 3B tabanlı neredeyse her türlü çevrimiçi alan – gibi Sanal Deneme için giyim alışverişi:
Tıklatarak oynatın. 2024 projesinden, çevrimiçi ‘deneme’ nin geleceğine dair bir bakış.Kaynak
Çoklu insan, çevresel özellikler ve ambiyans gibi durumlar gerekecek, burada yüksek performanslı ‘triage’ sistemleri, akış veri önceliklendirmesi belirleyecek, böylece izleyiciyi anında tutmak için:
Yeni makale, ProgressiveAvatars: İlerleyici Animasyonlu 3B Gaussian Avatarlar başlığını taşıyor ve Çin’in Hefei kentindeki Bilim ve Teknoloji Üniversitesi’nden üç araştırmacı tarafından yazılmıştır.
Yöntem
Yaklaşım, başlangıçta bir kişinin başının videosunu kullanıyor. Her kare için, standart FLAME parametrik yüz modeli uyuyor, böylece şekil ve ifade zaman içinde değişirken, altta yatan ağ yapıları sabit kalıyor. Temel topoloji değişmediği için, bir FLAME şablonu yeniden kullanılabilir ve her an yeniden inşa edilmek yerine geliştirilebilir:

Baş video önce bir FLAME ağza uyuyor, ardından her yüzeye 3B Gausslar ekleniyor ve ekran uzayındaki gradyanlara göre hiyerarşik olarak büyütülüyor.
Üstüne, ayrıntı katmanlar halinde ekleniyor; yüzey, hiyerarşiye implicit olarak bölünüyor ve her ayrıntı seviyesinde küçük 3B Gausslar yüzeye ekleniyor.
İlk, daha kaba katmanlar genel baş şekli ve hareketi yakalıyor, sonraki daha ince katmanlar ise kırışıklıkları, ince deformasyonları ve yüksek frekanslı dokuları sağlıyor. Görüntüler, bu Gausslardan farklılaşan bir Gauss rasterizer kullanılarak oluşturuluyor ve çoklu görüş gerçek veri karşıtı olarak eğitiliyor, böylece avatar gerçek kişinin görünümünü yeniden üretmeyi öğreniyor.
Eğitim sırasında, bu hiyerarşi otomatik olarak büyüyor: daha fazla ayrıntı gerektiren bölgeler, ekran uzayındaki sinyaller tarafından yönlendirilerek daha da bölünüyor, böylece hesaplama çabası, izleyici gözünün en çok hata göreceği alanlarda yoğunlaşıyor.
Çıktı sırasında, bu hiyerarşi ilerleyici akış ermögiliyor, yani avatarın kaba bir versiyonu önce görüntülenebilir ve eklenerek daha fazla veri yüklendikçe, yeni Gausslar eklenebilir, böylece animasyonlu bir baş avatarı hızlı bir şekilde ortaya çıkabilir ve daha fazla veri geldikçe daha da netleşir.
Yazarlar, tüm sistemin gelen verilerin önceliklendirilmesine dayandığını gözlemliyorlar:

Tüm Gausslar bir seviyede mevcut olduğunda, tam model en yüksek doğrulukla render ediliyor, ancak akış sırasında en yüksek katkı Gausslarını ilk olarak göndermek, erken kısmi sonuçların son görüntüye yakın olmasını sağlıyor.
Veri ve Testler
Testler için, yeni yöntem NeRSemble veri kümesi üzerinde değerlendirildi, bu veri kümesi her konu için çoklu görüş videolarını içeriyor, tüm görüntülerde kalibre edilmiş parametrelerle:

Testlerde kullanılan NeRSemble veri kümesindeki çeşitli konuların örnekleri. Kaynak
Asıl GaussianAvatars yöntemiyle uyumlu olarak, görüntüler 802x550px’ye küçültülüyor, bir ön plan maskesi oluşturuluyor ve orijinal proje’nin eğitim/test bölümü benimseniyor.
Adam optimizer parametre güncellemeleri için kullanılıyor, tüm barycentrik koordinatlar için 1×10-2 öğrenme oranı ile. Eğitim 60.000 iterasyon için çalıştırılıyor, hiyerarşi her 2.000 iterasyonda otomatik olarak genişletiliyor.
İlk olarak, yazarlar yeniden yapılandırma ve animasyon için test ediyor – düz videoyu 3B bilgisi olan (x/y/z) bir sisteme dönüştürme görevi, FLAME’in kanonik CGI temsilini temel mesh olarak kullanıyor. Bu testler için, tüm temel değerler sıfırdan eğitiliyor ve rakip çerçeveler olarak GaussianAvatars ve PointAvatar kullanılıyor.
Bu testler için kullanılan metrikler Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) ve Learned Perceptual Image Patch Similarity (LPIPS):

Yeni görüş ve yeni ifade sentezinde nitel karşılaştırma. GaussianAvatars, gözler, kırışıklıklar ve cilt dokusu etrafındaki ince ayrıntılar ile mücadele ederken, önerilen yöntem zaten ana yüz yapısını yaklaşık %5 iletmüş veri ile koruyor ve daha fazla Gausslar akışı ile birlikte zemin gerçeğine yaklaşıyor.
Yazarlar şunları iddia ediyor:
‘[Önerilen] yöntem, özellikle boyun, omuzlar ve kıyafetler gibi bölgelerde daha keskin ayrıntılar yeniden oluşturur. Bu alanlar, FLAME şablonunda yüksek saliencyli yüz bölgelerine (örneğin, perioküler bölge) kıyasla göreceli olarak kaba bir şekilde tessellatedir.
‘Önceki yöntemler, bu bölgelerin ince ayrıntılarını sadık bir şekilde yakalamak için genellikle yeterli 3B Gausslara tahsis etmez. Buna karşılık, bizim adaptif büyüme stratejimiz, Gaussların sayısını artırır ve yalnızca gerekli olan bölgelerde hiyerarşiyi iyileştirir, böylece Gaussların tahsisi FLAME’in non-uniform tessellasyonuna karşı duyarsız hale gelir.’
Yazarlar ayrıca, yaklaşımının devlet-sanat yöntemleriyle aynı seviyede olduğunu ve sadece %5 bant genişliği ile bile çalışabilir bir avatar sağladığını belirtiyorlar:

Yeni görüş sentezi ve yeni ifade sentezi için PSNR, SSIM ve LPIPS kullanarak nicel karşılaştırma. Tam iletimde, önerilen yöntem her iki görevde en yüksek PSNR’yi elde ediyor ve GaussianAvatars ile algısal metriklerde rekabetçi kalıyor, %5 ayarı ise aşırı bant genişliği kısıtlamaları altında kalite ticaretini gösteriyor.
Sonra, araştırmacılar ilerleyici rendering’i test ettiler. Bu, bir NVIDIA RTX 4090 üzerinde, 24Gb VRAM ile, 550x802px çözünürlükte yapıldı. Bu senaryoda, yazarlar, %25’lik bir bütçenin tüm ‘seviye 1’ Gausslarını ve bir subsetini ‘seviye 2’ Gausslarını kullanacağını, böylece Gauss gruplarının nasıl ayrıntı kazandığını ve daha düşük seviyelerin temel canvas’ı oluşturduğunu gösteriyor:

Yeni görüş ve yeni ifade sentezi için farklı iletim bütçeleri altında performans, Gausslar ve veri akışı arttıkça GaussianAvatars’i geçiyor ve RTX 4090 üzerinde gerçek zamanlı hızları koruyor.
Yazarlar şunları söylüyor:
‘Sadece 2.60 MB iletilmiş (%5 bütçe) ile, avatar zaten makul bir kaliteye ulaşıyor. Daha yüksek seviyedeki Gausslar akışı ile birlikte, gömlek düğmeleri, dişler ve saç gibi ince yapılar dần dần netleşiyor ve temporal stabilite korunuyor.
‘%100 iletimde, yaklaşımımız rendering kalitesi olarak devlet-sanat yöntemlerine benzer bir seviyeye ulaşıyor. Önemli olarak, kare hızları önemli ölçüde düşmüyor, muhtemelen 3DGS iş yükünün GPU’yi henüz doyurmamasından dolayı.’
Ancak, yazarlar, çoklu kullanıcı sanal gerçeklik senaryolarında, 3D Gaussların sayısı hızla artacak ve GPU rasterizasyonu bir bottleneck haline geleceğini belirtiyorlar. Daha ağır senaryolarda, önerilen yaklaşım, sistemlerin primitive sayısını görsel kaliteye karşı takas etmesini sağlayarak, yükü azaltıyor ve renderin çökmesini önleyerek:
makale, ayrıca MeGA Hybrid mesh-Gaussian avatar projesi ile ilave test karşılaştırmalarını içeriyor:
Tıklatarak oynatın. Makalenin eşlik eden projesi sitesinden, yeni yaklaşımın yeni görüş sentezi açısından bir karşılaştırması.
Sonuç
Gaussian Splatting, kalıcı olabilir veya hatırlanabilir, veya belki de RealPlayer gibi, etkileşimli akışın şafağında:
AI destekli veya AI-tabanlı 3B bilgisi olan temsil experiences, video sohbeti, sanal alışveriş, rota navigasyonu ve çeşitli eğlence uygulamaları dahil. Alternatif teknolojiler veya yaklaşımlar galip gelebilir, veya GSplat en güvenilir AI-video temsilcisi olabilir.
Eğer başka bir şey değilse, bu ilginç yeni makale, bu yeni alanın kapsamının bir kısmını haber veriyor ve belki de nostaljik bir şekilde, eski bant genişliği kısıtlı interneti anımsatıyor.
* ‘3D’ demişken, özel gözlük gerektiren bir deneyimi kastetmiyorum, ancak çoklu ortam içeriğinin X/Y/Z koordinatları hakkında bir tür bilgi sahibi olduğu deneyimleri kastediyorum.
İlk olarak Çarşamba, 18 Mart 2026’da yayınlandı.










