Anderson’un Açısı

Gerçek Zamanlı AI İnsanları Oluşturmak İçin Nöral Lumigraph Rendering ile Doğru Yöne

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Neural Lumigraph Rendering

Şu anki Nöral Işınım Alanları (NeRF) ile ilgili ilgi dalgasına rağmen, bu teknoloji 3D ortamlar ve nesneler oluşturmak için kullanılabiliyor, ancak bu yeni görüntü sentez teknolojisi hala büyük miktarda eğitim zamanı gerektiriyor ve gerçek zamanlı, yüksek derecede duyarlı arayüzler oluşturmak için bir uygulama eksikliği var.

Sanayi ve akademiden etkileyici isimlerin işbirliği, bu zorluğun (genel olarak Novel View Synthesis veya NVS olarak bilinen) yeni bir yaklaşımını sunuyor.

Araştırma makalesi, Nöral Lumigraph Rendering adlı, durumun mevcut durumuna göre yaklaşık iki katlık bir iyileştirme iddia ediyor ve makine öğrenimi boru hatları aracılığıyla gerçek zamanlı CG renderingu için birkaç adım öne çıkıyor.

Nöral Lumigraph Rendering (sağda) önceki yöntemlere göre daha iyi bir şekilde blending artifacts ve occlusion işleme sunuyor. Kaynak: https://www.youtube.com/watch?v=maVF-7x9644

Nöral Lumigraph Rendering (sağda) önceki yöntemlere göre daha iyi bir şekilde blending artifacts ve occlusion işleme sunuyor. Kaynak.

Makaledeki krediler sadece Stanford Üniversitesi ve holografik ekran teknolojisi şirketi Raxium’u (şu anda gizli modda çalışıyor) içerse de, katkıda bulunanlar arasında Google’da bir makine öğrenimi mimarı, Adobe’de bir bilgisayar bilimcisi ve CTO StoryFile (son zamanlarda manşetlere çıkan bir AI versiyonu ile William Shatner’ın hafızasını korumak için) bulunuyor.

StoryFile, yakın zamanda Shatner ile ilgili bir kamuoyu saldırısı melakukan, NLR’yi bireylerin özellikleri ve anlatıları temelinde etkileşimli, AI tarafından oluşturulan varlıklar oluşturmak için kullanıyor gibi görünüyor.

StoryFile, bu teknolojinin müze sergileri, online etkileşimli anlatılar, holografik ekranlar, artırılmış gerçeklik (AR) ve miras belgelerinde kullanımını öngörüyor ve ayrıca NLR’nin işe alım görüşmeleri ve sanal flört uygulamalarında potansiyel yeni uygulamalarına da bakıyor gibi görünüyor:

StoryFile tarafından yapılan bir online videodan önerilen kullanımlar. Kaynak: https://www.youtube.com/watch?v=2K9J6q5DqRc

StoryFile tarafından yapılan bir online videodan önerilen kullanımlar. Kaynak: https://www.youtube.com/watch?v=2K9J6q5DqRc

Yeni Görünüm Sentez Arayüzleri ve Video için Hacimsel Yakalama

Hacimsel yakalamanın ilkesi, bir dizi makalede biriken konu, bir konu hakkında stiller veya videolar almak ve makine öğrenimi kullanarak orijinal kamera dizisi tarafından kapsanmayan bakış açılarını ‘doldurmaktır’.

Kaynak: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Kaynak: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Yukardaki resim, Facebook’un 2019 AI araştırmasından (aşağıya bakınız) alınmıştır ve hacimsel yakalamanın dört aşamasını göstermektedir: Birden fazla kamera görüntüler/çekimler alır; kodlayıcı/çözücü mimarisi (veya diğer mimariler) bakış açılarının bağıntısını hesaplar ve birleştirir; ışın marching algoritmaları her bir noktadaki hacimsel uzaydaki voxels (veya diğer XYZ uzaysal geometrik birimler) hesaplar; ve (son makalelerde) eğitimi, gerçek zamanlı olarak manipüle edilebilen bir varlık sentezlemek için gerçekleşir.

Bu thường geniş ve veri yoğun eğitim aşaması, yeni görünüm sentezini gerçek zamanlı veya yüksek derecede duyarlı yakalamadan uzak tutmuştur.

Yeni Görünüm Sentezi, bir hacimsel uzayının tam bir 3D haritasını oluşturduğu için, bu noktaları geleneksel bir bilgisayar tarafından oluşturulan bir ağa birleştirmek nispeten kolaydır ve böylece bir CGI insanı (veya diğer herhangi bir sınırlı nesne) anında yakalar ve ifade eder.

NeRF’i kullanan yaklaşımlar, ara noktalar arasındaki interpolasyonları oluşturmak için nokta bulutları ve derinlik haritalarına güvenir:

NeRF, CG meshleri oluşturmak yerine derinlik haritalarının hesaplanması yoluyla hacimsel derinlik oluşturabilir. Kaynak: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF, CG meshleri oluşturmak yerine derinlik haritalarının hesaplanması yoluyla hacimsel derinlik oluşturabilir. Kaynak: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF yeteneğine sahiptir, ancak çoğu uygulama bunu hacimsel sahneleri oluşturmak için kullanmaz.

Öte yandan, Weizmann Bilim Enstitüsü tarafından Ekim 2020’de yayınlanan Implicit Differentiable Renderer (IDR) yaklaşımı, otomatik olarak oluşturulan 3D mesh bilgilerini kullanıyor:

IDR yakalama örnekleri, etkileşimli CGI meshlere dönüştürüldü. Kaynak: https://www.youtube.com/watch?v=C55y7RhJ1fE

IDR yakalama örnekleri, etkileşimli CGI meshlere dönüştürüldü. Kaynak: https://www.youtube.com/watch?v=C55y7RhJ1fE

NeRF, IDR’nin şekil tahmini yeteneğine sahip değildir, ancak IDR, NeRF’in görüntü kalitesine ulaşamamaktadır ve her ikisi de eğitim ve birleştirme için büyük kaynaklar gerektirir (ancak NeRF’deki recent yenilikler bu sorunu çözmeğe başlıyor).

NLR'nin özel kamera sistemi, 16 GoPro HERO7 ve 6 merkezi Back-Bone H7PRO kameraları içeriyor. 'Gerçek zamanlı' renderleme için, bu kameralar en az 60fps'de çalışıyor. Kaynak: https://arxiv.org/pdf/2103.11571.pdf

NLR’nin özel kamera sistemi, 16 GoPro HERO7 ve 6 merkezi Back-Bone H7PRO kameraları içeriyor. ‘Gerçek zamanlı’ renderleme için, bu kameralar en az 60fps’de çalışıyor. Kaynak: https://arxiv.org/pdf/2103.11571.pdf

Bunun yerine, Nöral Lumigraph Rendering, SIREN (Sinusoidal Representation Networks) kullanıyor ve her iki yaklaşımın güçlü yönlerini kendi çerçevesine entegre ediyor, bu da mevcut gerçek zamanlı grafik boru hatlarında doğrudan kullanılabilir çıktı oluşturmayı amaçlıyor.

SIREN, benzer uygulamalar için son bir yıl içinde kullanıldı ve şimdi görüntü sentezi topluluklarında bir API çağrısı olarak popülerlik kazandı; ancak NLR’nin yeniliği, SIREN’i iki boyutlu çoklu görüş görüntü denetimine uygulamaktır, bu da SIREN’in aşırı uyarlama yerine genelleştirilmiş çıktı üretmesi nedeniyle sorunlu bir görevdir.

CG mesh, kamera dizisi görüntülerinden çıkarıldıktan sonra, mesh OpenGL ile rasterize edilir ve meshin köşe noktaları ilgili piksellere eşlenir, ardından çeşitli katmanların birleştirilmesi hesaplanır.

Sonuç mesh, NeRF’in meshine göre daha genel ve temsil edicidir, daha az hesaplama gerektirir ve aşırı ayrıntı uygulamaz (örneğin, düz yüzeylerde).

Kaynak: https://arxiv.org/pdf/2103.11571.pdf

Kaynak: https://arxiv.org/pdf/2103.11571.pdf

Öte yandan, NLR henüz dinamik aydınlatma veya yeniden aydınlatma yeteneğine sahip değildir ve çıktı, yalnızca yakalama anında elde edilen gölgeli haritalar ve diğer aydınlatma dikkate alınır. Araştırmacılar, bu konuyu gelecekteki çalışmalarda ele almayı amaçlıyorlar.

Ayrıca, makale, NLR’nin şekillerinin bazı alternatif approacheden (Pixelwise View Selection for Unstructured Multi-View Stereo veya Weizmann Enstitüsü’nün daha önce bahsedilen araştırması gibi) daha doğru olmadığını kabul ediyor.

Hacimsel Görüntü Sentezinin Yükselişi

Nöral ağlarla sınırlı bir dizi fotoğraflardan 3D varlıklar oluşturma fikri, NeRF’den önce gelir ve 2007 veya daha önceki vizyoner makalelere kadar uzanır. 2019’da Facebook’un AI araştırma departmanı, Nöral Hacimler: Görüntülerden Dinamik Render Edilebilen Hacimler Öğrenme adlı bir araştırma makalesi yayınladı ve bu, makine öğrenimi tabanlı hacimsel yakalamanın sentetik insanlar için duyarlı arayüzler oluşturmasını sağladı.

Facebook'un 2019 araştırması, bir hacimsel kişi için kullanıcı tarafından yönlendirilen bir arayüz oluşturulmasını sağladı. Kaynak: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Facebook’un 2019 araştırması, bir hacimsel kişi için kullanıcı tarafından yönlendirilen bir arayüz oluşturulmasını sağladı. Kaynak: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai