Anderson’un Açısı

Nöral Arama ve Kurtarma Uçan Çevreleri Oluşturmak için Mega-NeRF ile Nöral Arama

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Carnegie Mellon ve otonom sürüş teknoloji şirketi Argo AI arasındaki yeni bir araştırma işbirliği, Neural Radiance Fields (NeRF) temelinde dinamik uçan çevreleri oluşturmak için ekonomik bir yöntem geliştirdi. Bu yöntem, dronlar tarafından çekilen görüntüleri kullanıyor.

"Mega-NeRF

Yeni yaklaşım, Mega-NeRF, ortalama Neural Radiance Fields rendering standardına göre 40 kat hızlanma elde ediyor ve ayrıca yeni NeRF makalelerinde tekrar eden “tanklar ve tapınaklar”ın aksine farklı bir şey sunuyor.

Yeni makale, Mega-NeRF: Sanal Uçan Çevreler için Büyük Ölçekli NeRF’lerin Ölçeklenebilir İnşası başlığını taşıyor ve Carnegie Mellon’dan üç araştırmacı tarafından yazılmış, bunlardan biri de Argo AI’yi temsil ediyor.

NeRF Manzarası için Arama ve Kurtarma

Yazarlar, arama ve kurtarma (SAR) operasyonlarının bu tekniğin muhtemel optimal kullanım alanı olduğunu düşünüyor. Bir SAR manzarasını değerlendirirken, dronlar şu anda bant genişliği ve pil ömrü kısıtlamaları ile sınırlıdır ve bu nedenle genellikle ayrıntılı veya kapsamlı bir kapsam elde edemezler, daha sonra topladıkları verileri dönüştürerek statik 2D hava görüntüleri oluştururlar.

Yazarlar şöyle diyor:

‘Gelecekte, nöral renderingin bu analizi 3D’ye taşıyacağı bir dünya hayal ediyoruz, böylece yanıt ekipleri, klasik Structure-from-Motion (SfM) ile elde edilebileceğinden çok daha ayrıntılı bir düzeyde sahaya gerçek zamanlı olarak uçan bir dron gibi bakabilecekler.’

Bu kullanım senaryosuna görevlendirilen yazarlar, bir gün içinde eğitilebilecek bir NeRF tabanlı model oluşturmayı amaçladılar, çünkü arama ve kurtarma operasyonlarında hayatta kalanların yaşam beklentisi ilk 24 saat içinde %80’e kadar düşebilir.

Yazarlar, Mega-NeRF modelini eğitmek için gerekli dron kamera veri setlerinin, standard bir NeRF veri setinden “büyüklükte daha büyük” olduğunu ve model kapasitesinin NeRF’in varsayılan çatallanması veya türetilmesinden daha yüksek olması gerektiğini belirtiyorlar. Ayrıca, arama ve kurtarma arazisi haritasında etkileşimlilik ve keşfedilebilirlik çok önemlidir, oysa standard gerçek zamanlı NeRF işlemleri daha sınırlı bir hareket aralığı bekliyor.

Parçalara Böl ve Fethet

Bu sorunları çözmek için yazarlar, görevi alt modüllere bölen bir geometrik kümeleme algoritması oluşturdular ve efektif olarak eş zamanlı olarak eğitilen bir alt-NeRF matrisi yarattılar.

İşleme sırasında, yazarlar ayrıca tam etkileşimlilik sağlamaya yeterli bir just-in-time görselleştirme algoritması uyguladılar, bu da video oyunlarının kullanıcının görüş açısına yaklaşan nesneleri daha ayrıntılı hale getirmesine benzer, ancak uzakta iken daha az ayrıntılı ve enerji tasarruflu kalır.

Bu ekonomiler, yazarlara göre, önceki yöntemlerden daha iyi ayrıntı sağlar ve ayrıca PlenOctree’nin eşdeğer işlevselliğine kıyasla görsel olarak daha iyi bir gelişme sağlar.

Projenin zincirli alt-NeRF’leri, KiloNeRF’in gerçek zamanlı rendering yeteneklerine dayanmaktadır, yazarlar bunu kabul etmektedir. Ancak Mega-NeRF, eğitim sırasında gerçekten “parçalama” (sahnenin belirli yönlerinin ayrılması) yapmaktadır, bu da KiloNeRF’in post-processing yaklaşımından farklıdır ve önceden hesaplanmış bir NeRF sahnesini daha sonra keşfedilebilir bir alana dönüştürür.

Ayrıntılı bir eğitim seti, her bir hücreyi temsil eden eğitim görüntü piksellerinin traijektorisini içeren alt modüller için oluşturulur. Sonucunda, her bir modül komşu hücrelerden tamamen bağımsız olarak eğitilir.

Ayrıntılı bir eğitim seti, her bir hücreyi temsil eden eğitim görüntü piksellerinin traijektorisini içeren alt modüller için oluşturulur. Sonucunda, her bir modül komşu hücrelerden tamamen bağımsız olarak eğitilir. Kaynak: https://arxiv.org/pdf/2112.10703.pdf

Yazarlar, Mega-NeRF’i ‘NeRF mimarisinin, eğitim ve işleme zamanında verimlilik iyileştirmeleri sağlayan, uzaysal olarak farkında bir şekilde katman bağlantılarını seyrelten bir yeniden formülasyonu’ olarak nitelendirdiler.

NeRF, NeRF++ ve Mega-NeRF'de eğitim ve veri ayrıştırmasının kavramsal karşılaştırması. Kaynak: https://meganerf.cmusatyalab.org/

NeRF, NeRF++ ve Mega-NeRF’de eğitim ve veri ayrıştırmasının kavramsal karşılaştırması. Kaynak: https://meganerf.cmusatyalab.org/

Yazarlar, Mega-NeRF’in yeni zamanlı tutarlılık stratejilerini kullanarak, aşırı ön işlemenin gereksiz olduğunu, ölçek sınırlarının üstesinden geldiğini ve önceki benzer çalışmaların sunduğu ayrıntıdan daha yüksek bir seviyeye ulaştığını, ancak etkileşimi feda etmediğini veya birden fazla gün eğitim gerektirmediğini iddia ediyorlar.

Araştırmacılar, dron görüntüleri ile elde edilen 100.000 metrekarelik endüstriyel kompleks arazisi kapsayan yüksek çözünürlüklü binlerce görüntüden oluşan büyük ölçekli veri setlerini de sunuyorlar. İki mevcut veri seti ‘Bina’ ve ‘Enkaz’ olarak adlandırılmaktadır.

Önceki Çalışmalardan İyileştirme

Makale, SneRG, PlenOctree ve FastNeRF gibi önceki benzer çalışmaların, sanal arama ve kurtarma çevrelerinin oluşturulması için uygun olmayan bazı türde önbelleğe alma veya ön işleme gerektirdiğini belirtiyor.

KiloNeRF, mevcut bir çok katmanlı perceptron (MLP) koleksiyonundan alt-NeRF’leri türetilir, ancak mimari olarak sınırlı iç mekanlara ve yüksek ölçekli çevreleri ele alma veya kapasite konusunda sınırlıdır. FastNeRF ise önceden hesaplanmış bir NeRF modelinin “pişirilmiş” bir versiyonunu özel bir veri yapısına depolar ve kullanıcının bu veri yapısı aracılığıyla bir MLP veya küresel temel hesaplama yoluyla gezinmesine izin verir.

KiloNeRF senaryosunda, sahnedeki her bir yönün maksimum çözünürlüğü zaten hesaplanmış olup, kullanıcı “yakınlaştırmaya” karar verirse daha yüksek bir çözünürlük elde edilemez.

Öte yandan, NeRF++ sınırsız, dış çevreleri doğası gereği ele alabilir ve potansiyel olarak keşfedilebilir alanı ön plan ve arka plan bölgelerine ayırır, her biri için ayrı bir MLP modeli tarafından denetlenir ve son bileşimden önce ışın atma işlemi gerçekleştirir.

Son olarak, NeRF in the Wild, sınırsız alanları doğrudan ele almasa da, Phototourism veri setinde görüntü kalitesini iyileştirir ve görünüm gömme noktaları Mega-NeRF mimarisinde takip edilmiştir.

Yazarlar ayrıca Mega-NeRF’in, özellikle Washington Üniversitesi’nin Building Rome in a Day projesi gibi Structure-from-Motion (SfM) projelerinden esinlendiğini kabul ediyorlar.

Zamansal Tutarlılık

PlenOctree gibi Mega-NeRF, kullanıcı odak noktasının bulunduğu bölgede kaba bir renk ve opaklık önbelleğini önceden hesaplar. Ancak, PlenOctree’nin her hesapladığı yolda hesapladığı yolu her defasında yeniden hesaplamak yerine, Mega-NeRF bu bilgileri “kaydederek” ve yeniden kullanarak hesaplamayı azaltır ve NeRF’in sıkı bağlantılı işleme törenini çözmeye yönelik bir eğilimi takip eder.

Sol tarafta, PlenOctree'nin tek kullanımlık hesaplaması. Orta, Mega-NeRF'nin uçan bölgenin mevcut konumu ile ilgili olarak oktreyi dinamik olarak genişletmesi. Sağ, oktreyi sonraki gezinme için yeniden kullanılması.

Sol tarafta, PlenOctree’nin tek kullanımlık hesaplaması. Orta, Mega-NeRF’nin uçan bölgenin mevcut konumu ile ilgili olarak oktreyi dinamik olarak genişletmesi. Sağ, oktreyi sonraki gezinme için yeniden kullanılması.

Bu hesaplamaların ekonomisi, yazarlara göre, yerel bir önbellek olarak hesaplamaları kullanarak işleme yükünü önemli ölçüde azaltır ve önceden tahmin ederek ve önbelleğe alarak değil, yerel olarak hesaplayarak tahmin eder.

Rehberli Örnekleme

İlk örnekleme之后, Mega-NeRF, standart modellere uygun olarak, oktree iyileştirmesi之后 ikinci bir rehberli ışın örnekleme işlemi gerçekleştirir ve bu işlem görüntü kalitesini iyileştirmek için kullanılır. Mega-NeRF, bu işlem için oktree veri yapısındaki mevcut ağırlıklara dayanarak yalnızca bir geçiş kullanır.

Yukarıdaki resimde görüldüğü gibi, yeni makaledeki standart örnekleme, hesaplamaları boşa harcar ve hedef alanın aşırı bir bölümünü değerlendirir, oysa Mega-NeRF, geometrinin var olduğu yerlerde hesaplamaları sınırlayarak, önceden belirlenmiş bir eşiğin üzerinde hesaplamaları azaltır.

Veri ve Eğitim

Araştırmacılar, Mega-NeRF’i çeşitli veri setleri üzerinde test etti, bunlar arasında endüstriyel zemin üzerinde dron görüntüleri ile oluşturulan iki el ile oluşturulan veri seti de vardı. İlk veri seti, Mill 19 – Bina, 500 x 250 metrekarelik bir alan üzerinde çekilen görüntüleri içerir. İkinci veri seti, Mill 19 – Enkaz, benzer görüntüleri bir inşaat sitesinde, potansiyel hayatta kalanların bulunduğu bir arama ve kurtarma senaryosunda temsil eder.

Makalenin ek malzemelerinden: Sol, Parrot Anafi dronunun kapsaması gereken kareler (merkezde ve sağdaki uzak fotoğrafta görüldüğü gibi).

Makalenin ek malzemelerinden: Sol, Parrot Anafi dronunun kapsaması gereken kareler (merkezde ve sağdaki uzak fotoğrafta görüldüğü gibi).

Ayrıca, mimari, Çin’deki Shenzhen Üniversitesi’ndeki Görsel Bilgisayar Araştırma Merkezi’nden UrbanScene3D sahnelerinden ve Indiana Üniversitesi’ndeki IU Bilgisayar Görme Laboratuvarı’ndan Quad 6k veri setinden büyük kentsel çevrelerin HD dron görüntüleri ile test edildi.

Eğitim, 8 alt modül üzerinde, her biri 256 gizli birimden oluşan 8 katman ve ardından 128 kanal ReLU katmanı ile gerçekleştirildi. NeRF’in aksine, aynı MLP, kaba ve rafine örnekleri sorgulamak için kullanıldı, bu da genel model boyutunu azalttı ve sonraki işleme aşamasında kaba ağ çıktılarının yeniden kullanılmasına izin verdi. Yazarlar, bu sayede her ışın için %25’lik model sorgusu tasarrufu sağlandığını tahmin ediyor.

1024 ışın, Adam’da 5×104 başlayan ve 5×10-5‘e düşen öğrenme hızında her parti için örneklendi. Görünüm gömme noktaları, yukarıda belirtilen NeRF in the Wild gibi ele alındı. Karma精度 örneklemesi (32 bitlik kayan nokta değerinden daha düşük bir精度da eğitim) kullanıldı ve MLP genişliği 2048 gizli birime sabitlendi.

Test ve Sonuçlar

Araştırmacıların testlerinde, Mega-NeRF, 500.000 iterasyondan sonra NeRF, NeRF++ ve DeepView‘i aşarak robust bir şekilde üstünlük gösterdi. Mega-NeRF hedef senaryosu zamanla sınırlı olduğundan, araştırmacılar daha yavaş önceki çerçevelere 24 saatlik sınırın ötesinde ek zaman tanıdı ve Mega-NeRF’in bu avantajlara rağmen hala onları aştığını bildirdi.

Kullanılan metrikler, Piksel Sinyal-Gürültü Oranı (PSNR), VGG versiyonu LPIPS ve SSIM idi. Eğitim, sekiz V100 GPU ile donatılmış tek bir makine üzerinde gerçekleştirildi – efektif olarak 256GB VRAM ve 5120 Tensor çekirdeği.

Mega-NeRF deneylerinin örnek sonuçları (tüm çerçeveler ve veri setleri için daha geniş sonuçlar için lütfen makaleye bakın), PlenOctree'nin belirgin voxelizasyonu neden olduğunu, KiloNeRF'nin ise genellikle daha bulanık ve daha çok artifact içerdiğini gösterir.

Mega-NeRF deneylerinin örnek sonuçları (tüm çerçeveler ve veri setleri için daha geniş sonuçlar için lütfen makaleye bakın), PlenOctree’nin belirgin voxelizasyonu neden olduğunu, KiloNeRF’nin ise genellikle daha bulanık ve daha çok artifact içerdiğini gösterir.

Proje sayfası https://meganerf.cmusatyalab.org/ adresinde ve yayınlanan kod https://github.com/cmusatyalab/mega-nerf adresinde bulunabilir.

İlk olarak 21 Aralık 2021’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai