Yapay zeka modelleri ve platformları
Splatter Image: Tek Görüntüden Ultra Hızlı 3D Reconstruction
Tek görüntüden 3D nesne yeniden yapılandırması, convolutional ağlarla birlikte dikkat çekici yetenekler göstermiştir. Tek görüntüden 3D yeniden yapılandırma modelleri, herhangi bir nesnenin 3D modelini tek bir görüntü kullanarak oluşturur ve bu, bilgisayar görüşünde en sıcak araştırma konularından biridir.

Örneğin, yukarıdaki resimdeki motosikleti düşünün. 3D yapısını oluşturmak, düşük seviyeli görüntülerden gelen ipuçlarını yüksek seviyeli anlamsal bilgilerle ve parçaların yapısal düzeni hakkında bilgiyle birleştiren karmaşık bir işlem gerektirir.
Bu karmaşık işlem nedeniyle, tek görüntüden 3D yeniden yapılandırma, bilgisayar görüşünde büyük bir zorluk olmuştur. Tek görüntüden 3D yeniden yapılandırmayı daha verimli hale getirmeye çalışan geliştiriciler, Splatter Image adlı bir yöntem üzerinde çalışmışlardır. Bu yöntem, nesnelerin ultra hızlı tek görüntüden 3D şekil ve 3D görünüş oluşturmayı hedeflemektedir. Splatter Image çerçevesi, temelde Gaussian Splatting yöntemini kullanarak 3D temsillemeleri analiz eder ve bu yöntemin sunduğu hız ve kaliteden yararlanılır.
Son zamanlarda, Gaussian Splatting yöntemi, birçok çok görüntüden yeniden yapılandırma modeli tarafından gerçek zamanlı rendering, artan ölçeklendirme ve hızlı eğitim için uygulanmıştır. Ancak Splatter Image, tek görüntüden yeniden yapılandırma görevleri için Gaussian Splatting yöntemini uygulayan ilk çerçevedir.
Bu makalede, Splatter Image çerçevesinin Gaussian Splatting’i kullanarak ultra hızlı tek görüntüden 3D yeniden yapılandırmayı nasıl başardığını keşfedeceğiz. Başlayalım.
Splatter Image: Ultra Hızlı Tek Görüntüden 3D Reconstruction
Önceki gibi, Splatter Image, Gaussian Splatting yöntemine dayalı ultra hızlı tek görüntüden 3D nesne yeniden yapılandırması için bir yaklaşımdır. Splatter Image, geleneksel olarak çok görüntüden 3D nesne yeniden yapılandırma çerçevelerini güçlendiren Gaussian Splatting’i uygulayan ilk bilgisayar görüşü çerçevesidir. Ancak, önceki yöntemlerden Splatter Image çerçevesini ayıran şey, öğrenme tabanlı bir yaklaşım olmasıdır ve test aşamasında yalnızca sinir ağı değerlendirmesi gerekir.
Splatter Image, temel olarak Gaussian Splatting’in rendering özelliklerine ve yüksek işlem hızına dayanarak 3D yeniden yapılandırmalar oluşturur. Splatter Image çerçevesi, basit bir tasarıma sahiptir: çerçeve, bir 2D görüntü-görüntü sinir ağı kullanır ve her bir girdi görüntü pikseli için bir 3D Gaussian öngörür ve girdi görüntüsünü bir 3D Gaussian’a haritalar. Sonuçlanan 3D Gaussians, Splatter Image olarak bilinen bir görüntüye sahiptir ve bu Gaussians ayrıca 360 derece görüntü sunar. İşlem aşağıdaki resimde gösterilmektedir.

Bu işlem basit ve anlaşılırdır, ancak Splatter Image çerçevesi, Gaussian Splatting’i kullanarak tek görüntüden 3D Gaussians oluştururken bazı ana zorluklarla karşılaşır. İlk büyük engel, bir nesnenin tüm yanlarını temsil eden bir Gaussian karışımı oluşturan bir sinir ağını tasarlamaktır. Bunu çözmek için, Splatter Image, Gaussian karışımının bir dizi veya sıralanmamış koleksiyon olmasına rağmen, stillerine göre depolanabileceğini kullanır. Buna göre, çerçeve, 3D Gaussians’ı depolamak için bir 2D görüntü kullanır ve her bir piksel, bir Gaussian’ın parametrelerini içerir.
3D Gaussian setlerini bir görüntüde depolayarak, Splatter Image çerçevesi, bir görüntü-görüntü sinir ağını öğrenirken karşılaşılan yeniden yapılandırma zorluklarını azaltabilir. Bu yaklaşım kullanılarak, yeniden yapılandırma işlemi yalnızca verimli 2D operatörler kullanılarak uygulanabilir. Ayrıca, Splatter Image çerçevesinde, 3D temsil, 3D Gaussians’ın bir karışımıdır ve bu, Gaussian Splatting’in sunduğu rendering hızı ve bellek verimliliği avantajlarını kullanmasını sağlar. Daha da önemlisi, Splatter Image çerçevesi, yalnızca tek görüntüden 3D temsil oluşturmakla kalmaz, aynı zamanda standart 3D nesne benchmark’larında tek bir GPU’da eğitilebilecek kadar verimlidir. Ayrıca, Splatter Image çerçevesi, birden fazla görüntüyü girdi olarak alabilir.
Deneysel olarak, Splatter Image çerçevesi, yalnızca bir tarafını gören bir nesnenin 360 derece yeniden yapılandırmasını üretebilir. Çerçeve, 2D bir komşulukta farklı Gaussians’ı nesnenin farklı kısımlarına atar ve üretilen 360 derece bilgisini 2D görüntüde kodlar. Ayrıca, çerçeve, beberapa Gaussian’ın opaklığını sıfıra ayarlayarak onları devre dışı bırakır ve bu da post-işlemede onları kesilmesini sağlar.
Özetle, Splatter Image çerçevesi
- Gaussian Splatting yöntemini kullanarak tek görüntüden 3D nesne yeniden yapılandırması için yeni bir yaklaşımdır.
- Çok görüntüden 3D nesne yeniden yapılandırması için yöntemi genişletir.
- Standart benchmark’lerde 3D nesne yeniden yapılandırması performansında devlet-sanatını sağlar ve olağanüstü hız ve kalite sunar.
Splatter Image: Yöntem ve Mimari
Gaussian Splatting
Önceki gibi, Gaussian Splatting, Splatter Image çerçevesinin tek görüntüden 3D nesne yeniden yapılandırması için uyguladığı temel yöntemdir. Basitçe, Gaussian Splatting, 3D görüntülerin ve gerçek zamanlı rendering’in rasterleştirme yöntemidir. 3D uzay, Gaussians olarak adlandırılır ve makine öğrenimi teknikleri, her bir Gaussian’ın parametrelerini öğrenmek için kullanılır. Gaussian Splatting, rendering sırasında eğitim gerektirmez, bu da daha hızlı rendering süreleri sağlar. Aşağıdaki resim, 3D Gaussian Splatting’in mimarisini özetlemektedir.

3D Gaussian Splatting, ilk olarak girdi görüntülerini kullanarak bir nokta bulutu oluşturur. Gaussian Splatting, daha sonra girdi görüntülerini kullanarak kameranın dış parametrelerini, yani eğim ve konumunu, görüntüler arasındaki pikselleri eşleştirerek tahmin eder ve bu parametreleri nokta bulutunu hesaplamak için kullanır. Farklı makine öğrenimi yöntemleri kullanılarak, Gaussian Splatting, her bir Gaussian için dört parametre optimize eder: Konum (nerede), Kovaryans (ne kadar uzatıldığı veya ölçeklendirildiği), Renk (RGB renk şeması) ve Alfa (saydamlık). Optimizasyon işlemi, her kamera pozisyonu için görüntüyü oluşturur ve parametreleri orijinal görüntüye yaklaştırmak için kullanır. Sonuç olarak, oluşan 3D Gaussian Splatting çıkışı, orijinal görüntüye en çok benzeyen Splatter Image olarak adlandırılan bir görüntüdür.

Ayrıca, Gaussian Splatting’deki opaklık fonksiyonu ve renk fonksiyonu, 3D noktasının görme yönüne bağlı bir radyans alanını sağlar. Çerçeve, bu fonksiyonları renklendirilmiş Gaussians’ın bir bileşimi olarak temsil eder ve her bir Gaussian, bir opaklık özelliğine ve bir görme bağımlı renk özelliğine sahiptir. Bu, radyans alanını tanımlar.
Splatter Image
Renderer bileşeni, 3D Gaussians’ı bir görüntüye haritalar. Tek görüntüden 3D yeniden yapılandırmayı gerçekleştirmek için, çerçeve, 3D Gaussians’ın bir karışımını bir görüntüden yeniden oluşturan ters bir fonksiyon arar. Burada önemli olan, ters fonksiyon için etkili ve basit bir tasarım önermektir. Özellikle, bir girdi görüntüsü için, çerçeve, bir görüntü-görüntü sinir ağı mimarisi kullanarak her bir piksel için bir Gaussian öngörür ve Splatter Image olarak adlandırılan bir görüntüyü oluşturur. Ağ, ayrıca şekil, opaklık ve rengi öngörür.
Şimdi, nasıl 3D temsilini yalnızca bir görüntüsüne erişerek yeniden oluşturabildiğini merak edebilirsiniz. Gerçek zamanlı olarak, Splatter Image çerçevesi, bazı Gaussians’ı görüntüyü yeniden oluşturmak için kullanmayı öğrenir ve geri kalan Gaussians’ı görünmeyen kısımları otomatik olarak yeniden oluşturmak için kullanır. Verimliliği en üst düzeye çıkarmak için, çerçeve, opaklığın sıfır olduğunu öngörerek herhangi bir Gaussian’ı devre dışı bırakabilir. Opaklık sıfırsa, Gaussians devre dışı bırakılır ve çerçeve bu noktaları render etmez, bunlar post-işlemede kesilir.
Görüntü Düzeyinde Kayıp
Gaussian Splatting yönteminin sunduğu hız ve verimlilikten yararlanmanın önemli bir avantajı, çerçevenin her bir iterasyonda tüm görüntüleri render edebilmesidir, hatta büyük batch’lerle bile. Ayrıca, bu, çerçevenin yalnızca parçalanabilir kayıpları değil, aynı zamanda piksel başına değil, görüntü düzeyinde kayıpları da kullanabileceği anlamına gelir.
Ölçek Normalizasyonu
Tek bir görüntüden bir nesnenin boyutunu tahmin etmek zor bir görevdir ve bu belirsizliği bir kayıp ile eğitirken çözmek de zor bir görevdir. Aynı sorun, sentetik veri kümelerinde gözlenmez, çünkü tüm nesneler aynı kamera iç parametreleriyle ve sabit bir mesafede render edilir, bu da belirsizliği çözmeye yardımcı olur. Ancak, gerçek görüntüleri içeren veri kümelerinde, belirsizlik belirgindir ve Splatter Image çerçevesi, tüm nesnelerin ölçeklerini yaklaşık olarak sabitlemek için çeşitli ön işleme yöntemleri kullanır.
Görme Bağımlı Renk
Görme bağımlı renkleri temsil etmek için, Splatter Image çerçevesi, renkleri Lambertian renk modelinin ötesinde genelleştirmek için küresel harmonikleri kullanır. Her bir Gaussian için, model, ağ tarafından öngörülen katsayılara ve küresel harmoniklere sahiptir. Görme yönündeki değişiklik, kamera kaynağındaki görme yönünü referans çerçevesindeki karşılık gelen görme yönüne dönüştürür. Model, dönüştürülmüş renk fonksiyonunu bulmak için karşılık gelen katsayılara sahiptir. Model bunu yapabilir, çünkü küresel harmonikler her sırayla kapalıdır.
Sinir Ağı Mimarisı
Girdi görüntüsünü Gaussian karışımına eşleyen predictor’un mimarisi, büyük ölçüde SongUNet çerçevesinde kullanılan işleme benzerdir. Mimarinin son katmanı, renk modelinin genişliğini belirleyen bir 1×1 convolutional katman ile değiştirilir. Verilen girdi görüntüsüne göre, ağ, bir çıktı kanal tensor’u üretir ve her bir piksel kanalında, parametreleri kodlar ve daha sonra ofset, opaklık, rotasyon, derinlik ve renk olarak dönüştürülür. Çerçeve, parametreleri aktive etmek için doğrusal olmayan fonksiyonları kullanır ve Gaussian parametrelerini elde eder.
Çok görüntüden 3D temsil oluşturmak için, Splatter Image çerçevesi, aynı ağı her bir girdi görüntüsüne uygular ve daha sonra görme yaklaşımını kullanarak bireysel yeniden yapılandırmaları birleştirir. Ayrıca, ağdaki farklı görüntüler arasındaki verimli koordinasyon ve bilgi alışverişi için, Splatter Image çerçevesi iki değişiklik yapar. İlk olarak, modeli kamera pozisyonuyla koşullandırır ve her bir girişi sinusoidal konum gömme kullanarak birden fazla boyuta kodlar. İkincisi, çerçeve, farklı görüntülerin özelliklerinin birbirleriyle iletişim kurmasını sağlayan çapraz dikkat katmanları ekler.
Splatter Image: Deneyler ve Sonuçlar
Splatter Image çerçevesi, yeniden yapılandırmaların kalitesini, Kaynak Görüntü Sentezi kalitesi tarafından değerlendirir, çünkü çerçeve, kaynak görüntüyü kullanır ve hedeflenmeyen görüntülere 3D şekli render ederek yeniden yapılandırmaları gerçekleştirir. Çerçeve, performansı SSIM veya Yapısal Benzerlik, PSNR veya Piksel Sinyal Gürültü Oranı ve Algısal Kalite veya LPIPS puanlarını ölçerek değerlendirir.
Tek Görüntüden 3D Yeniden Yapılandırma Performansı
Aşağıdaki tablo, Splatter Image modelinin ShapeNet benchmark’ünde tek görüntüden 3D yeniden yapılandırma görevindeki performansını göstermektedir.

Görülebileceği gibi, Splatter Image çerçevesi, LPIPS ve SSIM puanlarında tüm deterministik yeniden yapılandırma yöntemlerini aşar. Puanlar, Splatter Image modelinin daha keskin yeniden yapılandırmalar ürettiğini gösterir. Ayrıca, Splatter Image modeli, PSNR puanında da tüm deterministik temel çizgisini aşar, bu da üretilen yeniden yapılandırmaların daha doğru olduğunu gösterir. Ayrıca, tüm deterministik yöntemleri aşmakla kalmaz, Splatter Image çerçevesi, yalnızca göreli kamera pozlarını gerektirir ve hem eğitim hem de test aşamalarında verimliliği artırır.
Aşağıdaki resim, Splatter Image çerçevesinin nitel gücünü göstermektedir ve görülebileceği gibi, model, ince ve ilginç geometrilerle yeniden yapılandırmalar üretir ve koşullu görüntülerin ayrıntılarını yakalar.

Aşağıdaki resim, Splatter Image çerçevesinin ürettiği yeniden yapılandırmaların, özellikle ince yapılar ve sınırlı görünürlük gibi geleneksel koşullarda, önceki modellere göre daha keskin ve daha doğru olduğunu gösterir.

Çok Görüntüden 3D Yeniden Yapılandırma
Çok görüntüden 3D yeniden yapılandırma yeteneklerini değerlendirmek için, Splatter Image çerçevesi, iki görüntüden tahmin için SpaneNet-SRN Cars veri kümesinde eğitilir. Mevcut yöntemler, çok görüntüden 3D yeniden yapılandırma görevleri için mutlak kamera pozunu koşullandırma kullanır, bu da modelin nesnenin kanonik yönüne主要 olarak güvenmesini sağlar. Bu, işini görür, ancak modellerin uygulanabilirliğini sınırlar, çünkü mutlak kamera pozunu thường bilinmez bir nesnenin yeni bir görüntüsü için.

Son Düşünceler
Bu makalede, Splatter Image adlı bir yöntemden bahsettik, bu yöntem, nesnelerin ultra hızlı tek görüntüden 3D şekil ve 3D görünüş oluşturmayı hedeflemektedir. Splatter Image çerçevesi, temelde Gaussian Splatting yöntemini kullanarak 3D temsillemeleri analiz eder ve bu yöntemin sunduğu hız ve kaliteden yararlanılır. Splatter Image çerçevesi, bir görüntüyü işler ve her bir piksel için bir Gaussian öngörür, bu da bir pseudo-görüntü oluşturur. Gaussian Splatting yöntemi kullanılarak, Splatter Image çerçevesi, hızlı rendering ile hızlı çıkarımı birleştirir ve bu da gerçek ve sentetik benchmark’lerde hızlı eğitim ve daha hızlı değerlendirme sağlar.












