Anderson’un Açısı

ST-NeRF: Video Sentetik için Bileşim ve Düzenleme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ST-NeRF

Çinli bir araştırma konsorsiyumu, geçtiğimiz yılın en sıcak görüntü sentez araştırma alanlarından biri olan Nöral Radyans Alanları (NeRF) için düzenleme ve bileşim yetenekleri getirmeye yönelik teknikler geliştirdi. Sistem, ST-NeRF (Uzaysal-Zamansal Uyumlu Nöral Radyans Alanı) olarak adlandırılmaktadır.

Aşağıdaki görüntüde görünen fiziksel kamera panoramik görünümü, aslında kullanıcıların 4D uzayda bulunan video içeriğinde bakış açılarını “kaydırması” sonucu oluşmaktadır. Görünüm, videosunda yer alan kişilerin performanslarına kilitlenmemiştir ve 180 derecelik yarıçap içindeki herhangi bir noktadan hareketleri izlenebilir.

ST-NeRF

Her bir video içindeki parça, ayrı ayrı yakalanan bir öğedir ve dinamik olarak keşfedilebilecek bir sahneye birleştirilmiştir.

Parçalar sahne içinde özgürce kopyalanabilir veya yeniden boyutlandırılabilir:

ST-NeRF

Ayrıca, her bir parçanın zaman içindeki davranışı kolayca değiştirilebilir, yavaşlatılabilir, tersine çalıştırılabilir veya çeşitli şekillerde manipüle edilebilir, bu da filtre mimarilerine ve çok yüksek bir yorumlanabilirlik seviyesine yol açar.

Aynı sahnedeki iki ayrı NeRF parçasının farklı hızlarda çalışması. Kaynak: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Aynı sahnedeki iki ayrı NeRF parçasının farklı hızlarda çalışması. Kaynak: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Sanal sahneyi oluşturmak için oyuncuların veya ortamların rotoskopi yapılmasına veya oyuncuların hareketlerini sahne bağlamından bağımsız olarak gerçekleştirmelerine gerek yoktur. Bunun yerine, 16 video kameranın 180 derecelik bir alanı kapsamasıyla doğal olarak çekim yapılır:

16 kamera ST-NeRF

Üstteki üç öğe, iki kişi ve ortam, yalnızca görsel amaçlarla ayrılmıştır. Her biri değiştirilebilir ve her biri bireysel zaman çizelgesinde daha erken veya daha geç bir noktaya eklenebilir.

Üstteki üç öğe, iki kişi ve ortam, yalnızca görsel amaçlarla ayrılmıştır. Her biri değiştirilebilir ve her biri bireysel zaman çizelgesinde daha erken veya daha geç bir noktaya eklenebilir.

ST-NeRF, Nöral Radyans Alanları (NeRF) üzerine yapılan bir araştırmadır. Bu, çoklu bakış açısı yakalamalarının geniş bir eğitimle navigasyonel bir sanal uzaya sentezlenmesini sağlayan bir makine öğrenimi çerçevesidir (tek bakış açısı yakalaması da NeRF araştırmalarının bir alt bölümüdür).

Nöral Radyans Alanları, birden fazla bakış açısı yakalamalarını tek, tutarlı ve navigasyonel 3D uzaya birleştirir. Boşlukları nöral bir ağ tarafından tahmin edilir ve oluşturulur. Video (durağan görüntüler yerine) kullanıldığında, gerekli oluşturma kaynakları genellikle önemli miktarda olur. Kaynak: https://www.matthewtancik.com/nerf

Nöral Radyans Alanları, birden fazla bakış açısı yakalamalarını tek, tutarlı ve navigasyonel 3D uzaya birleştirir. Boşlukları nöral bir ağ tarafından tahmin edilir ve oluşturulur. Kaynak: https://www.matthewtancik.com/nerf

NeRF’e ilgi son dokuz ayda yoğunlaştı ve Reddit tarafından yönetilen liste, türetilmiş veya keşif amaçlı NeRF makalelerinin şu an 60 projesini içermektedir.

 

Orijinal NeRF makalesinin yalnızca birkaç türetilmiş çalışması. Kaynak: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Orijinal NeRF makalesinin yalnızca birkaç türetilmiş çalışması. Kaynak: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Uygun Fiyatlı Eğitim

Makale, Shanghai Teknoloji Üniversitesi ve DGene Dijital Teknoloji araştırmacıları arasındaki bir işbirliğidir ve Open Review‘de kabul görmüştür.

ST-NeRF, önceki girişimlere kıyasla ML türetilen navigasyonel video uzaylarında bir dizi yenilik sunmaktadır. En azından, sadece 16 kamera ile yüksek gerçeklik seviyesine ulaşır. Facebook’un DyNeRF iki kamera daha kullanmasına rağmen, çok daha kısıtlı bir navigasyon yayı sunar.

Facebook'un DyNeRF ortamının bir örneği, daha sınırlı bir hareket alanı ve sahneyi yeniden oluşturmak için daha fazla kamera gerektirir. Kaynak: https://neural-3d-video.github.io

Facebook’un DyNeRF ortamının bir örneği, daha sınırlı bir hareket alanı ve sahneyi yeniden oluşturmak için daha fazla kamera gerektirir. Kaynak: https://neural-3d-video.github.io

DyNeRF, ayrıca bireysel parçaları düzenleme ve birleştirmede yetersizdir ve hesaplama kaynakları açısından özellikle pahalıdır. Çinli araştırmacılar, verilerinin eğitim maliyetinin 900-3.000 dolar arasında olduğunu belirtirken, DVDGAN gibi video oluşturma modeli için 30.000 dolar ve DyNeRF gibi yoğun sistemler için daha yüksek maliyetler söz konusudur.

İnceleyiciler, ST-NeRF’in hareket öğrenme sürecini görüntü sentezinden ayırarak önemli bir yenilik getirdiğini de not etmişlerdir. Bu ayrılma, düzenleme ve birleştirmeyi mümkün kılar ve önceki yaklaşımlar daha kısıtlayıcı ve lineerdir.

16 kameranın bu kadar đầy dolu bir görüntüleme için sınırlı bir dizi olması nedeniyle, araştırmacılar gelecekteki çalışmalarında proxy ön-taranan statik arka planların ve daha veri odaklı sahne modelleme yaklaşımlarının kullanımıyla bu sayıyı daha da azaltmayı ummaktadır. Ayrıca, bir son yenilik olan yeniden aydınlatma yeteneklerini entegre etmeyi hedeflemektedirler.

ST-NeRF’in Sınırlılıklarını ele alma

Bilgisayar bilimi akademik makalelerinin genellikle yeni bir sistemin kullanılabilirliğini son paragrafta atıp atanması eğiliminde olduğu bağlamda, ST-NeRF için araştırmacıların kabul ettiği sınırlılıklar bile alışılmadık şekilde dikkat çekicidir.

Araştırmacılar, sistemin şu anda sahnedeki belirli nesneleri ayrı ayrı tanıyamadığını ve ayrı ayrı oluşturamadığını gözlemlemektedir, çünkü görüntüdeki insanlar insanları tanıyan ve nesneleri tanımayan bir sistem tarafından bireysel varlıklar olarak segmentlenmektedir – bu, YOLO ve benzeri çerçevelerle kolayca çözülebilecek bir sorun gibi görünmektedir, insan videosunun çıkarılması zaten yapılmıştır.

Araştırmacılar, şu anda yavaş motion oluşturulamadığını not etmişlerdir, ancak mevcut DAIN ve RIFE gibi çerçeve interpolasyonu yeniliklerinin uygulanmasıyla bunun engellenmesi için hiçbir şey yoktur.

NeRF uygulamalarının çoğunda ve bilgisayar vizyonu araştırmalarının birçok alanında olduğu gibi, ST-NeRF, konunun başka bir kişi veya nesne tarafından geçici olarak engellendiği ağır örtülme durumlarında başarısız olabilir ve ardından konuyu sürekli takip etmek veya yeniden kazanmak zor olabilir. Araştırmacılar, bu zorluğun akış yukarıdaki çözümleri beklemesi gerektiğini kabul etmektedir. Bu arada, araştırmacılar, bu engellenen karelerde manuel müdahalenin gerekli olduğunu kabul etmektedir.

Son olarak, araştırmacılar, insan segmentasyon prosedürlerinin şu anda renk farklılıklarına bağlı olduğunu ve bu durumun iki kişinin tek bir segmentasyon bloğuna yanlış bir şekilde birleştirilmesine neden olabileceğini gözlemlemektedir – bu, ST-NeRF ile sınırlı olmayan, kullanılan kütüphaneye özgü bir engel gibi görünmektedir ve optik akış analizi ve diğer ortaya çıkan tekniklerle belki çözülebilecektir.

İlk olarak 7 Mayıs 2021’de yayımlanmıştır.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]