Anderson’un Açısı
RigNeRF: Yeni Bir Derin Sahtecilik Yöntemi – Neural Işınım Alanlarını Kullanıyor

Adobe’ de geliştirilen yeni bir araştırmayla, Neural Radiance Fields (NeRF) temel alınarak oluşturulan ilk uygulanabilir ve etkili derin sahtecilik yöntemi sunuluyor – belki de 2017’deki ortaya çıkışından bu yana beş yıl içinde mimari veya yaklaşım açısından ilk gerçek yenilik.
Yöntem, RigNeRF olarak adlandırılıyor ve 3D morphable yüz modellerini (3DMM) nöral uzaya girişin yapılacağı kimlik ile NeRF renderi arasındaki aracı bir katman olarak kullanıyor. Bu yöntem, son yıllarda Genelleyici Karşıt Ağ (GAN) yüz sentez yaklaşımında yaygın olarak benimsenmiştir, ancak bu yaklaşımdan henüz işlevsel ve faydalı yüz değiştirme çerçeveleri üretilmemiştir.

Tradiyonel derin sahtecilik videolarının aksine, burada görünen hareketli içeriklerin hiçbiri ‘gerçek’ değil, ancak brief görüntülerden eğitilen nöral bir uzaydır. Sağ tarafta, 3D morphable yüz modelinin (3DMM) istenen manipülasyonlar (‘gülümse’, ‘sola bak’, ‘yukarı bak’ vb.) ile nöral ışıma alanları görselleştirmesinin genellikle zor ulaşılabilir parametreleri arasında bir arayüz olarak hareket ettiğini görüyoruz. Bu klipin yüksek çözünürlüklü bir versiyonu ve diğer örnekler için lütfen projeye veya makale sonundaki gömülü videolara bakınız. Kaynak: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
3DMM’ler temelde yüzlerin CGI modelleridir ve parametreleri daha soyut görüntü sentez sistemlerine, chẳng hạn NeRF ve GAN’a uyarlanabilir, ancak bu sistemler genellikle zor kontrol edilebilir.
Yukarıdaki resimdeki (orta resim, mavi gömlekli adam) ve doğrudan aşağıdaki resimdeki (sol resim, mavi gömlekli adam) görünen şey, ‘gerçek’ bir video değil, sondern tamamen sentezlenmiş bir sahnedir ve bu, bir hacimsel nöral render olarak var olur – vücut ve arka plan dahil:

Yukarıdaki örnekte, gerçek yaşam videosu (kırmızı elbise giyen kadın) sağ tarafta, RigNeRF aracılığıyla sol taraftaki yakalanan kimliği (mavi gömlekli adam) ‘kukla’ olarak kullanıyor ve yazarlar, RigNeRF’in ilk NeRF tabanlı sistem olduğunu ve poz ve ifadeyi ayırabilen ve yeni görüş sentezleri yapabilen bir sistem olduğunu iddia ediyorlar.
Sol taraftaki erkek figürü, 70 saniyelik bir akıllı telefon videosundan ‘yakalanmış’ ve girdi verileri (tüm sahne bilgisi dahil) daha sonra 4 V100 GPU’da eğitim için kullanılmıştır.
3DMM tarzı parametrik iskeletler aynı zamanda tüm vücut parametrik CGI proxy’leri olarak mevcuttur (sadece yüz iskeletleri değil), RigNeRF böylece gerçek insan hareketi, dokusu ve ifadesinin CGI tabanlı parametrik katmana geçirilmesini ve bu hareket ve ifadenin nöral ışıma alanlarına ve videolara çevrilmesini sağlayarak đầy vücut derin sahtecilik olanağı sunar.
RigNeRF – şu anki anlamıyla bir derin sahtecilik yöntemi midir? Yoksa DeepFaceLab ve diğer 2017 dönemi oto-encoder derin sahtecilik sistemlerine göre yarı yarıya bir sistem midir?
Yeni makalenin yazarları bu konuda açık:
‘Yüzleri canlandırabilen bir yöntem olarak, RigNeRF kötü aktörler tarafından derin sahtecilik üretmek için suistimal edilebilir.’
Yeni makale RigNeRF: Tamamen Kontrol Edilebilir Nöral 3B Portreler olarak adlandırılıyor ve Stonybrook Üniversitesi’nden ShahRukh Atha ve Adobe Araştırma’dan dört yazar tarafından yazılmıştır.
Oto-Encoder Tabanlı Derin Sahteciliklerin Ötesinde
Son birkaç yıl içinde viral olan derin sahteciliklerin çoğunluğu, oto-encoder tabanlı sistemler tarafından üretilmiştir ve bu sistemler, 2017’de promptly-banned r/deepfakes subreddit’de yayınlanan koddan türetilmiştir – ancak önce GitHub’a kopyalanmıştır, burada şu anda binlerce kez çatallanmıştır, en azından popüler (ancak tartışmalı) DeepFaceLab dağıtımı ve ayrıca FaceSwap projesine dahil edilmiştir.
Bunun yanı sıra, GAN ve NeRF, oto-encoder çerçeveleri de 3DMM’leri ‘kılavuzlar’ olarak geliştirilmiş yüz sentez çerçeveleri için denemiştir. Bir örnek, HifiFace projesidir ve Temmuz 2021’den beri hiçbir kullanılabilir veya popüler girişimin geliştirilmediği görünüyor.
RigNeRF sahneleri için veriler, kısa akıllı telefon videoları yakalayarak elde edilir. Projede, RigNeRF’in yazarları tüm deneyler için iPhone XR veya iPhone 12 kullanmışlardır. Yakalama işleminin ilk yarısında, konu geniş bir yüz ifadeleri ve konuşma yaparken başını sabit tutarken kamera etrafında hareket ettirilir.
İkinci yarıda, kamera sabit bir konumda kalırken, konu başını çeşitli ifadelerle hareket ettirmelidir. Sonuç olarak 40-70 saniyelik görüntüler (yaklaşık 1200-2100 kare) tüm eğitim verisi olarak kullanılır.
Veri Toplama Süresini Kısaltma
Karşılaştırıldığında, oto-encoder sistemleri gibi DeepFaceLab, genellikle binlerce çeşitli fotoğrafın toplanması ve düzenlenmesi gerekir, bu fotoğraflar YouTube videoları ve diğer sosyal medya kanallarından alınır ve ayrıca filmlerden (ünlü derin sahteciliklerin durumunda).
Sonuç olarak eğitilen oto-encoder modelleri genellikle çeşitli durumlar için kullanılır. Ancak en titiz ‘ünlü’ derin sahtecilikçiler, tek bir video için tüm modelleri sıfırdan eğitebilir,尽管 eğitim bir hafta veya daha uzun sürebilir.
Yeni çalışmanın yazarlarının uyarısına rağmen, AI porn ve popüler YouTube/TikTok ‘derin sahtecilik yeniden düzenleme’lerini güçlendirerek oluşturulan ‘yama’ ve genellikle derlenen veri kümeleri, sahne-spesifik bir metodolojiye sahip bir derin sahtecilik sistemi olan RigNeRF’de kabul edilebilir ve tutarlı sonuçlar üretmeyebilir. Veri yakalama kısıtlamaları, kötü niyetli derin sahteciliklerin casual suistimaline karşı bir miktar ek güvenlik önlemi olabilir.
Derin Sahtecilik Videolarına NeRF’i Uyarlamak
NeRF, bir fotogrametri tabanlı yöntemdir ve çeşitli açılardan alınan birkaç kaynak resim, bir keşfedilebilir 3B nöral uzaya birleştirilir. Bu yaklaşım, NVIDIA’nın Instant NeRF sistemini tanıttığında öne çıktı ve NeRF için eğitim sürelerini dakikalara veya saniyelere kadar kısaltabiliyor:

Instant NeRF. Kaynak: https://www.youtube.com/watch?v=DJ2hcC1orc4
Sonuç olarak elde edilen Nöral Işınım Alanı sahnesi, temelde statik bir ortamdır ve keşfedilebilir, ancak düzenlemek zordur. Araştırmacılar, iki önceki NeRF tabanlı girişimin – HyperNeRF + E/P ve NerFACE – yüz video sentezine bir girişimde bulunduğunu ve (apparently için completeness ve diligence sake) RigNeRF’i bu iki çerçeve ile test etmişlerdir:


RigNeRF, HyperNeRF ve NerFACE arasında nitel bir karşılaştırma. Bağlı kaynak videoları ve PDF için daha yüksek kaliteli sürümler için lütfen linke tıklayınız. Statik görüntü kaynağı: https://arxiv.org/pdf/2012.03065.pdf
Ancak bu durumda, RigNeRF’i favori gösteren sonuçlar, iki nedenle assez anomaldır: önce, yazarlar ‘elma ile elma karşılaştırması için mevcut hiçbir çalışma olmadığını’ gözlemliyor; ikincisi, bu, RigNeRF’in yeteneklerinin, daha kısıtlı bir işlevselliğe sahip önceki sistemlerle kısmen eşleşmesi gerektiği anlamına geliyor.
Sonuçlar, önceki çalışmaların üzerine bir ilerleme değil, NeRF düzenlenebilirliği ve faydasında bir ‘kırılma’ noktasını temsil ettiği için, test turunu bir kenara bırakacağız ve RigNeRF’in seleflerinden farklı olarak ne yaptığını göreceğiz.
Birleşik Güçler
NerFACE’in temel kısıtlaması, kaynak görüntülerin statik bir kamera ile yakalandığını varsayar, bu da poz ve ifade kontrolü sağlar, ancak bu, yalnızca sınırlı bir görüş açısına sahip bir ‘hareketli portre’ oluşturur ve derin sahtecilik tarzı video için uygun değildir.
HyperNeRF, diğer yandan, yeni ve gerçekçi görüntüler üretebilir, ancak baş pozisyonlarını veya yüz ifadelerini değiştirmek için bir araç içermez, bu da yine oto-encoder tabanlı derin sahteciliklerin bir rakibi oluşturmaz.
RigNeRF, bu iki ayrı işlevi birleştirebiliyor, ‘canonical space’ oluşturarak, bir varsayılan temel çizgi oluşturuyor ve 3DMM modülünden alınan girişlerle sapmalar ve deformasyonlar gerçekleştirilebiliyor.

Bir ‘canonical space’ (poz, ifade yok) oluşturarak, 3DMM tarafından üretilen deformasyonlar (yani poz ve ifadeler) burada hareket edebilir.
3DMM sistemi, yakalanan konuya tam olarak eşleşmeyeceği için, bu süreci telafi etmek önemlidir. RigNeRF, bu deformasyon alanını, kaynak görüntülerinden türetilen bir Çok Katmanlı Perceptron (MLP) kullanarak hesaplar.

Deformasyonları hesaplamak için gereken kamera parametreleri, COLMAP aracılığıyla elde edilir, her kare için ifade ve şekil parametreleri ise DECA aracılığıyla elde edilir.
Positioning, landmark fitting ve COLMAP’ın kamera parametreleri aracılığıyla optimize edilir ve, hesaplama kaynağı kısıtlamaları nedeniyle, video çıkışı eğitim için 256×256 çözünürlüğe küçültülür (ayrıca oto-encoder derin sahtecilik sahnesini de etkileyen bir donanım-kısıtlı küçültme işlemi).
Bu之后, deformasyon ağı, dört V100’de eğitilir – bu, derin öğrenme eğitimi için güçlü bir donanım, ancak bu donanımın casual entuziastların erişimine açık olmayabileceği de doğrudur (ancak, makine öğrenimi eğitimi söz konusu olduğunda, genellikle güçlü donanımdan zaman lehine ticaret yapılabilir ve model eğitimi günler veya hatta haftalar sürebilir).
Sonuç olarak, araştırmacılar şunları belirtiyorlar:
‘Diğer yöntemlerin aksine, RigNeRF, 3DMM yönlendirmeli bir deformasyon modülünün kullanılması sayesinde, baş pozisyonu, yüz ifadeleri ve tam 3B portre sahnesini yüksek doğrulukla modelleyebiliyor ve net detaylar ile daha iyi yeniden yapılar sunabiliyor.’
Aşağıdaki gömülü videolara bakarak daha fazla ayrıntı ve sonuç görüntülerini izleyebilirsiniz.
İlk olarak 15 Haziran 2022’de yayınlandı.












