Anderson’un Açısı

Derinlik Bilgisi Deepfake’leri Gerçek Zamanlı Olarak Açığa Çıkarmaya Yardımcı Olabilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

İtalya’dan yapılan yeni bir araştırmada, görüntülerden elde edilen derinlik bilgisi, deepfake’leri tespit etmek için yararlı bir araç olabilir ve hatta gerçek zamanlı olarak bunu yapabilir.

Son beş yıl içinde deepfake tespit araştırmalarının büyük çoğunluğu, artefakt tanımlama (geliştirilmiş tekniklerle hafifletilebilen veya kötü video codec sıkıştırmasıyla karıştırılabilen) üzerine odaklandı, çevresel aydınlatma, biyometrik özellikler, zamansal bozulma ve hatta insan içgüdüsü üzerine odaklandı, ancak yeni çalışma, derinlik bilgisi deepfake içeriğinin değerli bir anahtarı olabilir diye öne sürüyor.

Türetilen derinlik haritaları ve gerçek ve sahte görüntüler arasındaki algılanan derinlik bilgisi arasındaki fark. Kaynak: https://arxiv.org/pdf/2208.11074.pdf

Türetilen derinlik haritaları ve gerçek ve sahte görüntüler arasındaki algılanan derinlik bilgisi arasındaki fark. Kaynak: https://arxiv.org/pdf/2208.11074.pdf

Eleştirel olarak, yeni çalışmada geliştirilen tespit çerçeveleri, Xception gibi hafif bir ağ üzerinde çok iyi çalışıyor ve MobileNet üzerinde kabul edilebilir şekilde çalışıyor ve yeni makale, bu ağların sunduğu düşük gecikme süresinin, canlı deepfake dolandırıcılığına karşı gerçek zamanlı deepfake tespitini ermögelize edebileceğini kabul ediyor.

Çok daha azinferans zamanı, derinlik bilgisi için tam renkli görüntülere gerek kalmadan, yalnızca gri tonlamalı görüntülerle çalışabilmesi nedeniyle elde edilebilir.

Yazarlar şöyle diyor: ‘Bu sonuç, derinlik bilgisi bu durumda sınıflandırma için renk artefaktlerinden daha ilgili bir katkı sağladığını gösteriyor.’

Bu bulgular, DeepFaceLive gibi gerçek zamanlı yüz sentez sistemlerine karşı yönlendirilen yeni bir deepfake tespit araştırmaları dalgasının bir parçasını temsil ediyor – bu alanda son 3-4 ayda önemli bir hızlanma var, FBI’nin Mart ayında gerçek zamanlı video ve ses deepfake’lerinin riski hakkında uyarısından sonra.

The makale, DepthFake: bir derinlik tabanlı deepfake video tespiti stratejisi başlığını taşıyor ve Sapienza Üniversitesi’nden beş araştırmacının eseridir.

Kenar Durumlar

Eğitim sırasında, otomatik kodlayıcı tabanlı deepfake modelleri, gözler, burun ve ağız gibi yüzün iç bölgelerine öncelik veriyor. Çoğu durumda, DeepFaceLab ve FaceSwap gibi açık kaynaklı dağıtımlarda (her ikisi de 2017 Reddit kodu öncesi silinmeden önce çatallandırıldı), yüzün dış hatları, çok geç bir eğitim aşamasına kadar iyi tanımlanmıyor ve iç yüz alanı sentezinin kalitesine ulaşması muhtemel değil.

Önceki bir çalışmadan, yüzün 'önemlilik haritaları' görselleştirmesini görüyoruz. Kaynak: https://arxiv.org/pdf/2203.01318.pdf

Önceki bir çalışmadan, yüzün ‘önemlilik haritaları’ görselleştirmesini görüyoruz. Kaynak: https://arxiv.org/pdf/2203.01318.pdf

Normalde, bu önemli değil, çünkü gözlerimize ve öncelikle dışarıya doğru azalan dikkat seviyeleriyle odaklanma eğilimindeyiz, bu nedenle periferik kalitedeki düşüşler bizi rahatsız etmez – özellikle de sahte bir kimlik olan kişiyle canlı olarak konuşuyorsak, bu, sosyal kuralları ve işlem sınırlamalarını tetikleyecektir, bunlar ‘oluşturulmuş’ deepfake görüntülerini değerlendirdiğimizde mevcut değildir.

Ancak, deepfake yüzün etkilenen kenar bölgelerindeki ayrıntı veya doğruluğun eksikliği algoritmik olarak tespit edilebilir. Mart ayında, periferik yüz alanına odaklanan bir sistem duyuruldu. Ancak, bu, ortalama üstü bir eğitim verisi miktarı gerektirdiğinden, yalnızca ImageNet gibi güncel bilgisayar vizyonu ve deepfake tespit tekniklerinde kanıtları olan ünlü kişilerin yer aldığı popüler yüz veri setlerinde yer alan ünlüler için tasarlandı.

Bu yerine, yeni sistem, DepthFake, genel olarak bilinmeyen veya az bilinen kimliklere bile, gerçek ve sahte video içeriğinde tahmin edilen derinlik haritası bilgilerinin kalitesini ayırt ederek çalışabilir.

Derinlere İniş

Derinlik haritası bilgileri, AI destekli stereo uygulamaları dahil olmak üzere, akıllı telefonlara giderek daha fazla entegre ediliyor ve bu, bilgisayar vizyonu çalışmaları için özellikle faydalıdır. Yeni çalışmada, araştırmacılar, Ulusal İrlanda Üniversitesi’nin FaceDepth modelini kullandılar, bu model, tek kaynaklı görüntülerden derinlik haritalarını-efficient bir şekilde tahmin edebilen bir convolutional encoder/decoder ağıdır.

FaceDepth modeli çalışır durumda. Kaynak: https://tinyurl.com/3ctcazma

FaceDepth modeli çalışır durumda. Kaynak: https://tinyurl.com/3ctcazma

Sonraki adımda, İtalyan araştırmacıların yeni çerçevesi, konunun yüzünden hem orijinal RGB görüntüsünden hem de türetilen derinlik haritasından 224×224 piksellik bir yama çıkarmaktadır. Eleştirel olarak, bu işlem, çekirdek içeriği yeniden boyutlandırmeden kopyalamaya izin veriyor; bu önemli, çünkü boyut standardı yeniden boyutlandırma algoritmaları, hedeflenen alanların kalitesini olumsuz etkileyecektir.

Bu bilgiler kullanılarak, araştırmacılar, gerçek ve deepfake kaynaklardan, ilgili derinlik haritalarının algılanan kalitesi arasındaki farklılıklara dayanarak gerçek ile sahte örnekleri ayırt edebilen bir convolutional neural network (CNN) eğitti.

DepthFake için kavramsal işlem hattı.

DepthFake için kavramsal işlem hattı.

FaceDepth modeli, gerçekçi ve sentetik veriler kullanılarak, yüzün dış kenarlarında daha fazla ayrıntı sunan bir hibrit fonksiyon ile eğitildi ve bu, DepthFake için uygun hale getiriyor. Bir MobileNet örneğini özellik çıkaran olarak kullanıyor ve 480×640 girdi görüntüleri ile 240×320 derinlik haritaları çıkışı ile eğitildi. Her derinlik haritası, yeni projenin ayrımcının kullandığı dört girdi kanalından birini temsil ediyor.

Derinlik haritası, modern akıllı telefon kameralarının çıkabileceği RGBD görüntüsü ile dolu, orijinal RGB görüntüsüne otomatik olarak gömülür.

Eğitim

Model, önceden ImageNet üzerinde eğitilmiş bir Xception ağı üzerinde eğitildi, ancak mimari, ek derinlik bilgisini barındırmak ve ağırlıkların doğru başlangıcını korumak için bazı adaptasyonlara ihtiyaç duydu.

Ayrıca, derinlik bilgisi ve ağın beklediği değerler arasındaki değer aralıklarındaki uyumsuzluk, araştırmacıların değerleri 0-255’e normalize etmesini gerektirdi.

Eğitim sırasında, yalnızca flipping ve旋转 uygulandı. Çoğu durumda, modelin sağlam çıkarım geliştirmesi için çeşitli diğer görsel bozulmalar sunulacaktır, ancak kaynak fotoğraflardaki sınırlı ve çok kırılgan kenar derinlik haritası bilgisini korumak için araştırmacıların bir azaltma rejimini benimsemeleri gerekti.

Sistem ayrıca, kaynak görüntülerin ne kadar karmaşık olması gerektiği hakkında bilgi edinmek için basit 2-kanallı gri tonlamayla eğitildi.

Eğitim, TensorFlow API’si aracılığıyla, 8GB VRAM ile bir NVIDIA GTX 1080’da, ADAMAX optimize edici ile 25 epoch, 32’lik bir toplu boyutunda gerçekleşti. Giriş çözünürlüğü, yüz tespiti ve çıkarma için dlib C++ kütüphanesi ile gerçekleştirilirken, 224×224 olarak sabitlendi.

Sonuçlar

Sonuçların doğruluğu, Deepfake, Face2Face, FaceSwap, Neural Texture ve RGB ve RGBD girişleri ile đầy dataset kullanarak FaceForensic++ çerçevesi ile test edildi.

Dört deepfake yöntemi ve tüm bölünmemiş dataset üzerinde doğruluk sonuçları. Sonuçlar, kaynak RGB görüntülerinin analizi ve aynı görüntülerin gömülü tahmini derinlik haritaları ile bölünmüştür. En iyi sonuçlar kalın olarak gösteriliyor ve altındaki yüzde rakamları, derinlik haritası bilgisinin sonucu nasıl iyileştirdiğini gösteriyor.

Dört deepfake yöntemi ve tüm bölünmemiş dataset üzerinde doğruluk sonuçları. Sonuçlar, kaynak RGB görüntülerinin analizi ve aynı görüntülerin gömülü tahmini derinlik haritaları ile bölünmüştür. En iyi sonuçlar kalın olarak gösteriliyor ve altındaki yüzde rakamları, derinlik haritası bilgisinin sonucu nasıl iyileştirdiğini gösteriyor.

Tüm durumlarda, derinlik kanalı, tüm konfigürasyonlarda modelin performansını iyileştirir. Xception en iyi sonuçları elde eder, hafif MobileNet de yakın takip eder. Bunun üzerine yazarlar şöyle diyor:

‘MobileNet’in Xception’dan biraz daha düşük ve daha derin ResNet50’den daha iyi performans göstermesi ilginç. Bu, gerçek zamanlı uygulamalar için çıkarım zamanını azaltma hedefi düşünüldüğünde önemli bir sonuç. Bu, bu çalışmanın ana katkısı olmasa da, gelecekteki gelişmeler için cesaret verici bir sonuç olarak görüyoruz.’

Araştırmacılar ayrıca, RGBD ve 2-kanallı gri tonlamalı girişin, RGB ve doğrudan gri tonlamalı girişe kıyasla tutarlı bir avantajı olduğunu belirtiyorlar, derinlik çıkarımlarının gri tonlamalı dönüşümleri, hesaplama açısından çok ucuz olduğundan, modelin sınırlı yerel kaynaklarla gelişmiş sonuçlar elde etmesine olanak tanıyarak, derinlik bilgisine dayalı gerçek zamanlı deepfake tespiti geliştirilmesini kolaylaştırıyor.

 

İlk olarak 24 Ağustos 2022’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai