Anderson’un Açısı

Derin Sahte Veri Kaynaklarını AI Tabanlı Etiketleme ile Tanımlama

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çin, Singapur ve ABD’deki araştırmacılar arasında bir işbirliği, yüz fotoğraflarını o kadar güçlü bir şekilde “etiketlemek” için dayanıklı bir sistem üretti ki, tanımlayıcı işaretler, derin sahte eğitim sürecinde yok edilmez, bu da haksız yere kazanılmış kaynak verilerini “anonimleştirmeye” çalışan sentetik görüntü oluşturma sistemlerinin yeteneğini azaltabilecek IP iddiaları için yol açar.

Sistem, FakeTagger olarak adlandırılır ve görsel olarak ayırt edilemeyen ID bilgilerini görüntülere düşük bir seviyede gömme için kodlayıcı/çözücü bir işlem kullanır, böylece enjekte edilen bilgi, temel yüz özellikleri veri olarak yorumlanacak ve bu nedenle soyutlama süreçlerinden itibaren geçerlidir.

FakeTagger mimarisinin bir görünümü. Kaynak verileri, bir 'aşırı' yüz özelliğini oluşturmak için kullanılır, arka plan öğelerini görmezden gelir ve tipik bir derin sahte iş akışında maskeleme yoluyla çıkarılır. Mesaj, işlemin diğer ucunda geri kazanılabilir ve uygun bir tanıma algoritması ile tanımlanabilir. Kaynak: http://xujuefei.com/felix_acmmm21_faketagger.pdf

FakeTagger mimarisinin bir görünümü. Kaynak verileri, bir ‘aşırı’ yüz özelliğini oluşturmak için kullanılır, arka plan öğelerini görmezden gelir ve tipik bir derin sahte iş akışında maskeleme yoluyla çıkarılır. Mesaj, işlemin diğer ucunda geri kazanılabilir ve uygun bir tanıma algoritması ile tanımlanabilir. Kaynak: http://xujuefei.com/felix_acmmm21_faketagger.pdf

Araştırma, Wuhan’daki Siber Bilim ve Mühendislik Okulu, Çin Eğitim Bakanlığındaki Aerospace Bilgi Güvenliği ve Güvenilir Bilişim Anahtar Laboratuvarı, ABD’deki Alibaba Grubu, Boston’daki Northeastern Üniversitesi ve Singapur’daki Nanyang Teknoloji Üniversitesi’nden geliyor.

Deneysel sonuçlar, FakeTagger’in dört ortak derin sahte metodolojisi boyunca %95’e kadar bir yeniden tanımlama oranını gösteriyor: kimlik değişimi (yani DeepFaceLab, FaceSwap); yüz yeniden canlandırma; öznitelik düzenleme; ve toplam sentez.

Derin Sahte Tespitinin Eksiklikleri

Son üç yıl, yeni derin sahte tanımlama metodolojilerine yönelik bir dizi yeni yaklaşım getirdi, ancak bu tüm yaklaşımlar, göz parıltısı gibi derin sahte iş akışlarının giderilebilecek eksikliklerine dayanır ve daha önceki derin sahtelerde yetersiz yüz kümeleri nedeniyle göz kırpma eksikliği.

Yeni makale, Facebook’un en recent derin sahte tespit yarışması (DFDC) tarafından üretilen en etkili post-facto tespit metodunun, vahşi doğada derin sahteleri tespit etme açısından %70 doğruluğa sahip olduğunu gözlemliyor. Araştırmacılar, bu temsil edilen başarısızlığı, yeni ve yenilikçi GAN ve kodlayıcı/çözücü derin sahte sistemlerine karşı zayıf genelleme ve souvent düşük kaliteli derin sahte ikamelerine atfediyorlar.

Bu, bazen derin sahtecilerin düşük kaliteli çalışması veya videoların paylaşım platformlarına yüklenmesinden kaynaklanabilir, bu platformlar bant genişliği maliyetlerini sınırlamaya çalışır ve videoları çok daha düşük bit oranlarında yeniden kodlar. İronik olarak, bu görüntü bozulması, derin sahtenin apparent otantikliğine hijyenik bir şekilde müdahale etmez, aksine illüzyonu gerçekten güçlendirebilir, çünkü derin sahte videosu, algılanan otantik bir ortak görsel idiyoma dahil edilir.

Model İnvaryasyonuna Yardım Eden Dayanıklı Etiketleme

Makine öğrenimi çıkışından kaynak verilerini tanımlamak, nispeten yeni ve büyüyen bir alandır ve bu, IP temelli davalara dayanan yeni bir çağın mümkün olmasını sağlar, hükümetlerin şu anda izin veren ekran kazıma düzenlemeleri, ulusal araştırma üstünlüğünü engellememek için tasarlanmış global bir AI ‘silah yarışına’ karşı ticari hale gelir.

Model İnvaryasyonu, sentez sistemlerinin çıkışından kaynak verilerini haritalama ve tanımlama ile ilgilenir, bunlar arasında Doğal Dil Oluşturma (NLG) ve görüntü sentezi bulunur. Model invaryasyonu, özellikle bulanıklaştırılmış, pikselleştirilmiş veya bir Generatif Karşıt Ağ veya kodlayıcı/çözücü dönüşüm sistemi gibi bir soyutlama işleminden geçen yüzleri yeniden tanımlamada etkilidir.

Yeni veya mevcut yüz görüntülerine hedefli etiketleme ekleme, model invaryasyon tekniklerine potansiyel yeni bir yardımdır, su işaretleme bir ortaya çıkan alandır.

Post-Facto Etiketleme

FakeTagger, bir post-işlem yaklaşımı olarak tasarlanmıştır. Örneğin, bir kullanıcı bir fotoğrafı bir sosyal ağa yüklerse (bu genellikle bir tür optimize etme işlemi içerir ve nadiren orijinal görüntünün doğrudan ve değişmez bir aktarımıdır), algoritma görüntüyü işler ve yüzüne iddia edilen silinmez özellikler ekler.

Alternatif olarak, algoritma histórik görüntü koleksiyonları üzerinde uygulanabilir, bu da son yirmi yıl içinde birkaç kez oldu, büyük stok fotoğraf ve ticari görüntü koleksiyon siteleri, içeriğin izin olmadan yeniden kullanıldığını tanımlamak için yöntemler aradı.

FakeTagger, çeşitli derin sahte işlemlerinden geri kazanılabilir ID özelliklerini gömme amacını taşır.

FakeTagger, çeşitli derin sahte işlemlerinden geri kazanılabilir ID özelliklerini gömme amacını taşır.

Geliştirme ve Test

Araştırmacılar, FakeTagger’i, DeepFaceLab; Stanford’un Face2Face gibi dört yaklaşımın her birine karşı test etti; ve STGAN gibi yüz özniteliklerini düzenleyebilen diğerleri.

Testler, CelebA-HQ ile yapıldı, bu, 30.000 ünlü yüz görüntüsünü içeren bir kamu deposudur ve 1024 x 1024 piksele kadar çeşitli çözünürlüklerde bulunur.

Temel olarak, araştırmacılar geleneksel görüntü su işaretleme tekniklerini test etti, derin sahte iş akışlarının eğitim süreçlerinde etiketlerin hayatta kalıp kalamayacağını görmek için, ancak bu yöntemler tüm dört yaklaşımda başarısız oldu.

FakeTagger’in gömülü verileri, U-Net konvolüsyonel ağ tabanlı bir mimari kullanarak yüz kümesi görüntülerine enkoder aşamasında enjekte edildi. Ardından, çerçevenin decoder bölümü, gömülü bilgiyi bulmak için eğitilir.

Süreç, bir GAN simülatöründe denenmiştir, bu, yukarıda bahsedilen FOSS uygulamalarını/algoritmalarını kullanan bir kara kutu ayarında, her bir sistemin iş akışlarına özel veya ayrıcalıklı erişim olmadan denenmiştir. Rastgele sinyaller, ünlü görüntülerine bağlandı ve her görüntüye ilgili veri olarak kaydedildi.

Kara kutu ayarında, FakeTagger dört uygulamanın yaklaşımında %88.95’e kadar bir doğruluk elde edebildi. Paralel bir beyaz kutu senaryosunda, doğruluk %100’e yaklaştı. Ancak bu, gelecekteki derin sahte yazılımlarının FakeTagger’i doğrudan entegre edebileceği anlamına gelir, bu da yakın gelecekte olası değildir.

Maliyeti Hesaplamak

Araştırmacılar, FakeTagger için en zorlu senaryonun, CLIP tabanlı soyut oluşturma gibi tam görüntü sentezi olduğunu belirtiyorlar, çünkü girdi eğitim verileri bu durumda en derin soyutlama düzeylerine tabidir. Ancak bu, son birkaç yıldır başlıkları domine eden derin sahte iş akışlarına uygulanmaz, çünkü bunlar, ID tanımlayan yüz özelliklerinin sadık bir şekilde yeniden üretimine bağlıdır.

Makale ayrıca, karşıt saldırıların, böyle bir etiketleme sistemini bozmak için yapay gürültü ve tırmıklama gibi pertürbasyonlar eklemeye çalışabileceğini, ancak bunun derin sahte çıkışının otantikliğine zarar vereceğini belirtiyor.

Ayrıca, FakeTagger’in gömülü etiketlerin hayatta kalmasını sağlamak için görüntülere yedekli veri eklemesi gerektiğini ve bunun ölçekte önemli bir hesaplama maliyeti olabileceğini not ediyorlar.

Yazarlar, FakeTagger’in diğer alanlarda köken izleme için potansiyele sahip olabileceğini, karşıt yağmur saldırıları ve diğer görüntü tabanlı saldırılar gibi karşıt maruziyet, pus, bulanıklık, vignetting ve renk-jittering gibi saldırılar da dahil olmak üzere, belirterek bitiriyor.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai