Anderson’un Açısı

Derin Sahte ve Görüntü Sentezleme Sistemlerine Karşı Görüntüleri Kodlama

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Derin sahte araştırmalarında en çok bilinen araştırma alanı, derin sahte, sentezlenmiş veya başka şekilde sahte veya “düzenlenmiş” yüzlerin video ve görüntü içeriklerinde artifacts veya diğer suppoedly ayırt edici özelliklerini tanıyabilen sistemleri içerir.

Bu yaklaşımlar, derinlik algılama, video düzenliliği bozma, monitör aydınlatması değişiklikleri (potansiyel olarak derin sahte canlı video görüşmelerinde), biyometrik özellikler, yüzün dış bölgeleri ve hatta insan bilinçaltı sisteminin gizli güçleri gibi çeşitli taktiklerle çalışır.

Bu ve benzer yöntemlerin ortak noktası, bu yöntemlerin ancak sistemlerin already başarılı bir şekilde eğitildikten sonra devreye girdiğidir – binlerce veya yüz binlerce web’den kazınmış görüntülerle eğitilmiş merkezi mekanizmalar already başarılı bir şekilde eğitilmiştir. Bu görüntülerden, oto-encoder sistemleri kolayca ana özellikleri çıkarabilir ve video görüntüleri veya sentezlenmiş görüntülere yanlış bir kimlik uygulayabilen modeller oluşturabilir – hatta gerçek zamanlı olarak.

Kısacası, bu sistemler devreye girdiğinde, at already kaçmıştır.

Derin Sahte/Sentez Mimarilerine Düşman Görüntüler

Derin sahtelere ve görüntü sentezine karşı daha önleyici bir tutumla, bu sektördeki daha az bilinen bir araştırma dalı, tüm bu kaynak fotoğraflarını AI görüntü sentez sistemlerine “dostsuz” hale getirmenin olanaklarını içerir – genellikle algılanamaz veya几乎 algılanamaz şekillerde.

Örneğin, 2021’de çeşitli ABD ve Asya kurumlarından gelen bir öneri olan FakeTagger, görüntülere mesajlar kodlar; bu kodlamalar genelleme sürecine karşı dirençlidir ve görüntüler web’den kazınmış ve bir Generative Adversarial Network (GAN) gibi bir sisteme eğitildikten sonra bile kurtarılabilir.

Diğer yinelemeleri arasında, IBM’den 2018 projesi ve aynı yıl Japonya’dan bir dijital watermarking sistemi bulunur.

Daha yenilikçi bir şekilde, 2021’de Nanjing Havacılık ve Uzay Üniversitesi’nden bir girişim, eğitim görüntülerini yetkili sistemlerde etkili bir şekilde eğitilebilecek, ancak genel bir görüntü sentez eğitim pipeline’ında kullanıldığında felaketler yaşayabilecek şekilde “şifreleme”ye çalıştı.

Aslında, tüm bu yöntemler steganografi kategorisine girer, ancak tüm durumlarda, görüntülerdeki benzersiz tanımlama bilgisi, bir görüntünün öyle bir “özelliği” olmalıdır ki, bir oto-encoder veya GAN mimarisi tarafından atılabilir “gürültü” veya gereksiz veri olarak atılmaz, ancak diğer yüz özellileri ile birlikte kodlanır.

Aynı zamanda, bu işlem görüntüyü o kadar da bozamaz veya düşük kaliteli hale getiremez ki, casual izleyiciler tarafından kusurlu veya düşük kaliteli olarak algılanır.

TAFIM

Şimdi, yeni bir Alman araştırma girişimi (Münih Teknik Üniversitesi ve Sony Avrupa RDC Stuttgart’tan), derin sahte modelleri veya StyleGAN tipi çerçeveleri eğitilen işlenmiş görüntülerden unusable mavi veya beyaz çıktı üretebilen bir görüntü kodlama tekniğini önerdi.

TAFIM: Targeted Adversarial Attacks against Facial Image Manipulations adlı makale, bir sinir ağını kullanarak görüntülere neredeyse algılanamaz pertürbasyonlar kodlar. Görüntüler eğitildikten ve bir sentez mimarisine genelleştirildikten sonra, ortaya çıkan model, style mixing veya doğrudan yüz değiştirme kullanıldığında girdi kimliği için renksiz çıktı üretir.

Web’i Yeniden Kodlama..?

Ancak, bu durumda, son kavramın mimari veya minutiae’larını incelemeyeceğiz, sondern bunun toàn practicality’sini ele alacağız – özellikle Stable Diffusion gibi görüntü sentezleme çerçevelerinin kamu tarafından kazınmış görüntülerini kullanma konusundaki büyüyen tartışma ve bu tür içerikten türetilen ticari yazılımların sonraki yasal etkileri ışığında.

Proaktif, kodlama tabanlı yaklaşımlar, web tabanlı işleme kütüphanelerine yeni ve genişletilmiş sıkıştırma rutinleri kurumlarını gerektirir – Örneğin, birçok sosyal medya yükleme arayüzünü güçlendiren ImageMagick.

Birincil soru, böyle bir şemanın “ileri gidecek” mi, yoksa daha geniş ve geriye dönük bir dağıtım mı amaçlanıyor, yani on yıllardır mevcut olan historical medya mı ele alınacak?

Platformlar gibi Netflix, yeni kodlarla geri kataloğu yeniden kodlama konusunda isteksiz değil; YouTube’un tarihi içeriğini H.264 koduna dönüştürmesi de, Apple TV’yi desteklemek için yapıldığı gibi, lojistik olarak prohibitive görülmedi.

Politik Çatışma

Politik olarak, hükümetlerin AI gelişiminde geri kalmama kararları ile kamu tarafından açıkça kullanılabilen ses, video ve görüntü içeriğinin kullanımı konusunda endişelere karşı taviz vermeleri arasında bir gerilim vardır.

Resmi olarak, batı hükümetleri, bilgisayar vizyonu araştırma sektörünün kamu tarafından açıkça kullanılabilen medyayı kullanma yeteneğine karşı hoşgörülüdür – çünkü bazı otoriter Asya ülkeleri, kendi araştırma akışlarını kendi çıkarlarına göre şekillendirmek için daha fazla esnekliğe sahiptir.

Nisan 2022’de, ABD Temyiz Mahkemesi, kamu tarafından yüzleşen web verilerinin araştırma amaçları için adil oyun alanı olduğunu onayladı – LinkedIn’in protestolarına rağmen, kullanıcı profillerinin böyle süreçlerden korunmasını istiyor.

Kazual İnceleme

Öneriler, blockchain yöntemlerini kullanarak bir kaynak görüntüsünün gerçek provenansını ve görünümünü doğrulamak için sunuldu, ancak bu, görüntülerin eğitilmesini veya böyle dönüşümlerin mümkün olmasını engellemez.

haveibeentrained.com gibi web siteleri, kullanıcıların görüntülerini yüklemelerine ve LAION5B veri setinin Stable Diffusion’u güçlendirdiğini kontrol etmelerine olanak tanır.

LAION5B veri setinin milyarlarca görüntüsüne rağmen, çoğu geleneksel derin sahte veri seti, internetten çıkarılan video ve görüntülerden oluşur – ancak bu, sadece nöral dirence karşı dayanıklı bir watermarking ile ortaya çıkarılabilir.

Kaynağında Su İşaretleri Eklemek

Kaynağında görüntü watermarking’inin daha aşırı bir potansiyel uygulaması, ticari kameraların ham çıkışına gizli ve açık olmayan bilgileri eklemektir.

1990’ların sonlarında yapılan bir patent başvurusu, video ve still görüntülere steganografik “alt görüntüler” eklemek için Dikte Cosine Dönüşümlerini önerdi.

Basit bir yaklaşım, görüntülere açıkça görülebilen watermarklar eklemektir – bu, çoğu kullanıcı için hoş olmayan ve profesyoneller için gereksizdir.

En az bir kamera, yetkisiz kullanımın sinyalini verebilecek logo tabanlı watermark eklemesine olanak tanır, ancak AI tarafından logo kaldırma artık oldukça basittir ve hatta ticarileştirilmiştir.

 

İlk olarak 25 Eylül 2022’de yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai