Anderson’un Açısı

Derin Sahtekarlıklar Major Yüz ‘Canlılık’ API’lerini Etkili Bir Şekilde Kandırmaya Yarar

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

ABD ve Çin arasındaki yeni bir araştırma işbirliği, dünyanın en büyük yüz tabanlı kimlik doğrulama sistemlerinin derin sahtekarlıklara karşı savunmasızlığını araştırdı ve çoğunun gelişen ve ortaya çıkan derin sahtekarlık saldırılarına karşı savunmasız olduğunu buldu.

Araştırma, genellikle büyük satıcılar tarafından sağlanan ve havayolları ve sigorta şirketleri gibi alt müşterilere hizmet olarak satılan Yüz Canlılık Doğrulama (FLV) sistemlerine karşı özel bir çerçeve kullanarak derin sahtekarlık tabanlı saldırılar gerçekleştirdi.

Makaledeki FLV API'lerinin büyük sağlayıcılar arasındaki işleyişinin bir özeti. Kaynak: https://arxiv.org/pdf/2202.10673.pdf

Makaledeki FLV API’lerinin büyük sağlayıcılar arasındaki işleyişinin bir özeti. Kaynak: https://arxiv.org/pdf/2202.10673.pdf

Yüz Canlılığı, adversarial görüntü saldırıları, maskeler ve önceden kaydedilmiş video gibi tekniklerin kullanımını engellemeyi amaçlar; ayrıca, yüz kimlik doğrulama sistemlerinin yaklaşık %40’ını atlatmaya能够 olan “usta yüzler” ve diğer görsel kimlik klonlama formları gibi.

Çalışma, bu sistemlerdeki sınırlı sayıda derin sahtekarlık algılama modülünün, milyonlarca müşteriye hizmet veren birçok sistemde, günümüzde modası geçmiş olan veya çok mimariye özgü olabilecek şekilde yapılandırılmış olabileceğini sonucuna varıyor.

Yazarlar not ediyor:

‘Farklı derin sahtekarlık yöntemleri, farklı satıcılar arasında varyasyonlar gösteriyor… Hedef FLV satıcılarının teknik ayrıntılarına erişemediğimiz için, bu varyasyonların farklı satıcılar tarafından dağıtılan savunma önlemlerine atfedilebileceğini düşünüyoruz. Örneğin, belirli satıcılar, belirli derin sahtekarlık saldırılarına karşı savunma önlemleri dağıtabilir.’

Ve devam ediyor:

‘Çoğu FLV API’si, anti-deepfake algılama kullanmıyor; hatta savunma önlemlerine sahip olanlar için bile, bunların etkinliği endişe verici (örneğin, yüksek kaliteli sentezlenmiş videoları tespit edebilir ancak düşük kaliteli olanları tespit edemez).’

Araştırmacılar, bu bağlamda, “otantiklik”in göreceli olduğunu gözlemliyor:

‘Bir sentezlenmiş video, insanlara gerçekçi gelmeyebilir, ancak mevcut anti-deepfake algılama mekanizmasını çok yüksek bir başarı oranıyla atlatmaya devam edebilir.’

Üstte, yazarların deneylerinde kimlik doğrulama için başarılı olan örnek derin sahtekarlık görüntüleri. Altta, görünüşte çok daha gerçekçi olan ancak kimlik doğrulamayı geçen sahte görüntüler.

Üstte, yazarların deneylerinde kimlik doğrulama için başarılı olan örnek derin sahtekarlık görüntüleri. Altta, görünüşte çok daha gerçekçi olan ancak kimlik doğrulamayı geçen sahte görüntüler.

Diğer bir bulgu, genel yüz doğrulama sistemlerinin yapılandırmasının beyaz erkekler lehine önyargılı olduğudur. Sonuç olarak, kadın ve beyaz olmayan kimliklerin, kimlik doğrulama sistemlerini atlatmada daha etkili olduğu ve bu kategorilerdeki müşterileri, derin sahtekarlık tabanlı tekniklerle ihlale karşı daha büyük bir risk altına soktuğu tespit edilmiştir.

Raporda, popüler yüz canlılık doğrulama API'lerinin beyaz erkek kimliklerini en katı ve doğru şekilde değerlendirdiği belirtiliyor. Yukarıdaki tabloda, kadın ve beyaz olmayan kimliklerin bu sistemleri atlatmada daha kolay olduğunu görüyoruz.

Raporda, popüler yüz canlılık doğrulama API’lerinin beyaz erkek kimliklerini en katı ve doğru şekilde değerlendirdiği belirtiliyor. Yukarıdaki tabloda, kadın ve beyaz olmayan kimliklerin bu sistemleri atlatmada daha kolay olduğunu görüyoruz.

Çalışma, “Yüz Canlılık Doğrulama’da önyargılar vardır, bu da belirli bir grup insan için önemli güvenlik riskleri oluşturabilir” diyor.

Yazarlar ayrıca, bir Çin hükümeti, büyük bir Çin havayolu, Çin’deki en büyük yaşam sigorta şirketlerinden biri ve R360, dünyanın en büyük unicorn yatırım gruplarından biri de dahil olmak üzere çeşitli kurumlara karşı etik yüz kimlik doğrulama saldırıları gerçekleştirdiler ve bu kurumların incelenen API’lerin alt akış kullanımını atlatmada başarılı olduklarını bildirdiler.

Çinli havayolunun başarılı bir kimlik doğrulama atlatma durumunda, alt akış API, kullanıcının “kafasını sallamasını” olarak potansiyel derin sahtekarlık materyali karşıtı bir kanıt olarak gerektiriyordu, ancak bu, araştırmacılar tarafından geliştirilen çerçeveye karşı çalışmadığı kanıtlandı; bu çerçeve, altı derin sahtekarlık mimarilerini içeriyordu.

Havayolunun kullanıcıların kafalarını sallamasını değerlendirmesine rağmen, derin sahtekarlık içeriği testi geçti.

Havayolunun kullanıcıların kafalarını sallamasını değerlendirmesine rağmen, derin sahtekarlık içeriği testi geçti.

Çalışma, ilgili satıcıların bu çalışmayı kabul ettiğini kaydetti.

Yazarlar, FLV’nin mevcut durumundaki geliştirmeler için bir dizi öneri sunuyor; bunlar arasında, tek bir görüntüye dayalı kimlik doğrulama (‘Görüntü Tabanlı FLV’) terk edilmesi, derin sahtekarlık algılama sistemlerinin görüntü ve ses alanlarında daha esnek ve kapsamlı bir şekilde güncellenmesi, ses tabanlı kimlik doğrulamanın kullanıcı videolarında dudak hareketleriyle senkronize edilmesi (şu anda genelde böyle değil) ve kullanıcıların, şu anda derin sahtekarlık sistemleri tarafından kolayca yeniden üretilmesi zor olan jestler ve hareketler yapması gerekiyor (örneğin, profil görünümleri ve yüzün kısmi bulanıklığı).

Makale, “Görüyor musun? Yaşıyorsun? Yüz Canlılık Doğrulamasının Güvenliği Üzerine Derin Sahtekarlık Çağında Yeniden Düşünme” başlıklı ve Changjiang Li ve Li Wang’ın ortak lider yazarlarından oluşan altı yazar tarafından Pennsylvania Eyalet Üniversitesi, Zhejiang Üniversitesi ve Şandong Üniversitesi’nden ortak bir çalışmadır.

Temel Hedefler

Araştırmacılar, “en temsil edici” altı Yüz Canlılık Doğrulama (FLV) satıcısına yöneldiler; bu satıcılar araştırmada kriptonomlar ile anonimleştirildi.

Satıcılar şunlardır: ‘BD’ ve ‘TC’, en büyük yüzle ilgili API çağrısı sayısına sahip bir konglomerat satıcıyı ve Çin’in en büyük AI bulut hizmetleri payını temsil ediyor; ‘HW’, “en büyük [Çin] kamu bulut pazarından” bir satıcıdır; ‘CW’, bilgisayar vizyonunda en hızlı büyüme oranına sahip ve lider bir pazar konumuna ulaşıyor; ‘ST’, en büyük bilgisayar vizyonu satıcılarından biri; ve ‘iFT’, Çin’in en büyük AI yazılım satıcılarından biri.

Veri ve Mimari

Projenin altındaki veri, 625.537 görüntüden oluşan Çin girişimi CelebA-Spoof veri setini ve Michigan Eyalet Üniversitesi’nin 2019 SiW-M veri setinden canlı videoları içeriyor.

Tüm deneyler, 256 GB RAM ve 4 TB HDD ile çalışan ikiz 2,40 GHz Intel Xeon E5-2640 v4 CPU’lara sahip bir sunucuda, dört 1080Ti NVIDIA GPU’su ve toplam 44 GB işletim VRAM’ı ile gerçekleştirildi.

Altı Bir Arada

Makalenin yazarları tarafından geliştirilen çerçeve, LiveBugger olarak adlandırılmış ve FLV sistemlerindeki dört ana saldırı vektörüne karşı altı güncel derin sahtekarlık çerçevesini bir araya getirmiştir.

LiveBugger, çeşitli derin sahtekarlık yaklaşımlarını içerir ve FLV sistemlerindeki dört ana saldırı vektörüne odaklanır.

LiveBugger, çeşitli derin sahtekarlık yaklaşımlarını içerir ve FLV sistemlerindeki dört ana saldırı vektörüne odaklanır.

Kullanılan altı derin sahtekarlık çerçevesi şunlardır: Oxford Üniversitesi’nin 2018 X2Face; ABD akademik işbirliği ICface; 2019 İsrail projesi FSGAN‘ın iki varyasyonu; 2020 başlarında İtalyan First Order Method Model (FOMM); ve Peking Üniversitesi’nin Microsoft Research işbirliği FaceShifter (ancak FaceShifter açık kaynak olmadığı için yazarlar, yayımlanan mimari ayrıntılarına dayanarak onu yeniden inşa etmek zorunda kaldılar).

Bu çerçeveler arasında kullanılan yöntemler, daha önce API kimlik doğrulama gereksinimlerinden çıkarılan rutin eylemlerin bulunduğu önceden oluşturulmuş videoların kullanılması ve ayrıca etkili “derin sahtekarlık kukla” kullanımı, yani bir bireyin canlı hareketlerinin bir derin sahtekarlık akışına çevrilmesi ve bir ele geçirilmiş web kamerası akışına eklenmesi gibi yöntemler de dahil olmak üzere çeşitli teknikleri içeriyordu.

Bunlardan biri, DeepFaceLive‘dır; bu, geçen yaz popüler DeepFaceLab‘e bir eklenti programı olarak ortaya çıktı ve gerçek zamanlı derin sahtekarlık akışı sağlamayı amaçlıyordu, ancak yazarların araştırmasında yer almadı.

Dört Vektörü Saldırmak

FLV sistemindeki dört saldırı vektörü: görüntü tabanlı FLV, kullanıcıdan bir fotoğraf yüklemesini gerektirir; sessizlik tabanlı FLV, kullanıcının bir video klip yüklemesini gerektirir; hareket tabanlı FLV, kullanıcının platform tarafından belirlenen eylemleri gerçekleştirmesini gerektirir; ve sese dayalı FLV, kullanıcının sesini sistemdeki ses kalıplarıyla eşleştirir.

Sistem için ilk zorluk, API’nin gereksinimlerini ne ölçüde açıklığa kavuşturmasıdır, çünkü bunlar daha sonra derin sahtekarlık sürecinde öngörülebilir ve uyarlanabilir. Bu, LiveBugger’daki Zeka Motoru tarafından ele alınır; bu, API belgelerinden ve diğer kaynaklardan gereksinimler hakkında bilgi toplar.

Yayınlanan gereksinimlerin (çeşitli nedenlerle) API’nin gerçek rutinlerinden eksik olabileceği durumlarda, Zeka Motoru, keşif API çağrılarının sonuçlarına dayalı olarak örtük bilgi toplamak için bir sonda içerir. Araştırma projesinde, bu, geliştiricilerin yararına resmi olarak sunulan resmi “test” API’leri ve ayrıca kendi canlı hesaplarını test için sunmaya gönüllü olan gönüllüler tarafından kolaylaştırıldı.

Zeka Motoru, bir API’nin belirli bir yaklaşımı kullanıp kullanmadığını belirlemek için kanıt arar; bu tür özellikler, video karelerinin zaman içinde sürekli olup olmadığını kontrol eden uyum algılama gibi özellikler içerir; bu gereksinim, karışık video kareleri göndererek ve bunun kimlik doğrulama başarısızlığına katkıda bulunup bulunmadığını gözlemleyerek kurulabilir.

Modül ayrıca, API’nin dudak dili algılama kullanıp kullanmadığını arar; burada API, videodaki sesin kullanıcının dudak hareketleriyle senkronize olup olmadığını kontrol edebilir (bu durum nadiren görülür – bkz. “Sonuçlar” bölümü aşağıda).

Sonuçlar

Yazarlar, altı değerlendirilen API’nin hiçbirinin, deneylerin yapıldığı sırada, tutarlılık algılama kullanmadığını buldu; bu da LiveBugger’daki derin sahtekarlık motorunun, katkıda bulunanlardan alınan materyale dayalı olarak sentezlenmiş ses ile derin sahtekarlık videosunu basitçe birleştirmesine olanak tanıdı.

Bununla birlikte, bazı alt akış uygulamaları (yani API çerçevelerinin müşterileri), bu işlemi atlatmak için işlemlere tutarlılık algılama ekledi.

Ayrıca, yalnızca birkaç API satıcısı, dudak dili algılama kullanıyor; çoğunda, video ve ses, birbirleriyle eşleştirilmeye çalışılmayan ayrı miktarlar olarak analiz ediliyor.

LiveBugger'da FLV API'lerine karşı çeşitli sahte tekniklerin sonuçları. Daha yüksek numaralar, FLV'yi derin sahtekarlık teknikleriyle başarıyla ihlal etme oranını gösterir. FLV için tüm olası savunmalar, tüm API'ler tarafından sunulmaz; Örneğin, bazıları derin sahtekarlıklara karşı herhangi bir savunma sunmazken, diğerleri kullanıcı videolarında dudak hareketleriyle sesin eşleşip eşleşmediğini kontrol etmez.

LiveBugger’da FLV API’lerine karşı çeşitli sahte tekniklerin sonuçları. Daha yüksek numaralar, FLV’yi derin sahtekarlık teknikleriyle başarıyla ihlal etme oranını gösterir. FLV için tüm olası savunmalar, tüm API’ler tarafından sunulmaz; Örneğin, bazıları derin sahtekarlıklara karşı herhangi bir savunma sunmazken, diğerleri kullanıcı videolarında dudak hareketleriyle sesin eşleşip eşleşmediğini kontrol etmez.

Sonuç

Makalenin sonuçları ve FLV API’lerinin geleceği için önerileri, karmaşıktır ve yazarlar bunları, FLV geliştiricilerin bazı sorunları daha iyi anlamalarına yardımcı olacak işlevsel bir “zayıflık mimarisi” olarak birleştirdiler.

Yüz tabanlı video kimlik doğrulama rutinlerine karşı derin sahtekarlık saldırısına karşı mevcut ve potansiyel savunmasızlıklarla ilgili önerilerin ağı.

Yüz tabanlı video kimlik doğrulama rutinlerine karşı derin sahtekarlık saldırısına karşı mevcut ve potansiyel savunmasızlıklarla ilgili önerilerin ağı.

Öneriler not ediyor:

‘FLV’nin güvenlik riskleri, birçok gerçek dünya uygulamasında yaygın olarak bulunur ve milyonlarca son kullanıcıların güvenliğini tehdit eder.’

Yazarlar ayrıca, hareket tabanlı FLV kullanımının “marjinal” olduğunu ve kullanıcıların gerçekleştirmesi gereken eylemlerin sayısını artırmaya çalışmanın “hiçbir güvenlik kazancı getirmediğini” gözlemliyor.

Yazarlar ayrıca, ses tanıma ve zaman içinde yüz tanıma (videoda) kombinasyonunun, API sağlayıcıları sesin dudak hareketleriyle senkronize edilmesini talep etmeye başlamadıkça, boşuna bir savunma olduğunu belirtiyorlar.

Çalışma, FBI’nin derin sahtekarlık dolandırıcılığından işleri uyarmasından yaklaşık bir yıl sonra ve bu teknolojinin yabancı etkileme operasyonlarında kullanılacağından ve canlı derin sahtekarlık teknolojisinin kamuoyunun hala video kimlik doğrulama güvenlik mimarilerine güvendiği bir ortamda yeni bir suç dalgasına yol açacağından endişe edildiği bir zamanda ortaya çıktı.

Bunlar, derin sahtekarlık olarak kimlik doğrulama saldırı yüzeyi açısından masih erken günler; 2020’de, 35 milyon dolar, derin sahtekarlık ses teknolojisi kullanılarak bir UAE bankasından haksız yere çıkarıldı ve bir UK yöneticisi de 2019’da 243.000 doları sahtekarlığa uğradı.

 

İlk olarak 23 Şubat 2022’de yayımlanmıştır.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai