Yapay zeka modelleri ve platformları

İleri Yüz Tanıma için DeepFace

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yüz tanıma, AI ve ML’de birkaç yıldır trend olan bir alandır ve yüz tanımanın geniş kültürel ve sosyal etkileri vardır. Ancak, insan görsel sistemleri ve makineler arasında bir performans açığı vardır ve bu, yüz tanıma uygulamalarını sınırlar.

Performans açığını aşmak ve insan düzeyinde doğruluk sağlamak için Meta, DeepFace adlı bir yüz tanıma çerçevesi tanıttı. DeepFace modeli, büyük bir yüz veriseti üzerinde eğitilir ve diğer çerçevelerden farklı olarak, insan düzeyinde doğruluk sağlayabilir. Ayrıca, DeepFace çerçevesi, diğer sistemlerin ürettiği binlerce yüz görünümü özelliğine kıyasla compact yüz temsilmaları üretir.

Önerilen DeepFace çerçevesi, büyük bir veriseti üzerinde Derin Öğrenme kullanır. DeepFace ağ mimarisi, hizalamanın tamamlandığından, her yüz bölgesinin konumu piksel düzeyinde sabittir. Bu nedenle, diğer çerçevelerde yapılan gibi多lu konvolüsyonel katmanlar kullanmadan, ham piksel RGB değerlerini kullanmak mümkündür.

Modern yüz tanıma çerçevelerinin geleneksel işlem hattı, dört aşamadan oluşur: Tespit, Hizalama, Temsil ve Sınıflandırma. DeepFace çerçevesi, açık 3B yüz modelleme kullanır ve bir yüz temsili elde etmek için dokuz katmanlı bir derin sinir ağı kullanır. DeepFace çerçevesi, aşağıdaki katkıları yapmaya çalışır

  1. Büyük bir verisetini kullanarak, diğer verisetlerine genelleyebilen bir yüz temsili oluşturabilecek etkili bir DNN veya Derin Sinir Ağı mimarisi geliştirmek.
  2. Etkili bir yüz hizalama sistemi geliştirmek için açık 3B modelleme kullanmak.

DeepFace Modelinin Çalışma Prensibi

Yüz Hizalama

Yüz Hizalama, bir kişinin göz açısına göre görüntüsünü döndürme tekniğidir. Yüz Hizalama, yüz tanıma için veri ön işleme amacıyla kullanılan popüler bir uygulamadır ve yüz hizalı verisetleri, normalize girdi sağlayarak tanıma algoritmalarının doğruluğunu artırabilir. Ancak, yüzleri kısıtlama olmadan hizalamak, çoklu faktörler nedeniyle zor bir görevdir. several gelişmiş hizalama teknikleri, yüzün analitik 3B modelini veya harici verisetinden fidusiyel noktaları aramayı içerebilir.

Hizalama, kısıtlama olmayan yüz doğrulama ve tanıma için en popüler yöntemdir, ancak şu anda mükemmel bir çözüm yoktur. 3B modeller de kullanılır, ancak özellikle kısıtlama olmayan bir ortamda çalışırken son birkaç yılda popülerlikleri önemli ölçüde azaldı. Ancak, insan yüzleri 3B nesneler olduğu için, doğru şekilde kullanıldığında doğru yaklaşım olabilir. DeepFace modeli, yüzün analitik 3B modellemesi için fidusiyel noktaları kullanan bir sistem kullanır. Bu 3B modelleme, daha sonra yüz crop’ını 3B ön plana dönüştürmek için kullanılır.

Ayrıca, çoğu hizalama uygulaması gibi, DeepFace hizalaması da hizalama sürecini yönlendirmek için fidusiyel nokta dedektörleri kullanır. DeepFace modeli, basit bir nokta dedektörü kullanır, ancak birden fazla iterasyonda çıktı değerini iyileştirir. Her iterasyonda, bir görüntü açıklamasından fidusiyel noktaları çıkarmak için eğitilmiş bir Destek Vektör Regresörü (SVR) kullanılır. DeepFace’ın görüntü açıklaması, LBP Histogramlarına dayanmaktadır, ancak diğer özellikler de dikkate alınır.

2B Hizalama

DeepFace modeli, hizalama işlemini, algılama crop’ının ortasında bulunan altı fidusiyel nokta ile başlatır. Gözlerin, ağızın ve burnun konumları kullanılır. Bunlar, görüntüyü döndürmek, ölçeklemek ve altı anchor konumuna çevirmek için kullanılır ve dönüştürülmüş görüntü üzerinde yineleme yapılır. Toplanan dönüşüm, 2B hizalı bir crop oluşturur. Hizalama yöntemi, LFW-a’da kullanılan yönteme benzer ve yıllardır model doğruluğunu artırmak için kullanılmıştır.

3B Hizalama

DeepFace çerçevesi, yüzleri düzlem dışı döndürmelerle hizalamak için genel bir 3B şekil modeli kullanır ve 2B hizalı crop’u 3B şeklinin görüntü düzleminde sarmak için bir 3B kamera kaydeder. Sonuç olarak, model, corp’un 3B hizalı versiyonunu üretir ve bu, 2B hizalı corp’da 67 fidusiyel nokta lokalize ederek ikinci bir SVR ile elde edilir.

Model, daha sonra 67 anchor noktasını 3B şekline manuel olarak yerleştirir ve böylece 3B referanslar ve karşılık gelen fidusiyel noktaları arasında tam bir eşleşme sağlar. Sonraki adımda, bilinen kovaryans matrisi ile genel least squares çözümü kullanarak lineer sistemlere 3B’den 2B’ye affine bir kamera eklenir.

Frontalization

Esnek deformasyonlar ve tam perspektif projeksiyonları modellemeyen, 3B’den 2B’ye uyumlu kamera, sadece bir yaklaşıma hizmet eder. Önemli kimlik taşıyıcı faktörlerin bozulmasını azaltmak için, DeepFace modeli, her referans fidusiyel noktasının x-y bileşenlerine karşılık gelen artıkları ekler. Bu, kimlik kaybı olmadan 2B görüntüyü daha az bozulmalarla sarmak için makul bir yaklaşım sunar.

Son olarak, model, 67 fidusiyel noktadan türetilen Delaunay triangülasyonu ile yönlendirilen parça başına affine bir dönüşüm kullanarak frontalizasyonu gerçekleştirir.

  1. Altı fidusiyel nokta ile algılanan yüz.
  2. İndüklenen 2B hizalı crop.
  3. 2B hizalı corp’da 67 fidusiyel nokta.
  4. Referans 3B şekli, 2B hizalı corp görüntüsüne dönüştürülmüş.
  5. 3B-2B kamera ile ilgili üçgen görünürlüğü.
  6. 3B modeli tarafından üretilen 67 fidusiyel nokta.
  7. Corp’un 3B hizalı versiyonu.
  8. 3B modeli tarafından üretilen yeni görünüm.

Temsil

Eğitim verisi miktarının artmasıyla, öğrenme tabanlı yöntemler, özellikle belirli bir görev için özellikler keşfetme ve optimize etme yetenekleri nedeniyle, mühendislik özelliklerine kıyasla daha verimli ve doğru olduğunu kanıtlamıştır.

DNN Mimarisi ve Eğitimi

DeepFace DNN, yüzün kimliğini sınıflandıran çok sınıflı bir yüz tanıma görevi üzerinde eğitilir.

Aşağıdaki şekil, DeepFace modelinin genel mimarisini temsil eder. Model, 32 filtreli 11x11x3’lük bir konvolüsyonel katman (C1) ile beslenen, 152×152 piksel boyutunda 3B hizalı 3-kanallı RGB görüntüsüne sahiptir ve bu, 32 özellik haritasına sonuçlanır. Bu özellik haritaları, daha sonra her kanal için 3×3 spatial komşuluklar üzerinde maksimumu alan ve 2’lik bir adıma sahip bir M2 maksimum havuzu katmanına beslenir. Bunu, 9x9x16’lık 16 filtreli bir C3 konvolüsyonel katman izler. Bu katmanların temel amacı, doku ve basit kenarlar gibi düşük seviyeli özellikleri çıkarmaktır. Maksimum havuzu katmanlarının avantajı, konvolüsyonel katmanların ürettiği çıktının yerel çevirilere karşı daha robust olmasını sağlar ve hizalanmış yüz görüntülerine uygulanırsa, ağ küçük ölçekli kayıt hatalarına karşı daha robust hale gelir.

Birden çok düzeyde havuzlama, ağın belirli durumlara karşı daha robust olmasına neden olur, ancak aynı zamanda ağın mikro dokular ve ayrıntılı yüz yapıları hakkında bilgi kaybına neden olur. Bu bilgi kaybını önlemek için, DeepFace modeli, yalnızca ilk konvolüsyonel katmanla bir maksimum havuzu katmanı kullanır. Bu katmanlar, model tarafından ön işleme adaptif bir ön adım olarak yorumlanır. Hesaplamaların çoğunu yaparlar, ancak sınırlı parametrelere sahiptirler ve yalnızca girdiyi yerel özellikler kümesine genişletirler.

Takip eden L4, L5 ve L6 katmanları yerel olarak bağlantılıdır ve bir konvolüsyonel katman gibi, her konumda benzersiz bir filtre kümesi uygular. Hizalanmış bir görüntünün farklı bölgeleri farklı yerel istatistiklere sahip olabileceğinden, mekansal istasyonluluk varsayımı geçerli değildir. Örneğin, kaşlar ve gözler arasındaki alan, ağız ve burun arasındaki alana kıyasla daha yüksek ayırt edici yeteneğe sahiptir. Bağlantılı katmanların kullanılması, eğitilecek parametre sayısını etkiler, ancak özellik çıkarma sırasında hesaplama yükünü etkilemez.

DeepFace modeli, büyük miktarda iyi etiketlenmiş eğitim verisi olduğu için yalnızca üç katman kullanır. Bağlantılı katmanların kullanılması, her bir yerel olarak bağlı katmanın çıkışının büyük bir girdinin parçalarını etkileyebileceği şeklinde daha da haklı çıkarılabilir.

Son olarak, üst katmanlar tam olarak bağlantılıdır ve her bir çıktı birimi tüm girdilere bağlıdır. Bu katmanlar, yüz görüntülerinin farklı kısımlarında yakalanan özellikler arasındaki korelasyonu yakalayabilir, Örneğin, ağız ve gözlerin konumu ve şekli. İlk tam bağlantılı katmanın (F7) çıkışı, ağ tarafından ham yüz temsil özelliği vektörü olarak kullanılır. Model, son tam bağlantılı katmanın (F8) çıkışını, sınıf etiketleri üzerinde bir dağılım üreten K-yönlü softmax’a besler.

Veri Setleri

DeepFace modeli, Sosyal Yüz Sınıflandırma veya SFC veri seti de dahil olmak üzere çeşitli veri setlerinin bir kombinasyonunu kullanır. Ayrıca, DeepFace modeli, LFW veri setini ve YTF veri setini de kullanır.

SFC Veri Seti

SFC veri seti, Facebook’ (META ) tan alınan resim koleksiyonundan öğrenilir ve her biri 800 ila 1200 yüzle 4.030 kişinin 4,4 milyon etiketli görüntüsünden oluşur. Her kimliğin SFC veri setinin en son %5’i test amacıyla ayrılmıştır.

LFW Veri Seti

LFW veri seti, 13.323 fotoğrafın 10 bölüme ayrılmış 6.000 yüz çiftinden oluşur ve beş binden fazla ünlüyü içerir.

YTF Veri Seti

YTF veri seti, LFW veri setindeki ünlülerin bir alt kümesinden oluşan 1.595 konu hakkında 3.425 video içerir.

Sonuçlar

Frontalization olmadan ve yalnızca 2B hizalamayı kullanarak model, %94,3’lik bir doğruluk puanı elde eder. Model, yüz algılama merkezi crop’u kullanmazsa ve hiçbir hizalama yapmazsa, %87,9’luk bir doğruluk puanı döndürür, çünkü yüz bölgesinin bazı kısımları merkez crop’un dışında kalabilir. Model, yüz temsilinin ayırt edici yeteneğini izole olarak değerlendirmek için denetimsiz öğrenme ayarını takip eder ve normalize özellikleri arasındaki iç ürünü karşılaştırır. Bu, modelin ortalama doğruluğunu %95,92’ye çıkarır.

Aşağıdaki model, DeepFace modelinin diğer ileri yüz tanıma modelleriyle karşılaştırılmış performansını gösterir.

Aşağıdaki resim, veri setindeki ROC eğrilerini gösterir.

Sonuç

İdeal olarak, bir yüz sınıflandırıcı, insan düzeyinde doğrulukla yüzleri tanıyabilmeli ve görüntü kalitesi, poz, ifade veya aydınlatma ne olursa olsun yüksek doğruluk sağlayabilmelidir. Ayrıca, ideal bir yüz tanıma çerçevesi, minimum değişiklikle çeşitli uygulamalara uygulanabilmelidir. DeepFace, şu anda mevcut en gelişmiş ve verimli yüz tanıma çerçevelerinden biri olmasına rağmen, ideal değildir ve belirli durumlar için doğru sonuçlar üretemeyebilir. Ancak, DeepFace çerçevesi, yüz tanıma endüstrisinde önemli bir kilometre taşıdır ve güçlü bir ölçüm öğrenme tekniği kullanarak performans açığını kapatır ve zaman içinde daha da verimli hale gelecektir.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.