Anderson’un Açısı

AI, Fotoğrafın Yılını İnsanların Yaşlarına Göre Tahmin Edebilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
An image from the source paper 'Photo Dating by Facial Age Aggregation', overlaid against an image of a desk surface with a 1974 calendar on it. Source: eBay and Source paper + Firefly V3.

Yeni bir araştırma, AI’ın insanların yüzlerine bakarak fotoğrafın çekildiği yılı tahmin edebileceğini gösteriyor. Bu, bilinen doğum yılları ile yaş tahminlerini birleştirerek mevcut sahne tabanlı yöntemleri geçersiz kılar.

 

Fotoğrafın tarihini tahmin etmek eskiden daha kolaydı, çünkü saç ve giyim modaları hızla değişiyordu. Ancak約 30 yıl önce, bu görsel stil değişimi sona erdi, bu nedenle bir saç stilini veya kıyafeti görerek yılı tahmin etmek artık o kadar kolay değil.

Bir süre, film stoklarının renk çözünürlüğü ve tane özellikleri temelinde görüntüleri ve filmleri tarihlemek mümkün oldu. Bir uzman olmak zorunda değildiniz; yeterince eski film izlerseniz, kültürel ipuçları (müzik, arabalar, moda, konular vb.) film stili ile ilişkilendirilecekti:

Film stoklarında zaman içinde skin tonları ve aydınlatma stillerinin değişimini gösteren bir illüstrasyon. [ Kaynak ] https://archive.is/3ZSjN (kendi makalem)

Film stoklarında zaman içinde skin tonları ve aydınlatma stillerinin değişimini gösteren bir illüstrasyon. Kaynak (kendi makalem)

Ek bir tarihleme ipucu da fotoğrafın siyah beyaz olup olmadığıydı – bu, dijital fotoğrafçılığın popülerleşmesiyle birlikte bu yüzyılın başlarında gereksiz hale geldi

Birkaç ticari ve deneysel sistem, PhotoDater gibi MyHeritage aboneliğine bağlı sistemler, bu ve diğer çeşitli kriterleri kullanarak fotoğrafları tarihlemek için çalışır.

MyHeritage PhotoDater aboneliğine bağlı hizmetten bir örnek fotoğraf tahmini. Kaynak [ https://www.youtube.com/watch?v=2oVyLI6tBcY ]

MyHeritage PhotoDater aboneliğine bağlı hizmetten bir örnek fotoğraf tahmini. Kaynak

Diğer belirtilerin отсутствması durumunda, son 15-25 yıl içinde çekilen bir fotoğrafın yaşını tahmin etmenin en iyi yolu, fotoğraftaki kişinin (örneğin, bir ünlünün veya belki de bir tanıdığın) yaşını tahmin edebilmektir.

Yüz Yaşı Referans Olarak

Bilgisayarlı görü ile ilgili alanlarda ve çeşitli diğer alanlarda (örneğin, adli tıp, arşiv işleme, gazetecilik, veri seti mimarisi vb.), bir fotoğrafın yaşını belirleme yeteneği önemli bir hedeftir, çünkü birçok en ilginç dijital ve analog koleksiyonlar uygun açıklama ve meta veri eksikliği veya hatalı meta veri içerebilir.

Dolayısıyla, bir AI sisteminin fotoğrafları aynı şekilde incelemesi ve “Evet, o zaman…” diye yorum yapması yararlı olurdu. Soru, bu yaklaşımın anahtarı nedir?

Çek Cumhuriyeti’nden yeni bir araştırma makalesi, AI tabanlı yaş tanıma sistemlerini, yüz tanıma sistemleri ile birleştirerek ve bunları ortak bir kimlik veritabanına bağlayarak bu yaklaşıma ilk adımları atmaktadır:

1974 yapımı 'Joachim, Put It in the Machine' filminin bir sahnesi, tarihleme işlemini göstermek için kullanılmıştır. Model, fotoğraftaki bilinen kişileri tespit eder, yüz yaşını tahmin eder (sağ sütun) ve her kişinin doğum yılından bu değeri çıkararak olası fotoğraf tarihleri için bir olasılık dağılımı oluşturur. Graflar, her yaş tahmini için olasılığı gösterir ve kesik çizgiler, kişinin fotoğrafın çekildiği tarihteki gerçek yaşını gösterir. [ Kaynak ] https://arxiv.org/pdf/2511.05464

1974 yapımı ‘Joachim, Put It in the Machine’ filminin bir sahnesi, tarihleme işlemini göstermek için kullanılmıştır. Model, fotoğraftaki bilinen kişileri tespit eder, yüz yaşını tahmin eder ve her kişinin doğum yılından bu değeri çıkararak olası fotoğraf tarihleri için bir olasılık dağılımı oluşturur. Kaynak

Sistem, fotoğraftaki bilinen kişileri tespit eder, yüz yaşını tahmin eder ve her kişinin doğum yılından bu değeri çıkararak olası fotoğraf tarihleri için bir olasılık dağılımı oluşturur. Birden fazla yüz olduğunda, tarih tahminleri birleştirilerek nihai bir tahmin üretilir.

Yöntem, CSFD (Çekoslovak Film Veritabanı) adlı bir veritabanından alınan görüntüler üzerinde test edildi ve yazarlar, bu yaklaşımın aynı veri üzerinde eğitilen sahne tabanlı modellere kıyasla tutarlı olarak daha yüksek doğruluk sağladığını iddia ediyorlar.

Şema, bilinen bir grup insan hakkında bilgi içeren merkezi bir veritabanı gerektirir; bu durumda, IMDB tarzı bir Çek film veritabanıdır, ancak benzer bir koleksiyon, onaylanmış doğum tarihleri ve tarih onaylı olaylar içerebilir.

Makalede şöyle deniyor:

‘Örneksiz bir şekilde, veritabanımız, tek bir görüntüdeki birden fazla kişinin annotasyonlarını sağlar, bu da çok yüz bilgisi birleştirme çalışmasını mümkün kılar. Görsel kanıtları modern yüz tanıma ve yaş tahmini modellerinden ve kariyer temelli zaman önceliğinden birleştirerek fotoğrafın çekildiği yılı tahmin eden olasılıksal bir çerçeve öneriyoruz.

‘Deneylerimiz, birden fazla yüzün bulunması durumunda performansın tutarlı olarak iyileştiğini, bu yaklaşımın özellikle birden fazla tanınabilir kişi içeren görüntüler için güçlü sahne tabanlı referanslara kıyasla önemli ölçüde daha iyi performans gösterdiğini gösteriyor.’

Yeni makale burada bulunabilir ve Çek Teknik Üniversitesi’nden iki araştırmacı tarafından yazılmıştır. Daha sonra kod ve veri yayınlanacaktır.

Yöntem

Fotoğrafın çekildiği yılı tahmin etmek için yazarların yeni sistemi, her bir tespit edilen yüzü inceler ve kim olabileceğini tahmin etmeye çalışır, bu da yukarıda belirtilen veritabanını kullanır. Bir kişi bir fotoğrafta sadece bir kez görünabileceğinden, sistem tüm olası kimlik kombinasyonlarını kontrol eder ve bilinen doğum yıllarına göre yaşını tahmin eder.

Bu之后, sistem en olası yılı tahmin etmek için geri çalışır:

Sistem, tanınan kişilerin kariyerlerine dayalı bir zaman çizelgesi oluşturur (solda) ve yüz yaşını tahmin eder (sağda), bu da nihai bir tarih tahmini verir.

Sistem, tanınan kişilerin kariyerlerine dayalı bir zaman çizelgesi oluşturur (solda) ve yüz yaşını tahmin eder (sağda), bu da nihai bir tarih tahmini verir.

Sistem, yüzlerin bağımsız olduğunu ve her birinin görünümünün sadece kimliğine ve fotoğrafın çekildiği tarihe bağlı olduğunu varsayar.

Fotoğrafın çekildiği yılı tahmin etmek için sistem, NIST cvut-002 modelini kullanır, bu model ViT-B/16 mimarisi temel alınarak oluşturulmuştur ve özel bir veri setine göre eğitilmiştir (yazarlar, bu veritabanının NIST’in Yüz Analizi Teknoloji Değerlendirmesi (FATE) veritabanında yüksek sırada yer aldığını belirtiyorlar).

Kişinin doğum yılı bilinirse, model yaş tahmini ile doğum yılını birleştirerek olası fotoğraf tarihleri için bir olasılık dağılımı oluşturur. Bir yüzün tanınan bir kimlik ile nasıl eşleştiğini değerlendirmek için sistem, gömme değerlerini ArcFace uzayında karşılaştırır:

ArcFace, popüler InsightFace modelinin temel mimarisidir ve 2015 yılında yayınlanmıştır. [ Kaynak ] https://arxiv.org/pdf/1801.07698

ArcFace, popüler InsightFace modelinin temel mimarisidir ve 2015 yılında yayınlanmıştır. Kaynak

Her kimlik, referans portrelerinin ortalama gömme değerinden oluşur. Bir test yüzü ile bir kimlik arasındaki benzerlik, Von Mises Fisher Dağılımı ile ölçülür, bu da kimliğin portrelerinin ortalama değer etrafında nasıl kümelendiğini modelleyen bir dağılımdır. Paylaşılan bir keskinlik parametresi, bu kümelere olan güveni kontrol eder ve kimlik portreleri üzerinde bıraktığımız bir strateji ile tahmin edilir.

Model, bir fotoğrafın çekildiği zamanı tahmin etmek için beş tür öncül tanımlar: uniform; on yıl; film; görüntü; ve bir konveks kombinasyon önceli ki bu, en güçlü ve en zayıf seçenekleri birleştirir, böylece öncül gücüne duyarlılığı test eder (yani, öncüllerin strese karşı direnci).

Tanınmayan yüzleri işleyebilmek için model, bilgisiz dağılımlara sahip bir “bilinmeyen” kimlik içerir, bu da yüz olasılığı gömme uzayında düzgün ve tüm yıllar boyunca zaman önceliği sağlar, bu da nihai tarih tahmini üzerinde önyargı yaratmaz:

Açık set koşullarında tam modelin performansı, aynı görüntüde hem bilinen hem de bilinmeyen yüzlerin bulunduğu durumlar. Ortalama Mutlak Hata (MAE) bilinmeyen kimlik sayısına göre artar, ancak bilinen kimliklerin sayısı arttıkça sürekli olarak iyileşir. Her karenin boyutu, örnek sayısını gösterir ve düşük hata yapılandırması veri seti dağılımını domine eder.

Açık set koşullarında tam modelin performansı, aynı görüntüde hem bilinen hem de bilinmeyen yüzlerin bulunduğu durumlar. Her karenin boyutu, örnek sayısını gösterir ve düşük hata yapılandırması veri seti dağılımını domine eder.

Veri ve Testler

Yazarlar, CSFD veritabanından alınan sahnelerden oluşan bir koleksiyon oluşturdular ve bu koleksiyona CSFD-1.6M adını verdiler. Veri seti, her yüzün kimliği ve yılı ile etiketlenmiş çoklu kişi sahnelerinden oluşuyordu. Bu yapı, modelin yüzlerin birbirleriyle nasıl ilişkili olduğunu öğrenmesini sağlamak için gerekliydi; tek yüzü etiketleyen veri setleri (örneğin, IMDB-WIKI) bu amaç için uygun değildir, çünkü sadece her görüntüde bir kişi etiketlenir.

Fotoğrafın çekildiği tahun, Çekoslovak Film Veritabanı’ndan alınan film yayın tarihleri kullanılarak tahmin edilmiştir, her kişi görüntüde bir kamu profiline karşılık gelir ve bu profil doğum yılı ve bir portre içerir.

Sonrasında, her yüz görüntüde bilinen bir kimlik ile eşleştirilir, ilk olarak ArcFace kullanılarak yüz gömme değerleri oluşturulur ve her kimlik için ortalama bir gömme değeri hesaplanır.

Bu之后, Macar algoritması kullanılır, yüzleri kimliklere atanmak için gömme benzerliği karşılaştırır ve SCRFD-10GE çerçevesi tarafından tespit edilen yüz sayısı ile bilinen kişi sayısı arasında uyumsuzluk varsa, ayarlamalar yapılır.

CSFD-1.6M veri setinin istatistikleri, kazıntı görüntüleri, tespit edilen yüzleri, kimlik eşleştirmelerini, nihai etiketli örnekleri ve kullanılabilir kimlik havuzunu gösterir.

CSFD-1.6M veri setinin istatistikleri, kazıntı görüntüleri, tespit edilen yüzleri, kimlik eşleştirmelerini, nihai etiketli örnekleri ve kullanılabilir kimlik havuzunu gösterir.

Eşleşmeler, benzerlik düşükse veya tahmin edilen yaş gerçek yaşla büyük ölçüde farklıysa reddedilir, daha yaşlı konular için daha fazla tolerans sağlanır ve yüzler kalite veya boyut tarafından filtrelenmez.

Yazarlar, oluşturdukları veri setinin en yakın karşılaştırılabilir veri seti olan IMDB-WIKI’den üstün olduğunu belirtiyorlar:

‘Veri setimiz sadece çok daha büyük olmakla kalmaz, aynı zamanda modelimiz tarafından gereken çoklu kişi sahnelerinden oluşur. İnternetten kazıntı yapılmış hiçbir veri seti etiket gürültüsünden tamamen arınmış değildir, ancak veri tabanındaki görüntülerle kimlik profilleri arasındaki açık bağlantılar, daha yüksek kaliteli kimlik atamalarına ulaşmamızı sağlar.’

Değerlendirmeleri, tarihleme sisteminin çeşitli sürümlerini karşılaştırmak için yapılır, böylece performansındaki kazançların nereden geldiği anlaşılabilir. Bir model, görüntüdeki kişilerin kimliklerini tam olarak bilir ve bu, performansı üst sınıra taşır, sonra tam model kimlikleri ve tarihleri birlikte tahmin eder, farklı kimlik atamalarının ağırlıklarını değerlendirir ve nihai bir yıl tahmini yapar.

Bir başka varyant, en olası kimlik yapılandırmasını seçer, ancak alternatifleri marjinalleştirmeye çalışmaz, bu da uygulamada neredeyse aynı hiệu quảyi sağlar.

En temel referans ise her yüzü bağımsız olarak atar ve oluşan yaş temelli yıl tahminlerini birleştirir, ancak kimliklerin topluca mantıklı olup olmadığını dikkate almaz.

Yöntemin yüzleri kullanmaktan ne kadar yararlandığını test etmek için, bir model doğrudan tüm sahneyi kullanarak tarihi tahmin etmek üzere eğitilir. Bu, sahne tabanlı model, dönemsel görsel kalıpları tüm görüntüde öğrenerek, kimlik veya yaşa bağlı olmadan, en güçlü alternatif yaklaşımı oluşturur.

Metrikler ve Veri

Tahmin edilen yıl ile bilinen gerçek yıl arasındaki Ortalama Mutlak Hata (MAE), deneylerin temel ölçütüdür.

Veri, beş parçaya bölünmüştür, aynı filmden gelen tüm görüntülerin aynı bölüme dahil edilmesine özen gösterilmiştir. Üç parça eğitim için, bir parça doğrulama için ve bir parça test için kullanılır. Bu beş katlı döndürme, aşırı uyumu önlemek için uygulanır.

Yüz tabanlı modeller bu veri setinde eğitilmediği için, bölme gerekmez ve doğrudan tüm CSFD-1.6M seti üzerinde değerlendirilir.

Sahne modeli, Adam optimizatörü altında 200 dönem için eğitilir, görüntüler 384×384 kırpma boyutuna getirilir.

Sonuçlar

Makalenin sonuç bölümü, çeşitli performans göstergeleri üzerinden bölünmüştür ve tek bir ana sonuç yoktur. Ancak, en ilgili sonuçları burada sunuyoruz.

En önemli sonuç, tek bir sayı değil, bir modeldir: yüz birleştirme modelleri (özellikle Tam ve En İyi 1 varyantları), iki veya daha fazla bilinen kimlik olduğunda Sahne referansını tutarlı olarak geride bırakır – Sahne modeli aynı veri üzerinde eğitilmiş olsa da, yüz tabanlı tarihlemenin sahne yorumundan daha güçlü bir sinyal sağladığını gösteren bir sonuç.

Zaman öncüllerinin etkisini değerlendirmek için yazarlar, Tam modelinin çeşitli yapılandırmalarını karşılaştırmışlardır. En güçlü performans, On Yıl öncülü kullanılarak elde edilmiştir ve bu, Naif modeli (zaman öncülü kullanmayan) ve Uniform öncül (yılı tercih etmeyen) modellerini önemli ölçüde geride bırakmıştır:

Farklı yüz sayıları için modellerin performansı. Gerçekçi zaman öncülleri kullanan modeller, yüz sayısı arttıkça daha az etkilenirken, Naif ve Sahne referansları daha fazla yüz olduğunda daha fazla hata verir veya bozulur.

Farklı yüz sayıları için modellerin performansı. Gerçekçi zaman öncülleri kullanan modeller, yüz sayısı arttıkça daha az etkilenirken, Naif ve Sahne referansları daha fazla yüz olduğunda daha fazla hata verir veya bozulur.

CSFD-1.6M veri setinin, yüz yaşını tahmin etme görevi için bir ön eğitim kaynağı olarak değerini göstermek için, bu veri seti üzerinde ön eğitilen ResNet101 modelleri, IMDB-WIKI ve ImageNet üzerinde ön eğitilen modellerle karşılaştırılmıştır. Bu modeller daha sonra beş popüler test veri setinde (AgeDB, AFAD, MORPH, UTKFace ve CLAP2016) fine-tune edilmiştir ve değerlendirilmiştir:

Beş yüz yaşı tahmini test veri setinde (AgeDB, AFAD, MORPH, UTKFace ve CLAP2016) ResNet101 modellerinin ortalama mutlak hataları (standart sapma ile birlikte). Düşük değerler daha iyi performansı gösterir. CSFD-1.6M, tüm testlerde en iyi sonuçları verir.

Beş yüz yaşı tahmini test veri setinde (AgeDB, AFAD, MORPH, UTKFace ve CLAP2016) ResNet101 modellerinin ortalama mutlak hataları (standart sapma ile birlikte). Düşük değerler daha iyi performansı gösterir. CSFD-1.6M, tüm testlerde en iyi sonuçları verir.

Tüm beş veri setinde, CSFD-1.6M üzerinde ön eğitim, diğer iki ön eğitim kaynağına (IMDB-WIKI ve ImageNet) kıyasla en düşük hata oranlarına yol açmıştır, özellikle AFAD ve CLAP2016’da performansı açık bir şekilde üstün kılmıştır, ancak tüm veri setlerinde tutarlı bir performans farkı göstermiştir.

Sonuçların geri kalanı için kaynak makaleye başvurmanızı öneririz, bu makale ayrıca çeşitli soykırım çalışmaları ile ilgili ayrıntılara da girer.

Sonuç

Yeni makale, hızlı bir şekilde yoğunlaşıp erişilemez hale gelse de, ele alınan konu, bilgisayar görü literatüründe en ilginç ve ilgili konulardan biridir – özellikle de antropoloji ve kültürel çalışmalara da güzel bir şekilde geçiş yaptığı için.

 

* Müzik evrimi de değişim hızını yavaşlattı.

İlk olarak 10 Kasım 2025 Pazartesi günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai