Kąt Andersona
AI może zgadnąć rok zdjęcia na podstawie wieku ludzi

Naukowcy odkryli, że AI może wykorzystywać twarze ludzi do szacowania roku, w którym wykonano zdjęcie, łącząc szacunki wieku z znanymi latami urodzenia, aby pokonać obecne metody oparte na scenie.
Przewidywanie daty zdjęcia było kiedyś znacznie łatwiejsze niż teraz, ponieważ moda i fryzury ewoluowały w zastraszającym tempie. Z powodu różnych debat, ten wirualny styl skończył się około trzydzieści lat temu, co oznacza, że nie jest już tak łatwo spojrzeć na fryzurę lub strój i zgadnąć rok na podstawie tego rodzaju wizualnej wskazówki.
Przez jakiś czas było możliwe datowanie obrazów i filmów na podstawie rozdzielczości kolorów i charakterystyki ziarna filmu. Nie trzeba było być specjalistą od kryminalistyki; jeśli się obejrzało wystarczająco dużo starych filmów, kulturowe wskazówki (takie jak muzyka, samochody, moda, tematy itp.) ostatecznie stałyby się kojarzone przez widza z stylami filmu:
![Ilustracja pokazująca, jak poprawa jakości filmu stopniowo zwiększała zakres odcieni skóry i stylów oświetlenia w czasie, przechodząc od płaskich, frontalnych ustawień do bardziej naturalistycznych i zróżnicowanych wyglądów. [ Źródło ] https://archive.is/3ZSjN (mój własny artykuł)](https://www.unite.ai/wp-content/uploads/2025/11/grain-styles.jpg)
Ilustracja pokazująca, jak poprawa jakości filmu stopniowo zwiększała zakres odcieni skóry i stylów oświetlenia w czasie, przechodząc od płaskich, frontalnych ustawień do bardziej naturalistycznych i zróżnicowanych wyglądów. Źródło (mój własny artykuł)
Dodatkowym ” kotwicą” do datowania zdjęcia było to, czy było ono w czerni i bieli – ekonomiczne rozwiązanie, które stało się zbędne po popularyzacji cyfrowej fotografii na początku tego wieku
Istnieje wiele komercyjnych i eksperymentalnych systemów, takich jak MyHeritage PhotoDater, które próbują datować zdjęcia przy użyciu tych i innych kryteriów.
![Przykład szacowania wieku zdjęcia z usługi MyHeritage PhotoDater. Źródło [ https://www.youtube.com/watch?v=2oVyLI6tBcY ]](https://www.unite.ai/wp-content/uploads/2025/11/photodater.jpg)
Przykład szacowania wieku zdjęcia z usługi MyHeritage PhotoDater. Źródło
Brak innych wskazówek, takich jak smartfony lub inne technologie charakterystyczne dla danej epoki, najlepszym sposobem określenia wieku zdjęcia wykonanego w ciągu ostatnich 15-25 lat jest znajomość osoby (np. celebryty lub znajomego) i oszacowanie jej wieku, co daje przybliżony rok.
Wiek twarzy jako odniesienie
W dziedzinie widzenia komputerowego i wielu innych dziedzinach (np. kryminalistyki, przetwarzania archiwów, dziennikarstwa, architektury zbiorów danych itp.) zdolność do określenia wieku zdjęcia jest bardzo pożądana, ponieważ wiele najbardziej interesujących cyfrowych i analogowych kolekcji nie ma właściwej adnotacji i metadanych lub ma błędne metadane z powodu wcześniejszych (błędnych) szacunków.
Dlatego byłoby przydatne, gdyby system AI mógł przeglądać zdjęcia w taki sam sposób, jak my, gdy spoglądamy na nasze historyczne kolekcje i komentujemy ‘Och, to było wtedy, gdy…’. Pytanie brzmi, co mogłoby być punktem zaczepienia, brakując zwykłych wskazówek?
Nowy artykuł badawczy z Czech proponuje początkowy krok w tym podejściu, wykorzystując systemy rozpoznawania twarzy i wieku, połączone z bazą danych tożsamości (w tym przypadku zbiorami danych Czechów i twórców filmowych):

Kadr z filmu ‘Joachim, Put It in the Machine’ (1974), ilustrujący proces datowania. Model wykrywa znane osoby na zdjęciu, szacuje ich wiek przy użyciu estymatora wieku twarzy (kolumna po prawej), a następnie odjmuje tę wartość od roku urodzenia, aby wygenerować rozkład prawdopodobieństwa możliwych dat zdjęcia. Źródło
System działa poprzez wykrywanie znanych osób na zdjęciu, szacowanie ich wieku przy użyciu wstępnie wytrenowanego modelu, a następnie odjęcie tej wartości od roku urodzenia, aby wygenerować prawdopodobne daty zdjęcia. Gdy na zdjęciu jest wiele twarzy, szacunki dat są agregowane, aby uzyskać ostateczną prognozę.
Metoda ta została przetestowana na zdjęciach z Czecho-Słowackiej Bazy Filmowej (CSFD), a wyniki wskazują, że podejście to oferuje lepszą dokładność niż metody oparte na scenie, nawet gdy są one wytrenowane na tych samych danych.
Schemat tej metody wymaga centralnej bazy danych zawierającej informacje o dużej grupie osób; w tym przypadku jest to baza filmowa w stylu IMDB; jednak każda inna kolekcja zawierająca potwierdzone daty urodzenia i potwierdzone wydarzenia czasowe mogłaby dać podobny wynik.
Artykuł stwierdza:
‘Unikalnie, nasz zbiór danych zawiera adnotacje dla wielu osób w jednym obrazie, umożliwiając badanie agregacji informacji z wielu twarzy. Proponujemy ramy probabilistyczne, które łączą dowody wizualne z nowoczesnymi modelami rozpoznawania twarzy i estymacji wieku, a także priory temporalne oparte na karierze, aby wywnioskować rok wykonania zdjęcia.
‘Nasze eksperymenty pokazują, że agregacja dowodów z wielu twarzy stale poprawia wyniki i podejście znacznie przewyższa silne metody oparte na scenie, szczególnie w przypadku obrazów zawierających wiele rozpoznawalnych osób.’
Nowy artykuł badawczy nosi tytuł Photo Dating by Facial Age Aggregation i pochodzi od dwóch badaczy z Czechosłowacji, z obietnicą późniejszego udostępnienia kodu i danych.
Metoda
Aby oszacować, kiedy wykonano zdjęcie, nowy system autorów analizuje każdą wykrytą twarz i próbuje zgadnąć, kim mogą być te osoby, wykorzystując wspomnianą bazę danych znanych osób. Ponieważ osoba może pojawić się tylko raz na zdjęciu, system sprawdza wszystkie możliwe kombinacje tożsamości i wykorzystuje ich znane lata urodzenia, aby oszacować, jak stare wyglądają.
Po tym system działa wstecz, aby oszacować najbardziej prawdopodobny rok, który odpowiada tym wiekom:

Po lewej: system tworzy linię czasu, pokazując, kiedy rozpoznane osoby były najbardziej aktywne, na podstawie ich znanych karier. Po prawej: łączy to z estymacjami wieku twarzy, aby wygenerować ostateczną prognozę daty zdjęcia.
Aby zarządzać wieloma możliwymi kombinacjami tożsamości, system zakłada, że twarze są niezależne i że ich wygląd zależy tylko od tożsamości i daty zdjęcia.
Aby oszacować, kiedy wykonano zdjęcie, system najpierw szacuje wiek każdej wykrytej twarzy przy użyciu modelu cvut-002, który opiera się na architekturze ViT-B/16 i jest wytrenowany na prywatnym zbiorze danych (który, jak twierdzą autorzy, zajmuje wysoką pozycję w rankingu NIST’s Face Analysis Technology Evaluation (FATE) bazy danych).
Gdy znany jest rok urodzenia, model konwertuje szacunek wieku na prawdopodobny rok zdjęcia przez proste dodanie wieku do roku urodzenia, co daje rozkład prawdopodobieństwa możliwych lat wykonania. Aby ocenić, jak dobrze wykryta twarz odpowiada znanej tożsamości, system porównuje ich wektorowe reprezentacje w przestrzeni ArcFace:

ArcFace, główna architektura modelu InsightFace, została wprowadzona w 2015 roku i stała się wpływowym projektem w ocenie twarzy. Źródło
Każda tożsamość jest reprezentowana przez średnią wektorową zbudowaną z jej portretów referencyjnych. Podobieństwo między twarzą testową a tożsamością jest mierzone za pomocą rozkładu Von Misesa Fishera, który modeluje, jak ściśle portrety tożsamości są skupione wokół tej średniej. Wspólny parametr ostrości kontroluje, jak pewny jest system co do tych klastrów, i jest szacowany przy użyciu strategii leave-one-out na portretach tożsamości.
Model definiuje pięć typów priorytetów, aby oszacować, kiedy rozpoznana osoba może pojawić się na zdjęciu: uniform; decade; movie; image; i convex combination prior, który łączy najsilniejsze i najsłabsze opcje, aby przetestować wrażliwość na siłę priorytetu (tj. wytrzymałość priorytetów pod presją).
Aby obsłużyć twarze, które nie mogą być pewnie zidentyfikowane, model zawiera zapasową tożsamość “nieznana” z nieinformującymi rozkładami, posiadającą prawdopodobieństwo twarzy, które jest płaskie w przestrzeni wektorowej, i priorytet czasowy płaski we wszystkich latach. To pozwala na ignorowanie niepewnych twarzy bez wpływu na ostateczną estymację daty:

Wpływ nieznanych twarzy na wyniki. Każdy kwadrat pokazuje średni błąd datowania dla różnych liczb znanych i nieznanych tożsamości, a rozmiar kwadratu wskazuje liczbę próbek, ujawniając, że konfiguracje o niskim błędzie dominują w rozkładzie zbioru danych.
Dane i testy
Autorzy wykorzystali wspomniany zbiór danych CSFD do stworzenia nowego zbioru, który nazwali CSFD-1.6M. Zbiór ten został zbudowany z scen zawierających wiele osób, a każda twarz została oznaczona tożsamością i rokiem. Ta struktura była konieczna, aby nauczyć model, jak twarze są powiązane w kontekście; zbiory danych z jedną twarzą, takie jak IMDB-WIKI, nie obsługują tego, ponieważ oznaczają tylko jedną osobę na zdjęciu.
Lata premiery filmów z Czecho-Słowackiej Bazy Filmowej zostały wykorzystane do oszacowania, kiedy wykonano zdjęcie, a każda osoba na zdjęciu została dopasowana do publicznego profilu zawierającego jej rok urodzenia i portret.
Następnie każda twarz na zdjęciu została dopasowana do jednej z znanych tożsamości, początkowo przy użyciu ArcFace do utworzenia wektorowych reprezentacji twarzy, a następnie obliczono średnią reprezentację dla każdej tożsamości.
Po tym algorytm węgierski został wykorzystany do przypisania twarzy do tożsamości, porównując podobieństwo wektorowe, z dostosowaniami, gdy liczba wykrytych twarzy nie odpowiadała liczbie znanych osób.

Statystyki ze zbioru danych CSFD-1.6M, zawierające informacje o pobranych obrazach, wykrytych twarzach, dopasowaniach tożsamości, ostatecznych adnotacjach i dostępnym puli tożsamości.
Dopasowania były odrzucane, jeśli podobieństwo było zbyt niskie lub jeśli oszacowany wiek znacznie różnił się od znanego wieku, z większą tolerancją dla starszych osób, a twarze nie były filtrowane pod względem jakości lub rozmiaru.
Autorzy zwracają uwagę na wyższość swojego kuratorowanego zbioru nad najbliższym porównywalnym zbiorem, IMDB-WIKI:
‘Nasz zbiór danych nie tylko jest znacznie większy, ale krytycznie, składa się ze scen z wieloma osobami, co jest wymagane przez nasz model. Chociaż żaden zbiór danych pobranych z sieci nie jest wolny od szumu w etykietach, nasz pipeline adnotacji wykorzystuje jawne połączenia między obrazami a profilami tożsamości dostarczonymi przez bazę danych, dążąc do wyższej jakości przypisań tożsamości.’
Ich ocena porównywała kilka wersji systemu datowania, aby zrozumieć, skąd pochodzą jego zyski. Jeden model zakładał idealną wiedzę o tym, kto jest na zdjęciu, zapewniając górny limit wydajności, usuwając niepewność w rozpoznawaniu tożsamości, a pełna wersja modelu oszacowywała tożsamości i daty łącznie, ważąc różne możliwe przypisania tożsamości, zanim doszło do ostatecznej estymacji roku.
Prostsza wersja wybierała najbardziej prawdopodobną konfigurację tożsamości bez marginalizacji alternatyw, co okazało się prawie tak samo skuteczne w praktyce.
W przeciwieństwie do tego, najbardziej podstawowy model bazowy przypisywał każdej twarzy niezależnie i łączył wynikające z tego estymacje roku na podstawie wieku, nie uwzględniając, czy tożsamości zbiorczo mają sens.
Aby przetestować, jak bardzo metoda korzysta z wykorzystania twarzy, oddzielny model został wytrenowany do estymacji daty bezpośrednio z całej sceny. Ten model oparty na scenie stanowi najmocniejsze podejście alternatywne obecnie stosowane w estymacji daty obrazu, ponieważ może nauczyć się era-specyficznych wzorców wizualnych w całym obrazie, zamiast polegać na tożsamości lub wieku.
Metryki i dane
Średni błąd bezwzględny (MAE) między przewidywanym rokiem a znaną prawdą był główną miarą w eksperymentach.
Dane zostały podzielone na pięć części, z dbałością o to, aby wszystkie obrazy z tego samego filmu pozostały w jednej partycji. Trzy z nich zostały wykorzystane do treningu, jedna do walidacji, a jedna do testowania. Ta pięciokrotna rotacja została zastosowana, aby zapobiec przeuczeniu.
Ponieważ modele oparte na twarzach nie były wytrenowane na tym zbiorze danych, nie było potrzeby dzielenia, a zamiast tego zostały one ocenione bezpośrednio na pełnym zbiorze CSFD-1.6M.
Model sceny został wytrenowany przez 200 epok pod optymalizatorem Adam, z obrazami zmniejszonymi do rozmiaru 384×384 crop.
Wyniki
Rozdział z wynikami w artykule jest podzielony w nietypowy sposób na wiele wskaźników wydajności, bez jednego wyróżniającego się testu. Niemniej, przedstawimy wybrane najbardziej istotne wyniki.
Najważniejszy wynik nie jest pojedynczą liczbą, ale wzorcem: modele agregacji twarzy (szczególnie wersje Pełna i Najlepsza) stale przewyższają silny model Sceny bazowy, gdy na zdjęciu jest co najmniej dwie znane tożsamości – nawet jeśli model Sceny jest wytrenowany bezpośrednio na tych samych danych, wspierając główne twierdzenie, że datowanie twarzy połączone z tożsamością zapewnia bardziej solidny sygnał niż interpretacja całościowej sceny.
Aby ocenić wpływ priorytetów czasowych, autorzy porównali kilka konfiguracji swojego modelu Pełnego. Najlepszą wydajność uzyskano przy użyciu priorytetu Dekada, który znacznie przewyższył zarówno model Naiwny (który nie wykorzystuje priorytetu czasowego) i priorytet Uniform (który zakłada brak preferencji wobec lat):

Wyniki pokazują, że błąd maleje znacznie dla wszystkich metod, gdy liczba twarzy rośnie, ale modele wykorzystujące realistyczne priorytety czasowe, takie jak priorytet Dekada, są znacznie mniej dotknięte. Modele bazowe Naiwny i Scena pozostają płaskie lub pogarszają się przy większych grupach, podczas gdy model Pełny z informacyjnymi priorytetami utrzymuje niski błąd.
Aby zademonstrować wartość zbioru CSFD-1.6M poza datowaniem zdjęć, zbiór ten został również przetestowany jako zasób wstępnego treningu dla szerszego zadania estymacji wieku twarzy. Po standardowym protokole oceny, modele ResNet101 zostały wstępnie wytrenowane na CSFD-1.6M, a następnie porównane z odpowiednikami wstępnie wytrenowanymi na IMDB-WIKI i ImageNet. Następnie te modele zostały dostosowane i ocenione na pięciu popularnych benchmarkach: AgeDB; AFAD, MORPH; UTKFace; i CLAP2016:

Średni błąd bezwzględny (plus minus odchylenie standardowe) na pięciu benchmarkach estymacji wieku, porównując modele wstępnie wytrenowane na ImageNet, IMDB-WIKI i CSFD-1.6M. Niższe wartości wskazują lepszą wydajność. CSFD-1.6M daje najmocniejsze wyniki we wszystkich benchmarkach.
Na wszystkich pięciu zbiorach danych, wstępne trening na CSFD-1.6M prowadził do najniższych wskaźników błędu, przewyższając inne źródła treningu o wyraźną przewagę – przewagę, która okazała się najmocniejsza na AFAD i CLAP2016, ale pozostała spójna we wszystkich przypadkach.
Odsyłamy czytelnika do reszty nieco rozproszonego rozdziału z wynikami w oryginalnym artykule, który zajmuje się również obszernie studiami ablacjnymi.
Wnioski
Chociaż nowy artykuł szybko staje się gęsty i niedostępny dla niezainteresowanego czytelnika, temat, który jest poruszony, jest jednym z najbardziej interesujących i istotnych w literaturze związanej z widzeniem komputerowym – nie tylko dlatego, że łączy się z antropologią i studiami kulturowymi, gdzie stałe są trudne do ustalenia.
* Podobnie jak ewolucja muzyki również zwolniła tempo zmian.
Publikacja po raz pierwszy w poniedziałek, 10 listopada 2025












