Andersons hoek

AI kan de jaar van een foto raden op basis van de leeftijd van de mensen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
An image from the source paper 'Photo Dating by Facial Age Aggregation', overlaid against an image of a desk surface with a 1974 calendar on it. Source: eBay and Source paper + Firefly V3.

Nieuw onderzoek toont aan dat AI de leeftijd van een foto kan schatten door naar de leeftijd van de mensen op de foto te kijken, door leeftijdschattingen te combineren met bekende geboortedata om huidige scene-gebaseerde methoden te verslaan.

 

Het raden van de datum van een foto was vroeger een stuk eenvoudiger dan het nu is, omdat haarmodes en kledingstijlen vroeger met een razend tempo evolueerden. Om veel bediscussieerde redenen eindigde deze omwenteling van visuele stijl ongeveer dertig jaar geleden, waardoor het niet langer zo eenvoudig is om naar een haarmode of kledingstukken te kijken en het jaar te raden op basis van deze visuele aanwijzing.

Voor een tijdje was het ook mogelijk om afbeeldingen en films te dateren op basis van de kleurenschaal en korrelkenmerken van de film. Men hoefde geen forensisch specialist te zijn; als men genoeg oude films keek, zouden de culturele aanwijzingen (zoals muziek, auto’s, mode, onderwerpen, enz.) uiteindelijk geassocieerd worden met filmstijlen:

Een illustratie van de manier waarop verbeteringen in filmstock geleidelijk de reikwijdte van huidtinten en lichtstijlen in de loop van de tijd hebben uitgebreid, van platte, frontale opstellingen naar meer naturalistische en gevarieerde looks. [ Bron ] https://archive.is/3ZSjN (mijn eigen artikel)

Een illustratie van de manier waarop verbeteringen in filmstock geleidelijk de reikwijdte van huidtinten en lichtstijlen in de loop van de tijd hebben uitgebreid, van platte, frontale opstellingen naar meer naturalistische en gevarieerde looks. Bron (mijn eigen artikel)

Een extra ‘anker’ voor het dateren van een foto was of het in zwart-wit was – een economie die overbodig werd na de popularisatie van digitale fotografie aan het begin van deze eeuw

Een aantal commerciële en experimentele systemen, zoals de MyHeritage-abonnement-gebundelde PhotoDater, proberen foto’s te dateren met behulp van deze en diverse andere criteria.

Een voorbeeld van foto-leeftijdsschatting van de MyHeritage PhotoDater-abonnement-only-service. Bron [ https://www.youtube.com/watch?v=2oVyLI6tBcY ]

Een voorbeeld van foto-leeftijdsschatting, van de MyHeritage PhotoDater-abonnement-only-service. Bron

Afwezig van andere aanwijzingen, zoals smartphones of andere technologie uit een bepaalde tijdperk, is de beste manier om de leeftijd van een foto uit de afgelopen 15-25 jaar te schatten, als je de persoon kent (d.w.z. een beroemdheid of misschien een kennis) en kunt schatten hoe oud hij is, wat een ruwe equivalent van het jaar oplevert.

Gezichtsleeftijd als referentie

In het veld van computerzicht en in diverse andere velden (d.w.z. forensisch, archiefverwerking, journalistiek, datasetarchitectuur, enz.) is de mogelijkheid om de leeftijd van een foto te bepalen een gewild doel, aangezien veel van de meest interessante digitale en analoge collecties geen juiste annotatie en metadata hebben, of zelfs verkeerde metadata van eerdere (verkeerde) schattingen.

Daarom zou het nuttig zijn als een AI-systeem foto’s op dezelfde manier kon bekijken als wij wanneer we terugkijken op onze historische collecties en commentaar geven ‘Oh ja, dat was toen…’. De vraag is, wat zou de haak kunnen zijn, afwezig van de gebruikelijke vereiste aanwijzingen?

Een nieuw onderzoeksartikel uit Tsjechië biedt een eerste houvast voor deze benadering, door AI-gebaseerde leeftijdsrecognitiesystemen te exploiteren, in combinatie met gezichtsrecognitiesystemen die zijn gekoppeld aan een gemeenschappelijke database van identiteiten (in dit geval een IMDB-achtige collectie met Tsjechische artiesten en filmmakers):

Een still uit Joachim, Put It in the Machine (1974), gebruikt om het dateringsproces te illustreren. Het model detecteert bekende individuen in de foto, schat hun leeftijd met behulp van een gezichtsleeftijdschatting (rechterkolom) en trekt die waarde af van elke persoon zijn geboortejaar om een waarschijnlijkheidsverdeling over mogelijke fotodatums te genereren. De grafieken tonen de waarschijnlijkheid van elke leeftijdschatting, met gestreepte lijnen die de persoon zijn werkelijke leeftijd op het moment van de foto aangeven. [ Bron ] https://arxiv.org/pdf/2511.05464

Een still uit ‘Joachim, Put It in the Machine’ (1974), gebruikt om het dateringsproces te illustreren. Het model detecteert bekende individuen in de foto, schat hun leeftijd met behulp van een gezichtsleeftijdschatting (rechterkolom) en trekt die waarde af van elke persoon zijn geboortejaar om een waarschijnlijkheidsverdeling over mogelijke fotodatums te genereren. De grafieken tonen de waarschijnlijkheid van elke leeftijdschatting, met gestreepte lijnen die de persoon zijn werkelijke leeftijd op het moment van de foto aangeven. Bron

Het systeem werkt door bekende individuen in een foto te detecteren, hun gezichtsleeftijd te schatten met behulp van een vooraf getraind model en die schatting af te trekken van hun geregistreerde geboortejaar om een waarschijnlijke datum voor de foto te genereren. Wanneer meerdere gezichten aanwezig zijn, worden de datumschattingen geaggregeerd om een definitieve voorspelling te produceren.

De methode werd getest op afbeeldingen die zijn verzameld uit de Czecho-Slowaakse Film Database (CSFD), met als resultaat een benadering die, volgens de auteurs, consistent beter presteert dan scene-gebaseerde modellen (statische modellen die afhankelijk zijn van achtergrondelementen of visuele context in plaats van gezichten) die zijn getraind op dezelfde gegevens.

Het schema voor deze methode vereist een centrale database die kennis bevat van een brede groep individuen, in dit geval de IMDB-achtige Tsjechische film database; maar elke soortgelijke collectie die bevestigde geboortedata en centrale datum-bevestigde gebeurtenissen bevat, kan een soortgelijk resultaat opleveren.

Het artikel vermeldt:

‘Uniek, onze dataset biedt annotaties voor meerdere individuen in één afbeelding, waardoor de studie van multi-gezichtsinformatie-aggregatie mogelijk wordt. We stellen een probabilistisch kader voor dat visuele bewijs van moderne gezichtsrecognitie- en leeftijdschattingmodellen formeel combineert, en carrière-gebaseerde temporele prioriteiten om de fotocapturejaar af te leiden.

‘Onze experimenten laten zien dat het aggregatie van bewijs van meerdere gezichten de prestaties consistent verbetert en de aanpak significant beter presteert dan sterke scene-gebaseerde baselines, vooral voor afbeeldingen met meerdere identificeerbare individuen.’

Het nieuwe artikel heeft de titel Foto-datering door gezichtsleeftijdsaggregatie en komt van twee onderzoekers aan de Tsjechische Technische Universiteit in Praag, met de belofte van een latere code- en gegevensrelease.

Methode

Om te schatten wanneer een foto is genomen, kijkt het systeem van de auteurs naar elk gedetecteerd gezicht en probeert te raden wie het zou kunnen zijn, met behulp van de eerdergenoemde database van bekende personen. Aangezien een persoon slechts één keer in een foto kan verschijnen, controleert het systeem alle combinaties van mogelijke identiteiten en gebruikt hun bekende geboortedata om te schatten hoe oud elke persoon eruitziet.

Daarna werkt het systeem achteruit om de meest waarschijnlijke jaar te schatten die die leeftijden in overeenstemming zou brengen:

Links: het systeem bouwt een tijdbalk op die aangeeft wanneer de herkende individuen het meest actief waren, op basis van hun bekende carrières. Rechts: dit wordt gecombineerd met gezichtsleeftijdschattingen om een definitieve schatting te produceren voor wanneer de afbeelding is genomen.

Links: het systeem bouwt een tijdbalk op die aangeeft wanneer de herkende individuen het meest actief waren, op basis van hun bekende carrières. Rechts: dit wordt gecombineerd met gezichtsleeftijdschattingen om een definitieve schatting te produceren voor wanneer de afbeelding is genomen.

Om het grote aantal mogelijke identiteitscombinaties te beheren, gaat het systeem ervan uit dat gezichten onafhankelijk zijn en dat elk gezicht alleen afhankelijk is van zijn identiteit en de datum van de foto.

Om te schatten wanneer een foto is genomen, schat het systeem eerst de leeftijd van elk gedetecteerd gezicht met behulp van het NIST cvut-002 model, dat is gebaseerd op een ViT-B/16 architectuur en getraind op een privé-dataset (die, volgens de auteurs, hoog scoort in NIST’s Face Analysis Technology Evaluation (FATE) database).

Als de persoon zijn geboortejaar eenmaal bekend is, converteert het model de leeftijdschatting naar een waarschijnlijke fotodatum door eenvoudig de leeftijd toe te voegen aan het geboortejaar, waardoor een waarschijnlijkheidsverdeling over mogelijke capturejaren ontstaat. Om te beoordelen hoe goed een gedetecteerd gezicht overeenkomt met een bekende identiteit, vergelijkt het systeem hun embeddings in ArcFace-ruimte:

ArcFace, de centrale bijdragende architectuur voor het nu populaire InsightFace-model, werd in 2015 gelanceerd en was bestemd om een invloedrijk project te worden in gezichtsbeoordeling en -evaluatie. [ Bron ] https://arxiv.org/pdf/1801.07698

ArcFace, de centrale bijdragende architectuur voor het nu populaire InsightFace-model, werd in 2015 gelanceerd en was bestemd om een invloedrijk project te worden in gezichtsbeoordeling en -evaluatie. Bron

Elke identiteit wordt vertegenwoordigd door een gemiddelde embedding die is opgebouwd uit zijn referentieportretten. De overeenkomst tussen een testgezicht en een identiteit wordt vervolgens gemeten met behulp van een Von Mises Fisher-verdeling, die aangeeft hoe strak de identiteit zijn portretten clusteren rond die gemiddelde. Een gedeelde scherpte-parameter controleert hoe zeker het systeem is van die clusters en wordt geschat met behulp van een leave-one-out-strategie op de identiteitsportretten.

Het model definieert vijf soorten priors om te schatten wanneer een herkend persoon in een foto kan verschijnen: uniform; decade; film; afbeelding; en een convex combinatie prior die de sterkste en zwakste opties combineert, om gevoeligheid voor prior-sterkte te testen (d.w.z. de veerkracht van de priors onder stress).

Om gezichten te behandelen die niet met vertrouwen kunnen worden geïdentificeerd, omvat het model een fallback ‘onbekend’ identiteit met oninformatieve verdelingen, met een gezichtswaarschijnlijkheid die plat is in de embedding-ruimte en een temporele prior die plat is over alle jaren. Dit stelt onzekere gezichten in staat om te worden genegeerd zonder de uiteindelijke datumschatting te beïnvloeden:

Prestatie van het volledige model onder open-set-omstandigheden, waarin zowel bekende als onbekende gezichten in dezelfde afbeelding voorkomen. De Mean Absolute Error (MAE) neemt toe met het aantal onbekende identiteiten, maar verbetert consistent naarmate meer bekende identiteiten beschikbaar zijn om de tijdbalk te ankeren. De grootte van elk vierkant geeft de steekproefgrootte aan, waardoor blijkt dat configuraties met lage fouten ook de datasetverdeling domineren.

Hoe de prestatie wordt beïnvloed wanneer sommige gezichten in een afbeelding niet kunnen worden geïdentificeerd. Elk vierkant toont de gemiddelde dateringsfout voor verschillende aantallen bekende en onbekende identiteiten, waarbij de grootte van het vierkant de frequentie van die combinatie in de dataset aangeeft. De fout neemt toe met meer onbekenden, maar daalt gestaag naarmate meer bekende identiteiten worden toegevoegd.

Gegevens en tests

De auteurs gebruikten de eerdergenoemde CSFD-dataset om gegevens te verzamelen voor een nieuwe collectie die ze CSFD-1.6M noemden. De dataset werd opgebouwd uit scènes met meerdere personen, waarbij elk gezicht werd gelabeld met identiteit en jaar. Deze structuur was noodzakelijk om het model te leren hoe gezichten in context met elkaar verband houden; single-gezichtsdatasets zoals IMDB-WIKI ondersteunen dit niet, omdat ze alleen één persoon per afbeelding labelen.

De filmuitgavedata uit de Czecho-Slowaakse Film Database werden gebruikt om te schatten wanneer elke foto was genomen, waarbij elke persoon in de afbeelding werd gematcht met een openbaar profiel met zijn geboortejaar en een portret.

Vervolgens werd elk gezicht in de afbeelding gematcht met een van de bekende identiteiten, aanvankelijk met behulp van ArcFace om gezichtsembeddings te maken en een gemiddelde embedding te berekenen voor elke identiteit.

Daarna werd de Hongaarse algoritme gebruikt om gezichten toe te wijzen aan identiteiten door embedding-overeenkomst te vergelijken, met aanpassingen wanneer het aantal gedetecteerde gezichten via het SCRFD-10GE-kader niet overeenkwam met het aantal bekende individuen.

Statistieken van de CSFD-1.6M-dataset, met details over gescrapte afbeeldingen, gedetecteerde gezichten, identiteitsmatches, definitieve geannoteerde monsters en het beschikbare identiteitspool.

Statistieken van de CSFD-1.6M-dataset, met details over gescrapte afbeeldingen, gedetecteerde gezichten, identiteitsmatches, definitieve geannoteerde monsters en het beschikbare identiteitspool.

Overeenkomsten werden afgewezen als de overeenkomst te laag was of als de geschatte leeftijd te veel afweek van de bekende leeftijd, met een grotere tolerantie toegestaan voor oudere onderwerpen, en gezichten werden niet gefilterd op kwaliteit of grootte.

De auteurs merken de superioriteit van hun verzamelde set op ten opzichte van de dichtstbijzijnde vergelijkbare dataset, IMDB-WIKI:

‘Onze dataset is niet alleen aanzienlijk groter, maar bestaat kritisch uit multi-persoonsscènes die vereist zijn door ons model. Terwijl geen web-gebaseerde dataset vrij is van labelruis, levert onze annotatiepijplijn de expliciete links tussen afbeeldingen en identiteitsprofielen die door de database worden geboden, met als doel identiteitsaanwijzingen van hogere kwaliteit.’

Hun evaluatie vergeleek verschillende versies van het dateringssysteem om te begrijpen waar de voordelen vandaan kwamen. Een model ging ervan uit dat er een perfecte kennis was van wie er in de afbeelding stond, waardoor een bovengrens voor de prestaties werd geboden door alle onzekerheid in identiteitsherkenning te verwijderen, met het volledige model dat identiteiten en datums gezamenlijk schatte, waarbij verschillende mogelijke identiteitsaanwijzingen werden afgewogen voordat een definitieve jaarschatting werd gedaan.

Een eenvoudigere variant selecteerde de meest waarschijnlijke identiteitsconfiguratie zonder alternatieven te marginaliseren, wat in de praktijk bijna even effectief bleek.

Daarentegen wees een basislijn elke gezicht onafhankelijk toe en combineerde de resulterende leeftijdsgebaseerde jaarschattingen, zonder rekening te houden met of de identiteiten collectief zin hadden.

Om te testen hoeveel de methode profiteerde van het gebruik van gezichten, werd een afzonderlijk model getraind om de datum rechtstreeks uit de hele scène te schatten. Dit scene-gebaseerde model vormt de sterkste alternatieve aanpak die momenteel in beeldDatum-schatting wordt gebruikt, aangezien het era-specifieke visuele patronen over de hele afbeelding kan leren, in plaats van te vertrouwen op identiteit of leeftijd.

Metrieken en gegevens

De Mean Absolute Error (MAE) tussen de geschatte jaar en de bekende grondwaarheid was de centrale metric voor de experimenten.

De gegevens werden verdeeld in vijf delen, waarbij ervoor werd gezorgd dat alle afbeeldingen uit dezelfde film binnen één partitie bleven. Drie van deze delen werden gebruikt voor training, één voor validatie en één voor testen. Deze vijfvoudige rotatie werd toegepast om overfitting te voorkomen.

Aangezien de gezichtsgebaseerde modellen niet op deze dataset waren getraind, was geen splitsing vereist en werden ze in plaats daarvan rechtstreeks geëvalueerd op de volledige CSFD-1.6M-set.

Het Scène-model werd getraind voor 200 epochs onder de Adam-optimizer, met afbeeldingen die waren ingedeeld tot een 384×384 crop.

Resultaten

Het resultaatengedeelte van het artikel is ongebruikelijk verdeeld over een aantal prestatie-indicatoren, zonder één uitstekende of centrale test. We presenteren hier een selectie van de meest pertinente resultaten.

Het belangrijkste resultaat is niet één getal, maar een patroon: gezichtsaggregatiemodellen (vooral de Volledige en Top-1 varianten) presteren consistent beter dan de sterke Scène-baseline wanneer twee of meer bekende identiteiten aanwezig zijn – zelfs als de Scène-model rechtstreeks op de dataset is getraind, waardoor de centrale claim wordt ondersteund dat identiteit-gekoppelde gezichtsdatum-schatting een robuustere signalen biedt dan holistische scène-interpretatie.

Om de invloed van temporele priors te evalueren, vergeleken de auteurs verschillende configuraties van hun Volledige model. De sterkste prestatie werd behaald met behulp van de Decade Prior, die aanzienlijk beter presteerde dan zowel de Naïeve model (dat geen temporele prior gebruikt) als de Uniform Prior (die geen voorkeur over jaren veronderstelt):

Prestatie daalt scherp voor alle methoden naarmate het aantal gezichten toeneemt, maar modellen die realistische temporele priors gebruiken, zoals de Decade Prior, worden veel minder beïnvloed. De Naive en Scene-baselines blijven plat of verslechteren met grotere groepen, terwijl het Volledige model met informatieve priors een lage fout behoudt. De oracle-gebaseerde priors, die zijn gebaseerd op testset-statistieken, definiëren de ondergrens voor de prestaties die kunnen worden behaald.

Prestatie daalt scherp voor alle methoden naarmate het aantal gezichten toeneemt, maar modellen die realistische temporele priors gebruiken, zoals de Decade Prior, worden veel minder beïnvloed. De Naive en Scene-baselines blijven plat of verslechteren met grotere groepen, terwijl het Volledige model met informatieve priors een lage fout behoudt. De oracle-gebaseerde priors, die zijn gebaseerd op testset-statistieken, definiëren de ondergrens voor de prestaties die kunnen worden behaald.

Om de waarde van CSFD-1.6M te demonstreren buiten fotodatering, werd de dataset ook getest als een vooraftrainingsbron voor de bredere taak van gezichtsleeftijdschatting. Volgens een standaard evaluatieprotocol werden ResNet101-modellen voorafgetraind op CSFD-1.6M en vergeleken met tegenhangers die waren voorafgetraind op IMDB-WIKI en ImageNet. Deze modellen werden vervolgens fijngetraind en geëvalueerd op vijf populaire benchmarks: AgeDB; AFAD, MORPH; UTKFace; en CLAP2016:

Mean absolute error (plus minus standaarddeviatie) op vijf leeftijdschatting-benchmarks, waarbij modellen die zijn voorafgetraind op ImageNet, IMDB-WIKI en CSFD-1.6M worden vergeleken. Lagere waarden geven betere prestaties aan. CSFD-1.6M levert de sterkste resultaten op alle benchmarks.

Mean absolute error (plus minus standaarddeviatie) op vijf leeftijdschatting-benchmarks, waarbij modellen die zijn voorafgetraind op ImageNet, IMDB-WIKI en CSFD-1.6M worden vergeleken. Lagere waarden geven betere prestaties aan. CSFD-1.6M levert de sterkste resultaten op alle benchmarks.

Over alle vijf datasets heen leidde vooraftrainen op CSFD-1.6M tot de laagste foutpercentages, waarbij de andere twee vooraftrainingsbronnen met een duidelijke marge werden overtroffen – een prestatieverschil dat het sterkst was op AFAD en CLAP2016, maar consistent overal bleef.

We verwijzen de lezer naar de rest van het enigszins gefragmenteerde resultaatengedeelte in het bronartikel, dat ook uitgebreid ingaat op ablatie-studies.

Conclusie

Hoewel het nieuwe artikel snel dicht en ontoegankelijk wordt voor de gemiddelde lezer, is het onderwerp dat wordt aangepakt een van de meest interessante en relevante in de computerzichtliteratuur – niet in de laatste plaats omdat het soepel overgaat in antropologie en culturele studies, waar de constanten moeilijk te bepalen zijn.

 

* Net zoals de muzikale evolutie ook de snelheid van verandering vertraagde.

Voor het eerst gepubliceerd op maandag 10 november 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai