Andersons hoek

Het gebruik van AI om echte foto’s te verbeteren voordat ze worden genomen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

In plaats van GenAI te gebruiken om foto’s te corrigeren na u ze hebt gemaakt, hebben onderzoekers een systeem getraind dat u vertelt hoe u moet bewegen, poseren en de shot moet kaderen voordat u de foto neemt, met behulp van gekende kennis over wat foto’s onthoudbaar maakt.

 

Het corrigeren van foto’s achteraf is al een tijdje gemakkelijker geworden, aangezien fabrikanten en technologieplatforms steeds vaker in-camera-editing aanbieden waarmee gebruikers afbeeldingen kunnen wijzigen zodra ze zijn genomen. Populaire systemen van dit type zijn onder andere Google’s conversational editing, en Samsung’s generatieve edit, om er maar een paar te noemen.

Echter, een nieuwe trend die de voorkeur geeft aan ‘authenticiteit’ boven AI-verbeterde resultaten, kan ertoe leiden dat veel consumenten voor wie dergelijke systemen zijn bedoeld, ‘bewerkte’ foto’s als AI-slop gaan beschouwen.

Misschien is dit wat Google ertoe heeft gebracht om een AI-getrainde ‘camera-coach’ te creëren die is geïnformeerd door Gemini, die in staat is om directe instructies te geven om een foto te verbeteren tijdens het proces van het nemen ervan:

Google's Camera Coach vertelt de gebruiker hoe hij een foto opnieuw moet kaderen, evenals andere basisinstructies. Bron: https://store.google.com/intl/en_uk/ideas/articles/camera-coach/

Google’s Camera Coach vertelt de gebruiker hoe hij een foto opnieuw moet kaderen, evenals andere basisinstructies. Bron

Als een propriëtair systeem, en met praktisch geen informatie beschikbaar online over het onderwerp, lijkt Camera Coach Gemini te gebruiken om gebruikers te helpen bij het kaderen (zie bovenstaande afbeelding) of om kleine veranderingen in houding aan te brengen (zoals dichter bij elkaar komen of rechtstreeks naar de camera kijken).

Om zo ver als iemand kan zien, duwt het product de compositie naar het midden, waarschijnlijk op basis van miljoenen geüploade datapunten die waarschijnlijk hebben bijgedragen aan de trainingsdata van Gemini. In deze zin hebben de uploadende gebruikers de kalibratie van de AI gegenereerd door onbevredigende shots te weigeren en de shots die ze leuk vinden te uploaden – een effectieve (en gratis) vorm van dataset-curatie!

Dat gezegd hebbende, foto’s die uitgemiddeld zijn in termen van compositie, bezitten niet noodzakelijkerwijs dezelfde esthetische waarden of kijker-impact als foto’s die onthoudbaar zijn.

Verder dan ‘Cheese!’ en de Regel van de Derde

Daartoe, en naar een systeem dat toegankelijker is over platforms, biedt nieuw onderzoek uit Italië een Coach-achtig systeem dat gebaseerd is op voorafgaande kennis van wat foto’s onthoudbaar maakt:

Uiteenlopende voorbeelden van advies van het nieuwe systeem van de auteurs. Bron - https://arxiv.org/pdf/2602.21877

Uiteenlopende voorbeelden van advies van het nieuwe systeem van de auteurs. Bron

In de bovenstaande voorbeelden zien we advies gegeven door het nieuwe systeem van de auteurs – gedoopt MemCoach – dat moeilijk is voor te stellen dat een compositie-georiënteerde AI zoals Camera Coach het zou kunnen geven. In het eerste (meest linkse) geval is het advies om de hoofdbedekking te verwijderen, bijzonder specifiek; in de tweede afbeelding is het moeilijk te zien wat een conventionele context een compositie-georiënteerde AI zou kunnen trekken uit het algemene scenario (d.w.z. een ‘artistieke’ afbeelding van een jonge vrouw die op de grond ligt met haar ogen gesloten).

De kerninzicht over onthoudbaarheid in fotografie, gebruikt om het driedelige Italiaanse systeem te ontwikkelen, is afgeleid van verschillende eerdere werken, waaronder de uitgave Wat maakt een object onthoudbaar? uit 2015, en de paper Wat maakt een foto onthoudbaar? uit 2013.

Uit de paper Wat maakt een foto onthoudbaar?, vertegenwoordigende voorbeelden van goede, middelmatige en slechte foto's, in termen van onthoudbaarheid. Bron - https://people.csail.mit.edu/torralba/publications/Isola_memorabilityPhotos_PAMI2014.pdf

Uit de paper Wat maakt een foto onthoudbaar?, vertegenwoordigende voorbeelden van goede, middelmatige en slechte foto’s, in termen van onthoudbaarheid. Bron

Iedereen, zoals ik, met een negatieve Unix-geboortedatum, zal waarschijnlijk het sjabloon voor ‘minst onthoudbare afbeeldingen’ (bovenste rechts in de bovenstaande afbeelding) herkennen, van de eindeloze dia-avonden die onze kindertijd hebben vervloekt. Zoals de auteurs verklaren*:

‘Deze werken identificeerden sleutelintrinsieke factoren zoals de aanwezigheid van mensen, binnenhuisscènes, of emotionele expressies, in plaats van objecten en panoramische weergaven, evenals extrinsieke factoren, waaronder context en de waarnemer. ‘

Het project draait om ‘onthoudbaarheidsfeedback’ (MemFeed), dat wordt uitgedrukt in de MemCoach-tutor-toepassing, en een benchmark (getiteld MemBench) op basis van de PPR10K-dataset.

Uit de paper PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, uiteenlopende voorbeelden uit de dataset. Bovenste rij toont de oorspronkelijke afbeeldingen, onderste rij toont expert-geretoucheerde versies samen met overeenkomstige menselijke regiobladen. De oorspronkelijke foto's variëren sterk in gezichtspunt, achtergrond, belichting en camerainstellingen, terwijl de geretoucheerde resultaten een verbeterde visuele kwaliteit en een sterkere consistentie binnen elke groep vertonen. Bron - https://arxiv.org/pdf/2105.09180

Uit de paper PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, uiteenlopende voorbeelden uit de dataset. Toprij toont de oorspronkelijke afbeeldingen, onderste rij toont expert-geretoucheerde versies samen met overeenkomstige menselijke regiobladen. De oorspronkelijke foto’s variëren sterk in gezichtspunt, achtergrond, belichting en camerainstellingen, terwijl de geretoucheerde resultaten een verbeterde visuele kwaliteit en een sterkere consistentie binnen elke groep vertonen. Bron

De paper stelt vast dat onthoudbaarheid kwantificeerbaar is in foto’s, in plaats van een register van subjectieve oordelen, en de auteurs merken verder op dat de eigenschap zowel voor foto’s (in verschillende werken) als voor video’s (in verschillende andere werken) is geïdentificeerd.

De nieuwe paper is getiteld Hoe neem je een onthoudbare foto? Gebruikers empowerment met actiegerichte feedback, en komt van vier onderzoekers uit de Universiteit van Trento, de Universiteit van Pisa en Fondazione Bruno Kessler. De bijbehorende projectpagina suggereert dat GitHub-code en Hugging Face-gehoste data volgende maand (maart 2026) beschikbaar zullen zijn.

Methode

Om de MemBench-dataset te cureren uit de bron-PPR10K-portretdataset, groepeerden de onderzoekers foto’s uit hetzelfde scène en scoorden elke afbeelding voor onthoudbaarheid met behulp van een getrainde predictor op basis van CLIP functies. Ze rangschikten de foto’s binnen elke scène van minder naar meer onthoudbaar en paarden ze dienovereenkomstig:

Overzicht van de constructie en evaluatie van MemBench. Bovenste rij toont de datapipeline, van het groeperen van afbeeldingen per scène en het voorspellen van onthoudbaarheid, tot het rangschikken van foto's en het genereren van onthoudbaarheidsgeoriënteerde actiefeedback. Onderste rij illustreert de evaluatie, waarbij de kwaliteit van de feedback wordt gemeten door middel van edit-gebaseerde onthoudbaarheidswinsten en perplexiteitsscores.

Overzicht van de constructie en evaluatie van MemBench. Bovenste rij toont de datapipeline, van het groeperen van afbeeldingen per scène en het voorspellen van onthoudbaarheid, tot het rangschikken van foto’s en het genereren van onthoudbaarheidsgeoriënteerde actiefeedback. Onderste rij illustreert de evaluatie, waarbij de kwaliteit van de feedback wordt gemeten door middel van edit-gebaseerde onthoudbaarheidswinsten en perplexiteitsscores.

Voor elk paar werden natuurlijke taalbeschrijvingen gegenereerd met de InternVL3.5-model om de zichtbare verschillen tussen de minder onthoudbare versie en de meer onthoudbare versie te verklaren; en deze beschrijvingen zouden het trainingsignaal vormen voor het onthoudbaarheidsfeedbacksysteem.

In tegenstelling tot de logica die ten grondslag ligt aan Google’s Camera Coach, zochten de onderzoekers naar een subtieler set van interpretaties:

‘In tegenstelling tot computergestuurde fotocorrecties die zich richten op post-hoc-correcties (bijv. “maak de afbeelding helderder”), richten wij ons op semantische acties die een gebruiker onderweg kan uitvoeren voor een betere shot, bijv. “Ga naar elkaar toe”.’

De definitieve MemBench-verzameling bestaat uit ongeveer 10.000 afbeeldingen, gegroepeerd in 1.570 scènes, met gemiddeld 6,5 afbeeldingen per scène. De woordwolk die de auteurs hebben gegenereerd (zie onderstaande afbeelding), suggereert een breed scala aan semantische categorieën in de dataset:

Een woordwolk van de meest voorkomende termen in MemBench.

Een woordwolk van de meest voorkomende termen in MemBench.

De bronafbeeldingen hadden een gemiddelde onthoudbaarheidsscore van 0,63, terwijl de meest onthoudbare shots uit dezelfde scène varieerden van 0,51 tot 1,0, met een opvallende overlap tussen de twee groepen:

Verdeling van onthoudbaarheidsscores voor de minst en meest onthoudbare afbeeldingen binnen elke scène.

Verdeling van onthoudbaarheidsscores voor de minst en meest onthoudbare afbeeldingen binnen elke scène.

De feedback zelf varieerde van korte notities van zeven woorden tot opvallend langere instructies (links, in onderstaande afbeelding). Elk stuk advies werd vervolgens onderverdeeld in kleine actietypen met behulp van GPT-5 Mini (rechts, in onderstaande afbeelding):

Verdeling van de lengte van de feedback in inhoudswoorden, en categorisatie van atomaire sub-acties met akkoordbreedtes die de frequentie van co-occurrentie aangeven tussen categorieën.

Verdeling van de lengte van de feedback in inhoudswoorden, en categorisatie van atomaire sub-acties met akkoordbreedtes die de frequentie van co-occurrentie aangeven tussen categorieën.

De auteurs merken op dat de meeste suggesties zich richtten op hoe het onderwerp was geposeerd, gevolgd door veranderingen in betekenis of scène-inhoud, waarbij framing vaak werd gekoppeld aan poseren, en lichtaanpassingen vaak werden gekoppeld aan semantische veranderingen.

Flux Capacitor

Om te evalueren of de onthoudbaarheid werd verhoogd door de feedback, werd de gebruikersconformiteit gesimuleerd met behulp van het FLUX.1 Kontext-generatieve model, als een proxy voor de fotograaf. Gegeven een bronafbeelding en een stuk tekstuele feedback, werd een bewerkte versie gegenereerd door Flux die de voorgestelde veranderingen simuleerde:

De afbeeldingen links zijn echt, uit de dataset, en de afbeeldingen rechts (in elk geval) zijn gegenereerd door Flux op basis van de prompt (in geel, onder). Op deze manier konden de effectiviteit van prompts worden geëvalueerd zonder uitgebreide menselijke betrokkenheid. Deze kennis zou uiteindelijk terug worden gevoerd in het MemCoach-kader, en vertegenwoordigt in feite een workflow die een systeem van dit type (d.w.z. uiteindelijk met echte wereldvoorbeelden in plaats van Flux-voorbeelden) iteratief kan verbeteren.

De afbeeldingen links zijn echt, uit de dataset, en de afbeeldingen rechts (in elk geval) zijn gegenereerd door Flux op basis van de prompt (in geel, onder). Op deze manier konden de effectiviteit van prompts worden geëvalueerd zonder uitgebreide menselijke betrokkenheid. Deze kennis zou uiteindelijk terug worden gevoerd in het MemCoach-kader, en vertegenwoordigt in feite een workflow die een systeem van dit type (d.w.z. uiteindelijk met echte wereldvoorbeelden in plaats van Flux-voorbeelden) iteratief kan verbeteren.

Beide de oorspronkelijke en bewerkte afbeeldingen werden vervolgens door een onthoudbaarheidspredictor geleid, waardoor de meting van hoe vaak de bewerkte versie een hogere score behaalde – genoemd de Verbeteringsratio – en hoe groot de winst was ten opzichte van de startafbeelding, genoemd Relatieve onthoudbaarheid.

Overeenkomst met onthoudbaarheidsgerichte referentieadvies werd ook gemeten door de perplexiteit te berekenen tegen de grondwaarheidsbeschrijvingen, en een 80–20 split werd toegepast op scèneniveau, zodat alleen scènes die niet tijdens de training waren gebruikt, werden getest.

State of the Art

De onthoudbaarheidsbewustzijn van huidige multimodale grote taalmodellen werd getest. Afbeeldingen uit de LaMem-dataset werden getoond aan enkele toonaangevende modellen, die werden gevraagd of de afbeelding onthoudbaar was. De modelconfidentieschatting werd vervolgens vergeleken met de scores die door menselijke kijkers in de oorspronkelijke studie waren toegewezen:

Tests die aantonen dat basismultimodale modellen de onthoudbaarheid niet vastleggen. Links, Spearman-rangcorrelatie tussen modelvoorspellingen en LaMem-grondwaarheidscores, met inter-annotatorovereenkomst van LaMem getoond voor referentie. Rechts, verbeteringsratio behaald door zero-shot-feedback ten opzichte van de edit-baseline, met slechts marginale winsten.

Tests die aantonen dat basismultimodale modellen de onthoudbaarheid niet vastleggen. Links, Spearman-rangcorrelatie tussen modelvoorspellingen en LaMem-grondwaarheidscores, met inter-annotatorovereenkomst van LaMem getoond voor referentie. Rechts, verbeteringsratio behaald door zero-shot-feedback ten opzichte van de edit-baseline, met slechts marginale winsten.

Bijna geen significante correlatie met menselijke oordelen werd gevonden, en ondanks grote voorafgaande training, beweren de auteurs dat de modellen niet bijhielden wat mensen consequent onthouden.

Voorbeelden uit de LaMem-dataset. Bovenlinks zien we ook een warmtekaart afgebeeld voor die afbeelding. Bron - http://memorability.csail.mit.edu/explore.html

Voorbeelden uit de LaMem-dataset. Bovenlinks zien we ook een warmtekaart afgebeeld voor die afbeelding. Bron

MemCoach

MemCoach richt zich op semantische, on-the-fly-instructies die kunnen worden uitgevoerd voordat de sluiter wordt ingedrukt – bijvoorbeeld, het aanpassen van de pose, het wijzigen van interacties tussen onderwerpen of het wijzigen van scène-elementen. De feedback die door MemCoach wordt gegeven, varieert van 7 tot 102 inhoudswoorden. Onthoudbaarheid, zoals de paper stelt, lijkt meer te worden aangedreven door onderwerpconfiguratie en narratieve hints dan door eenvoudige compositieaanpassingen:

Overzicht van de MemCoach-pijplijn, waarin onthoudbaarheidsgeoriënteerde instructies van een teacher MLLM worden gekoppeld aan neutrale studentreacties om contrasterende gegevens te vormen; activiteitsverschillen over lagen worden gemiddeld om een onthoudbaarheidsstuurvector af te leiden; en die vector wordt geïnjecteerd bij inferentie om studentactiviteiten te verschuiven naar het produceren van verbeterde, onthoudbaarheidsgeoriënteerde feedback zonder extra training.

Overzicht van de MemCoach-pijplijn, waarin onthoudbaarheidsgeoriënteerde instructies van een teacher MLLM worden gekoppeld aan neutrale studentreacties om contrasterende gegevens te vormen; activiteitsverschillen over lagen worden gemiddeld om een onthoudbaarheidsstuurvector af te leiden; en die vector wordt geïnjecteerd bij inferentie om studentactiviteiten te verschuiven naar het produceren van verbeterde, onthoudbaarheidsgeoriënteerde feedback, zonder extra training.

Tests

Zeven Multimodale Grote Taalmodellen (MLLM’s) werden gebruikt in de testfase voor het nieuwe systeem: Qwen2.5V.L; InternVL3_5-8B; Idefics3-8B; en LLaVA-OneVision-1.5. Bovendien werd GPT-5 Mini opgenomen als een vertegenwoordiger van propriëtaire, gesloten-bronmodellen, evenals de esthetiek-georiënteerde Q-Instruct en AesExpert-modellen. De MLLM’s werkten op verschillende manieren als zero-shot en teacher-oracles.

InternVL3.5 werd gebruikt voor zowel de teacher- als studentmodellen, met de MemBench-trainingsplitsing gebruikt om contrasterende voorbeelden te creëren:

MemCoach-prestaties in vergelijking met state-of-the-art MLLM's over teacher-oracles, esthetiek-georiënteerde modellen en zero-shot-baselines, met een hogere Verbeteringsratio en concurrerende Relatieve Onthoudbaarheid, evenals de laagste perplexiteit, wat aangeeft dat de feedback consistenter en onthoudbaarheidsgeoriënteerder is.

MemCoach-prestaties in vergelijking met state-of-the-art MLLM’s over teacher-oracles, esthetiek-georiënteerde modellen en zero-shot-baselines, met een hogere Verbeteringsratio en concurrerende Relatieve Onthoudbaarheid, evenals de laagste perplexiteit, wat aangeeft dat de feedback consistenter en onthoudbaarheidsgeoriënteerder is.

In de tabel voor de eerste test (hierboven), zien we dat MemCoach meer effectieve onthoudbaarheidsadvies lijkt te geven dan enig van de vergelijkingsmodellen – en het gestuurde InternVL3.5-model verhoogt de onthoudbaarheid vaker en met een grotere hoeveelheid, met een 5% Verbeteringsratio-winst boven GPT-5 Mini, en een 31,81% sprong in Relatieve Onthoudbaarheid boven zijn ongestuurde versie.

Het overtreft ook esthetiek-georiënteerde systemen, zonder extra training nodig te hebben. Lagere perplexiteit, zoals de paper beweert, geeft verder aan dat de feedback dezelfde linguïstische patronen volgt die menselijke onthoudbaarheidsbeoordelingen de neiging hebben te belonen:

Generalisatieresultaten die aantonen dat MemCoach onthoudbaarheidsgeoriënteerde feedback verbetert over meerdere multimodale backbones, met consistent hogere Verbeteringsratio's en Relatieve Onthoudbaarheid, evenals lagere perplexiteit voor de meeste modellen.

Generalisatieresultaten die aantonen dat MemCoach onthoudbaarheidsgeoriënteerde feedback verbetert over meerdere multimodale backbones, met consistent hogere Verbeteringsratio’s en Relatieve Onthoudbaarheid, evenals lagere perplexiteit voor de meeste modellen.

Een verdere test (zie bovenstaande tabel) geeft aan dat het toevoegen van MemCoach de onthoudbaarheidsgeoriënteerde feedback over alle geteste multimodale backbones verhoogde, met consistente winsten in Verbeteringsratio en de grootste sprongen voor Qwen2.5VL en LLaVA-OV.

Een kwalitatieve evaluatie werd vervolgens uitgevoerd, waarbij voorbeelden van MemCoach-feedback werden geanalyseerd waarin de bronafbeelding, de natuurlijke taal-suggestie en het veronderstelde verbeterde resultaat zij aan zij werden onderzocht:

Kwalitatieve voorbeelden van onthoudbaarheidsgeoriënteerde feedback gegenereerd door MemCoach. Elk triplet toont de bronafbeelding, de natuurlijke taal-instructie en de resulterende bewerkte afbeelding, met Relatieve Onthoudbaarheid (RM) die de gemeten verandering aangeeft. De instructies variëren van pose- en blikaanpassingen tot semantische interventies, zoals het verwijderen van objecten, waarbij zowel succesvolle winsten als gevallen waarin het verwijderen van ongebruikelijke elementen de onthoudbaarheid vermindert.

Kwalitatieve voorbeelden van onthoudbaarheidsgeoriënteerde feedback gegenereerd door MemCoach. Elk triplet toont de bronafbeelding, de natuurlijke taal-instructie en de resulterende bewerkte afbeelding, met Relatieve Onthoudbaarheid (RM) die de gemeten verandering aangeeft. De instructies variëren van pose- en blikaanpassingen tot semantische interventies, zoals het verwijderen van objecten, waarbij zowel succesvolle winsten als gevallen waarin het verwijderen van ongebruikelijke elementen de onthoudbaarheid vermindert.

Van deze resultaten zeggen de auteurs:

‘De voorbeelden benadrukken de variëteit aan suggesties die het model voorstelt, variërend van fijne compositieaanpassingen, zoals het wijzigen van de blikrichting, pose of handpositie, tot semantische interventies, zoals het verwijderen van objecten of het wijzigen van gezichtsuitdrukkingen.

‘De feedback is natuurlijk interpreteerbaar en actiegericht, uitgedrukt in conciese tekstuele instructies (meestal met werkwoorden “Breng”, “Sta”, “Verwijder”) die rechtstreeks kunnen worden geïmplementeerd, waardoor effectief wordt verwoord hoe je een onthoudbare foto kunt nemen.’

Conclusie

Het zou zeer interessant zijn om de methodologie van Google’s gesloten benadering te vergelijken met het MemBench-project – niet in de laatste plaats om te weten welke centrale standaarden, referenties en databases Google heeft gebruikt om de esthetische standaarden van het systeem te definiëren.

Het negatieve aspect van systemen van dit type, open of gesloten bron, is dat ze op grote schaal het risico lopen om uniforme standaarden af te dwingen die zijn voorbestemd om te eindigen als memes en clichés – een soort visueel equivalent van de AI-em-dash-debatten, waarin de ‘juiste’ procedure enigszins vervloekt is in informele gebruiken.

 

* Mijn conversie van de inline-citaten van de auteurs naar hyperlinks, als de link niet elders in het artikel wordt weergegeven.

Het artikel verwijst hier naar, evenals in verschillende andere plaatsen, naar ‘aanvullend materiaal’ dat ik niet kan vinden, noch vanuit het artikel, noch vanuit de Arxiv-lijst, noch vanuit de projectsite.

Eerst gepubliceerd op donderdag 26 februari 2026

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai