Andersons vinkel

Å bruke AI til å forbedre virkelige bilder før de tas

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

I stedet for å bruke GenAI til å fikse bilder etter du har tatt dem, har forskere trent et system som forteller deg hvordan du skal bevege deg, posere og ramme inn bildet på forhånd, ved å bruke studert kunnskap om hva som gjør bilder minneverdige.

 

Å fikse bilder etter hendelsen har blitt enklere over tid, ettersom produsenter og teknologiplattformer stadig oftere tilbyr redigering i kameraet som lar brukerne endre bildene så snart de er tatt. Populære systemer av denne typen inkluderer Google’s konversasjonell redigering, og Samsung’s generativ redigering, blant andre.

Imidlertid kan en ny trend som favoriserer ‘autentisitet’ over AI-forbedrede resultater bety at mange av forbrukerne som slike systemer er rettet mot, begynner å anse ‘endrede’ bilder som AI-søle.

Kanskje dette er hva som inspirerte Google til å lage en AI-trening ‘kamera-trener’ informert av Gemini, som er i stand til å gi direkte instruksjoner for å forbedre et bilde under prosessen med å ta det:

Google's Camera Coach forteller brukeren hvordan han skal ramme inn et bilde, blant annet andre grundige råd. Kilde: https://store.google.com/intl/en_uk/ideas/articles/camera-coach/

Google’s Camera Coach forteller brukeren hvordan han skal ramme inn et bilde, blant annet andre grundige råd. Kilde

Da det er et proprietært system, og med praktisk talt ingen informasjon tilgjengelig på nett, ser Camera Coach ut til å bruke Gemini til å hjelpe brukerne med å forbedre innrammingen (se bildet ovenfor) eller å gjøre mindre endringer i holdning (slik som å flytte nærmere hverandre, eller å se direkte på kameraet).

Så langt som noen kan si, skyver produktet komposisjonen mot medianen, antagelig basert på millioner av lastede innholdspunkter som sannsynligvis har bidratt til Geminis treningdata. På denne måten har lastende brukere skapt AIens kalibrering ved å avvise utilfredsstillende bilder og laste opp de de liker – en effektiv (og gratis) form for dataset-kurering!

Det er sagt, bilder som er utjevnede når det gjelder komposisjon, besitter ikke nødvendigvis de samme estetiske verdiene eller seer-impulsen som bilder som er minneverdige.

Bortenfor ‘Ost!’ og tredjedelsregelen

I denne retningen, og mot et system som er mer tilgjengelig på tvers av plattformer, tilbyr ny forskning fra Italia et Coach-lignende system som er basert på forhåndskunnskap om hva som gjør bilder minneverdige:

Langtrekkende eksempler på råd fra forfatternes nye system. Kilde - https://arxiv.org/pdf/2602.21877

Langtrekkende eksempler på råd fra forfatternes nye system. Kilde

I eksemplene ovenfor ser vi råd gitt av forfatternes nye system – kalt MemCoach – som det er vanskelig å forestille seg at en komposisjons-sentrert AI som Camera Coach kunne gi. I det første (venstre) tilfellet er rådet om å fjerne hodeplagget spesielt tvilsomt; i det andre bildet er det vanskelig å forestille seg hva slags konvensjonell kontekst en komposisjons-basert AI kunne trekke fra den generelle situasjonen (dvs. et ‘kunstnerisk’ bilde av en ung kvinne som ligger på gulvet med øynene lukket).

Kjerneforståelsen om minneverdighet i fotografi, brukt til å utvikle det tre-delte italienske systemet, er hentet fra ulike tidligere arbeider, inkludert 2015-utgaven Hva gjør et objekt minneverdig?, og 2013-paperet Hva gjør et fotografi minneverdig?.

Fra 2013-papiret Hva gjør et fotografi minneverdig?, representative eksempler på gode, middels og dårlige bilder, når det gjelder minneverdighet. Kilde - https://people.csail.mit.edu/torralba/publications/Isola_memorabilityPhotos_PAMI2014.pdf

Fra 2013-papiret Hva gjør et fotografi minneverdig?, representative eksempler på gode, middels og dårlige bilder, når det gjelder minneverdighet. Kilde

Hvem som helst, som meg, med en negativ Unix-fødselsdato, vil sannsynligvis gjenkjenne malen for ‘minst minneverdige bilder’ (øverst til høyre i bildet ovenfor), fra de endeløse slide-netter som forfulgte vår barndom. Som forfatterne sier*:

‘Disse arbeidene identifiserte nøkkel-intrinsiske faktorer som tilstedeværelse av mennesker, indendørs scener, eller emosjonelle uttrykk, snarere enn objekter og panoramabilder, samt ekstrinsiske faktorer, inkludert kontekst og observatøren. ‘

Prosjektet sentrerer seg rundt ‘minneverdighets-tilbakemelding’ (MemFeed), som uttrykkes i MemCoach-tutor-applikasjonen, og en benchmark (tittel MemBench) basert på PPR10K-datasettet.

Fra papiret PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, diverse eksempler fra datasettet. Øverste rad viser de originale bildene, nederste rad viser ekspert-retusjerte versjoner sammen med tilhørende menneske-region masker. De originale bildene varierer mye i synsvinkel, bakgrunn, lys og kamera-innstillinger, mens de retusjerte resultater viser forbedret visuell kvalitet og sterkere konsistens innen hver gruppe. Kilde - https://arxiv.org/pdf/2105.09180

Fra papiret PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, diverse eksempler fra datasettet. Øverste rad viser de originale bildene, nederste rad viser ekspert-retusjerte versjoner sammen med tilhørende menneske-region masker. De originale bildene varierer mye i synsvinkel, bakgrunn, lys og kamera-innstillinger, mens de retusjerte resultater viser forbedret visuell kvalitet og sterkere konsistens innen hver gruppe. Kilde

Papiret observerer at minneverdighet er kvantifiserbar i bilder, snarere enn en registrering av subjektive vurderinger, og forfatterne noterer videre at egenskapen har blitt identifisert både for bilder (i forskjellige arbeider) og videoer (i forskjellige andre).

Den nye papiret har tittelen How to Take a Memorable Picture? Empowering Users with Actionable Feedback, og kommer fra fire forskere på Universitetet i Trento, Universitetet i Pisa og Fondazione Bruno Kessler. Prosjektsiden antyder at GitHub-kode og Hugging Face-vert data vil være tilgjengelig neste måned (mars 2026).

Metode

For å kurere MemBench-datasettet fra kilde-PPR10K-portrett-datasettet, grupperte forskerne bilder fra samme scene og scoret hver bilde for minneverdighet ved å bruke en trent prediktor basert på CLIP funksjoner. De rangerte deretter bildene innen hver scene fra minst til mest minneverdig og parret dem deretter:

Oversikt over MemBench-konstruksjon og evaluering. Øverste rad viser data-pipeline, fra gruppering av bilder etter scene og prediksjon av minneverdighet, til rangering av bilder og generering av minneverdighets-bevisst aksjons-tilbakemelding. Nederste rad viser evaluering, måling av tilbakemeldingskvalitet gjennom redigering-basert minneverdighets-gevinst og perplexity-scoring.

Oversikt over MemBench-konstruksjon og evaluering. Øverste rad viser data-pipeline, fra gruppering av bilder etter scene og prediksjon av minneverdighet, til rangering av bilder og generering av minneverdighets-bevisst aksjons-tilbakemelding. Nederste rad viser evaluering, måling av tilbakemeldingskvalitet gjennom redigering-basert minneverdighets-gevinst og perplexity-scoring.

For hver par, ble naturlige språk-beskrivelser generert med InternVL3.5-modellen for å forklare de synlige forskjellene mellom den minst minneverdige versjonen og den mest minneverdige versjonen; og disse beskrivelsene ville utgjøre treningssignalet for minneverdighets-tilbakemeldingssystemet.

I motsetning til den type logikk som ligger til grunn for Google’s Camera Coach, søkte forskerne en mer subtil tolkning:

‘I motsetning til komputasjonsfotografi-justeringer som fokuserer på etterfølgende korreksjoner (f.eks. “gjør bildet lysere”), fokuserer vi på semantiske handlinger som en bruker kan utføre på fly for et bedre skudd, f.eks. “Vend dere mot hverandre”.’

Den endelige MemBench-samlingen består av rundt 10 000 bilder gruppert i 1 570 scener, med en gjennomsnitt på 6,5 bilder per scene. Ordskyen forfatterne genererte (se bildet under), antyder en bred rekke semantiske kategorier i datasettet:

En ordsky av de mest hyppige termene i MemBench.

En ordsky av de mest hyppige termene i MemBench.

Kilde-bildene hadde en gjennomsnittlig minneverdighets-score på 0,63, mens de mest minneverdige skuddene fra samme scene strakk seg fra 0,51 til 1,0, med merkbar overlap mellom de to gruppene:

Minneverdighets-score-distribusjoner som sammenligner de minst og mest minneverdige bildene innen hver scene.

Minneverdighets-score-distribusjoner som sammenligner de minst og mest minneverdige bildene innen hver scene.

Tilbakemeldingen selv varierte fra korte syv-ord-notater til merkbart lengre instruksjoner (venstre, i bildet under). Hver del av råd ble deretter brutt ned i små handlingstyper ved å bruke GPT-5 Mini (høyre, i bildet under):

Tilbakemeldingslengde-distribusjon målt i innhold-ord, og kategorisering av atomiske under-handlinger med akkord-bredden som indikerer sam-forekomst-hyppighet over kategorier.

Tilbakemeldingslengde-distribusjon målt i innhold-ord, og kategorisering av atomiske under-handlinger med akkord-bredden som indikerer sam-forekomst-hyppighet over kategorier.

Forfatterne noterer at de fleste forslagene fokuserte på hvordan motivet var posisjonert, fulgt av endringer i mening eller scene-innhold, med innramming ofte koblet til posisjonering, og lys-justeringer ofte knyttet til semantiske endringer.

Flux Capacitor

For å evaluere om minneverdighet økte med tilbakemeldingen, ble bruker-etterlevelse simulert ved å bruke FLUX.1 Kontext-generativ modell, som en proxy for fotografen. Gitt et kilde-bilde og en tekst-tilbakemelding, ble en redigert versjon generert av Flux som simulerte de foreslåtte endringene:

Bildene til venstre er ekte, fra datasettet, og bildene til høyre (i hvert tilfelle) er skapt av Flux, basert på prompten (i gul, under). På denne måten kunne effektiviteten av promptene vurderes uten omfattende menneskelig involvering. Denne kunnskapen ville til slutt føre tilbake til MemCoach-rammeverket, og faktisk representere en arbeidsflyt som kunne iterativt forbedre et slikt system (dvs. til slutt med ekte verden-eksempler i stedet for Flux-eksempler).

Bildene til venstre er ekte, fra datasettet, og bildene til høyre (i hvert tilfelle) er skapt av Flux, basert på prompten (i gul, under). På denne måten kunne effektiviteten av promptene vurderes uten omfattende menneskelig involvering. Denne kunnskapen ville til slutt føre tilbake til MemCoach-rammeverket, og faktisk representere en arbeidsflyt som kunne iterativt forbedre et slikt system (dvs. til slutt med ekte verden-eksempler i stedet for Flux-eksempler).

Både det originale og det redigerte bildet ble deretter sendt gjennom en minneverdighets-prediktor, som muliggjorde måling av hvor ofte den redigerte versjonen oppnådde en høyere score – betegnet som Forbedrings-forholdet – og hvor stor gevinsten var i forhold til start-bildet, betegnet som Relativ minneverdighet.

Lignende til minneverdighets-fokusert referanse-tilbakemelding ble også målt ved å beregne perplexity mot grunn-sannhets-beskrivelsene, og en 80–20 split ble brukt på scenenivå, så testing ble utført bare på scener som ikke hadde blitt brukt under trening.

Tilstand av kunnskap

Minneverdighets-bevisstheten til nåværende multimodale store språk-modeller ble testet. Bilder fra LaMem-datasettet ble vist til flere ledende modeller, som ble bedt om å si om bildet var minneverdig. Modellens konfidens-estimat ble deretter sammenlignet med poengene som var tildelt av menneskelige seere i den opprinnelige studien:

Tester som indikerer at basis-multimodale modeller ikke fanger minneverdighet. Venstre, Spearman-rang-korrelasjon mellom modell-prediksjoner og LaMem-grunn-sannhets-poeng, med inter-annotator-enighet fra LaMem vist som referanse. Høyre, forbedrings-forhold oppnådd av null-skudd-tilbakemelding i forhold til redigering-basert baseline, viser bare marginale gevinster.

Tester som indikerer at basis-multimodale modeller ikke fanger minneverdighet. Venstre, Spearman-rang-korrelasjon mellom modell-prediksjoner og LaMem-grunn-sannhets-poeng, med inter-annotator-enighet fra LaMem vist som referanse. Høyre, forbedrings-forhold oppnådd av null-skudd-tilbakemelding i forhold til redigering-basert baseline, viser bare marginale gevinster.

Nesten ingen meningsfull korrelasjon med menneskelige vurderinger ble funnet, og, til tross for stor-skala-pre-trening, hevder forfatterne at modellene ikke sporet hva mennesker konsekvent husker.

Eksempler fra LaMem-datasettet. Øverst til venstre ser vi også en varme-kart avbildet for dette bildet. Kilde - http://memorability.csail.mit.edu/explore.html

Eksempler fra LaMem-datasettet. Øverst til venstre ser vi også en varme-kart avbildet for dette bildet. Kilde

MemCoach

MemCoach fokuserer på semantiske, på-fly-instruksjoner som kan utføres før skuddet tas – for eksempel, justering av posisjon, endring av interaksjoner mellom motiv, eller modifisering av scene-elementer. Tilbakemeldingen gitt av MemCoach varierer fra 7-102 innhold-ord. Minneverdighet, papiret hevder, synes å være drevet mer av motiv-konfigurasjon og narrative-koder enn av enkle komposisjon-justeringer:

Oversikt over MemCoach-pipeline, hvor minneverdighets-bevisst veiledning fra en lærer-MLLM er parret med nøytrale elev-respons for å danne kontrast-data; aktiverings-forskjeller over lag er gjennomsnittlig for å avlede en minneverdighets-styrings-vektor; og den vektoren injiseres ved inferens for å skyve elev-aktiveringer mot å produsere forbedret, minneverdighets-orientert tilbakemelding uten ekstra trening.

Oversikt over MemCoach-pipeline, hvor minneverdighets-bevisst veiledning fra en lærer-MLLM er parret med nøytrale elev-respons for å danne kontrast-data; aktiverings-forskjeller over lag er gjennomsnittlig for å avlede en minneverdighets-styrings-vektor; og den vektoren injiseres ved inferens for å skyve elev-aktiveringer mot å produsere forbedret, minneverdighets-orientert tilbakemelding, uten ekstra trening.

Tester

Syv multimodale store språk-modeller (MLLMs) ble brukt i testfasen for det nye systemet: Qwen2.5V.L; InternVL3_5-8B; Idefics3-8B; og LLaVA-OneVision-1.5. I tillegg ble GPT-5 Mini inkludert som en representant for proprietære, lukkede modeller, sammen med estetikk-spesialiserte Q-Instruct og AesExpert-modellene. MLLM-ene opererte ulikt som null-skudd og lærer-orakler.

InternVL3.5 ble brukt både som lærer- og elev-modell, med MemBench-trening-delen brukt til å lage kontrast-eksempler:

MemCoach-ytelse sammenlignet med state-of-the-art MLLMs over lærer-orakler, estetikk-spesialiserte modeller og null-skudd-baselinjer, viser høyere Forbedrings-forhold og konkurranse-Relativ minneverdighet sammen med den laveste perplexity, som indikerer mer konsistent og minneverdighets-orientert tilbakemelding.

MemCoach-ytelse sammenlignet med state-of-the-art MLLMs over lærer-orakler, estetikk-spesialiserte modeller og null-skudd-baselinjer, viser høyere Forbedrings-forhold og konkurranse-Relativ minneverdighet sammen med den laveste perplexity, som indikerer mer konsistent og minneverdighets-orientert tilbakemelding.

I tabellen for den første testen (vist ovenfor) ser vi at MemCoach synes å levere mer effektiv minneverdighets-tilbakemelding enn noen av sammenlignings-modellene – og den styrede InternVL3.5-modellen øker minneverdighet oftere, og med en større mengde, med en 5% Forbedrings-forhold-gevinst over GPT-5 Mini, og en 31,81% hopp i Relativ minneverdighet over sin ustyrt versjon.

Det overstiger også estetikk-fokuserte systemer, til tross for at det ikke krever ekstra trening. Lavere perplexity, papiret hevder, antyder videre at dens tilbakemelding følger de samme lingvistiske mønster som menneskelige minneverdighets-vurderinger tenderer til å belønne:

Generalisering-resultater som viser at MemCoach forbedrer minneverdighets-tilbakemelding over flere multimodale rygger, konsistent øker Forbedrings-forhold og Relativ minneverdighet, og også reduserer perplexity for de fleste modellene.

Generalisering-resultater som viser at MemCoach forbedrer minneverdighets-tilbakemelding over flere multimodale rygger, konsistent øker Forbedrings-forhold og Relativ minneverdighet, og også reduserer perplexity for de fleste modellene.

En ytterligere test (se tabellen ovenfor) indikerer at å legge til MemCoach økte minneverdighets-tilbakemelding over hver enkelt testet multimodal rygg, med konsistente gevinster i Forbedrings-forhold og den største hopp i Relativ minneverdighet for Qwen2.5VL og LLaVA-OV.

En kvalitativ evaluering ble deretter utført, med analyse av eksempler på MemCoach-tilbakemelding hvor kilde-bildet, den naturlige språk-tilbakemeldingen og det imaginerte forbedrede resultatet ble vist side om side:

Kvalitative eksempler på minneverdighets-tilbakemelding generert av MemCoach. Hver triplet viser kilde-bildet, den naturlige språk-instruksjonen og det resulterende redigerte bildet, med Relativ minneverdighet (RM) som indikerer den målte endringen. Veiledningen strekker seg fra posisjons- og blikk-justeringer til semantiske inngrep som fjerning av objekter, og illustrerer både vellykkede gevinster og tilfeller hvor fjerning av uvanlige elementer reduserer minneverdighet.

Kvalitative eksempler på minneverdighets-tilbakemelding generert av MemCoach. Hver triplet viser kilde-bildet, den naturlige språk-instruksjonen og det resulterende redigerte bildet, med Relativ minneverdighet (RM) som indikerer den målte endringen. Veiledningen strekker seg fra posisjons- og blikk-justeringer til semantiske inngrep som fjerning av objekter, og illustrerer både vellykkede gevinster og tilfeller hvor fjerning av uvanlige elementer reduserer minneverdighet.

Av disse resultater sier forfatterne:

‘Eksemplene fremhever variasjonen i forslag som modellen foreslår, som strekker seg fra fine-grained komposisjon-justeringer, som å endre blikk-retning, posisjon eller hånd-posisjon, til semantiske inngrep som å fjerne objekter eller endre ansikts-uttrykk.

‘Tilbakemelding er naturlig fortolkbar og handling-orientert, uttrykt i konsise tekst-instruksjoner (hovedsakelig inneholdende verb “Bring”, “Stå”, “Fjern”) som kan utføres direkte, effektivt verbalisering av hvordan man tar et minneverdig bilde.’

Konklusjon

Det ville være svært interessant å sammenligne metodikken til Google’s lukkede-boks-tilnærming til MemBench-prosjektet – ikke minst for å vite hva sentrale standarder, referanser og databaser Google brukte til å definere systemets estetiske standarder.

Den negative siden av systemer av denne typen, åpne eller lukkede kilde, er at de på stor skala risikerer å tvinge frem enhetlige standarder som er bestemt til å ende som memes og klisjeer – en slags visuell ekvivalent til AI-strekkdebattene, hvor den ‘korrekte’ prosedyren har blitt noe forhekset i uformell bruk.

 

* Min konvertering av forfatternes inline-citater til hyperlenker, hvis lenken ikke er presentert andre steder i artikkelen.

Papiret henviser her, som på flere andre steder, til ‘supplementært materiale’ som jeg ikke kan finne, hverken fra papiret, den primære Arxiv-listingen eller prosjekt-siden.

Først publisert torsdag, 26. februar 2026

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai