Andersons vinkel
Hvordan stoppe AI fra å avbilde iPhones i gamle epoker

Hvordan forestiller AI-bildegeneratorene seg fortiden? Ny forskning indikerer at de plasserer smarttelefoner i 1700-tallet, setter inn bærbare datamaskiner i 1930-årenes scener og plasserer støvsugere i 1800-tallets hjem, og det setter spørsmål ved hvordan disse modellene forestiller seg historien – og om de er i stand til å være kontekstuell historisk nøyaktige overhode.
Tidlig i 2024 ble bildeskapelsesegenskapene til Googles Gemini multimodale AI-modell kritisert for å påtvinge demografisk rettferdighet i uaktuelle sammenhenger, slik som å generere WWII-tyske soldater med usannsynlig proveniens:

Demografisk usannsynlig tysk militærpersonell, som forestilt av Googles Gemini multimodale modell i 2024. Kilde: Gemini AI/Google via The Guardian
Dette var et eksempel der forsøk på å rette opp bias i AI-modeller ikke tok hensyn til en historisk kontekst. I dette tilfelle ble problemet løst kort tid etter. Men diffusjonsbaserte modeller er fortsatt utsatt for å generere versjoner av historien som forvirrer moderne og historiske aspekter og artefakter.
Dette skyldes delvis entanglement, der egenskaper som ofte opptrer sammen i treningsdata blir sammenflettet i modellens utdata. For eksempel, hvis moderne objekter som smarttelefoner ofte opptrer sammen med handlingen å snakke eller lytte i datasettet, kan modellen lære å assosiere disse aktivitetene med moderne enheter, selv om prompten spesifiserer en historisk setting. Når disse assosiasjonene er innlejret i modellens interne representasjoner, blir det vanskelig å skille aktivitetene fra deres samtidskontekst, noe som fører til historisk uaktuelle resultater.
En ny rapport fra Sveits, som undersøker fenomenet med sammenflettet historisk generering i latente diffusjonsmodeller, observerer at AI-rammeverk som er svært dyktige til å lage fotorealistiske bilder likevel foretrekker å avbilde historiske figurer på historiske måter:
![Fra den nye rapporten, diverse representasjoner via LDM av prompten 'Et fotorealistisk bilde av en person som ler med en venn i [den historiske perioden]', med hver periode indikert i hver utdata. Som vi kan se, har mediumet for epoken blitt assosiert med innholdet. Kilde: https://arxiv.org/pdf/2505.17064](https://www.unite.ai/wp-content/uploads/2025/05/laughing-with-a-friend.jpg)
Fra den nye rapporten, diverse representasjoner via LDM av prompten ‘Et fotorealistisk bilde av en person som ler med en venn i [den historiske perioden]’, med hver periode indikert i hver utdata. Som vi kan se, har mediumet for epoken blitt assosiert med innholdet. Kilde: https://arxiv.org/pdf/2505.17064
For prompten ‘Et fotorealistisk bilde av en person som ler med en venn i [den historiske perioden]’, ignorerer en av de tre testede modellene ofte den negative prompten ‘monokrom’ og bruker i stedet fargebehandlinger som reflekterer visuelt medium for den spesifiserte epoken, for eksempel ved å etterligne de dæmpede tonene fra celluloidfilmen fra 1950- og 1970-årene.
I testingen av de tre modellene for deres evne til å lage anakronismer (ting som ikke er fra målperioden, eller ‘ut av tid’ – som kan være fra målperiodens framtid så vel som dens fortid), fant de en generell tendens til å sammenflette tidløse aktiviteter (slik som ‘singing’ eller ‘cooking’) med moderne kontekster og utstyr:

Diverse aktiviteter som er fullstendig gyldige for tidligere århundrer, avbildet med nåværende eller mer nylig teknologi og utstyr, mot ånden av den ønskede bildet.
Det er verdt å merke seg at smarttelefoner er særlig vanskelige å skille fra idiom av fotografi, og fra mange andre historiske kontekster, siden deres utbredelse og avbildning er godt representert i innflytelsesrike hyperskale-datasett som Common Crawl:

I Flux generative tekst-til-bilde-modell, er kommunikasjon og smarttelefoner tett assosiert konsepter – selv når historisk kontekst ikke tillater det.
For å bestemme omfanget av problemet, og for å gi fremtidige forskningsinnsats en måte å gå videre med denne bestemte feilen, utviklet rapportens forfattere en spesialdatasett mot å teste generative systemer. I et øyeblikk, skal vi se på denne nye rapporten, som heter Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models, og kommer fra to forskere ved Universitetet i Zürich. Datasett og kode er offentlig tilgjengelig.
En skjør ‘sannhet’
Noen av temaene i rapporten berører kulturelt sensitive spørsmål, som underrepresentasjon av raser og kjønn i historiske representasjoner. Mens Geminis påtvingelse av rase-lignhet i det grovt ulike Tredje Riket er en absurd og fornærmende historisk revisjon, ville gjenoppretting av ‘tradisjonelle’ rase-representasjoner (der diffusjonsmodellene har ‘oppdatert’ disse) ofte effektivt ‘gjøre historien hvit igjen’.
Mange nylige suksessfulle historiske show, som Bridgerton, blander historisk demografisk nøyaktighet på måter som sannsynligvis vil påvirke fremtidige treningsdatasett, og kompliserer forsøk på å sammenligne LLM-generert periode-bilde med tradisjonelle standarder. Men dette er et komplekst tema, gitt den historiske tendensen av (vestlig) historie til å favorisere rikdom og hvithet, og å la så mange ‘mindre’ historier ufortalt.
Med tanke på disse vanskelige og skiftende kulturelle parameterne, la oss se på forskernes nye tilnærming.
Metode og tester
For å teste hvordan generative modeller tolker historisk kontekst, skapte forfatterne HistVis, en datasett på 30 000 bilder produsert fra hundre prompter som avbildet vanlige menneskelige aktiviteter, hver gjengitt over ti forskjellige tidsperioder:

Et eksempel fra HistVis-datasett, som forfatterne har gjort tilgjengelig på Hugging Face. Kilde: https://huggingface.co/datasets/latentcanon/HistVis
Aktivitetene, som matlaging, bønn eller lytting til musikk, ble valgt for deres universalitet, og formulert på en nøytral måte for å unngå å feste modellen i en bestemt estetikk. Tidsperioder for datasett varierer fra 1600-tallet til i dag, med ekstra fokus på fem enkeltige tiår fra 1900-tallet.
30 000 bilder ble generert ved hjelp av tre vidt brukte åpne diffusjonsmodeller: Stable Diffusion XL; Stable Diffusion 3; og FLUX.1. Ved å isolere tidsperioden som den eneste variabelen, skapte forskerne en strukturert basis for å evaluere hvordan historiske hint er visuelt kodet eller ignorert av disse systemene.
Visuell stil-dominans
Forfatterne undersøkte først om generative modeller som standard bruker bestemte visuelle stiler når de avbilder historiske perioder; fordi det syntes som om selv når promptene ikke inneholdt noen omtale av medium eller estetikk, ville modellene ofte assosiere bestemte århundrer med karakteristiske stiler:
![Forventede visuelle stiler for bilder generert fra prompten “En person som danser med en annen i [den historiske perioden]” (venstre) og fra den modifiserte prompten “Et fotorealistisk bilde av en person som danser med en annen i [den historiske perioden]” med “monokromt bilde” satt som en negativ prompt (høyre).](https://www.unite.ai/wp-content/uploads/2025/05/period-style.jpg)
Forventede visuelle stiler for bilder generert fra prompten ‘En person som danser med en annen i [den historiske perioden]’ (venstre) og fra den modifiserte prompten ‘Et fotorealistisk bilde av en person som danser med en annen i [den historiske perioden]’ med ‘monokromt bilde’ satt som en negativ prompt (høyre).
For å måle denne tendensen, trente forfatterne en convolutional neural network (CNN) for å klassifisere hvert bilde i HistVis-datasett i en av fem kategorier: tegning; gravering; illustrasjon; maleri; eller fotografi. Disse kategoriene var ment å reflektere vanlige mønster som oppstår over tid, og som støtter strukturert sammenligning.
Klassifikatoren var basert på en VGG16-modell forhåndstrener på ImageNet og fine-tuned med 1 500 eksempler per klasse fra et WikiArt-derivert datasett. Ettersom WikiArt ikke skille monokrom fra fargefotografi, ble en separat fargefullhet-score brukt til å merke lav-saturerte bilder som monokrome.
Den trente klassifikatoren ble så brukt på hele datasett, med resultater som viste at alle tre modellene påtvinger konsistente stil-preferanser etter periode: SDXL assosierer 1600- og 1700-tallet med graveringer, mens SD3 og FLUX.1 tenderer mot maleri. I 1900-tallets tiår favoriserer SD3 monokrom fotografi, mens SDXL ofte returnerer moderne illustrasjoner.
Disse preferansene ble funnet å bestå til tross for prompt-justeringer, noe som tyder på at modellene koder innarbeidede lenker mellom stil og historisk kontekst.

Forventede visuelle stiler for genererte bilder over historiske perioder for hver diffusjonsmodell, basert på 1 000 prøver per periode per modell.
For å kvantifisere hvor sterkt en modell kobler en historisk periode til en bestemt visuell stil, utviklet forfatterne en metode de kaller Visuell stil-dominans (VSD). For hver modell og tidsperiode er VSD definert som andelen av utdata som ble forventet å dele den vanligste stilen:

Eksempler på stil-bias over modellene.
En høyere score indikerer at en enkelt stil dominerer utdataene for den perioden, mens en lavere score peker på større variasjon. Dette gjør det mulig å sammenligne hvordan hver modell holder seg til bestemte stil-konvensjoner over tid.
Applikasjon av hele HistVis-datasett avslører VSD-metrikken forskjellige nivåer av konvergens, og hjelper med å klargjøre hvor sterkt hver modell snevrer sin visuelle tolkning av fortiden:

Resultattabellen over viser VSD-poeng over historiske perioder for hver modell. I 1600- og 1700-tallet tenderer SDXL å produsere graveringer med høy konsistens, mens SD3 og FLUX.1 favoriserer maleri. I 1900- og 2000-tallets tiår skifter SD3 og FLUX.1 mot fotografi, mens SDXL viser mer variasjon, men ofte returnerer illustrasjoner.
Alle tre modellene viser en sterk preferanse for monokromt bilde i tidligere tiår av 1900-tallet, spesielt 1910-, 1930- og 1950-årene.
For å teste om disse mønsterene kunne mildnes, brukte forfatterne prompt-engineering, og ba eksplisitt om fotorealisme og diskurerte monokromt utdata ved hjelp av en negativ prompt. I noen tilfeller ble dominans-poengene redusert, og den ledende stilen skiftet, for eksempel fra monokrom til maleri, i 1600- og 1700-tallet.
Men disse inngrepene produserte sjelden genuint fotorealistiske bilder, noe som indikerer at modellenes stil-preferanser er dypt innarbeidet.
Historisk konsistens
Den neste linjen med analyse så på historisk konsistens: om genererte bilder inneholdt objekter som ikke passet til tidsperioden. I stedet for å bruke en fast liste over forbudte elementer, utviklet forfatterne en fleksibel metode som utnyttet store språk- og visuelt-språklige modeller for å spore elementer som syntes å være utenfor plass i den historiske konteksten.
Dette oppdager-metoden fulgte samme format som HistVis-datasett, hvor hver prompt kombinerte en historisk periode med en menneskelig aktivitet. For hver prompt genererte GPT-4o en liste over objekter som ville være utenfor plass i den spesifiserte tidsperioden; og for hvert foreslått objekt produserte GPT-4o et ja-eller-nei-spørsmål designet for å sjekke om det objektet dukket opp i det genererte bildet.
For eksempel, gitt prompten ‘En person som lytter til musikk i 1700-tallet’, kunne GPT-4o identifisere moderne lyd-enheter som historisk uaktuelle, og produsere spørsmålet Bruker personen hodetelefoner eller en smarttelefon som ikke eksisterte i 1700-tallet?.
Disse spørsmålene ble returnert til GPT-4o i en visuell spørsmål-svar-oppsetting, hvor modellen gjennomgikk bildet og returnerte et ja eller nei-svar for hvert. Denne pipeline-tilnærmingen muliggjorde oppdaging av historisk uaktuell innhold uten å stole på noen forhåndsdefinert taksonomi over moderne objekter:

Eksempler på genererte bilder merket av den to-trinns oppdager-metoden, som viser anakronistiske elementer: hodetelefoner i 1700-tallet; en støvsuger i 1800-tallet; en bærbar datamaskin i 1930-årene; og en smarttelefon i 1950-årene.
For å måle hvor ofte anakronismer dukket opp i de genererte bildene, innførte forfatterne en enkel metode for å score frekvens og alvorlighet. Først tok de hensyn til mindre ordvalg-forskjeller i hvordan GPT-4o beskrev det samme objektet.
For eksempel ble moderne lyd-enhet og digital lyd-enhet behandlet som ekvivalente. For å unngå dobbelt-telling, ble et fuzzy-matching-system brukt til å gruppere disse overflatenivå-forskjellene uten å påvirke genuint distinkte konsepter.
Når alle foreslåtte anakronismer var normalisert, ble to målinger beregnet: frekvens målte hvor ofte et gitt objekt dukket opp i bilder for en bestemt tidsperiode og modell; og alvorlighet målte hvor pålitelig det objektet dukket opp en gang det hadde blitt foreslått av modellen.
Hvis en moderne telefon ble merket ti ganger og dukket opp i ti genererte bilder, fikk den en alvorlighets-score på 1,0. Hvis den dukket opp i bare fem, var alvorlighets-scoren 0,5. Disse poengene hjalp med å identifisere ikke bare om anakronismer forekom, men også hvor fast de var innlejret i modellens utdata for hver periode:

Topp femten anakronistiske elementer for hver modell, plottet etter frekvens på x-aksen og alvorlighet på y-aksen. Sirkler markerer elementer rangert i topp femten etter frekvens, trekanter etter alvorlighet, og diamanter etter begge.
Ovenfor ser vi de femten mest vanlige anakronismene for hver modell, rangert etter hvor ofte de dukket opp og hvor konsekvent de matchet promptene.
Klede var hyppige men spredte, mens objekter som lyd-enheter og stryke-utstyr dukket opp mindre ofte, men med høy konsekvens – mønster som tyder på at modellene ofte reagerer mer på aktiviteten i prompten enn på tidsperioden.
SD3 viste den høyeste raten av anakronismer, spesielt i 1800-tallets og 1930-årenes bilder, etterfulgt av FLUX.1 og SDXL.
For å teste hvor godt oppdager-metoden matchet menneskelig dømmekraft, kjørte forfatterne en bruker-undersøkelse med 1 800 tilfeldig utvalgte bilder fra SD3 (modellen med den høyeste anakronisme-raten), hvor hvert bilde ble vurdert av tre crowd-workers. Etter å ha filtrert for pålitelige svar, ble 2 040 vurderinger fra 234 brukere inkludert, og metoden var enig med flertallsavgjørelsen i 72 prosent av tilfellene.

GUI for den menneskelige evaluering-undersøkelsen, som viser oppgave-instruksjoner, eksempler på nøyaktige og anakronistiske bilder, og ja-nei-spørsmål for å identifisere temporale inkonsistenser i genererte utdata.
Demografi
Den siste analysen så på hvordan modellene avbilder rase og kjønn over tid. Ved hjelp av HistVis-datasett, sammenlignet forfatterne modell-utdata med baseline-estimater generert av en språkmodell. Disse estimatene var ikke nøyaktige, men ga en omtrentlig forestilling av historisk plausibilitet, og hjalp med å avsløre om modellene tilpasset avbildninger til den ønskede perioden.
For å vurdere disse avbildningene i større skala, bygde forfatterne en pipeline som sammenlignet modell-genererte demografi med røffe forventninger for hver tid og aktivitet. De brukte først FairFace-klassifikatoren, et ResNet34-basert verktøy trent på over 100 000 bilder, for å detektere kjønn og rase i de genererte utdataene, og muliggjorde måling av hvor ofte ansikter i hver scene ble klassifisert som mann eller kvinne, og for å spore rase-kategorier over perioder.

Eksempler på genererte bilder som viser demografisk overrepresentasjon over modeller, tidsperioder og aktiviteter.
Lav-konfidens-resultater ble filtrert ut for å redusere støy, og prediksjoner ble gjennomsnittlig over alle bilder knyttet til en bestemt tid og aktivitet. For å sjekke påliteligheten av FairFace-lesningene, ble et annet system basert på DeepFace brukt på en stikkprøve av 5 000 bilder. De to klassifikatorene viste sterk enighet, og støttet konsistensen av de demografiske lesningene brukt i studien.
For å sammenligne modell-utdata med historisk plausibilitet, ba forfatterne GPT-4o om å estimere den forventede kjønn- og rase-fordelingen for hver aktivitet og tidsperiode. Disse estimatene tjente som røffe baseline-estimater heller enn grunn-sannhet. To målinger ble brukt: underrepresentasjon og overrepresentasjon, som målte hvor mye modellens utdata avvik fra LLM-estimater.
Resultatene viste tydelige mønster: FLUX.1 overrepresenterte ofte menn, selv i scenarier som matlaging, hvor kvinner var forventet; SD3 og SDXL viste lignende trender over kategorier som arbeid, utdanning og religion; hvite ansikter dukket opp mer enn forventet totalt, selv om denne biasen avtok i nyere perioder; og noen kategorier viste uventede topp i ikke-hvit-representasjon, noe som tyder på at modell-atferd kan reflektere datasett-korrelasjoner heller enn historisk kontekst:

Kjønn og rase-overrepresentasjon og underrepresentasjon i FLUX.1-utdata over århundrer og aktiviteter, vist som absolutt forskjeller fra GPT-4o-demografi-estimater.
Forfatterne konkluderer:
‘Vår analyse avslører at [Tekst-til-bilde/TTI]-modeller avhenger av begrensede stil-kodinger heller enn nøyaktige forståelser av historiske perioder. Hver epoke er sterkt knyttet til en bestemt visuell stil, noe som resulterer i en-dimensjonale avbildninger av historien.
‘Merkbart er at fotorealistiske avbildninger av mennesker bare dukker opp fra 1900-tallet og utover, med bare sjeldne unntak i FLUX.1 og SD3, noe som tyder på at modellene forsterker lært assosiasjoner heller enn å tilpasse seg historiske kontekster fleksibelt, og videreforsterker forestillingen om at realisme er en moderne egenskap.
‘I tillegg viser hyppige anakronismer at historiske perioder ikke er renset skilt i de latente rommene til disse modellene, ettersom moderne artefakter ofte dukker opp i før-moderne sammenhenger, og undergraver påliteligheten av TTI-systemer i utdannings- og kulturarv-sammenhenger.’
Konklusjon
Under trening av en diffusjonsmodell, bosetter nye konsepter seg ikke nøyaktig i forhåndsdefinerte plasser i det latente rommet. I stedet danner de kluster formet av hvor ofte de opptrer og av deres nærhet til relaterte ideer. Resultatet er en løst organisert struktur hvor konsepter eksisterer i forhold til deres frekvens og typisk kontekst, heller enn noen ren eller empirisk skille.
Dette gjør det vanskelig å isolere hva som teller som ‘historisk’ i et stort, generelt datasett. Som funnene i den nye rapporten antyder, blir mange tidsperioder representert mer av utseendet på mediet som brukes til å avbilde dem, enn av noen dypere historisk detalj.
Dette er en årsak til at det fortsatt er vanskelig å generere et 2025-kvalitets fotorealistisk bilde av en karakter fra (for eksempel) 1800-tallet; i de fleste tilfeller vil modellen avhenge av visuelle tropier hentet fra film og fjernsyn. Når disse ikke matcher forespørselen, er det lite annet i dataene som kan kompensere. Å lukke denne gapen vil sannsynligvis avhenge av fremtidige forbedringer i å skille overlappende konsepter.
Først publisert mandag, 26. mai 2025












