Andersons vinkel
AI-modellers ‘kreative’ output blir stadig mer lik på tvers av leverandører

Ny forskning antyder at AI-modeller fra rivaliserende selskaper blir mer like i sine kreative svar, noe som potensielt innsnevrer rekkevidden av ideer brukerne støter på.
Ny forskning fra USA har funnet at ‘kreativt’ output på tvers av et bredt spekter av ledende AI-modeller blir stadig mer lik over tid.
Forfatterne, fra Duke University, testet 69 modeller fra 12 leverandørfamilier, med utgivelser fra 2023 til 2026, og fant en statistisk signifikant nedgang i output‑mangfold både på virkelige, åpne spørsmål og på en standard kreativitetstest – noe som tyder på at lignende ideer kan bli tilbudt som svar på ‘kreative’ forespørsler, i økende grad, blant alle de store LLM‑leverandørene.
De testede leverandørfamiliene var Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; og Z.ai*:

Fra den nye artikkelen – modellutgivelser som ble brukt i studien, fra mars 2023 til juli 2026. Diagrammet viser 69 modellversjoner fra 12 AI‑leverandører, demonstrerer hvordan de testede modellene var fordelt over tre‑årsperioden, og viser stadig hyppigere utgivelsesplaner for noen leverandører, noe som må tas med i forfatternes beregninger. Source
Forfatterne av den nye artikkelen uttaler**:
‘Vi finner at LLM‑svar på de åpne oppfordringene vi [tester] har blitt stadig mer like over tid.’
‘Dette antyder at LLM‑er blir mindre kreative i oppgaver som innebærer å generere åpne svar, og krever kritisk vurdering av deres langsiktige nytte som kreative assistenter.’
Selv om ‘algoritmisk monokultur’ har blitt en etablert forskningslinje, har en systematisk undersøkelse av tendensen mot homogenitet i AI‑genererte kreative output‑resultater ikke blitt gjort før nå, hevder forfatterne.
Likevel har enkelte isolerte hendelser pekt på denne konvergensen en stund, inkludert det merkelige tilfellet beskrevet i Cornell Universitys studie fra mai 20026, hvor et mangfoldig spekter av LLM‑leverandører ble vist å ha underlige, kolliderende besettelser av ‘fyrvoktere’, samt en spesiell samling anachronistiske navn, inkludert ‘Mara’ og ‘Elias’:

I mai fant Cornell Universitys nye artikkel merkelige likheter på tvers av LLM‑leverandører når de fikk ‘åpne oppfordringer’ – selv om ingen forklaringer på hvorfor dette oppstår har blitt tydelige i de varierte treningsdataene som driver modellene.
Den nye studien er mer systematisk: forfatterne testet tre år med modeller mot både virkelige kreative oppfordringer og en klassisk psykologitest som etterspør uvanlige bruksområder for hverdagslige objekter. Deretter målte de hvor langt apart modellenes svar var i betydning, og sporet om disse avstandene krympet over påfølgende generasjoner.
Forfatterne av det nye arbeidet, med tittelen Are LLMs becoming similarly creative? Evidence from three years of models, uttaler†:
‘Våre funn, selv om de er foreløpige, reiser bekymringer om LLM‑ers langsiktige nytte som kreative partnere. Selv om modeller presterer godt på kreative oppgaver, kan konvergerende output innskrenke rekkevidden av muligheter brukerne eksponeres for, og dermed begrense bredden i deres egen tenkning.’
‘Hvis bruk av en LLM for kreative oppgaver som essay‑skriving reduserer hjerneaktiviteten, kan bruk av stadig mindre kreative LLM‑er – trenden vår studie antyder – forverre LLM‑ers påvirkning på menneskelig kreativitet, slik dette og andre studier har observert?’
Allerede har de mangfoldige egenskapene ved LLM‑tekstoutput blitt stoff til memer; og, som vi rapporterte i mai i år, har minst én forfatter allerede selvpublisert en bok som tilsynelatende inneholder den nevnte ‘fyrvokter‑fikseringen’ som er vanlig blant de store modellene.
Så, i et klima hvor forlag i økende grad trekker tilbake bøker de mistenker er AI‑skrevne eller AI‑assistert, vil den nye forskningen synes å indikere at vi kan forvente en økning i ‘plott‑sammenfall’ som oppstår i tilsynelatende menneskeskrevne verk, inkludert akademiske arbeider innlevert av studenter.
Når det gjelder hvor denne konvergensen kommer fra, antar forfatterne at overlappende treningsdata og stadig liknende optimaliseringsmål kan presse modellene mot sammenlignbare interne representasjoner av konsepter og semantiske relasjoner – som til slutt produserer mer like svar†:
‘[Det] er fortsatt uklart om denne homogeniteten er et midlertidig biprodukt av en fremdeles underutviklet teknologi eller en uunngåelig – potensielt forsterkende – egenskap ved statistiske språkmodeller.’
‘Tilknyttelige krefter peker i begge retninger. En voksende mengde akademisk arbeid antyder at generative modeller trent på overlappende data og optimalisert mot lignende mål vil organisere konsepter og semantiske relasjoner på stadig like måter, noe som resulterer i like output‑resultater.’
Forfatterne peker imidlertid også på arbeid som indikerer at etter hvert som modeller utvikler seg, kan de igjen divergere inn i sine egne, avgrensede karakteristikker når det gjelder kreativ output.
Method
For å spore om AI‑modeller blir mer like, begynte forskerne med åpne spørsmål og samlet svar fra påfølgende generasjoner av modeller. Hvert svar ble konvertert til en numerisk representasjon av sin betydning, noe som gjorde det mulig å måle hvor like eller ulike svarene var.
Regresjonsanalyse ble deretter brukt til å fastslå om disse forskjellene krympet etter hvert som nyere modeller ble lansert:

Forfatternes skjema for å måle om AI‑output blir mer lik over tid. Åpne, kreative oppfordringer ble kjørt på tvers av ulike modellfamilier, deres svar kartlagt etter mening for å måle avstanden mellom dem, med regresjonsanalyse som sporer hvordan disse avstandene endrer seg over påfølgende modellgenerasjoner.
To sett med oppfordringer ble valgt for å teste kreativitet fra ulike vinkler. Først, Alternate Uses Task (AUT), en standard psykologitest for divergent tenkning, ber om ukonvensjonelle bruksområder for vanlige objekter, og studien brukte objekter som en bok, en sko og en hammer. Dens faste format ga en kontrollert måte å sammenligne idéene generert av ulike modeller.
Ytterligere 100 oppfordringer ble destillert fra Infinity-Chat100, en samling avledet fra virkelige samtaler med språkmodeller. Disse dekket mindre begrensede kreative oppgaver som innholds‑generering, problemløsning, idémyldring og idéutvikling; oppgaver som tillot større frihet i svarene og tilnærmingene.
De komplette AUT‑ og Infinity-Chat100‑oppfordringssettene ble deretter sendt til modeller som ble sluppet mellom mars 2023 og juli 2026, fra 12 leverandører og systemer fra Anthropic, Google, Meta, OpenAI, DeepSeek og Mistral AI. Alle svar ble samlet via OpenRouter‑API‑en med identiske sampling‑innstillinger, med temperatur (frihet til å svare kreativt) og top‑p begge satt til én.
Modellene ble ordnet etter utgivelsesmåned for å undersøke om nyere generasjoner produserte mer like svar.
Ettersom utgivelsesdatoer ikke egentlig fanger endringer i treningsdata, arkitektur eller etter‑trening, behandlet forfatterne den observerte trenden som en assosiasjon med modellutvikling, snarere enn bevis på at selve tidsforløpet forårsaker konvergens.
Modellenes svar ble deretter konvertert til innbygginger ved hjelp av all‑MiniLM‑L6‑v2 setning‑transformer. Hvert svar ble representert som en numerisk vektor, slik at svar med lignende betydning kunne plasseres i lignende retninger, og deres semantiske avstand kunne måles.
For AUT ble alle bruksforslag for hvert objekt behandlet som ett enkelt svar, og produserte ti innbygginger per modell. For Infinity-Chat100 ble hvert svar innbygd separat, og ga 100 innbygginger per modell.
De 27 utgivelsesmånedene ble gruppert i ni tidsperioder, og kun modeller fra ulike leverandører ble sammenlignet. Semantiske avstander mellom deres svar ble målt innenfor hver periode, der mindre avstand indikerer større likhet.
For å hindre leverandører med flere modeller fra å dominere resultatene, ble analysen gjentatt 1 000 ganger, med balanserte prøver fra hver leverandør.
Results
Lineær regresjon ble så brukt til å spore disse avstandene over tid, med en konsistent negativ helning som indikerer at modeller fra ulike leverandører ble mer like:

Første testresultater som viser om kreative svar fra ulike AI‑leverandører ble mer like over tid. Semantiske avstander falt både for Alternate Uses Task‑ og Infinity-Chat100‑oppfordringene, mens gjentatte balanserte prøver ga konsekvent negative trender, noe som indikerer økende likhet på tvers av modellgenerasjoner.
Av disse resultatene fremhever forfatterne:
‘For både AUT‑ og Infinity‑Chat‑svarsettene observerer vi en nedgang i tverr‑leverandør‑output‑avstander over observasjonsperioden.’
‘Dette tyder på en synkende mangfoldighet – eller økende homogenitet – av LLM‑ers kreative output over tid.’
Forskjellen mellom eldre og nyere modeller var tydeligst i Alternate Uses Task. Gjennomsnittlig avstand mellom svar fra ulike leverandører falt fra omtrent 0,50 for de tidligste modellene til under 0,40 for de nyeste, noe som betyr at svarene deres ble betydelig mer like. Det samme mønsteret ble funnet med Infinity‑Chat100, selv om endringen var mindre, med gjennomsnittlig avstand som falt fra omtrent 0,34 til litt over 0,32.

Testresultater som måler hvor raskt svar fra de ulike AI‑leverandørene ble mer like over tid. ‘Alternate Uses‑oppgaven’ viste en langt sterkere nedgang i forskjeller mellom modeller enn Infinity‑Chat, med begge resultatene stabile gjennom forskernes gjentatte prøvetakinger.
Funnet holdt også i alle 1 000 rundene med balansert resampling. I hvert tilfelle produserte nyere modeller svar som var nærmere hverandre enn de fra eldre modeller. Størrelsen på disse nedgangene, sammen med forskernes 95 % konfidensintervaller, er avbildet ovenfor.
Om dette sier papiret:
‘Omfanget av AUT‑nedgangen er spesielt bemerkelsesverdig gitt oppgavens hensikt. AUT tester eksplisitt divergent tenkning ved å instruere modeller til å produsere bruksområder som er så originale og uventede som mulig, og dette er nettopp situasjonen hvor output‑ene ville blitt forventet å avvike.’
Infinity‑Chat‑resultatene viser at samme trend også dukket opp over et mye bredere spekter av kreative oppgaver. De 100 oppfordringene ba modellene om å generere mange ulike typer åpne svar, og disse svarene ble mer like over tid.
Endringen var mindre enn i Alternate Uses‑oppgaven, men ble tydeligere blant modeller sluppet fra 2025 og fremover. Forfatterne antyder at dette kan være et tidlig tegn på at kreative output fra ulike AI‑leverandører blir mer like generelt, snarere enn kun på én spesiell testtype.
Conclusion
Problemstillinger rundt konvergens mellom LLM‑er og VLM‑er er en pågående og voksende kilde til bekymring både i forskningsmiljøet og blant brukerne av nedstrømsmodeller. Vi nærmer oss slutten av den første og eneste ‘rene’ generasjonen av data som forskningsfeltet noen gang vil ha tilgang til; og besluttsomheten til modellleverandører om å eksfiltrere rivalers data medfører uunngåelig risiko for konvergens, siden dataene blir identiske, og prinsippene for modelltrening er like, om ikke identiske, blant leverandørene.
Derfor er ingenting så enkelt som å erstatte em‑strekene sannsynlig å dukke opp for å bekjempe den økende likheten i kreativ output blant modellfamiliene, og tilfeller av duplisering vil i stedet sannsynligvis komme frem i mer offentlige og pinlige former.
* Den komplette modelllisten er Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; og GLM-5.2
** Forfatternes fremhevelser, ikke mine.
† Min konvertering av forfatternes inline‑sitat til hyperkoblinger.
Første publisert fredag 21. august 2026












