Andersons vinkel

AI-modellers ‘kreative’ output blir stadig mer lik på tvers av leverandører

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Ny forskning antyder at AI-modeller fra rivaliserende selskaper blir mer like i sine kreative svar, noe som potensielt innsnevrer rekkevidden av ideer brukerne støter på.

 

Ny forskning fra USA har funnet at ‘kreativt’ output på tvers av et bredt spekter av ledende AI-modeller blir stadig mer lik over tid.

Forfatterne, fra Duke University, testet 69 modeller fra 12 leverandørfamilier, med utgivelser fra 2023 til 2026, og fant en statistisk signifikant nedgang i output‑mangfold både på virkelige, åpne spørsmål og på en standard kreativitetstest – noe som tyder på at lignende ideer kan bli tilbudt som svar på ‘kreative’ forespørsler, i økende grad, blant alle de store LLM‑leverandørene.

De testede leverandørfamiliene var Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; og Z.ai*:

From the new paper - model releases used in the study, from mars 2023 to juli 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Fra den nye artikkelen – modellutgivelser som ble brukt i studien, fra mars 2023 til juli 2026. Diagrammet viser 69 modellversjoner fra 12 AI‑leverandører, demonstrerer hvordan de testede modellene var fordelt over tre‑årsperioden, og viser stadig hyppigere utgivelsesplaner for noen leverandører, noe som må tas med i forfatternes beregninger. Source

Forfatterne av den nye artikkelen uttaler**:

‘Vi finner at LLM‑svar på de åpne oppfordringene vi [tester] har blitt stadig mer like over tid.’

‘Dette antyder at LLM‑er blir mindre kreative i oppgaver som innebærer å generere åpne svar, og krever kritisk vurdering av deres langsiktige nytte som kreative assistenter.’

Selv om ‘algoritmisk monokultur’ har blitt en etablert forskningslinje, har en systematisk undersøkelse av tendensen mot homogenitet i AI‑genererte kreative output‑resultater ikke blitt gjort før nå, hevder forfatterne.

Likevel har enkelte isolerte hendelser pekt på denne konvergensen en stund, inkludert det merkelige tilfellet beskrevet i Cornell Universitys studie fra mai 20026, hvor et mangfoldig spekter av LLM‑leverandører ble vist å ha underlige, kolliderende besettelser av ‘fyrvoktere’, samt en spesiell samling anachronistiske navn, inkludert ‘Mara’ og ‘Elias’:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

I mai fant Cornell Universitys nye artikkel merkelige likheter på tvers av LLM‑leverandører når de fikk ‘åpne oppfordringer’ – selv om ingen forklaringer på hvorfor dette oppstår har blitt tydelige i de varierte treningsdataene som driver modellene.

Den nye studien er mer systematisk: forfatterne testet tre år med modeller mot både virkelige kreative oppfordringer og en klassisk psykologitest som etterspør uvanlige bruksområder for hverdagslige objekter. Deretter målte de hvor langt apart modellenes svar var i betydning, og sporet om disse avstandene krympet over påfølgende generasjoner.

Forfatterne av det nye arbeidet, med tittelen Are LLMs becoming similarly creative? Evidence from three years of models, uttaler:

‘Våre funn, selv om de er foreløpige, reiser bekymringer om LLM‑ers langsiktige nytte som kreative partnere. Selv om modeller presterer godt på kreative oppgaver, kan konvergerende output innskrenke rekkevidden av muligheter brukerne eksponeres for, og dermed begrense bredden i deres egen tenkning.’

‘Hvis bruk av en LLM for kreative oppgaver som essay‑skriving reduserer hjerneaktiviteten, kan bruk av stadig mindre kreative LLM‑er – trenden vår studie antyder – forverre LLM‑ers påvirkning på menneskelig kreativitet, slik dette og andre studier har observert?’

Allerede har de mangfoldige egenskapene ved LLM‑tekstoutput blitt stoff til memer; og, som vi rapporterte i mai i år, har minst én forfatter allerede selvpublisert en bok som tilsynelatende inneholder den nevnte ‘fyrvokter‑fikseringen’ som er vanlig blant de store modellene.

Så, i et klima hvor forlag i økende grad trekker tilbake bøker de mistenker er AI‑skrevne eller AI‑assistert, vil den nye forskningen synes å indikere at vi kan forvente en økning i ‘plott‑sammenfall’ som oppstår i tilsynelatende menneskeskrevne verk, inkludert akademiske arbeider innlevert av studenter.

Når det gjelder hvor denne konvergensen kommer fra, antar forfatterne at overlappende treningsdata og stadig liknende optimaliseringsmål kan presse modellene mot sammenlignbare interne representasjoner av konsepter og semantiske relasjoner – som til slutt produserer mer like svar:

‘[Det] er fortsatt uklart om denne homogeniteten er et midlertidig biprodukt av en fremdeles underutviklet teknologi eller en uunngåelig – potensielt forsterkende – egenskap ved statistiske språkmodeller.’

‘Tilknyttelige krefter peker i begge retninger. En voksende mengde akademisk arbeid antyder at generative modeller trent på overlappende data og optimalisert mot lignende mål vil organisere konsepter og semantiske relasjoner stadig like måter, noe som resulterer i like output‑resultater.’

Forfatterne peker imidlertid også på arbeid som indikerer at etter hvert som modeller utvikler seg, kan de igjen divergere inn i sine egne, avgrensede karakteristikker når det gjelder kreativ output.

Method

For å spore om AI‑modeller blir mer like, begynte forskerne med åpne spørsmål og samlet svar fra påfølgende generasjoner av modeller. Hvert svar ble konvertert til en numerisk representasjon av sin betydning, noe som gjorde det mulig å måle hvor like eller ulike svarene var.

Regresjonsanalyse ble deretter brukt til å fastslå om disse forskjellene krympet etter hvert som nyere modeller ble lansert:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Forfatternes skjema for å måle om AI‑output blir mer lik over tid. Åpne, kreative oppfordringer ble kjørt på tvers av ulike modellfamilier, deres svar kartlagt etter mening for å måle avstanden mellom dem, med regresjonsanalyse som sporer hvordan disse avstandene endrer seg over påfølgende modellgenerasjoner.

To sett med oppfordringer ble valgt for å teste kreativitet fra ulike vinkler. Først, Alternate Uses Task (AUT), en standard psykologitest for divergent tenkning, ber om ukonvensjonelle bruksområder for vanlige objekter, og studien brukte objekter som en bok, en sko og en hammer. Dens faste format ga en kontrollert måte å sammenligne idéene generert av ulike modeller.

Ytterligere 100 oppfordringer ble destillert fra Infinity-Chat100, en samling avledet fra virkelige samtaler med språkmodeller. Disse dekket mindre begrensede kreative oppgaver som innholds‑generering, problemløsning, idémyldring og idéutvikling; oppgaver som tillot større frihet i svarene og tilnærmingene.

De komplette AUT‑ og Infinity-Chat100‑oppfordringssettene ble deretter sendt til modeller som ble sluppet mellom mars 2023 og juli 2026, fra 12 leverandører og systemer fra Anthropic, Google, Meta, OpenAI, DeepSeek og Mistral AI. Alle svar ble samlet via OpenRouter‑API‑en med identiske sampling‑innstillinger, med temperatur (frihet til å svare kreativt) og top‑p begge satt til én.

Modellene ble ordnet etter utgivelsesmåned for å undersøke om nyere generasjoner produserte mer like svar.

Ettersom utgivelsesdatoer ikke egentlig fanger endringer i treningsdata, arkitektur eller etter‑trening, behandlet forfatterne den observerte trenden som en assosiasjon med modellutvikling, snarere enn bevis på at selve tidsforløpet forårsaker konvergens.

Modellenes svar ble deretter konvertert til innbygginger ved hjelp av all‑MiniLM‑L6‑v2 setning‑transformer. Hvert svar ble representert som en numerisk vektor, slik at svar med lignende betydning kunne plasseres i lignende retninger, og deres semantiske avstand kunne måles.

For AUT ble alle bruksforslag for hvert objekt behandlet som ett enkelt svar, og produserte ti innbygginger per modell. For Infinity-Chat100 ble hvert svar innbygd separat, og ga 100 innbygginger per modell.

De 27 utgivelsesmånedene ble gruppert i ni tidsperioder, og kun modeller fra ulike leverandører ble sammenlignet. Semantiske avstander mellom deres svar ble målt innenfor hver periode, der mindre avstand indikerer større likhet.

For å hindre leverandører med flere modeller fra å dominere resultatene, ble analysen gjentatt 1 000 ganger, med balanserte prøver fra hver leverandør.

Results

Lineær regresjon ble så brukt til å spore disse avstandene over tid, med en konsistent negativ helning som indikerer at modeller fra ulike leverandører ble mer like:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Første testresultater som viser om kreative svar fra ulike AI‑leverandører ble mer like over tid. Semantiske avstander falt både for Alternate Uses Task‑ og Infinity-Chat100‑oppfordringene, mens gjentatte balanserte prøver ga konsekvent negative trender, noe som indikerer økende likhet på tvers av modellgenerasjoner.

Av disse resultatene fremhever forfatterne:

‘For både AUT‑ og Infinity‑Chat‑svarsettene observerer vi en nedgang i tverr‑leverandør‑output‑avstander over observasjonsperioden.’

‘Dette tyder på en synkende mangfoldighet – eller økende homogenitet – av LLM‑ers kreative output over tid.’

Forskjellen mellom eldre og nyere modeller var tydeligst i Alternate Uses Task. Gjennomsnittlig avstand mellom svar fra ulike leverandører falt fra omtrent 0,50 for de tidligste modellene til under 0,40 for de nyeste, noe som betyr at svarene deres ble betydelig mer like. Det samme mønsteret ble funnet med Infinity‑Chat100, selv om endringen var mindre, med gjennomsnittlig avstand som falt fra omtrent 0,34 til litt over 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Testresultater som måler hvor raskt svar fra de ulike AI‑leverandørene ble mer like over tid. ‘Alternate Uses‑oppgaven’ viste en langt sterkere nedgang i forskjeller mellom modeller enn Infinity‑Chat, med begge resultatene stabile gjennom forskernes gjentatte prøvetakinger.

Funnet holdt også i alle 1 000 rundene med balansert resampling. I hvert tilfelle produserte nyere modeller svar som var nærmere hverandre enn de fra eldre modeller. Størrelsen på disse nedgangene, sammen med forskernes 95 % konfidensintervaller, er avbildet ovenfor.

Om dette sier papiret:

‘Omfanget av AUT‑nedgangen er spesielt bemerkelsesverdig gitt oppgavens hensikt. AUT tester eksplisitt divergent tenkning ved å instruere modeller til å produsere bruksområder som er så originale og uventede som mulig, og dette er nettopp situasjonen hvor output‑ene ville blitt forventet å avvike.’

Infinity‑Chat‑resultatene viser at samme trend også dukket opp over et mye bredere spekter av kreative oppgaver. De 100 oppfordringene ba modellene om å generere mange ulike typer åpne svar, og disse svarene ble mer like over tid.

Endringen var mindre enn i Alternate Uses‑oppgaven, men ble tydeligere blant modeller sluppet fra 2025 og fremover. Forfatterne antyder at dette kan være et tidlig tegn på at kreative output fra ulike AI‑leverandører blir mer like generelt, snarere enn kun på én spesiell testtype.

Conclusion

Problemstillinger rundt konvergens mellom LLM‑er og VLM‑er er en pågående og voksende kilde til bekymring både i forskningsmiljøet og blant brukerne av nedstrømsmodeller. Vi nærmer oss slutten av den første og eneste ‘rene’ generasjonen av data som forskningsfeltet noen gang vil ha tilgang til; og besluttsomheten til modellleverandører om å eksfiltrere rivalers data medfører uunngåelig risiko for konvergens, siden dataene blir identiske, og prinsippene for modelltrening er like, om ikke identiske, blant leverandørene.

Derfor er ingenting så enkelt som å erstatte em‑strekene sannsynlig å dukke opp for å bekjempe den økende likheten i kreativ output blant modellfamiliene, og tilfeller av duplisering vil i stedet sannsynligvis komme frem i mer offentlige og pinlige former.

 

* Den komplette modelllisten er Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; og GLM-5.2

** Forfatternes fremhevelser, ikke mine.

Min konvertering av forfatternes inline‑sitat til hyperkoblinger.

Første publisert fredag 21. august 2026

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai