Andersons vinkel
AI-modellers ’kreativa’ resultat blir mer lika bland leverantörer

Ny forskning tyder på att AI-modeller från konkurrerande företag blir mer lika i sina kreativa svar, vilket potentiellt kan begränsa det idéutbud som användare möter.
Ny forskning från USA har funnit att den ’kreativa’ outputen från ett brett spektrum av ledande AI-modeller blir mer likartad över tid.
Författarna, från Duke University, testade 69 modeller från 12 leverantörsfamiljer, med versioner från 2023 till 2026, och fann en statistiskt signifikant minskning av outputens mångfald både för verkliga öppna frågor och ett standardiserat kreativitetstest – vilket tyder på att liknande idéer kan erbjudas som svar på ’kreativa’ förfrågningar, i allt högre grad, bland alla större LLM‑leverantörer.
De testade leverantörsfamiljerna var Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; och Z.ai*:

Från den nya artikeln – modellutgåvor som användes i studien, från mars 2023 till juli 2026. Diagrammet täcker 69 modellversioner från 12 AI‑leverantörer och visar hur de testade modellerna fördelades över den treårsperioden samt hur vissa leverantörers utgivningsschema blev allt tätare, vilket måste beaktas i författarnas beräkningar. Source
Författarna till den nya artikeln konstaterar**:
’Vi finner att LLM‑svaren på de öppna promptarna vi [testar] har blivit alltmer lika över tid.’
’Detta tyder på att LLM‑erna blir mindre kreativa i uppgifter som innebär att generera öppna svar, vilket kräver granskning av deras långsiktiga nytta som kreativa assistenter.’
Även om ’algorithmic monoculture’ har blivit en etablerad forskningslinje, har en undersökning av trenden mot homogenitet i AI‑genererade kreativa outputar inte genomförts förrän nu, menar författarna.
Isolerade incidenter har dock pekat på denna konvergens under en tid, inklusive det märkliga fallet som beskrivs i Cornell Universities maj‑20026‑studie, där ett brett spektrum av LLM‑leverantörer visade märkliga, kolliderande besattheter kring ’fyrvaktare’ och ett särskilt urval av anachronistiska namn, bland annat ’Mara’ och ’Elias’:

I maj fann Cornell Universities nya artikel märkliga likheter mellan LLM‑leverantörer när de fick ’öppna promptar’ – men inga ledtrådar till varför har ännu framkommit i den mångsidiga träningsdata som driver modellerna.
Den nya studien är mer systematisk: författarna testade tre år av modeller mot både verkliga kreativa promptar och ett klassiskt psykologiskt test som ber om ovanliga användningar för vardagsföremål. De mätte sedan hur långt ifrån varandra modellernas svar var i betydelse och spårade om dessa avstånd minskade över successive generationer.
Författarna till det nya arbetet, med titeln Are LLMs becoming similarly creative? Evidence from three years of models, påpekar†:
’Våra preliminära fynd väcker oro för LLM‑ernas långsiktiga nytta som kreativa partners. Även om modeller presterar bra på kreativa uppgifter, kan konvergerande output begränsa det utbud av möjligheter som LLM‑användare exponeras för, och därmed minska bredden i deras eget tänkande.’
’Om en LLM används för kreativa uppgifter som uppsatsskrivning minskar hjärnaktiviteten, kan användning av allt mindre kreativa LLM‑er – trenden som vår studie föreslår – ytterligare förvärra LLM‑ernas påverkan på mänsklig kreativitet, enligt denna och andra studier?’
Redan har de mångfacetterade egenskaperna i LLM‑textoutput blivit fodral för memes; och, som vi rapporterade i maj i år, har minst en författare redan självpublicerat en bok som tydligen innehåller den ovan nämnda ’fyr‑fixeringen’ som är gemensam för de stora modellerna.
Så, i ett klimat där förlag i allt högre grad drar tillbaka böcker som de misstänker är AI‑skrivna eller AI‑stöttade, skulle den nya forskningen kunna indikera att vi kan förvänta oss en ökning av ’plot‑sammanträffanden’ i till synes mänskligt skrivna verk, inklusive akademiska arbeten som lämnas in av studenter.
När det gäller var konvergensen kommer ifrån, hypoteserar författarna att överlappande träningsdata och allt mer likartade optimeringsmål kan driva modeller mot jämförbara interna representationer av begrepp och semantiska relationer – vilket i slutändan ger mer likartade svar†:
’[Det] är fortfarande oklart om denna homogenitet är ett tillfälligt biprodukt av en fortfarande under utveckling stående teknik eller en oundviklig – potentiellt förstärkande – egenskap hos statistiska språkmodeller.’
’Tänkbara krafter pekar i båda riktningarna. En växande mängd akademisk litteratur antyder att generativa modeller som tränas på överlappande data och optimeras mot likartade mål kommer att organisera begrepp och semantiska relationer i allt mer likartade sätt, vilket resulterar i likartade outputar.’
Författarna hänvisar dock också till arbete som visar att när modeller utvecklas kan de återigen divergera till egna, avgränsade egenskaper vad gäller kreativ output.
Metod
För att spåra om AI‑modeller blir mer lika började forskarna med öppna frågor och samlade svar från successiva modellgenerationer. Varje svar konverterades till en numerisk representation av dess betydelse, vilket möjliggjorde mätning av hur lika eller olika svaren var.
Regression-analys användes sedan för att fastställa om dessa skillnader minskade när nyare modeller släpptes:
Författarnas schema för att mäta om AI‑output blir mer likartad över tid. Öppna kreativa promptar kördes över olika modellfamiljer, deras svar kartlades efter betydelse för att mäta avståndet mellan dem, och regression analyserade hur dessa avstånd förändrades över successiva modellgenerationer.
Två uppsättningar av promptar valdes för att testa kreativitet ur olika vinklar. Först, Alternate Uses Task (AUT), ett standardiserat psykologiskt test för divergent tänkande, ber om okonventionella användningar för vanliga föremål, där studien använde objekt som en bok, sko och hammare. Dess fasta format gav ett kontrollerat sätt att jämföra idéerna som producerades av olika modeller.
Ytterligare 100 promptar destillerades från Infinity-Chat100, en samling hämtad från verkliga konversationer med språkmodeller. Dessa täckte mindre begränsade kreativa uppgifter som innehållsgenerering, problemlösning, brainstorming och idéframtagning; uppgifter som tillät större frihet i både svar och tillvägagångssätt.
De kompletta AUT‑ och Infinity-Chat100‑promptuppsättningarna skickades sedan till modeller som släppts mellan mars 2023 och juli 2026, från 12 leverantörer och system inklusive Anthropic, Google, Meta, OpenAI, DeepSeek och Mistral AI. Alla svar samlades via OpenRouter‑API med samma sampling‑inställningar, där temperature (frihet att svara kreativt) och top-p båda sattes till ett.
Modellerna ordnades efter utgivningsmånad för att undersöka om nyare generationer producerade mer likartade svar.
Eftersom utgivningsdatum inte fångar förändringar i träningsdata, arkitektur eller efterträningsprocesser, behandlade författarna den observerade trenden som en association med modellutveckling snarare än bevis för att tidens gång i sig orsakar konvergens.
Modellernas svar konverterades sedan till inbäddningar med hjälp av all-MiniLM-L6-v2-sentence‑transformer. Varje svar representerades som en numerisk vektor, vilket möjliggör att svar med liknande betydelser placeras i liknande riktningar och deras semantiska avstånd kan mätas.
För AUT behandlades alla föreslagna användningar för varje objekt som ett enda svar, vilket gav tio inbäddningar per modell. För Infinity-Chat100 embeddes varje svar separat, vilket gav 100 inbäddningar per modell.
De 27 utgivningsmånaderna grupperades i nio tidsperioder, och endast modeller från olika leverantörer jämfördes. Semantiska avstånd mellan deras svar mättes inom varje period, där mindre avstånd indikerade större likhet.
För att förhindra att leverantörer med fler modeller dominerade resultaten upprepades analysen 1 000 gånger med balanserade urval från varje leverantör.
Resultat
Linjära regressioner användes sedan för att spåra dessa avstånd över tid, där ett konsekvent negativt lutningstal indikerade att modeller från olika leverantörer blev mer lika:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.
Av dessa resultat betonar författarna:
’För både AUT‑ och Infinity‑Chat‑svarsuppsättningarna observerar vi en minskning av tvär‑leverantörs‑output‑avstånd under observationsperioden.’
’Detta tyder på minskande mångfald – eller ökande homogenitet – i LLM‑ers kreativa output över tid.’
Skillnaden mellan äldre och nyare modeller var tydligast i Alternate Uses Task. Det genomsnittliga avståndet mellan svar från olika leverantörer föll från cirka 0,50 för de tidigaste modellerna till under 0,40 för de nyaste, vilket betyder att svaren blev avsevärt mer lika. Samma mönster observerades för Infinity‑Chat100, men förändringen var mindre, med ett genomsnittligt avstånd som föll från cirka 0,34 till strax över 0,32.
Test results measuring how quickly answers from the different AI providers became more similar over time. The ‘Alternate Uses’ Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.
Fyndet höll även i alla 1 000 rundor av balanserad omsampling. I varje fall producerade nyare modeller svar som låg närmare varandra än de från äldre modeller. Storleken på dessa minskningar, tillsammans med forskarnas 95 % konfidensintervall, visas ovan.
När det gäller detta säger artikeln:
’Storleken på AUT‑nedgången är särskilt anmärkningsvärd med tanke på uppgiftens syfte. AUT testar uttryckligt divergent tänkande genom att instruera modeller att producera användningar som är så originella och oväntade som möjligt, vilket är precis den situation där output förväntas skilja sig.’
Infinity‑Chat‑resultaten visar att samma trend även uppträdde över ett mycket bredare spektrum av kreativa uppgifter. Dess 100 promptar bad modellerna producera många olika typer av öppna svar, och dessa svar blev mer lika över tid.
Förändringen var mindre än i Alternate Uses Task, men blev tydligare bland modeller som släppts från 2025 och framåt. Författarna föreslår att detta kan vara ett tidigt tecken på att kreativa outputar från olika AI‑leverantörer blir mer lika generellt, snarare än bara för en specifik testtyp.
Slutsats
Frågor kring LLM‑ och VLM‑konvergens är en pågående och växande källa till oro både i forskarsamhället och bland konsumenterna av de nedströmsmodeller som härrör från dem. Vi närmar oss slutet av den första och enda ’rena’ generationen av data som forskningsvärlden någonsin kommer att ha tillgång till; och leverantörernas vilja att exfiltrera rivalernas data riskerar oundvikligen konvergens, eftersom data blir identisk och träningsprinciperna är lika, om inte identiska, bland leverantörerna.
Därför är inget lika enkelt som att ersätta em‑dash sannolikt att dyka upp för att bekämpa den växande likheten i kreativ output bland modellfamiljerna, och fall av duplicering kommer i stället sannolikt att framträda på mer offentliga och pinsamma sätt.
* Den kompletta modelllistan är Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; och GLM-5.2
** Författarnas betoning, inte min.
† Min konvertering av författarnas inline‑citat till hyperlänkar.
Först publicerad fredag 21 augusti 2026 .6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; och GLM-5.2 ** Författarnas betoning, inte min. † Min konvertering av författarnas inline‑citat till hyperlänkar. Först publicerad fredag 21 augusti 2026












