Andersons vinkel

AI-modellers ‘kreative’ output bliver mere ens på tværs af leverandører

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Ny forskning antyder, at AI-modeller fra rivaliserende virksomheder bliver mere ens i deres kreative svar, hvilket potentielt indsnævrer det udvalg af idéer, som brugerne støder på.

 

Ny forskning fra USA har fundet, at ‘kreativt’ output på tværs af en bred vifte af førende AI-modeller bliver mere ens over tid.

Forfatterne fra Duke University testede 69 modeller på tværs af 12 leverandørfamilier, der dækker udgivelser fra 2023 til 2026, og fandt en statistisk signifikant nedgang i output-diversitet både på virkelige åbne spørgsmål og på en standard kreativitetstest – hvilket antyder, at lignende idéer kan blive tilbudt som svar på ‘kreative’ anmodninger i stigende grad blandt alle de store LLM-leverandører.

De testede leverandørfamilier var Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; og Z.ai*:

From the new paper - model releases used in the study, from marts 2023 to juli 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Fra den nye artikel – modeludgivelser brugt i undersøgelsen, fra marts 2023 til juli 2026. Diagrammet dækker 69 modelversioner på tværs af 12 AI‑leverandører og viser, hvordan de testede modeller var fordelt over de tre år, samt at nogle leverandører har fået stadig hyppigere udgivelsesplaner, hvilket skal tages i betragtning i forfatternes beregninger. Kilde

Forfatterne af den nye artikel konstaterer**:

‘Vi finder, at LLM-svarene på de åbne prompts, vi [tester], er blevet mere og mere ens over tid.

‘Dette antyder, at LLM’er bliver mindre kreative i opgaver, der involverer generering af åbne svar, hvilket kræver en kritisk vurdering af deres langsigtede nytte som kreative assistenter.’

Selvom ‘algorithmic monoculture‘ er blevet en etableret forskningslinje, er en undersøgelse af tendenserne mod homogenitet i AI‑genererede kreative output først nu blevet foretaget, hævder forfatterne.

Dog har enkelte hændelser peget på denne konvergens i nogen tid, herunder det mærkelige tilfælde beskrevet i Cornell Universitys maj 20026-undersøgelse, hvor et bredt udvalg af LLM-leverandører viste mærkelige, kolliderende besættelser af ‘fyrtårnbetjente’ og et særligt sæt anachronistiske navne, herunder ‘Mara’ og ‘Elias’:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

I maj fandt Cornell Universitys nye artikel mærkelige ligheder på tværs af LLM-leverandører, når de fik ‘åbne prompts’ – selvom der endnu ikke er fundet nogen forklaringer i det mangfoldige træningsdata, der driver disse modeller.

Den nye undersøgelse er mere systematisk: forfatterne testede tre år af modeller både på virkelige kreative prompts og på en klassisk psykologisk test, der efterspørger usædvanlige anvendelser af hverdagsobjekter. De målte derefter, hvor langt modellernes svar var fra hinanden i betydning, og spore om afstanden blev mindre på tværs af successive generationer.

Forfatterne af det nye arbejde, med titlen Are LLMs becoming similarly creative? Evidence from three years of models, udtaler:

‘Vores fund, selvom de er foreløbige, vækker bekymring om LLM’ers langsigtede nytte som kreative partnere. Selvom modellerne klarer sig godt på kreative opgaver, kan konvergerende output begrænse det udvalg af muligheder, som LLM‑brugere udsættes for, og dermed også bredden af deres egen tænkning.

‘Hvis brug af en LLM til kreative opgaver som essay‑skrivning nedsætter ens hjerneaktivitet, kunne brug af i stigende grad mindre kreative LLM’er – den tendens, som vores studie antyder – yderligere forværre LLM’ers indvirkning på menneskelig kreativitet, som observeret i denne og andre undersøgelser?

Allerede er de forskellige karakteristika ved LLM‑tekstoutput blevet materiale til memes; og som vi rapporterede i maj i år, har mindst én forfatter allerede selvudgivet en bog formodentlig med den førnævnte ‘fyrtårn’-besættelse, som er fælles for de store modeller.

Således, i et klima hvor udgivere i stigende grad trækker bøger tilbage, som de mistænker for at være AI‑skrevne eller AI‑understøttede, ser den nye forskning ud til at indikere, at vi kan forvente en vækst i ‘plottetilfælde’, der opstår i tilsyneladende menneskeskrevne værker, inklusive akademiske arbejder indsendt af studerende.

Med hensyn til, hvor denne konvergens stammer fra, antager forfatterne, at overlappende træningsdata og i stigende grad enslignede optimeringsmål kan presse modellerne mod sammenlignelige interne repræsentationer af begreber og semantiske relationer – hvilket i sidste ende producerer mere ens svar:

‘[Det] er stadig uklart, om denne homogenitet er et midlertidigt biprodukt af en stadig under udviklingsteknologi eller en uundgåelig – potentielt forstærkende – egenskab ved statistiske sprogmodeller.

‘Tilsyneladende kræfter peger i begge retninger. Et voksende antal akademiske arbejder antyder, at generative modeller, der er trænet på overlappende data og optimeret mod lignende mål, vil organisere begreber og semantiske relationer stadig mere ens måde, hvilket resulterer i ens output.’

Dog citerer forfatterne også arbejde, der indikerer, at efterhånden som modellerne udvikler sig, kan de igen divergere ind i deres eget afgrænsede sæt af karakteristika med hensyn til kreativ output.

Metode

For at spore, om AI-modeller bliver mere ens, begyndte forskerne med åbne spørgsmål og indsamlede svar fra successive generationer af modeller. Hvert svar blev omdannet til en numerisk repræsentation af sin betydning, hvilket gjorde det muligt at måle, hvor ens eller forskellige svarene var.

Regressionsanalyse blev derefter brugt til at fastslå, om disse forskelle blev mindre, efterhånden som nye modeller blev udgivet:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Forfatternes skema til at måle, om AI-output bliver mere ens over tid. Åbne kreative prompts blev kørt på tværs af forskellige modelfamilier, deres svar kortlagt efter betydning for at måle afstanden mellem dem, og med regressionsanalyse, der sporer, hvordan disse afstande ændrede sig på tværs af successive modelgenerationer.

To sæt prompts blev udvalgt for at teste kreativitet fra forskellige vinkler. Først, Alternate Uses Task (AUT), en standard psykologisk test for divergent tænkning, beder om ukonventionelle anvendelser af almindelige objekter, hvor undersøgelsen brugte objekter som en bog, en sko og en hammer. Dets faste format gav en kontrolleret måde at sammenligne idéerne produceret af forskellige modeller.

Yderligere 100 prompts blev udtrukket fra Infinity-Chat100, en samling afledt af virkelige samtaler med sprogmodeller. Disse dækkede mindre begrænsede kreative opgaver inden for indholdsgenerering, problemløsning, brainstorming og idéudvikling; opgaver, der tillader større frihed i forhold til de producerede svar og de anvendte tilgange.

De komplette AUT- og Infinity-Chat100-prompt‑sæt blev derefter sendt til modeller udgivet mellem marts 2023 og juli 2026, der dækker 12 leverandører og systemer fra Anthropic, Google, Meta, OpenAI, DeepSeek og Mistral AI. Alle svar blev indsamlet via OpenRouter’s API under de samme sampling‑indstillinger, med temperatur (frihed til at svare kreativt) og top-p begge sat til én.

Modellerne blev arrangeret efter udgivelsesmåned for at undersøge, om nyere generationer producerede mere ens svar.

Da udgivelsesdatoer ikke faktisk indfanger ændringer i træningsdata, arkitektur eller eftertræning, behandlede forfatterne den observerede tendens som en sammenhæng med modeludvikling snarere end som bevis på, at selve tidsforløbet forårsager konvergens.

Modellernes svar blev derefter omdannet til indlejringer ved hjælp af all-MiniLM-L6-v2-sætningen‑transformer. Hvert svar blev repræsenteret som en numerisk vektor, hvilket gør det muligt at placere svar med lignende betydning i lignende retninger og måle deres semantiske afstand.

For AUT blev alle anvendelser foreslået for hvert objekt behandlet som et enkelt svar, hvilket gav ti indlejringer pr. model. For Infinity-Chat100 blev hvert svar indlejret separat, hvilket gav 100 indlejringer pr. model.

De 27 udgivelsesmåneder blev grupperet i ni tidsperioder, og kun modeller fra forskellige leverandører blev sammenlignet. Semantiske afstande mellem deres svar blev målt inden for hver periode, hvor mindre afstand indikerer større enshed.

For at forhindre leverandører med flere modeller i at dominere resultaterne, blev analysen gentaget 1.000 gange ved brug af afbalancerede prøver fra hver leverandør.

Resultater

Lineær regression blev derefter brugt til at spore disse afstande over tid, hvor en konsekvent negativ hældning indikerer, at modeller fra forskellige leverandører blev mere ens:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Indledende testresultater, der viser, om kreative svar fra forskellige AI‑leverandører blev mere ens over tid. Semantiske afstande faldt for både Alternate Uses Task og Infinity-Chat100-promptene, mens gentagen afbalanceret sampling gav konsekvent negative tendenser, hvilket indikerer stigende enshed på tværs af modelgenerationer.

Af disse resultater fremhæver forfatterne:

‘For både AUT- og Infinity-Chat‑svar‑sæt observerer vi et fald i tvær‑leverandør‑output‑afstande over observationsperioden.

‘Dette antyder en faldende diversitet – eller stigende homogenitet – af LLM‑kreative output over tid.’

Forskellen mellem ældre og nyere modeller var mest tydelig i Alternate Uses Task. Den gennemsnitlige afstand mellem svar fra forskellige leverandører faldt fra omkring 0,50 for de tidligste modeller til under 0,40 for de nyeste, hvilket betyder, at deres svar blev væsentligt mere ens. Det samme mønster blev fundet med Infinity-Chat100, selvom ændringen var mindre, med en gennemsnitlig afstand, der faldt fra omkring 0,34 til lige over 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Testresultater, der måler, hvor hurtigt svar fra de forskellige AI‑leverandører blev mere ens over tid. ‘Alternate Uses’-opgaven viste et meget stærkere fald i forskelle mellem modeller end Infinity-Chat, med begge resultater, der forblev konsistente på tværs af forskernes gentagne sampling‑tests.

Fundet holdt også til efter alle 1.000 runder af afbalanceret resampling. I hver enkelt sag producerede nyere modeller svar, der lå tættere på hinanden end svar fra ældre modeller. Størrelsen af disse fald, sammen med forskernes 95 % konfidensintervaller, er vist ovenfor.

I denne forbindelse siger artiklen:

‘Omfanget af AUT‑faldet er særligt bemærkelsesværdigt i betragtning af opgavens formål. AUT tester eksplicit divergent tænkning ved at instruere modellerne i at producere anvendelser, der er så originale og uventede som muligt, hvilket netop er den situation, hvor output forventes at variere.’

Infinity-Chat‑resultaterne viser, at den samme tendens også fremkom over et langt bredere udvalg af kreative opgaver. Dets 100 prompts bad modellerne om at producere mange forskellige typer af åbne svar, og disse svar blev mere ens over tid.

Ændringen var mindre end i Alternate Uses‑opgaven, men blev tydeligere blandt modeller udgivet fra 2025 og frem. Forfatterne antyder, at dette kan være et tidligt tegn på, at kreative output fra forskellige AI‑leverandører generelt bliver mere ens, snarere end kun på én specifik testtype.

Konklusion

Problemer omkring LLM- og VLM‑konvergens udgør en vedvarende og voksende kilde til bekymring både i forskningsmiljøet og blandt forbrugerne af de efterfølgende modeller, som udspringer af dem. Vi nærmer os slutningen af den første og eneste ‘rene’ generation af data, som forskningsverdenen nogensinde vil have adgang til; og modeludbydernes beslutning om at eksfiltrere rivalers data risikerer uundgåeligt konvergens, da dataene bliver identiske, og principperne for modeltræning er ens, om ikke identiske, blandt leverandørerne.

Derfor er der sandsynligvis ikke noget så simpelt som at udskifte em‑stregene, der vil dukke op for at bekæmpe den stigende lighed i kreativt output blandt modelfamilierne, og tilfælde af dublering vil i stedet sandsynligvis blive afsløret på mere offentlige og pinlige måder.

 

* Den komplette model‑liste er Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; og GLM-5.2

** Forfatternes fremhævelser, ikke mine.

Min konvertering af forfatternes indlejrede kildehenvisninger til hyperlinks.

Først offentliggjort fredag d. 21. august 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai