Andersonin kulma

AI-mallien “luova” tuotanto muuttuu samankaltaiseksi eri tarjoajien välillä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Uusi tutkimus viittaa siihen, että eri yritysten AI-mallit tulevat yhä samankaltaisemmiksi luovissa vastauksissaan, mikä saattaa kaventaa käyttäjien kohtaamien ideoiden kirjoa.

 

Yhdysvalloista kotoisin oleva uusi tutkimus on havainnut, että “luovan” tuotannon laajalla valikoimalla johtavia AI-malleja on yhä samankaltaisempaa ajan myötä.

Tekijät Duke‑yliopistolta testasivat 69 mallia 12 tarjoajaperheessä, kattamalla julkaisut vuosina 2023–2026, ja havaitsivat tilastollisesti merkittävän vähenemisen tuotannon monimuotoisuudessa sekä todellisissa avoimissa kysymyksissä että standarditestissä – mikä viittaa siihen, että samankaltaisia ideoita voidaan tarjota “luovia” pyyntöjä vastaan yhä useammin kaikkien suurten LLM‑tarjoajien keskuudessa.

Testatut tarjoajaperheet olivat Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; ja Z.ai*:

From the new paper - model releases used in the study, from maaliskuu 2023 to heinäkuu 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Uudesta artikkelista – tutkimuksessa käytetyt mallijulkaisut maaliskuusta 2023 heinäkuuhun 2026. Kaavio kattaa 69 malliversiota 12 AI‑tarjoajalta, osoittaen, miten testatut mallit jakautuivat kolmen vuoden aikana, ja näyttäen joidenkin tarjoajien julkaisuaikataulujen yhä tiheämmän kasvun, mikä on otettava huomioon tekijöiden arvioissa. Lähde

Uuden artikkelin tekijät toteavat**:

“Havaitsemme, että LLM‑vastausten avoimiin kehotteisiin, joita [testaamme], on tullut yhä samankaltaisempia ajan myötä.”

“Tämä viittaa siihen, että LLM:t tulevat vähemmän luoviksi tehtävissä, joissa tuotetaan avoimia vastauksia, ja niiden pitkäaikainen hyödyllisyys luovina avustajina vaatii tarkempaa tarkastelua.”

Vaikka “algoritminen monokulttuuri” on vakiintunut tutkimuslinja, AI:n tuottaman luovan sisällön homogeenisuuden suuntausten tarkastelua ei ole tähän mennessä tehty, tekijöiden mukaan.

Kuitenkin erilliset tapaukset ovat viitanneet tähän konvergenssiin jo jonkin aikaa, mukaan lukien erikoinen tapaus Cornellin yliopiston toukokuussa 20026 tehdystä tutkimuksesta, jossa monipuolinen joukko LLM‑tarjoajia osoitti omituisia, toisiinsa törmäviä pakkomielteitä “majakanvartijoista” ja tiettyjä anekdoottisia nimiä, kuten “Mara” ja “Elias”:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

Huhtikuussa Cornellin yliopiston uusi artikkeli löysi omituisia samankaltaisuuksia LLM‑tarjoajien välillä, kun ne saivat “avokehotteita” – vaikka syitä ei ole vielä löytynyt monipuolisesta koulutusdatasta, joka ravitsee näitä malleja.

Uusi tutkimus on systemaattisempi: tekijät testasivat kolmen vuoden mallijoukkoa sekä todellisilla luovilla kehotteilla että klassisella psykologiatestillä, joka pyytää epätavallisia käyttötapoja arkipäiväisille esineille. He mittasivat, kuinka kaukana mallien vastaukset olivat merkitykseltään, ja seurasivat, supistuivatko nämä etäisyydet peräkkäisissä sukupolvissa.

Uuden työn tekijät, jonka otsikko on Are LLMs becoming similarly creative? Evidence from three years of models, toteavat:

“Löydöksemme, vaikka alustavia, herättävät huolia LLM:ien pitkän aikavälin hyödyllisyyden suhteen luovina kumppaneina. Vaikka mallit suoriutuvatkin hyvin luovissa tehtävissä, konvergoivat tuotokset voivat rajoittaa käyttäjien kohtaamien mahdollisuuksien kirjoa ja siten kaventaa heidän omaa ajatteluaan.”

“Jos LLM:n käyttäminen luovissa tehtävissä kuten esseen kirjoittaminen vähentää aivoaktiivisuutta, voisiko yhä vähemmän luovien LLM:ien – tutkimuksemme ehdottaman trendin – käyttö pahentaa LLM:ien vaikutusta ihmisen luovuuteen, kuten tämä ja muut tutkimukset ovat havainneet?”

Jo nyt LLM‑tekstin moninaiset ominaisuudet ovat meemin aiheita; ja kuten toukokuussa tänä vuonna raportoimme, vähintään yksi tekijä on jo itse julkaissut kirjan joka ilmeisesti sisältää edellä mainitun “majakan” pakkomielen, joka on yleinen suurten mallien keskuudessa.

Siispä ilmapiirissä, jossa kustantajat yleensää poistavat kirjoja, joita he epäilevät olevan AI:n kirjoittamia tai AI:n avustamia, uusi tutkimus vaikuttaisi viittaavan siihen, että voimme odottaa “juoniyhtälöiden” yleistymistä ilmeisesti ihmisen kirjoittamista teoksista, mukaan lukien opiskelijoiden lähettämät akateemiset työt.

Mistä tämä konvergenssi syntyy, tekijät spekuloivat, että päällekkäinen koulutusdata ja yhä samankaltaisemmat optimointitavoitteet saattavat työntää malleja kohti verrattavissa olevia sisäisiä käsitteiden ja semanttisten suhteiden esityksiä – lopulta tuottaen samankaltaisempia vastauksia:

“[Se] on edelleen epäselvää, onko tämä homogeenisuus tilapäinen sivutuote vielä kehittyvästä teknologiasta vai väistämätön – mahdollisesti kasvava – ominaisuus tilastollisissa kielimalleissa.”

“Mahdolliset voimat osoittautuvat molempiin suuntiin. Kasvava akateeminen kirjallisuus viittaa siihen, että päällekkäisellä datalla koulutetut generatiiviset mallit ja samankaltaisiin tavoitteisiin optimoidut mallit järjestävät käsitteet ja semanttiset suhteet yhä samankaltaisemmiksi, mikä johtaa samankaltaisiin tuotoksiin.”

Tekijät kuitenkin viittaavat työhön, jonka mukaan mallien kehittyessä ne saattavat jälleen hajautua omiksi erillisinä ominaisuuksikseen luovan tuotannon osalta.

Menetelmä

Seuratakseen, tulevatko AI‑mallit yhä samankaltaisemmiksi, tutkijat aloittivat avoimilla kysymyksillä keräten vastauksia peräkkäisiltä mallisukupolvilta. Jokainen vastaus muunnettiin numeeriseksi merkityksen esitykseksi, mikä mahdollisti sen mittaamisen, kuinka samankaltaisia tai erilaisia vastaukset olivat.

Regressio-analyysiä käytettiin sitten selvittämään, supistuivatko nämä erot uusien mallien julkaisun myötä:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Tekijöiden kaavio AI‑tuotosten samankaltaisuuden mittaamiseksi ajan myötä. Avoimia luovia kehotteita ajetaan eri malliperheissä, niiden vastaukset kartoitetaan merkityksen perusteella etäisyyden mittaamiseksi, ja regressioanalyysi seuraa, miten nämä etäisyydet muuttuvat peräkkäisissä mallisukupolvissa.

Kaksi kehotteiden sarjaa valittiin luovuuden testaamiseen eri näkökulmista. Ensinnäkin Alternate Uses Task (AUT), standardi psykologinen divergoivan ajattelun testi, pyytää epätavallisia käyttötapoja tavallisille esineille; tutkimuksessa käytettiin esineitä kuten kirja, kenkä ja vasara. Sen vakioitu muoto tarjosi hallitun tavan vertailla eri mallien tuottamia ideoita.

Lisäksi 100 kehotetta johdettiin Infinity-Chat100-kokoelmasta, joka on peräisin todellisista keskusteluista kielimalleja vastaan. Nämä kattoivat vähemmän rajoitettuja luovia tehtäviä, kuten sisällöntuotantoa, ongelmanratkaisua, aivoriihiä ja ideointia; tehtäviä, jotka sallivat suuremman vapauden vastauksissa ja lähestymistavoissa.

Kokonaiset AUT‑ ja Infinity-Chat100‑kehotteet lähetettiin malleille, jotka julkaistiin maaliskuusta 2023 heinäkuuhun 2026, kattaen 12 tarjoajaa ja järjestelmää Anthropicista, Googleen, Metaan, OpenAI:hin, DeepSeek:iin ja Mistral AI:hin. Kaikki vastaukset kerättiin OpenRouterin API:n kautta samoilla näytteenottosäädöillä, joissa lämpötila (luovan vapauden taso) ja top-p molemmat asetettiin yhdeksi.

Mallit järjestettiin julkaisukuukauden mukaan tarkastelemaan, tuottavatko uudemmat sukupolvet samankaltaisempia vastauksia.

Koska julkaisupäivät eivät varsinaisesti kata muutoksia koulutusdatassa, arkkitehtuurissa tai jälkikoulutuksessa, tekijät tulkitsivat havaintojen trendin yhteydeksi mallikehitykseen sen sijaan, että ne olisivat todisteita siitä, että ajan kuluminen itsessään aiheuttaisi konvergenssia.

Mallien vastaukset muunnettiin sitten upotuksiksi käyttäen all-MiniLM-L6-v2-lausekäännintä. Jokainen vastaus esitettiin numeerisena vektorina, mikä mahdollisti samankaltaisten merkitysten sijoittamisen samansuuntaisiksi ja niiden semanttisen etäisyyden mittaamisen.

AUT‑tehtävässä kaikki kullekin esineelle ehdotetut käyttötavat käsiteltiin yhtenä vastauksena, tuottaen kymmenen upotusta per malli. Infinity-Chat100‑tehtävässä jokainen vastaus upotettiin erikseen, tuottaen 100 upotusta per malli.

27 julkaisukuukautta ryhmiteltiin yhdeksään aikajaksoon, ja verrattiin vain eri tarjoajien malleja. Semanttiset etäisyydet niiden vastausten välillä mitattiin kunkin jakson sisällä; pienemmät etäisyydet merkitsivät suurempaa samankaltaisuutta.

Estääkseen, että tarjoajat, joilla on enemmän malleja, hallitsisivat tuloksia, analyysi toistettiin 1 000 kertaa tasapainotetuilla otoksilla jokaisesta tarjoajasta.

Tulokset

Lineaarista regressiota käytettiin sitten näiden etäisyyksien ajan myötä seuraamiseen, ja johdonmukainen negatiivinen kaltevuus osoitti, että eri tarjoajien mallit tulevat yhä samankaltaisemmiksi:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Alkuperäiset testitulokset, jotka osoittavat, ovatko eri AI‑tarjoajien luovat vastaukset muuttuneet yhä samankaltaisemmiksi ajan myötä. Semanttiset etäisyydet vähenivät sekä Alternate Uses Task‑ että Infinity-Chat100‑kehotteissa, ja toistuva tasapainotettu otanta tuotti johdonmukaisesti negatiivisia trendejä, mikä viittaa kasvavaan samankaltaisuuteen mallisukupolvien välillä.

Tekijät korostavat näitä tuloksia:

“Sekä AUT‑ että Infinity-Chat‑vastausjoukkojen osalta havaitsemme etäisyyksien vähenemisen eri tarjoajien välillä tarkkailujakson aikana.”

“Tämä viittaa monimuotoisuuden vähenemiseen – tai LLM‑luovien tuotosten homogeenisuuden lisääntymiseen ajan myötä.”

Ero vanhojen ja uusien mallien välillä oli selkein Alternate Uses Task -tehtävässä. Keskimääräinen etäisyys eri tarjoajien vastausten välillä laski noin 0,50 varhaisimmissa malleissa alle 0,40 uusimmissa, mikä tarkoittaa, että niiden vastaukset muuttuivat merkittävästi samankaltaisemmiksi. Sama malli havaittiin Infinity-Chat100‑tehtävässä, vaikka muutos oli pienempi: keskimääräinen etäisyys laski noin 0,34:stä juuri 0,32:n tasolle.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Testitulokset, jotka mittaavat, kuinka nopeasti eri AI‑tarjoajien vastaukset muuttuvat yhä samankaltaisemmiksi ajan myötä. “Alternate Uses”‑tehtävä osoitti paljon voimakkaamman erojen vähenemisen mallien välillä kuin Infinity-Chat, ja molemmat tulokset pysyivät johdonmukaisina tutkijoiden toistuvissa otantatesteissä.

Löytyi, että havainto kesti kaikki 1 000 tasapainotettua uudelleennäytettä. Kaikissa tapauksissa uudemmat mallit tuottivat vastauksia, jotka olivat lähempänä toisiaan kuin vanhemmat mallit. Näiden vähenemisten suuruus sekä tutkijoiden 95 %:n luottamusvälit on esitetty yllä.

Paperi toteaa:

“AUT‑vähennyksen suuruus on erityisen merkittävä ottaen huomioon tehtävän tarkoitus. AUT testaa nimenomaan divergoivaa ajattelua ohjeistamalla malleja tuottamaan käyttöjä, jotka ovat mahdollisimman alkuperäisiä ja odottamattomia, mikä tekee juuri tästä tilanteesta sen, jossa tuotosten odotetaan eroavan toisistaan.”

Infinity-Chat‑tulokset osoittavat, että sama trendi ilmeni myös paljon laajemmassa luovien tehtävien valikoimassa. Sen 100 kehotetta pyysivät malleja tuottamaan monenlaisia avoimia vastauksia, ja nämä vastaukset muuttuivat ajan myötä samankaltaisemmiksi.

Muutoksen suuruus oli pienempi kuin Alternate Uses Task -tehtävässä, mutta se selkeytyi erityisesti vuodesta 2025 alkaen julkaistuissa malleissa. Tekijät ehdottavat, että tämä voi olla varhainen merkki siitä, että eri AI‑tarjoajien luovat tuotokset tulevat yhä samankaltaisemmiksi yleisesti, eivätkä vain yhdessä testityypissä.

Johtopäätös

LLM‑ ja VLM‑konvergenssin ongelmat ovat jatkuva ja kasvava huolenaihe sekä tutkimusyhteisössä että niiden alaismallien kuluttajissa. Olemme lähestymässä ensimmäisen ja ainoan “puhdas” datageneration loppua, johon tutkimuskenttä koskaan pääsee käsiksi; ja mallitarjoajien pyrkimys varastaa kilpailijoiden dataa uhkaa väistämättä konvergenssia, sillä data muuttuu identtiseksi ja mallien koulutusperiaatteet ovat samankaltaisia, ellei identtisiä, tarjoajien välillä.

Siksi mikään niin yksinkertainen kuin em‑viivojen korvaaminen ei todennäköisesti riitä torjumaan luovan tuotannon kasvavaa samankaltaisuutta malliperheissä, ja kopiointitapaukset tulevat sen sijaan todennäköisesti nousseet julkisiksi ja noloa tilanteiksi.

 

* Täydellinen mallilista on Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; ja GLM-5.2

** Tekijöiden korostukset, ei omiani.

Oma muunnokseni tekijöiden sisäisistä viitteistä hyperlinkkeiksi.

Ensimmäisen kerran julkaistu perjantaina 21. elokuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai