Unghiul lui Anderson
Ieșirile „creative” ale modelelor AI devin similare între furnizori

Cercetări noi sugerează că modelele AI ale companiilor concurente devin tot mai asemănătoare în răspunsurile lor creative, limitând potențial gama de idei pe care utilizatorii le întâlnesc.
Cercetări noi din Statele Unite au constatat că ieșirile „creative” ale unui număr larg de modele AI de top devin din ce în ce mai similare în timp.
Autorii, de la Universitatea Duke, au testat 69 de modele din 12 familii de furnizori, acoperind lansări din 2023 până în 2026, și au constatat o scădere semnificativă statistic a diversității ieșirilor atât la întrebările deschise din viața reală, cât și la un test standard de creativitate – sugerând că idei similare pot fi oferite tot mai des în răspuns la cereri „creative”, în rândul tuturor furnizorilor principali de LLM.
Familiile de furnizori testate au fost Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; și Z.ai*:

Din noua lucrare – lansările de modele utilizate în studiu, din martie 2023 până în iulie 2026. Graficul acoperă 68 de versiuni de modele din 12 furnizori AI, demonstrând cum au fost distribuite modelele testate pe parcursul celor trei ani și arătând programări de lansare din ce în ce mai frecvente pentru unii furnizori, aspect ce trebuie luat în considerare în calculele autorilor. Sursă – https://arxiv.org/pdf/2608.19437 Sursă
Autorii noii lucrări afirmă**:
‘Observăm că răspunsurile LLM la solicitările deschise pe care le [testăm] au devenit din ce în ce mai similare în timp.
‘Acest lucru sugerează că LLM-urile devin mai puțin creative în sarcini care implică generarea de răspunsuri deschise, necesitând o examinare a utilității lor pe termen lung ca asistenți creativi.’
Deși ‘monocultura algoritmică‘ a devenit o direcție de studiu consacrată, o examinare a tendințelor spre omogenitate în ieșirile creative generate de AI nu a fost întreprinsă până acum, afirmă autorii.
Totuși, incidente izolate au indicat această convergență de ceva timp, inclusiv cazul ciudat descris în studiul universității Cornell din mai 20026, în care o gamă diversă de furnizori LLM au demonstrat obsesii ciudate și colizive legate de „păstrănii de far”, și un set particular de nume anacronistice, inclusiv „Mara” și „Elias”:

În mai, noua lucrare a Universității Cornell a constatat similitudini ciudate între furnizorii LLM atunci când li s-au oferit „solicitări deschise” – deși încă nu există indicii privind motivul în datele de antrenament diverse care alimentează aceste modele.
Noul studiu este mai sistematic: cercetătorii au testat trei ani de modele atât cu solicitări creative din viața reală, cât și cu un test clasic de psihologie care solicită utilizări neobișnuite pentru obiecte cotidiene. Au apoi măsurat cât de diferite erau răspunsurile modelelor în sens, urmărind dacă aceste distanțe s-au micșorat de-a lungul generațiilor succesive.
Autorii noii lucrări, intitulată Se devin LLM-urile similar creative? Dovezi din trei ani de modele, afirmă†:
‘Descoperirile noastre, deși preliminare, ridică îngrijorări privind utilitatea pe termen lung a LLM-urilor ca parteneri creativi. Chiar dacă modelele performează bine la sarcini creative, ieșirile convergente ar putea limita gama de posibilități la care utilizatorii LLM sunt expuși și, implicit, lățimea propriilor lor gândiri.
‘Dacă utilizarea unui LLM pentru sarcini creative, cum ar fi redactarea unui eseu reduce activitatea cerebrală a unei persoane, ar putea utilizarea tot mai puțin creativă a LLM-urilor – tendința sugerată de studiul nostru – să agraveze și mai mult efectele LLM-urilor asupra creativității umane, așa cum s-a observat în această și alte studii?’
Deja, caracteristicile diverse ale ieșirilor textuale ale LLM-urilor au devenit material pentru meme-uri; și, așa cum am raportat în mai anul acesta, cel puțin un autor a auto-publicat deja o carte presupus că prezintă fixația „far” menționată anterior, comună principalelor modele.
Astfel, într-un climat în care editorii retrage din ce în ce mai multe cărți pe care le suspectează că sunt scrise de AI sau asistate de AI, noile cercetări par să indice că ne putem aștepta la o creștere a „coincidențelor de intrigă” apărute în lucrări aparent scrise de oameni, inclusiv lucrări academice depuse de studenți.
În ceea ce privește sursa acestei convergențe, autorii presupun că suprapunerea datelor de antrenament și obiectivele de optimizare tot mai similare ar putea împinge modelele spre reprezentări interne comparabile ale conceptelor și relațiilor semantice – producând în final răspunsuri mai similare†:
‘[Este] neclar dacă această omogenitate este un subprodus temporar al unei tehnologii încă în dezvoltare sau o caracteristică inevitabilă – potențial cumulativă – a modelelor statistice de limbaj.
‘Forțe plauzibile indică ambele direcții. Un număr tot mai mare de lucrări academice sugerează că modelele generative antrenate pe date suprapuse și optimizate spre obiective similare vor organiza conceptele și relațiile semantice în mod din ce în ce similar, rezultând în ieșiri similare.’
Totuși, autorii mai citează lucrări care indică faptul că, pe măsură ce modelele evoluează, acestea ar putea diverge din nou în propriul set izolat de caracteristici, în ceea ce privește ieșirile creative.
Metodă
Pentru a urmări dacă modelele AI devin tot mai asemănătoare, cercetătorii au început cu întrebări deschise, colectând răspunsuri de la generațiile successive de modele. Fiecare răspuns a fost transformat într-o reprezentare numerică a sensului său, permițând măsurarea gradului de similitudine sau diferență dintre răspunsuri.
Regresia a fost apoi utilizată pentru a stabili dacă aceste diferențe se micșorau pe măsură ce modele noi erau lansate:

Schema autorilor pentru măsurarea dacă ieșirile AI devin mai similare în timp. Solicitările creative deschise au fost rulate pe diferite familii de modele, răspunsurile lor fiind mapate prin sens pentru a măsura distanța dintre ele, iar regresia a urmărit cum aceste distanțe s-au schimbat de-a lungul generațiilor succesive de modele.
Două seturi de solicitări au fost selectate pentru a testa creativitatea din diferite perspective. Mai întâi, Sarcina de utilizări alternative (AUT), un test psihologic standard de gândire divergentă, solicită utilizări neconvenționale pentru obiecte obișnuite, studiul folosind obiecte precum un carte, un pantof și un ciocan. Formatul său fix a oferit o metodă controlată pentru a compara ideile produse de diferite modele.
Un alt set de 100 de solicitări a fost extras din Infinity-Chat100, o colecție derivată din conversații reale cu modele de limbaj. Acestea au acoperit sarcini creative mai puțin constrânse, implicând generarea de conținut, rezolvarea de probleme, brainstorming și ideare; sarcini care permit o libertate mai mare în ceea ce privește răspunsurile produse și abordările adoptate.
Seturile complete de solicitări AUT și Infinity-Chat100 au fost apoi trimise către modele lansate între martie 2023 și iulie 2026, acoperind 12 furnizori și sisteme de la Anthropic, Google, Meta, OpenAI, DeepSeek și Mistral AI. Toate răspunsurile au fost colectate prin API-ul OpenRouter sub aceleași setări de eșantionare, cu temperatura (libertatea de a răspunde creativ) și top-p ambele setate la unu.
Modelele au fost aranjate pe lună de lansare pentru a examina dacă generațiile noi produceau răspunsuri mai similare.
Deoarece datele de lansare nu surprind în realitate schimbările în datele de antrenament, arhitectură sau post-antrenament, autorii au tratat tendința rezultată ca o asociere cu dezvoltarea modelului, mai degrabă decât ca dovadă că trecerea timpului în sine cauzează convergența.
Răspunsurile modelelor au fost apoi convertite în încorporări folosind all-MiniLM-L6-v2 sentence-transformer. Fiecare răspuns a fost reprezentat ca un vector numeric, permițând plasarea răspunsurilor cu sensuri similare în direcții similare și măsurarea distanței semantice dintre ele.
Pentru AUT, toate utilizările sugerate pentru fiecare obiect au fost tratate ca un singur răspuns, producând zece încorporări pe model. Pentru Infinity-Chat100, fiecare răspuns a fost încorporat separat, producând 100 de încorporări pe model.
Cele 27 de luni de lansare au fost grupate în nouă perioade de timp, și au fost comparate doar modelele de la furnizori diferiți. Distanțele semantice dintre răspunsurile lor au fost măsurate în cadrul fiecărei perioade, distanțele mai mici indicând o similitudine mai mare.
Pentru a preveni ca furnizorii cu mai multe modele să domine rezultatele, analiza a fost repetată de 1.000 de ori, utilizând mostre echilibrate de la fiecare furnizor.
Rezultate
Regresia liniară a fost apoi utilizată pentru a urmări aceste distanțe în timp, cu o pantă negativă constantă indicând că modelele de la furnizori diferiți deveneau tot mai similare:

Rezultatele inițiale ale testului, arătând dacă răspunsurile creative ale diferiților furnizori AI au devenit mai similare în timp. Distanțele semantice au scăzut atât pentru sarcina de utilizări alternative, cât și pentru solicitările Infinity-Chat100, în timp ce eșantionarea echilibrată repetată a produs tendințe negative constante, indicând o similitudine crescândă între generațiile de modele.
Din aceste rezultate autorii subliniază:
‘Pentru ambele seturi de răspunsuri AUT și Infinity-Chat, observăm o scădere a distanțelor de ieșire între furnizori pe parcursul perioadei de observație.
‘Acest lucru sugerează o scădere a diversității – sau o creștere a omogenității – a ieșirilor creative ale LLM-urilor în timp.’
Diferența dintre modelele mai vechi și cele mai noi a fost cea mai evidentă în Sarcina de utilizări alternative. Distanța medie dintre răspunsurile de la furnizori diferiți a scăzut de la aproximativ 0,50 pentru cele mai vechi modele la sub 0,40 pentru cele mai noi, ceea ce înseamnă că răspunsurile lor au devenit substanțial mai asemănătoare. Același tipar a fost găsit și la Infinity-Chat100, deși schimbarea a fost mai mică, distanța medie scăzând de la aproximativ 0,34 la puțin peste 0,32.

Rezultatele testului care măsoară cât de repede răspunsurile de la diferiții furnizori AI au devenit mai similare în timp. Sarcina „Utilizări alternative” a arătat o scădere mult mai puternică a diferențelor dintre modele decât Infinity-Chat, iar ambele rezultate au rămas consecvente în testele de eșantionare repetate ale cercetătorilor.
Descoperirea a rezistat tuturor celor 1.000 de runde de eșantionare echilibrată. În fiecare caz, modelele noi au produs răspunsuri care erau mai apropiate unele de altele decât cele ale modelelor vechi. Mărimea acestor scăderi, împreună cu intervalele de încredere de 95% ale cercetătorilor, sunt ilustrate mai sus.
În legătură cu acest lucru, lucrarea afirmă:
‘Magnitudinea scăderii AUT este deosebit de notabilă având în vedere scopul sarcinii. AUT testează explicit gândirea divergentă prin instruirea modelelor să producă utilizări cât mai originale și neașteptate, fiind exact contextul în care ieșirile ar fi de așteptat să difere.’
Rezultatele Infinity-Chat arată că aceeași tendință a apărut și pe o gamă mult mai largă de sarcini creative. Cele 100 de solicitări i-au cerut modelelor să producă multe tipuri diferite de răspunsuri deschise, și aceste răspunsuri au devenit mai similare în timp.
Schimbarea a fost mai mică decât în Sarcina de utilizări alternative, dar a devenit mai evidentă la modelele lansate începând cu 2025. Autorii sugerează că acesta ar putea fi un semn timpuriu că ieșirile creative ale diferiților furnizori AI devin în general mai asemănătoare, nu doar la un anumit tip de test.
Concluzie
Problemele legate de convergența LLM și VLM reprezintă o sursă în creștere de îngrijorare în comunitatea de cercetare și în rândul consumatorilor modelelor derivate. Ne apropiem de sfârșitul primei și singurei generații „pure” de date la care scena de cercetare va avea vreodată acces; și determinarea furnizorilor de modele de a exfiltra datele rivalilor implică inevitabil riscul convergenței, deoarece datele devin identice, iar principiile de antrenament ale modelelor sunt similare, dacă nu identice, între furnizori.
Prin urmare, nimic la fel de simplu precum înlocuirea cratimelor em nu este probabil să apară pentru a combate creșterea similitudinii ieșirilor creative dintre familiile de modele, iar cazurile de duplicare vor ieși, în schimb, la lumină în moduri mult mai publice și jenante.
* Lista completă de modele este Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; și GLM-5.2
** Accentele autorilor, nu ale mele.
† Conversia mea a citărilor în linie ale autorilor în hyperlinkuri.
Publicat prima dată vineri, 21 august 2026












