Kąt Andersona
Kreatywne wyniki modeli AI stają się podobne wśród dostawców

Nowe badania sugerują, że modele AI od konkurujących firm stają się coraz bardziej podobne w swoich kreatywnych odpowiedziach, co może ograniczyć zakres pomysłów, które napotykają użytkownicy.
Nowe badania z USA wykazały, że „kreatywne” wyniki w szerokim spektrum wiodących modeli AI stają się z czasem coraz bardziej podobne.
Autorzy z Uniwersytetu Duke przetestowali 69 modeli w 12 rodzinach dostawców, obejmując wydania od 2023 do 2026 roku, i stwierdzili statystycznie istotny spadek różnorodności wyników zarówno w rzeczywistych pytaniach otwartych, jak i w standardowym teście kreatywności – co sugeruje, że podobne pomysły mogą być coraz częściej oferowane w odpowiedzi na „kreatywne” zapytania przez wszystkich głównych dostawców LLM.
Testowane rodziny dostawców to Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; oraz Z.ai*:

From the new paper – model releases used in the study, from marzec 2023 to lipiec 2026. The chart covers 69 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors’ reckonings. Source
Autorzy nowego artykułu stwierdzają**:
‘Stwierdzamy, że odpowiedzi LLM na otwarte zapytania, które testujemy, stają się z czasem coraz bardziej podobne.
‘To sugeruje, że LLM stają się mniej kreatywne w zadaniach polegających na generowaniu otwartych odpowiedzi, co wymaga dokładnej analizy ich długoterminowej przydatności jako kreatywnych asystentów.’
Mimo że ‘monokultura algorytmiczna‘ stała się ustalonym tematem badań, analiza trendów prowadzących do homogenizacji kreatywnych wyników generowanych przez SI nie została dotąd podjęta, twierdzą autorzy.
Mimo to, odosobnione incydenty wskazywały na to zbieżność od pewnego czasu, w tym dziwny przypadek opisany w badaniu z maja 20026 Uniwersytetu Cornell, w którym wykazano, że różnorodna gama dostawców LLM ma dziwaczne, kolidujące obsesje na temat „strażników latarni”, oraz szczególny zestaw anachronicznych imion, w tym „Mara” i „Elias”:

In May, Cornell University’s new paper found strange similarities across LLM providers when given ‘open prompts’ – though no clues as to why have yet become apparent in the diverse training data fueling these models.
Nowe badanie jest bardziej systematyczne: autorzy przetestowali trzy lata modeli zarówno na rzeczywistych kreatywnych poleceniach, jak i na klasycznym teście psychologicznym, który wymaga wymyślenia nietypowych zastosowań codziennych przedmiotów. Następnie zmierzyli, jak bardzo różnią się znaczeniowo odpowiedzi modeli, obserwując, czy odległości te zmniejszają się w kolejnych generacjach.
Autorzy nowej pracy, zatytułowanej Czy LLM stają się podobnie kreatywne? Dowody z trzech lat modeli, stwierdzają†:
‘Nasze wyniki, choć wstępne, budzą obawy co do długoterminowej użyteczności LLM jako partnerów kreatywnych. Nawet jeśli modele radzą sobie dobrze w zadaniach kreatywnych, zbieżne wyniki mogą ograniczyć zakres możliwości, na które narażeni są użytkownicy LLM, a wraz z tym szerokość ich własnego myślenia.’
‘Jeśli użycie LLM do kreatywnych zadań, takich jak pisanie esejów, obniża aktywność mózgu, czy stosowanie coraz mniej kreatywnych LLM – trend sugerowany przez nasze badanie – może jeszcze bardziej pogorszyć wpływ LLM na ludzką kreatywność, jak zaobserwowano w tym oraz innych badaniach?’
Już różnorodne cechy tekstowego wyjścia LLM stały się materiałem na memy; a jak donieśliśmy w maju tego roku, przynajmniej jeden autor samodzielnie wydał książkę prawdopodobnie zawierającą wspomnianą obsesję na temat „latarni”, wspólną dla głównych modeli.
Zatem, w klimacie, w którym wydawcy coraz częściej wycofują książki, które podejrzewają o bycie napisanymi przez SI lub wspomaganymi przez SI, nowe badania wydają się wskazywać, że możemy spodziewać się wzrostu „zbieżności fabularnych” pojawiających się w pozornie ludzkich dziełach, w tym pracach akademickich składanych przez studentów.
Jeśli chodzi o źródło tej zbieżności, autorzy przypuszczają, że nakładające się dane treningowe i coraz podobniejsze cele optymalizacji mogą popychać modele w kierunku porównywalnych wewnętrznych reprezentacji pojęć i relacji semantycznych – ostatecznie generując bardziej podobne odpowiedzi†:
‘[To] pozostaje niejasne, czy ta jednorodność jest tymczasowym produktem ubocznym wciąż rozwijającej się technologii, czy nieuniknioną – potencjalnie narastającą – cechą modeli językowych statystycznych.
‘Prawdopodobne siły wskazują w obu kierunkach. Rosnąca liczba prac akademickich sugeruje, że generatywne modele trenowane na nakładających się danych i optymalizowane pod kątem podobnych celów będą organizować pojęcia i relacje semantyczne w coraz bardziej podobny sposób, co skutkuje podobnymi wynikami.’
Jednak autorzy cytują również badanie, które wskazuje, że w miarę rozwoju modeli mogą one ponownie odchodzić od siebie, tworząc własny, odizolowany zestaw cech pod względem kreatywnych wyników.
Metoda
Aby śledzić, czy modele SI stają się bardziej podobne, badacze rozpoczęli od pytań otwartych, gromadząc odpowiedzi kolejnych generacji modeli. Każda odpowiedź została przekształcona w numeryczną reprezentację jej znaczenia, co umożliwiło pomiar podobieństwa lub różnicy odpowiedzi.
Regresja została następnie użyta do ustalenia, czy te różnice zmniejszają się wraz z wydawaniem nowszych modeli:

The authors’ schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts were run across different model families, their answers mapped by meaning, to measure the distance between them, and with regression analysis tracking how those distances changed across successive model generations.
Wybrano dwa zestawy poleceń, aby testować kreatywność z różnych perspektyw. Najpierw Zadanie Alternatywnych Zastosowań (AUT), standardowy test psychologiczny myślenia dywergencyjnego, który pyta o niekonwencjonalne zastosowania zwykłych przedmiotów; w badaniu użyto takich obiektów jak książka, but i młotek. Jego stały format zapewnił kontrolowany sposób porównywania pomysłów generowanych przez różne modele.
Dodatkowo 100 poleceń wyodrębniono z Infinity-Chat100, zbioru pochodzącego z rzeczywistych rozmów z modelami językowymi. Obejmowały one mniej ograniczone zadania kreatywne, związane z generowaniem treści, rozwiązywaniem problemów, burzą mózgów i pomysłowością; zadania, które pozwalały na większą swobodę w zakresie generowanych odpowiedzi i przyjętych podejść.
Pełne zestawy poleceń AUT i Infinity-Chat100 zostały następnie wysłane do modeli wydanych między marcem 2023 a lipcem 2026, obejmując 12 dostawców i systemy od Anthropic, Google, Meta, OpenAI, DeepSeek i Mistral AI. Wszystkie odpowiedzi zebrano za pośrednictwem API OpenRouter przy tych samych ustawieniach próbkowania, przy temperaturze (swobodzie kreatywnej odpowiedzi) oraz top-p ustawionych na jeden.
Modele uporządkowano według miesiąca wydania, aby zbadać, czy nowsze generacje produkują bardziej podobne odpowiedzi.
Ponieważ daty wydania nie odzwierciedlają faktycznych zmian w danych treningowych, architekturze ani po‑treningu, autorzy potraktowali obserwowany trend jako powiązanie z rozwojem modeli, a nie jako dowód, że sam upływ czasu powoduje zbieżność.
Odpowiedzi modeli przekształcono następnie w osadzenia przy użyciu all-MiniLM-L6-v2 sentence‑transformera. Każda odpowiedź została przedstawiona jako wektor numeryczny, co pozwala umieścić odpowiedzi o podobnym znaczeniu w podobnych kierunkach oraz zmierzyć ich odległość semantyczną.
W przypadku AUT wszystkie sugerowane zastosowania dla każdego przedmiotu potraktowano jako jedną odpowiedź, generując dziesięć osadzeń na model. W przypadku Infinity-Chat100 każda odpowiedź była osadzana osobno, generując 100 osadzeń na model.
27 miesięcy wydania pogrupowano w dziewięć okresów czasowych i porównano jedynie modele od różnych dostawców. Odległości semantyczne między ich odpowiedziami zmierzono w ramach każdego okresu, przy czym mniejsze odległości wskazują na większe podobieństwo.
Aby zapobiec dominacji dostawców posiadających więcej modeli, analiza została powtórzona 1 000 razy, używając zrównoważonych próbek od każdego dostawcy.
Wyniki
Następnie zastosowano regresję liniową do śledzenia tych odległości w czasie, przy czym konsekwentny ujemny nachylenie wskazywało, że modele od różnych dostawców stają się bardziej podobne:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.
Wśród tych wyników autorzy podkreślają:
‘Dla obu zestawów odpowiedzi AUT i Infinity-Chat obserwujemy spadek odległości wyników pomiędzy dostawcami w okresie obserwacji.’
‘Wskazuje to na zmniejszanie się różnorodności – lub rosnącą jednorodność – kreatywnych wyników LLM w czasie.’
Różnica między starszymi a nowszymi modelami była najbardziej widoczna w Zadaniu Alternatywnych Zastosowań. Średnia odległość między odpowiedziami od różnych dostawców spadła z około 0,50 dla najwcześniejszych modeli do poniżej 0,40 dla najnowszych, co oznacza, że ich odpowiedzi stały się znacznie bardziej podobne. Ten sam wzorzec zaobserwowano w Infinity-Chat100, choć zmiana była mniejsza – średnia odległość spadła z około 0,34 do nieco ponad 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The ‘Alternate Uses’ Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.
Wynik przetrwał także wszystkie 1 000 rund zrównoważonego resamplingu. W każdym przypadku nowsze modele generowały odpowiedzi bliższe sobie niż te od starszych modeli. Wielkość tych spadków, wraz z 95 % przedziałami ufności badaczy, przedstawiono powyżej.
W odniesieniu do tego, artykuł stwierdza:
‘Wielkość spadku w AUT jest szczególnie godna uwagi, biorąc pod uwagę cel tego zadania. AUT wyraźnie testuje myślenie dywergencyjne, instruując modele, aby generowały zastosowania tak oryginalne i nieoczekiwane, jak to tylko możliwe, co czyni to właśnie środowiskiem, w którym oczekiwano różnorodnych wyników.’
Wyniki Infinity-Chat pokazują, że ten sam trend pojawił się także w znacznie szerszym zakresie zadań kreatywnych. Jego 100 poleceń prosiło modele o generowanie wielu różnych rodzajów otwartych odpowiedzi, a odpowiedzi te stały się z czasem bardziej podobne.
Zmiana była mniejsza niż w Zadaniu Alternatywnych Zastosowań, ale stała się wyraźniejsza wśród modeli wydanych od 2025 roku. Autorzy sugerują, że może to być wczesny sygnał, że kreatywne wyniki różnych dostawców SI stają się ogólnie bardziej podobne, a nie tylko w jednym konkretnym typie testu.
Wnioski
Kwestie związane ze zbieżnością LLM i VLM są ciągle rosnącym źródłem niepokoju zarówno w społeczności badawczej, jak i wśród konsumentów modeli pochodnych. Zbliżamy się do końca pierwszej i jedynej „czystej” generacji danych, do której scena badawcza kiedykolwiek będzie mieć dostęp; a determinacja dostawców modeli do wykradania danych rywali nieuchronnie zwiększa ryzyko zbieżności, ponieważ dane stają się identyczne, a zasady treningu modeli są podobne, jeśli nie identyczne, wśród dostawców.
Dlatego nic tak prostego jak zastąpienie myślników em nie pojawi się, aby przeciwdziałać rosnącej podobieństwu kreatywnych wyników wśród rodzin modeli, a przypadki duplikacji prawdopodobnie ujawnią się w bardziej publiczny i żenujący sposób.
* Pełna lista modeli to Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; i GLM-5.2
** Podkreślenia autorów, nie moje.
† Moja konwersja cytowań w tekście autorów na hiperłącza.
Po raz pierwszy opublikowano w piątek, 21 sierpnia 2026












