Погляд Anderson
Творчі результати ШІ‑моделей стають схожими між постачальниками

Нові дослідження свідчать, що ШІ‑моделі конкурентних компаній стають більш схожими у своїх творчих відповідях, що потенційно звужує спектр ідей, які отримують користувачі.
Нові дослідження зі США виявили, що «творчий» вихід у широкого спектру провідних ШІ‑моделей стає дедалі схожішим з часом.
Автори з Університету Дьюка протестували 69 моделей у 12 сімей постачальників, охопивши випуски з 2023 по 2026 роки, і виявили статистично значне зниження різноманітності вихідних відповідей як у реальних відкритих питаннях, так і у стандартному тесті креативності — що свідчить про те, що схожі ідеї все частіше пропонуються у відповідь на «творчі» запити серед усіх провідних постачальників LLM.
Тестовані сімейства постачальників: Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; та Z.ai*:

З нової статті — випуски моделей, використані у дослідженні, з березня 2023 по липень 2026 року. Діаграма охоплює 69 версій моделей у 12 постачальників ШІ, демонструючи, як протестовані моделі розподілені протягом трирічного періоду, і показує все частіші графіки випуску у деяких постачальників, що має бути враховано у підрахунках авторів. Джерело
Автори нової статті стверджують**:
‘Ми виявили, що відповіді LLM на відкриті підказки, які ми [тестуємо], стали дедалі схожішими з часом.’
‘Це свідчить про те, що LLM стають менш креативними у завданнях, що передбачають генерування відкритих відповідей, що вимагає ретельної оцінки їхньої довгострокової корисності як творчих помічників.’
Хоча ‘алгоритмічна монокультура‘ стала усталеною темою досліджень, аналіз тенденцій до однорідності у творчих виходах, згенерованих ШІ, досі не проводився, стверджують автори.
Проте окремі випадки вже деякий час вказували на цю конвергенцію, включаючи дивний випадок, описаний у дослідженні Корнельського університету травня 20026 року, де різноманітний спектр постачальників LLM продемонстрували дивні, зіткнуті одержимості щодо «ліхтарників», а також певний набір анахронічних імен, включаючи «Mara» та «Elias»:

У травні нова стаття Корнельського університету виявила дивні схожості між постачальниками LLM при отриманні «відкритих підказок» — хоча поки що не виявлено причин у різноманітних навчальних даних, що живлять ці моделі.
Нове дослідження є більш систематичним: автори протестували трирічний діапазон моделей як на реальних творчих підказках, так і на класичному психологічному тесті, що запитує незвичні використання повсякденних предметів. Потім вони виміряли, наскільки різними за змістом були відповіді моделей, відстежуючи, чи зменшуються ці відстані між послідовними поколіннями.
Автори нової роботи, названої Чи стають LLM однаково креативними? Докази з трирічного набору моделей, стверджують†:
‘Наші результати, хоча й попередні, викликають занепокоєння щодо довгострокової корисності LLM як творчих партнерів. Навіть якщо моделі добре справляються з творчими завданнями, збіжність виходів може обмежити діапазон можливостей, до яких мають доступ користувачі LLM, і, відповідно, широту їхнього власного мислення.’
‘Якщо використання LLM для творчих завдань, таких як написання есе, зменшує активність мозку, чи може використання все менш креативних LLM — тенденція, яку вказує наше дослідження — ще більше погіршити вплив LLM на людську креативність, як це спостерігалося в цьому та інших дослідженнях?’
Вже різноманітні характеристики тексту LLM стали матеріалом для мемів; і, як ми повідомляли у травні цього року, принаймні один автор уже самостійно опублікував книгу ймовірно містить згадану вище «ліхтарну» одержимість, спільну для основних моделей.
Отже, у середовищі, де видавці все частіше відкликають книги, які вони підозрюють у написанні ШІ або за допомогою ШІ, нові дослідження, здається, вказують на те, що ми можемо очікувати зростання «спільних сюжетних випадків», що виникають у, здавалося б, людсько написаних творах, включаючи академічні роботи, подані студентами.
Щодо того, звідки походить ця конвергенція, автори гіпотетизують, що перекриваючі навчальні дані та все більш схожі цілі оптимізації можуть штовхати моделі до подібних внутрішніх уявлень концепцій і семантичних зв’язків — в результаті генеруючи більш схожі відповіді†:
‘[Це] залишається незрозумілим, чи є ця однорідність тимчасовим побічним ефектом ще розвиваючої технології, чи неминучою — можливо усугублювальною — особливістю статистичних мовних моделей.’
‘Ймовірні сили вказують у обох напрямках. Зростаючий обсяг академічних досліджень свідчить, що генеративні моделі, навчені на перекриваючих даних і оптимізовані до схожих цілей, будуть організовувати концепції та семантичні зв’язки у все більш схожих способах, що призводить до схожих виходів.’
Проте автори також посилаються на дослідження, яке вказує, що з розвитком моделей вони можуть знову розійтись у власний обмежений набір характеристик щодо творчих виходів.
Метод
Щоб відстежити, чи стають ШІ‑моделі більш схожими, дослідники розпочали з відкритих питань, збираючи відповіді від послідовних поколінь моделей. Кожну відповідь перетворювали у числове представлення її змісту, що дозволяє вимірювати, наскільки схожі чи різні були відповіді.
Регресія аналіз була потім використана, щоб встановити, чи ці відмінності зменшуються з випуском нових моделей:

Схема авторів для вимірювання того, чи стають виходи ШІ більш схожими з часом. Відкриті творчі підказки запускалися в різних сімействах моделей, їхні відповіді відображалися за змістом, щоб виміряти відстань між ними, а регресійний аналіз відстежував, як ці відстані змінювалися між послідовними поколіннями моделей.
Було обрано два набори підказок для тестування креативності з різних кутів. По‑першу, Завдання альтернативних використань (AUT), стандартний психологічний тест на дивергентне мислення, запитує незвичні використання звичайних предметів; у дослідженні використано предмети, такі як книга, взуття та молоток. Його фіксований формат забезпечив контрольований спосіб порівняння ідей, створених різними моделями.
Додатково 100 підказок було відібрано з Infinity-Chat100, колекції, отриманої з реальних розмов з мовними моделями. Вони охоплювали менш обмежені творчі завдання, пов’язані зі створенням контенту, розв’язанням проблем, мозковим штурмом та генерацією ідей; завдання, що дозволяють більшу свободу у відповідях та підходах.
Повний набір підказок AUT та Infinity-Chat100 був потім надісланий моделям, випущеним між березнем 2023 та липнем 2026 року, охоплюючи 12 постачальників та системи від Anthropic, Google, Meta, OpenAI, DeepSeek та Mistral AI. Усі відповіді були зібрані через API OpenRouter за однакових налаштувань семплювання, з температурою (свобода творчої відповіді) та top-p, обидва встановлені на одиницю.
Моделі були впорядковані за місяцем випуску, щоб дослідити, чи новіші покоління виробляють більш схожі відповіді.
Оскільки дати випуску не відображають зміни в навчальних даних, архітектурі чи посттренуванні, автори розглядали отриману тенденцію як асоціацію з розвитком моделей, а не як доказ того, що саме проходження часу викликає конвергенцію.
Відповіді моделей потім були перетворені у векторні представлення за допомогою all-MiniLM-L6-v2 sentence‑transformer. Кожна відповідь була представлена як числовий вектор, що дозволяє розташовувати відповіді зі схожим змістом у схожих напрямках та вимірювати їхню семантичну відстань.
Для AUT всі запропоновані використання кожного предмета розглядалися як одна відповідь, створюючи десять векторів на модель. Для Infinity-Chat100 кожна відповідь вбудовувалась окремо, створюючи 100 векторів на модель.
27 місяців випуску були згруповані у дев’ять часових періодів, і порівнювалися лише моделі різних постачальників. Семантичні відстані між їхніми відповідями вимірювалися в межах кожного періоду, причому менші відстані вказували на більшу схожість.
Щоб запобігти домінуванню постачальників з більшою кількістю моделей, аналіз було повторено 1 000 разів, використовуючи збалансовані вибірки від кожного постачальника.
Результати
Лінійна регресія була потім використана для відстеження цих відстаней у часі, причому послідовний негативний нахил вказував на те, що моделі різних постачальників стають більш схожими:

Початкові результати тесту, що показують, чи творчі відповіді різних постачальників ШІ стали більш схожими з часом. Семантичні відстані знизились як для Завдання альтернативних використань, так і для підказок Infinity-Chat100, тоді як повторне збалансоване семплювання дало послідовно негативні тенденції, що вказує на зростаючу схожість між поколіннями моделей.
З цих результатів автори підкреслюють:
‘Для обох наборів відповідей AUT та Infinity-Chat ми спостерігаємо зниження відстаней між виходами різних постачальників протягом спостережуваного періоду.’
‘Це свідчить про зменшення різноманітності — або збільшення однорідності — творчих виходів LLM з часом.’
Різниця між старими та новими моделями була найчіткішою у Завданні альтернативних використань. Середня відстань між відповідями різних постачальників впала з приблизно 0,50 для найраніших моделей до нижче 0,40 для найновіших, що означає, що їхні відповіді стали значно схожішими. Така ж закономірність була виявлена у Infinity-Chat100, хоча зміна була меншою: середня відстань впала з приблизно 0,34 до трохи вище 0,32.

Результати тесту, що вимірюють, як швидко відповіді різних постачальників ШІ стали більш схожими з часом. Завдання «Альтернативні використання» показало значно сильніше зниження різниць між моделями, ніж Infinity-Chat, при цьому обидва результати залишалися стабільними під час повторних тестів вибірки дослідників.
Знахідка також пройшла всі 1 000 раундів збалансованого ресемплінгу. У кожному випадку новіші моделі генерували відповіді, які були ближчими один до одного, ніж у старіших моделей. Розмір цих знижень разом із 95 % довірчими інтервалами дослідників зображено вище.
Щодо цього, у статті зазначено:
‘Величина зниження у AUT особливо помітна, враховуючи мету завдання. AUT явно тестує дивергентне мислення, інструктуючи моделі створювати використання, які є максимально оригінальними та неочікуваними, що саме створює умови, в яких виходи мали б різнитися.’
Результати Infinity-Chat показують, що та сама тенденція також проявилася у набагато ширшому спектрі творчих завдань. Його 100 підказок просили моделі створювати багато різних типів відкритих відповідей, і ці відповіді стали більш схожими з часом.
Зміна була меншою, ніж у Завданні альтернативних використань, але стала очевиднішою серед моделей, випущених з 2025 року. Автори припускають, що це може бути раннім сигналом того, що творчі виходи різних постачальників ШІ загалом стають більш схожими, а не лише в одному конкретному типі тесту.
Висновок
Проблеми, пов’язані з конвергенцією LLM та VLM, залишаються актуальними та зростаючими джерелом занепокоєння як у науковій спільноті, так і серед споживачів нижчепослідовних моделей. Ми підходимо до самого кінця першого і єдиного «чистого» покоління даних, до яких дослідницька сцена коли‑небудь матиме доступ; і рішучість постачальників моделей екстрагувати дані конкурентів неминуче створює ризик конвергенції, оскільки дані стають ідентичними, а принципи навчання моделей схожі, якщо не ідентичні, серед постачальників.
Тому нічого настільки простого, як заміна тире, навряд чи з’явиться, щоб протистояти зростаючій схожості творчих виходів серед сімейств моделей, і випадки дублювання, навпаки, швидше за все, будуть виявлені більш публічно та незручно.
* Повний список моделей: Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; та GLM-5.2
** Наголоси авторів, а не мої.
† Моє перетворення вбудованих посилань авторів у гіперпосилання.
Перший раз опубліковано у п’ятницю, 21 серпня 2026 року












