Погляд Anderson

Творчі результати ШІ‑моделей стають схожими між постачальниками

mm
Додайте Unite.AI до бажаних джерел у Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Нові дослідження свідчать, що ШІ‑моделі конкурентних компаній стають більш схожими у своїх творчих відповідях, що потенційно звужує спектр ідей, які отримують користувачі.

 

Нові дослідження зі США виявили, що «творчий» вихід у широкого спектру провідних ШІ‑моделей стає дедалі схожішим з часом.

Автори з Університету Дьюка протестували 69 моделей у 12 сімей постачальників, охопивши випуски з 2023 по 2026 роки, і виявили статистично значне зниження різноманітності вихідних відповідей як у реальних відкритих питаннях, так і у стандартному тесті креативності — що свідчить про те, що схожі ідеї все частіше пропонуються у відповідь на «творчі» запити серед усіх провідних постачальників LLM.

Тестовані сімейства постачальників: Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; та Z.ai*:

From the new paper - model releases used in the study, from березень 2023 to липень 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

З нової статті — випуски моделей, використані у дослідженні, з березня 2023 по липень 2026 року. Діаграма охоплює 69 версій моделей у 12 постачальників ШІ, демонструючи, як протестовані моделі розподілені протягом трирічного періоду, і показує все частіші графіки випуску у деяких постачальників, що має бути враховано у підрахунках авторів. Джерело

Автори нової статті стверджують**:

‘Ми виявили, що відповіді LLM на відкриті підказки, які ми [тестуємо], стали дедалі схожішими з часом.’

‘Це свідчить про те, що LLM стають менш креативними у завданнях, що передбачають генерування відкритих відповідей, що вимагає ретельної оцінки їхньої довгострокової корисності як творчих помічників.’

Хоча ‘алгоритмічна монокультура‘ стала усталеною темою досліджень, аналіз тенденцій до однорідності у творчих виходах, згенерованих ШІ, досі не проводився, стверджують автори.

Проте окремі випадки вже деякий час вказували на цю конвергенцію, включаючи дивний випадок, описаний у дослідженні Корнельського університету травня 20026 року, де різноманітний спектр постачальників LLM продемонстрували дивні, зіткнуті одержимості щодо «ліхтарників», а також певний набір анахронічних імен, включаючи «Mara» та «Elias»:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

У травні нова стаття Корнельського університету виявила дивні схожості між постачальниками LLM при отриманні «відкритих підказок» — хоча поки що не виявлено причин у різноманітних навчальних даних, що живлять ці моделі.

Нове дослідження є більш систематичним: автори протестували трирічний діапазон моделей як на реальних творчих підказках, так і на класичному психологічному тесті, що запитує незвичні використання повсякденних предметів. Потім вони виміряли, наскільки різними за змістом були відповіді моделей, відстежуючи, чи зменшуються ці відстані між послідовними поколіннями.

Автори нової роботи, названої Чи стають LLM однаково креативними? Докази з трирічного набору моделей, стверджують:

‘Наші результати, хоча й попередні, викликають занепокоєння щодо довгострокової корисності LLM як творчих партнерів. Навіть якщо моделі добре справляються з творчими завданнями, збіжність виходів може обмежити діапазон можливостей, до яких мають доступ користувачі LLM, і, відповідно, широту їхнього власного мислення.’

‘Якщо використання LLM для творчих завдань, таких як написання есе, зменшує активність мозку, чи може використання все менш креативних LLM — тенденція, яку вказує наше дослідження — ще більше погіршити вплив LLM на людську креативність, як це спостерігалося в цьому та інших дослідженнях?’

Вже різноманітні характеристики тексту LLM стали матеріалом для мемів; і, як ми повідомляли у травні цього року, принаймні один автор уже самостійно опублікував книгу ймовірно містить згадану вище «ліхтарну» одержимість, спільну для основних моделей.

Отже, у середовищі, де видавці все частіше відкликають книги, які вони підозрюють у написанні ШІ або за допомогою ШІ, нові дослідження, здається, вказують на те, що ми можемо очікувати зростання «спільних сюжетних випадків», що виникають у, здавалося б, людсько написаних творах, включаючи академічні роботи, подані студентами.

Щодо того, звідки походить ця конвергенція, автори гіпотетизують, що перекриваючі навчальні дані та все більш схожі цілі оптимізації можуть штовхати моделі до подібних внутрішніх уявлень концепцій і семантичних зв’язків — в результаті генеруючи більш схожі відповіді:

‘[Це] залишається незрозумілим, чи є ця однорідність тимчасовим побічним ефектом ще розвиваючої технології, чи неминучою — можливо усугублювальною — особливістю статистичних мовних моделей.’

‘Ймовірні сили вказують у обох напрямках. Зростаючий обсяг академічних досліджень свідчить, що генеративні моделі, навчені на перекриваючих даних і оптимізовані до схожих цілей, будуть організовувати концепції та семантичні зв’язки у все більш схожих способах, що призводить до схожих виходів.’

Проте автори також посилаються на дослідження, яке вказує, що з розвитком моделей вони можуть знову розійтись у власний обмежений набір характеристик щодо творчих виходів.

Метод

Щоб відстежити, чи стають ШІ‑моделі більш схожими, дослідники розпочали з відкритих питань, збираючи відповіді від послідовних поколінь моделей. Кожну відповідь перетворювали у числове представлення її змісту, що дозволяє вимірювати, наскільки схожі чи різні були відповіді.

Регресія аналіз була потім використана, щоб встановити, чи ці відмінності зменшуються з випуском нових моделей:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Схема авторів для вимірювання того, чи стають виходи ШІ більш схожими з часом. Відкриті творчі підказки запускалися в різних сімействах моделей, їхні відповіді відображалися за змістом, щоб виміряти відстань між ними, а регресійний аналіз відстежував, як ці відстані змінювалися між послідовними поколіннями моделей.

Було обрано два набори підказок для тестування креативності з різних кутів. По‑першу, Завдання альтернативних використань (AUT), стандартний психологічний тест на дивергентне мислення, запитує незвичні використання звичайних предметів; у дослідженні використано предмети, такі як книга, взуття та молоток. Його фіксований формат забезпечив контрольований спосіб порівняння ідей, створених різними моделями.

Додатково 100 підказок було відібрано з Infinity-Chat100, колекції, отриманої з реальних розмов з мовними моделями. Вони охоплювали менш обмежені творчі завдання, пов’язані зі створенням контенту, розв’язанням проблем, мозковим штурмом та генерацією ідей; завдання, що дозволяють більшу свободу у відповідях та підходах.

Повний набір підказок AUT та Infinity-Chat100 був потім надісланий моделям, випущеним між березнем 2023 та липнем 2026 року, охоплюючи 12 постачальників та системи від Anthropic, Google, Meta, OpenAI, DeepSeek та Mistral AI. Усі відповіді були зібрані через API OpenRouter за однакових налаштувань семплювання, з температурою (свобода творчої відповіді) та top-p, обидва встановлені на одиницю.

Моделі були впорядковані за місяцем випуску, щоб дослідити, чи новіші покоління виробляють більш схожі відповіді.

Оскільки дати випуску не відображають зміни в навчальних даних, архітектурі чи посттренуванні, автори розглядали отриману тенденцію як асоціацію з розвитком моделей, а не як доказ того, що саме проходження часу викликає конвергенцію.

Відповіді моделей потім були перетворені у векторні представлення за допомогою all-MiniLM-L6-v2 sentence‑transformer. Кожна відповідь була представлена як числовий вектор, що дозволяє розташовувати відповіді зі схожим змістом у схожих напрямках та вимірювати їхню семантичну відстань.

Для AUT всі запропоновані використання кожного предмета розглядалися як одна відповідь, створюючи десять векторів на модель. Для Infinity-Chat100 кожна відповідь вбудовувалась окремо, створюючи 100 векторів на модель.

27 місяців випуску були згруповані у дев’ять часових періодів, і порівнювалися лише моделі різних постачальників. Семантичні відстані між їхніми відповідями вимірювалися в межах кожного періоду, причому менші відстані вказували на більшу схожість.

Щоб запобігти домінуванню постачальників з більшою кількістю моделей, аналіз було повторено 1 000 разів, використовуючи збалансовані вибірки від кожного постачальника.

Результати

Лінійна регресія була потім використана для відстеження цих відстаней у часі, причому послідовний негативний нахил вказував на те, що моделі різних постачальників стають більш схожими:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Початкові результати тесту, що показують, чи творчі відповіді різних постачальників ШІ стали більш схожими з часом. Семантичні відстані знизились як для Завдання альтернативних використань, так і для підказок Infinity-Chat100, тоді як повторне збалансоване семплювання дало послідовно негативні тенденції, що вказує на зростаючу схожість між поколіннями моделей.

З цих результатів автори підкреслюють:

‘Для обох наборів відповідей AUT та Infinity-Chat ми спостерігаємо зниження відстаней між виходами різних постачальників протягом спостережуваного періоду.’

‘Це свідчить про зменшення різноманітності — або збільшення однорідності — творчих виходів LLM з часом.’

Різниця між старими та новими моделями була найчіткішою у Завданні альтернативних використань. Середня відстань між відповідями різних постачальників впала з приблизно 0,50 для найраніших моделей до нижче 0,40 для найновіших, що означає, що їхні відповіді стали значно схожішими. Така ж закономірність була виявлена у Infinity-Chat100, хоча зміна була меншою: середня відстань впала з приблизно 0,34 до трохи вище 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Результати тесту, що вимірюють, як швидко відповіді різних постачальників ШІ стали більш схожими з часом. Завдання «Альтернативні використання» показало значно сильніше зниження різниць між моделями, ніж Infinity-Chat, при цьому обидва результати залишалися стабільними під час повторних тестів вибірки дослідників.

Знахідка також пройшла всі 1 000 раундів збалансованого ресемплінгу. У кожному випадку новіші моделі генерували відповіді, які були ближчими один до одного, ніж у старіших моделей. Розмір цих знижень разом із 95 % довірчими інтервалами дослідників зображено вище.

Щодо цього, у статті зазначено:

‘Величина зниження у AUT особливо помітна, враховуючи мету завдання. AUT явно тестує дивергентне мислення, інструктуючи моделі створювати використання, які є максимально оригінальними та неочікуваними, що саме створює умови, в яких виходи мали б різнитися.’

Результати Infinity-Chat показують, що та сама тенденція також проявилася у набагато ширшому спектрі творчих завдань. Його 100 підказок просили моделі створювати багато різних типів відкритих відповідей, і ці відповіді стали більш схожими з часом.

Зміна була меншою, ніж у Завданні альтернативних використань, але стала очевиднішою серед моделей, випущених з 2025 року. Автори припускають, що це може бути раннім сигналом того, що творчі виходи різних постачальників ШІ загалом стають більш схожими, а не лише в одному конкретному типі тесту.

Висновок

Проблеми, пов’язані з конвергенцією LLM та VLM, залишаються актуальними та зростаючими джерелом занепокоєння як у науковій спільноті, так і серед споживачів нижчепослідовних моделей. Ми підходимо до самого кінця першого і єдиного «чистого» покоління даних, до яких дослідницька сцена коли‑небудь матиме доступ; і рішучість постачальників моделей екстрагувати дані конкурентів неминуче створює ризик конвергенції, оскільки дані стають ідентичними, а принципи навчання моделей схожі, якщо не ідентичні, серед постачальників.

Тому нічого настільки простого, як заміна тире, навряд чи з’явиться, щоб протистояти зростаючій схожості творчих виходів серед сімейств моделей, і випадки дублювання, навпаки, швидше за все, будуть виявлені більш публічно та незручно.

 

* Повний список моделей: Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; та GLM-5.2

** Наголоси авторів, а не мої.

Моє перетворення вбудованих посилань авторів у гіперпосилання.

Перший раз опубліковано у п’ятницю, 21 серпня 2026 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai