Взгляд Anderson

Творческий вывод ИИ‑моделей становится похожим у разных провайдеров

mm
Добавьте Unite.AI в избранные источники в Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Новое исследование показывает, что ИИ‑модели конкурирующих компаний становятся всё более похожими в своих творческих ответах, что может сузить диапазон идей, с которыми сталкиваются пользователи.

 

Новое исследование из США обнаружило, что «творческий» вывод широкого спектра ведущих ИИ‑моделей со временем становится всё более похожим.

Авторы из Университета Дьюка протестировали 69 моделей в 12 семейств провайдеров, охватывая выпуски с 2023 по 2026 годы, и выявили статистически значимое снижение разнообразия выводов как по реальным открытым вопросам, так и по стандартному тесту креативности – что указывает на то, что похожие идеи всё чаще предлагаются в ответ на «творческие» запросы у всех основных поставщиков LLM.

Тестируемыми семействами провайдеров были Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; и Z.ai*:

From the new paper - model releases used in the study, from март 2023 to июль 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed ...

Из новой статьи – выпуски моделей, использованные в исследовании, с марта 2023 года по июль 2026 года. Диаграмма охватывает 69 версий моделей от 12 провайдеров ИИ, показывая, как тестируемые модели распределялись в течение трёх лет, и демонстрирует всё более частые графики выпусков у некоторых провайдеров, что необходимо учитывать в расчётах авторов. Источник – https://arxiv.org/pdf/2608.19437 Источник

Авторы новой статьи заявляют**:

«Мы обнаружили, что ответы LLM на открытые подсказки, которые мы [тестируем], со временем становятся всё более похожими.

«Это указывает на то, что LLM становятся менее креативными в задачах, требующих генерации открытых ответов, что требует тщательного анализа их долгосрочной полезности в качестве творческих помощников».

Хотя «алгоритмическая монокультура» уже стала устоявшейся темой исследований, изучение тенденций к однородности в творческих выводах ИИ‑моделей до сих пор не проводилось, утверждают авторы.

Тем не менее, отдельные случаи указывали на такое сближение уже некоторое время, включая странный пример, описанный в исследовании Корнеллского университета май 20026 года, где разнообразные провайдеры LLM продемонстрировали странные, совпадающие «одержимости» темой «маячных смотрителей» и набором анахронных имён, среди которых «Mara» и «Elias»:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

В мае новое исследование Корнеллского университета обнаружило странные сходства между провайдерами LLM при работе с «открытыми подсказками» – хотя пока нет объяснений, почему такие сходства появляются в разнообразных обучающих данных, питающих эти модели.

Новое исследование более систематично: авторы протестировали три года моделей как на реальных творческих подсказках, так и на классическом психологическом тесте, который запрашивает необычные применения обычных предметов. Затем они измерили, насколько ответы моделей различаются по смыслу, отслеживая, сокращаются ли эти различия в последующих поколениях.

Авторы новой работы под названием Are LLMs becoming similarly creative? Evidence from three years of models утверждают:

«Наши предварительные выводы вызывают опасения относительно долгосрочной полезности LLM в качестве творческих партнёров. Даже если модели хорошо справляются с творческими задачами, сходящиеся выводы могут ограничить диапазон возможностей, с которыми сталкиваются пользователи LLM, и, соответственно, сузить широту их собственного мышления.»

«Если использование LLM для творческих задач, таких как написание эссе, снижает мозговую активность, может ли использование всё менее творческих LLM – тенденция, предложенная нашим исследованием – ещё сильнее ухудшать влияние LLM на человеческую креативность, как показали это исследование и другие исследования

Уже сейчас разнообразные характеристики текста LLM стали материалом для мемов; и, как мы сообщали в мае этого года, по крайней мере один из авторов уже самостоятельно опубликовал книгу по-видимому посвящённую упомянутой «маячной» фиксации, характерной для крупных моделей.

Таким образом, в условиях, когда издатели всё чаще отказываются от книг, которые они подозревают в том, что они написаны ИИ или с его помощью, новое исследование, по‑видимому, указывает на рост «совпадений сюжетов», возникающих в, казалось бы, написанных человеком произведениях, включая академические работы студентов.

Что касается причин этого сближения, авторы предполагают, что перекрывающиеся обучающие данные и всё более схожие цели оптимизации могут подталкивать модели к сходным внутренним представлениям концепций и семантических отношений – в конечном итоге порождая более похожие ответы:

«[Пока] неясно, является ли эта однородность временным побочным продуктом всё ещё развивающейся технологии или неизбежной – потенциально усугубляющейся – особенностью статистических языковых моделей.»

«Возможные силы указывают в обе стороны. Растущее количество академических работ свидетельствует о том, что генеративные модели, обученные на перекрывающихся данных и оптимизированные к схожим целям, будут организовывать концепции и семантические отношения в всё более похожие способы, приводя к похожим выводам.»

Однако авторы также ссылаются на исследование, указывающее, что по мере развития моделей они могут вновь разойтись, сформировав собственный набор характеристик творческого вывода.

Метод

Для отслеживания того, становятся ли ИИ‑модели более похожими, исследователи начали с открытых вопросов, собирая ответы последовательно выпущенных поколений моделей. Каждый ответ был преобразован в числовое представление его смысла, что позволило измерять, насколько похожи или различны ответы.

Регрессионный анализ затем использовался для определения того, сокращаются ли эти различия по мере выпуска новых моделей:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Схема авторов для измерения того, становятся ли выводы ИИ более похожими со временем. Открытые творческие подсказки запускались на разных семействам моделей, их ответы сопоставлялись по смыслу для измерения расстояния между ними, а регрессионный анализ отслеживал, как эти расстояния меняются в последующих поколениях моделей.

Были выбраны два набора подсказок для проверки креативности с разных сторон. Сначала задача альтернативных применений (AUT), стандартный психологический тест дивергентного мышления, запрашивает необычные применения обычных предметов; в исследовании использовались такие предметы, как книга, обувь и молоток. Его фиксированный формат предоставил контролируемый способ сравнения идей, генерируемых разными моделями.

Дополнительные 100 подсказок были отобраны из Infinity-Chat100, набора, сформированного на основе реальных разговоров с языковыми моделями. Они охватывали менее ограниченные творческие задачи, связанные с генерацией контента, решением проблем, мозговым штурмом и идеацией; задачи, позволяющие большую свободу в формировании ответов и подходов.

Полные наборы подсказок AUT и Infinity-Chat100 были затем отправлены моделям, выпущенным с марта 2023 года по июль 2026 года, охватывая 12 провайдеров и систем от Anthropic, Google, Meta, OpenAI, DeepSeek и Mistral AI. Все ответы собирались через API OpenRouter при одинаковых настройках сэмплинга, при этом temperature (степень творческой свободы) и top-p были установлены в единицу.

Модели упорядочивали по месяцу выпуска, чтобы проверить, производят ли более новые поколения более похожие ответы.

Поскольку даты выпуска не отражают изменения в обучающих данных, архитектуре или пост‑тренинге, авторы рассматривали наблюдаемый тренд как связь с развитием модели, а не как доказательство того, что сам факт прохождения времени приводит к конвергенции.

Ответы моделей затем преобразовывались в эмбеддинги с помощью трансформера предложений all-MiniLM-L6-v2. Каждый ответ представлялся в виде числового вектора, позволяющего размещать ответы с похожими смыслами в схожих направлениях и измерять их семантическое расстояние.

Для AUT все предложенные применения каждого предмета рассматривались как единый ответ, создавая десять эмбеддингов на модель. Для Infinity-Chat100 каждый ответ эмбеддировался отдельно, получая 100 эмбеддингов на модель.

27 месяцев выпуска были сгруппированы в девять периодов, и сравнивались только модели разных провайдеров. Семантические расстояния между их ответами измерялись в рамках каждого периода; меньшие расстояния указывали на большую схожесть.

Для предотвращения доминирования провайдеров с большим количеством моделей анализ был повторён 1 000 раз, используя сбалансированные выборки от каждого провайдера.

Результаты

Для отслеживания этих расстояний во времени использовалась линейная регрессия, при которой постоянный отрицательный наклон указывал на то, что модели разных провайдеров становятся более похожими:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Начальные результаты тестов, показывающие, становятся ли творческие ответы разных провайдеров ИИ более похожими со временем. Семантические расстояния сократились как для задачи альтернативных применений, так и для подсказок Infinity-Chat100, а повторные сбалансированные выборки consistently gave negative trends, indicating increasing similarity across model generations.

Из этих результатов авторы подчёркивают:

«Для обоих наборов ответов AUT и Infinity-Chat мы наблюдаем снижение межпровайдерных расстояний вывода за период наблюдения.

«Это свидетельствует о снижении разнообразия – или росте однородности – творческих выводов LLM со временем.»

Разница между старыми и новыми моделями была наиболее заметна в задаче альтернативных применений. Среднее расстояние между ответами разных провайдеров упало с примерно 0,50 у самых ранних моделей до менее 0,40 у новейших, что означает существенное сближение ответов. Аналогичная тенденция наблюдалась и в Infinity-Chat100, хотя изменение было менее выраженным: среднее расстояние снизилось с около 0,34 до чуть выше 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Результаты тестов, измеряющие, как быстро ответы разных провайдеров ИИ становятся более похожими со временем. Задача «Альтернативные применения» показала гораздо более сильное снижение различий между моделями, чем Infinity-Chat, при этом оба результата оставались согласованными в повторных выборках исследователей.

Этот вывод выдержал все 1 000 раундов сбалансированного ресэмплинга. В каждом случае новые модели генерировали ответы, ближе друг к другу, чем у старых моделей. Размеры этих снижения, вместе с 95 % доверительными интервалами исследователей, изображены выше.

В этом контексте статья заявляет:

«Величина снижения AUT особенно примечательна, учитывая цель задачи. AUT явно тестирует дивергентное мышление, заставляя модели предлагать применения, как можно более оригинальные и неожиданныe, что именно в такой обстановке ожидается различие выводов.»

Результаты Infinity-Chat показывают, что та же тенденция проявилась и в гораздо более широком спектре творческих задач. Его 100 подсказок просили модели генерировать множество разных открытых ответов, и эти ответы со временем стали более похожими.

Изменение было менее заметным, чем в задаче альтернативных применений, но стало яснее среди моделей, выпущенных с 2025 года. Авторы предполагают, что это может быть ранним признаком того, что творческие выводы разных провайдеров ИИ становятся в целом более похожими, а не только в рамках одного конкретного теста.

Заключение

Вопросы конвергенции LLM и VLM продолжают вызывать растущую озабоченность как в исследовательском сообществе, так и среди потребителей downstream‑моделей. Мы приближаемся к концу первой и единственной «чистой» генерации данных, к которой исследователи когда‑либо получат доступ; а стремление провайдеров экстрагировать данные конкурентов неизбежно повышает риск конвергенции, поскольку данные становятся идентичными, а принципы обучения моделей схожи, если не идентичны, между провайдерами.

Поэтому ничего столь простого, как замена тире, вряд ли поможет бороться с растущей схожестью творческих выводов среди семейств моделей, а случаи дублирования, скорее всего, будут выявляться более публично и неловко.

 

* Полный список моделей: Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; и GLM-5.2

** Авторские акценты, а не мои.

Моя конверсия авторских внутритекстовых ссылок в гиперссылки.

Первоначально опубликовано в пятницу, 21 августа 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai