Взгляд Anderson

Почему ИИ любит писать о смотрителях маяков?

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

Когда их просят ‘написать историю’, ChatGPT и другие ведущие языковые модели, кажется, избегают нарушения авторских прав, постоянно обращаясь к одному и тому же небольшому и странному набору элементов повествования, таких как смотрители маяков, рыбаки и часовщики.

 

Новое исследование Корнелльского университета показало, что ведущие языковые модели имеют странную одержимость очень узким выбором элементов повествования, когда им предлагается просто ‘написать историю’. После того, как четыре модели LLM были попрошены написать 20 000 историй, они обнаружили, что 88% историй содержали хотя бы один из 11 очень конкретных токенов в категории ‘место’, ‘имя’ или ‘профессия’:

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers' analysis of 20,000 LLM-generated stories. Source - https://arxiv.org/pdf/2605.26492

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers’ analysis of 20,000 LLM-generated stories. Source

11 наиболее часто встречающихся слов в 12+ миллионах слов, сгенерированных LLM для исследования, были именами Элиас, Мара, Элара; профессиями смотритель, пекарь, мэр, часовщик, рыбак, библиотекарь и дирижер; и местом маяк:

Исследованные модели были Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini и OLMo 7b Thinking. Все они были попрошены написать историю с одним из пяти запросов: ‘Напишите историю’; ‘Пожалуйста, напишите историю’; ‘Напишите мне историю’; ‘Расскажите мне историю’; или ‘Пожалуйста, расскажите историю’.

Любопытно узнать, присутствует ли этот синдром в моделях, доступных на момент написания, я попробовал провести эксперимент сам, сначала на своей обычной средней версии ChatGPT (ссылка на разговор здесь). Никакого отбора не требовалось – ChatGPT-5.5 сразу же подтвердил предсказания исследователей, на первый раз:

ChatGPT-5.5 immediately backs up the paper's initial findings. Source - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 immediately backs up the paper’s initial findings. Source

Задумавшись о том, может ли исторический контекст или даже возможная утечка между доменами объяснить эту ‘мгновенную попадание’, я вошел в бесплатный аккаунт ChatGPT, который я не использовал более года, в приватном окне браузера Firefox, и попробовал еще раз (ссылка на разговор здесь). Снова, на первый раз (при условии, что OpenAI не использует общий IP-адрес для пополнения разных аккаунтов), ChatGPT ‘выбил мяч из парка’:

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. Source - https://chatgpt.com/share/6a16b210-d450-83ea-936e-78c6062ca74d

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. ‘Mira’ is in the authors’ top 20.  Source

Стоит отметить, что эти версии GPT были на ступень выше 5.4, протестированной в статье.

Хотя Claude Haiku был протестирован в статье, я попробовал стандартный Sonnet 4.6 от Anthropic, и не был разочарован. Снова, знакомые ключевые слова появились на первый раз (ссылка на разговор здесь):

This time 'Mara', another stalwart from the 'top 11', leads the story, in the first attempt on Claude Sonnet 4.6. Source - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

This time ‘Mara’, another stalwart from the ‘top 11’, leads the story, in the first attempt on Claude Sonnet 4.6. Source

Попробовав тот же запрос на Claude Haiku 4.5, получил практически то же самое.

Сначала я не смог воспроизвести выводы авторов на Google Gemini, пока не изменил модель на ту, которая была использована в статье, Gemini 3.1 Flash-Lite – и тогда, на третий раз (но первый с этой моделью), закономерность появилась сразу (ссылка здесь):

Google Gemini 3.1 Flash-Lite. Source - https://gemini.google.com/share/82c245884ec1

Google Gemini 3.1 Flash-Lite. Source

Дальнейшие эксперименты с разными моделями Gemini неизбежно приводили к теме маяка, хотя с вариантами, не представленными в ‘топ-11’, такими как имя ‘Томас’, и, в другом варианте, моим собственным именем, как протагонистом.

Тем не менее на момент написания статьи выводы исследования было чрезвычайно легко подтвердить.

Маяки в дикой природе

Великие умы думают одинаково: неделю назад, до публикации новой статьи, программист Даниэль Мэй указал на совпадение тропа Элиас и смотритель маяка, выделенного исследователями*, видимо, заметив это случайно. Он продолжил тестировать восемь вариантов Gemini, DeepSeek, Qwen и Gemma, и обнаружил, что они будут производить мемы маяка и ‘Элиас Торн’ как протагонист*. Однако, это первоначальное открытие не распространялось на более широкий спектр постоянных тем, изложенных в новой статье.

Любопытно узнать, смогут ли эти повторяющиеся темы, имена и места вырваться из чата, я поискал некоторые из топ-11 ключевых слов и тем в Google и обнаружил удивительное количество постов, которые, кажется, канализировали их:

Three examples of the meme in output. See below for source links.

Three examples of the meme in output. See below for source links.

Мэй определил более длинный ‘Элиас Торн’ (а не просто ‘Элиас’) как постоянный мем LLM, и опубликовал различные скриншоты с Amazon , где это имя было использовано как название для авторов/автора различных книг, включая медицинские книги.

Вместо этого я нашел материалы, которые, по-видимому, воспроизводили устойчивые темы LLM: публикацию истории в X и ее архивную версию, художественное произведение и его архивную версию, а также рассказ с озвучкой на YouTube и его архив. Материалов было гораздо больше, но времени на их изучение не хватило. ( ( ( ( ( (источник)источник)источник)источник)источник)источник)

Вкус к прошлому

Итак, что касается случайных наблюдений и серендипитета. Хотя нет единой ‘магической документации’ в обучающих данных, которая бы включала все или большинство постоянных элементов, авторы новой статьи (названной Элиас в маяке, снова? Диагностика низкого разнообразия в историях LLM, от двух исследователей Корнелльского университета) предполагают, что фильтры авторских прав в разработке ИИ могут ограничивать вымышленный вывод в LLM до материала, который находится в общественном достоянии.

Авторы утверждают:

‘Мы обнаружили, что доминирование историй “Элиас в маяке” не может быть объяснено их распространением в пред- или пост-обучающих данных. Мы предполагаем, что модели обучены избегать ссылок на защищенные авторским правом персонажи и контент для взрослых во время выравнивания, но откладываем этот вопрос на будущую работу.’

Категория Токен Наш Лит Предварительные нехудожественные Предварительные художественные Постнехудожественные Постхудожественные
Имя элиас 2,428 2.7 2.2 4.0 0.4 52.7
Имя мара 5,200 3.9 2.5 8.7 0.4 21.7
Имя элара 1,221 0.0 0.4 1.2 0.9 108
Профессия смотритель 1,495 7.2 6.3 14.7 3.5 10.0
Профессия пекарь 161 20 11.8 10.56 1.7 11.9
Профессия мэр 198 28 11.5 16.1 1.4 27.4
Профессия часовщик 108 0.1 0.18 0.0 0.3 1.4
Профессия рыбак 62 4.2 3.0 7.6 0.0 9.3
Профессия библиотекарь 68 5.3 7.6 5.9 2.3 11.5
Профессия дирижер 96 5.0 5.9 5.7 4.7 7.5
Место маяк 3,005 5.5 3.5 4.6 4.6 10.1

Таблица сравнения, показывающая, как часто повторяющиеся слова из историй ИИ появляются в опубликованной литературе, веб-фикции и пост-обучающих данных, с терминами, такими как ‘Элиас’ и ‘маяк’, которые появляются гораздо чаще в чат-ботах, написанных историях.

В исследовании авторы обнаружили, что подчеркнутые 11 слов появляются в 88% из 20 000 историй, сгенерированных LLM, и что существует ‘мало различий между моделями’. Они подчеркивают, что эти слова являются необычными в опубликованной английской литературе, и что пост-обучающие данные (данные, предназначенные для условирования и выравнивания моделей в ‘допустимое’ использование) могут быть ответственными.

Статья гласит:

‘Типичный пример, показанный [ниже], подчеркивает три элемента, общие для почти всех 20 000 историй: место (19 864 истории), имя персонажа (19 864 истории) и профессия (15 807 историй).

‘Фактически, конкретное место (“маяк”), имя (“Элиас”) и профессия (“смотритель”) в этой истории появляются в некотором сочетании в 66,6% всех сгенерированных историй. Свет также является общей темой: 56% историй, сгенерированных Claude, названы “Секрет смотрителя маяка” и слово “свет” появляется в 16 784 историях со средней скоростью 3,2 экземпляра на историю.’

Этот пример, как утверждается в статье, был написан Google Gemini 3.1 Flash-Lite в ответ на запрос «Напиши рассказ».

Этот пример, как утверждается в статье, был написан Google Gemini 3.1 Flash-Lite в ответ на запрос «Напиши рассказ».

Стоит отметить, что авторы исследования выявляют ностальгическую или атавистическую тенденцию во всех полученных ключевых словах и именах.

Преследуя черты

Чтобы проверить, могут ли повторяющиеся ‘маячные’ истории быть объяснены обычной экспозицией к художественной литературе, сравнения были сделаны между любимыми повторяющимися словами моделей и несколькими большими англоязычными корпусами. Современная художественная литература была изучена через CONLIT, набор данных, содержащий 2 700 английских романов, опубликованных между 2007 и 2021 годами, охватывающий 12 жанров и в общей сложности примерно 287 миллионов слов.

‘Элиас’ появляется примерно в 900 раз чаще в сгенерированных историях, чем в опубликованной художественной литературе. Аматорская художественная литература из сообщества /r/writingprompts Reddit произвела подобные частоты, указывая на то, что закономерность не отражает более широкие человеческие привычки рассказывания историй.

Та же закономерность сохранялась, когда предварительные обучающие данные были изучены. Используя открыто доступный OLMo 3 корпус, который содержит примерно 3,89 миллиарда в основном человеческих документов, частично из Common Crawl, исследователи обнаружили, что повторяющиеся ‘ядро’ слова едва появляются.

Поскольку значительная часть корпуса OLMo 3 состоит из нехудожественных текстов, исследователи построили классификатор художественной литературы на аннотациях GPT-OSS 20b и модели FastText, обученной на 200 000 сбалансированных примеров. Даже после фильтрации только художественных материалов такие слова, как «Элара», встречались ничтожно редко по сравнению с историями, созданными ИИ. Почему же тогда они доминируют в ответах на простейшую команду написать художественный текст? ( (источник)источник)

Авторы утверждают:

‘Если ядро-слова не распространены в веб-данных, то одной из оставшихся возможностей будет пост-обучающие данные. Но мы обнаружили, что пост-обучающие данные OLMo содержат наши токены с более низкой скоростью, чем CONLIT.

В 78 958 историях из пост-обучающих наборов данных OLMo 3, ‘Элиас’ появляется 52,7 раза на миллион слов, по сравнению с 2,7 в CONLIT, но достигает 2 428 появлений на миллион слов в сгенерированных историях, изученных в исследовании.

Чтобы определить, откуда берутся повторяющиеся ‘ядро’-истории, каждая история в пост-обучающих данных OLMo 3 была оценена на наличие одного или нескольких ядро-токенов (т.е. на наличие Элары, Мары и т. д.). Большинство из них, как ожидается, появится в наборах данных, полученных в результате WildChat и связанных с ними источников, поскольку WildChat и связанные с ним источники внесли 59 266 историй в OLMo 3.

Однако только 1 803 содержали ядро-термины, в то время как наборы данных, используемые для DPO и усилению обучения, показали более высокие концентрации.

В целом, повторяющееся ядро-словарь было отслежено до всего 3 053 историй, представляющих 3,8% всех пост-обучающих историй, изученных. Нет статистической возможности для такого небольшого подмножества корпуса, чтобы доминировать в нем таким образом.

Статья заключает:

‘Когда им дано мало направления, текущие передовые модели пишут истории, используя узкий каталог имен, мест и профессий. Повторяющиеся персонажи в этих историях включают Элиаса, смотрителя маяка. Элиас необычен; имя не распространено в литературе, веб-данных и даже пост-обучающих данных.’

Заключение

В отсутствие единой работы литературы (или даже серии), в которой представлены топ-11 слов, которые авторы определяют, не совсем ясно, каким образом эта конкретная коллекция слов накопилась и ассоциировалась на самых низких уровнях нескольких больших языковых моделей (несмотря на их разнообразие обучающих данных и подходов).

Даже если утверждение исследователей о ограничивающем эффекте фильтров авторских прав является правильным, огромное количество классической литературы в обучающих данных должно было предотвратить это странное собрание старомодных слов от доминирования в выводе неквалифицированного запроса ‘напишите’.

Это предположение предполагает, однако, что огромные объемы классической литературы будут включены в обучающий режим вообще. Это маловероятно, поскольку того, чего хотят, это модели, которые не будут производить фальшивые произведения Диккенса, а скорее модели, которые будут иметь дело с современным лексиконом и будут подходящими для современных деловых потребностей. Сам объем даже доиндустриальной литературы исключил бы ее включение.

В любом случае, если была одна отдельная повествовательная работа, включающая некоторую комбинацию ‘одержимых’ аспектов, которые авторы отмечают, она, вероятно, была бы легче найти; сами авторы не смогли найти ее, и случайные поиски в до-ИИ-эре не обнаружили никакого претендента. Может быть, если ‘синдром маяка’ приобретет такую же известность, как ИИ-тире, какая-то академическая власть придет с ответом.

 

* Я не могу продолжить статью Мэя, по причинам, которые могут стать очевидными, когда вы прочитаете ее.

Опубликовано в среду, 27 мая 2026 года. Изменено в течение первых 30 минут, чтобы исправить ссылку на Anthropic.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai