Взгляд Anderson
Почему ИИ любит писать о смотрителях маяков?

Когда их просят ‘написать историю’, ChatGPT и другие ведущие языковые модели, кажется, избегают нарушения авторских прав, постоянно обращаясь к одному и тому же небольшому и странному набору элементов повествования, таких как смотрители маяков, рыбаки и часовщики.
Новое исследование Корнелльского университета показало, что ведущие языковые модели имеют странную одержимость очень узким выбором элементов повествования, когда им предлагается просто ‘написать историю’. После того, как четыре модели LLM были попрошены написать 20 000 историй, они обнаружили, что 88% историй содержали хотя бы один из 11 очень конкретных токенов в категории ‘место’, ‘имя’ или ‘профессия’:

Частота встречаемости маловероятных ключевых слов, представленная в миллионных долях, полученная в результате анализа 20 000 историй, сгенерированных LLM. Источник
11 наиболее часто встречающихся слов в 12+ миллионах слов, сгенерированных LLM для исследования, были именами Элиас, Мара, Элара; профессиями смотритель, пекарь, мэр, часовщик, рыбак, библиотекарь и дирижер; и местом маяк:
Исследованные модели были Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini и OLMo 7b Thinking. Все они были попрошены написать историю с одним из пяти запросов: ‘Напишите историю’; ‘Пожалуйста, напишите историю’; ‘Напишите мне историю’; ‘Расскажите мне историю’; или ‘Пожалуйста, расскажите историю’.
Любопытно узнать, присутствует ли этот синдром в моделях, доступных на момент написания, я попробовал провести эксперимент сам, сначала на своей обычной средней версии ChatGPT (ссылка на разговор здесь). Никакого отбора не требовалось – ChatGPT-5.5 сразу же подтвердил предсказания исследователей, на первый раз:

ChatGPT-5.5 сразу же подтвердил первоначальные выводы исследования. Источник
Задумавшись о том, может ли исторический контекст или даже возможная утечка между доменами объяснить эту ‘мгновенную попадание’, я вошел в бесплатный аккаунт ChatGPT, который я не использовал более года, в приватном окне браузера Firefox, и попробовал еще раз (ссылка на разговор здесь). Снова, на первый раз (при условии, что OpenAI не использует общий IP-адрес для пополнения разных аккаунтов), ChatGPT ‘выбил мяч из парка’:

Второй аккаунт ChatGPT следует одной и той же одержимости и крошечной книге имен и тем, изложенных в новой статье. ‘Мира’ входит в топ-20 авторов. Источник
Стоит отметить, что эти версии GPT были на ступень выше 5.4, протестированной в статье.
Хотя Claude Haiku был протестирован в статье, я попробовал стандартный Sonnet 4.6 от Anthropic, и не был разочарован. Снова, знакомые ключевые слова появились на первый раз (ссылка на разговор здесь):

В этот раз ‘Мара’, еще один стойкий из ‘топ-11’, возглавляет историю, в первом подходе к Claude Sonnet 4.6. Источник
Попробовав тот же запрос на Claude Haiku 4.5, получил практически то же самое.
Сначала я не смог воспроизвести выводы авторов на Google Gemini, пока не изменил модель на ту, которая была использована в статье, Gemini 3.1 Flash-Lite – и тогда, на третий раз (но первый с этой моделью), закономерность появилась сразу (ссылка здесь):

Google Gemini 3.1 Flash-Lite. Источник
Дальнейшие эксперименты с разными моделями Gemini неизбежно приводили к теме маяка, хотя с вариантами, не представленными в ‘топ-11’, такими как имя ‘Томас’, и, в другом варианте, моим собственным именем, как протагонистом.
Маяки в дикой природе
Великие умы думают одинаково: неделю назад, до публикации новой статьи, программист Даниэль Мэй указал на совпадение тропа Элиас и смотритель маяка, выделенного исследователями*, видимо, заметив это случайно. Он продолжил тестировать восемь вариантов Gemini, DeepSeek, Qwen и Gemma, и обнаружил, что они будут производить мемы маяка и ‘Элиас Торн’ как протагонист*. Однако, это первоначальное открытие не распространялось на более широкий спектр постоянных тем, изложенных в новой статье.
Любопытно узнать, смогут ли эти повторяющиеся темы, имена и места вырваться из чата, я поискал некоторые из топ-11 ключевых слов и тем в Google и обнаружил удивительное количество постов, которые, кажется, канализировали их:

Три примера мема в выводе. См. ниже для ссылок на источники.
Мэй определил более длинный ‘Элиас Торн’ (а не просто ‘Элиас’) как постоянный мем LLM, и опубликовал различные скриншоты с Amazon, где это имя было использовано как название для авторов/автора различных книг, включая медицинские книги.
Вкус к прошлому
Итак, что касается случайных наблюдений и серендипитета. Хотя нет единой ‘магической документации’ в обучающих данных, которая бы включала все или большинство постоянных элементов, авторы новой статьи (названной Элиас в маяке, снова? Диагностика низкого разнообразия в историях LLM, от двух исследователей Корнелльского университета) предполагают, что фильтры авторских прав в разработке ИИ могут ограничивать вымышленный вывод в LLM до материала, который находится в общественном достоянии.
Авторы утверждают:
‘Мы обнаружили, что доминирование историй “Элиас в маяке” не может быть объяснено их распространением в пред- или пост-обучающих данных. Мы предполагаем, что модели обучены избегать ссылок на защищенные авторским правом персонажи и контент для взрослых во время выравнивания, но откладываем этот вопрос на будущую работу.’
| Категория | Токен | Наш | Лит | Предварительные нехудожественные | Предварительные художественные | Постнехудожественные | Постхудожественные |
|---|---|---|---|---|---|---|---|
| Имя | элиас | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Имя | мара | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Имя | элара | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Профессия | смотритель | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Профессия | пекарь | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Профессия | мэр | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Профессия | часовщик | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Профессия | рыбак | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Профессия | библиотекарь | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Профессия | дирижер | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Место | маяк | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Таблица сравнения, показывающая, как часто повторяющиеся слова из историй ИИ появляются в опубликованной литературе, веб-фикции и пост-обучающих данных, с терминами, такими как ‘Элиас’ и ‘маяк’, которые появляются гораздо чаще в чат-ботах, написанных историях.
В исследовании авторы обнаружили, что подчеркнутые 11 слов появляются в 88% из 20 000 историй, сгенерированных LLM, и что существует ‘мало различий между моделями’. Они подчеркивают, что эти слова являются необычными в опубликованной английской литературе, и что пост-обучающие данные (данные, предназначенные для условирования и выравнивания моделей в ‘допустимое’ использование) могут быть ответственными.
Статья гласит:
‘Типичный пример, показанный [ниже], подчеркивает три элемента, общие для почти всех 20 000 историй: место (19 864 истории), имя персонажа (19 864 истории) и профессия (15 807 историй).
‘Фактически, конкретное место (“маяк”), имя (“Элиас”) и профессия (“смотритель”) в этой истории появляются в некотором сочетании в 66,6% всех сгенерированных историй. Свет также является общей темой: 56% историй, сгенерированных Claude, названы “Секрет смотрителя маяка” и слово “свет” появляется в 16 784 историях со средней скоростью 3,2 экземпляра на историю.’
Преследуя черты
Чтобы проверить, могут ли повторяющиеся ‘маячные’ истории быть объяснены обычной экспозицией к художественной литературе, сравнения были сделаны между любимыми повторяющимися словами моделей и несколькими большими англоязычными корпусами. Современная художественная литература была изучена через CONLIT, набор данных, содержащий 2 700 английских романов, опубликованных между 2007 и 2021 годами, охватывающий 12 жанров и в общей сложности примерно 287 миллионов слов.
‘Элиас’ появляется примерно в 900 раз чаще в сгенерированных историях, чем в опубликованной художественной литературе. Аматорская художественная литература из сообщества /r/writingprompts Reddit произвела подобные частоты, указывая на то, что закономерность не отражает более широкие человеческие привычки рассказывания историй.
Та же закономерность сохранялась, когда предварительные обучающие данные были изучены. Используя открыто доступный OLMo 3 корпус, который содержит примерно 3,89 миллиарда в основном человеческих документов, частично из Common Crawl, исследователи обнаружили, что повторяющиеся ‘ядро’ слова едва появляются.
Авторы утверждают:
‘Если ядро-слова не распространены в веб-данных, то одной из оставшихся возможностей будет пост-обучающие данные. Но мы обнаружили, что пост-обучающие данные OLMo содержат наши токены с более низкой скоростью, чем CONLIT.
В 78 958 историях из пост-обучающих наборов данных OLMo 3, ‘Элиас’ появляется 52,7 раза на миллион слов, по сравнению с 2,7 в CONLIT, но достигает 2 428 появлений на миллион слов в сгенерированных историях, изученных в исследовании.
Чтобы определить, откуда берутся повторяющиеся ‘ядро’-истории, каждая история в пост-обучающих данных OLMo 3 была оценена на наличие одного или нескольких ядро-токенов (т.е. на наличие Элары, Мары и т. д.). Большинство из них, как ожидается, появится в наборах данных, полученных в результате WildChat и связанных с ними источников, поскольку WildChat и связанные с ним источники внесли 59 266 историй в OLMo 3.
Однако только 1 803 содержали ядро-термины, в то время как наборы данных, используемые для DPO и усилению обучения, показали более высокие концентрации.
В целом, повторяющееся ядро-словарь было отслежено до всего 3 053 историй, представляющих 3,8% всех пост-обучающих историй, изученных. Нет статистической возможности для такого небольшого подмножества корпуса, чтобы доминировать в нем таким образом.
Статья заключает:
‘Когда им дано мало направления, текущие передовые модели пишут истории, используя узкий каталог имен, мест и профессий. Повторяющиеся персонажи в этих историях включают Элиаса, смотрителя маяка. Элиас необычен; имя не распространено в литературе, веб-данных и даже пост-обучающих данных.’
Заключение
В отсутствие единой работы литературы (или даже серии), в которой представлены топ-11 слов, которые авторы определяют, не совсем ясно, каким образом эта конкретная коллекция слов накопилась и ассоциировалась на самых низких уровнях нескольких больших языковых моделей (несмотря на их разнообразие обучающих данных и подходов).
Даже если утверждение исследователей о ограничивающем эффекте фильтров авторских прав является правильным, огромное количество классической литературы в обучающих данных должно было предотвратить это странное собрание старомодных слов от доминирования в выводе неквалифицированного запроса ‘напишите’.
Это предположение предполагает, однако, что огромные объемы классической литературы будут включены в обучающий режим вообще. Это маловероятно, поскольку того, чего хотят, это модели, которые не будут производить фальшивые произведения Диккенса, а скорее модели, которые будут иметь дело с современным лексиконом и будут подходящими для современных деловых потребностей. Сам объем даже доиндустриальной литературы исключил бы ее включение.
В любом случае, если была одна отдельная повествовательная работа, включающая некоторую комбинацию ‘одержимых’ аспектов, которые авторы отмечают, она, вероятно, была бы легче найти; сами авторы не смогли найти ее, и случайные поиски в до-ИИ-эре не обнаружили никакого претендента. Может быть, если ‘синдром маяка’ приобретет такую же известность, как ИИ-тире, какая-то академическая власть придет с ответом.
* Я не могу продолжить статью Мэя, по причинам, которые могут стать очевидными, когда вы прочитаете ее.
Опубликовано в среду, 27 мая 2026 года. Изменено в течение первых 30 минут, чтобы исправить ссылку на Anthropic.












