Отчёты
Что Читает ИИ? Внутренние Механизмы Генеративных Цитат

По мере того, как генеративный ИИ меняет цифровой ландшафт, в центре создания и открытия контента появляется новый вопрос: что именно читает ИИ? Новаторское исследование под названием Что Читает ИИ от Generative Pulse от Muck Rack проанализировало более 1 миллиона цитат из основных систем ИИ, включая ChatGPT от OpenAI (4o и 4o-mini), Gemini от Google (Flash и Pro) и Claude от Anthropic (Sonnet и Haiku), чтобы раскрыть скрытые динамики, лежащие в основе ссылок, которые эти модели используют при генерации ответов.
Результаты не только откровенны, но и трансформируют подход для всех, кто работает в журналистике, корпоративных коммуникациях, SEO или бренд-стратегии.
Цитаты Не Просто Дополнения — Они Перестраивают Поведение ИИ
Как очевидно для всех, кто погружен в мир ИИ, простое включение или выключение функции цитирования изменяет сами ответы. Когда цитаты выключены, ИИ больше полагается на статические обучающие данные. Но когда цитаты включены, модели генерируют существенно разные выходные данные, напрямую сформированные реальными источниками, которые они извлекают.
Ключевой Пример: Когда ИИ спрашивают о худшей команде Главной лиги бейсбола, ИИ без цитат упоминает команду 1962 года «Нью-Йорк Метс». Но с включенными цитатами он обновляет ответ, включая «Чикаго Уайт Сокс» 2024 года с рекордным сезоном 41-121, явно цитируя CBS Sports.
Доминирование Заработанной СМИ
Более 95% всех цитируемых источников приходятся на неплатную СМИ. Это включает:
- 27% журналистского контента (например, Reuters, AP, Financial Times)
- 18% сайтов правительства/НПО
- 13% академических или исследовательских источников
- 10% агрегаторов/энциклопедических платформ, таких как Wikipedia или Visual Capitalist
Напротив, платный или рекламный контент составляет менее 5% цитат, что делает rõ, что модели ИИ систематически предвзяты против маркетингового контента.
Предвзятость Новых Событий: Почему Побеждают Новые Контенты
Свежесть имеет значение — особенно для моделей OpenAI. В журналистском контенте 56% цитат, сделанных ChatGPT, были опубликованы в течение последних 12 месяцев, по сравнению с 36% для Claude. Эта тенденция, известная как предвзятость новых событий, относится к предпочтению более новых, недавно опубликованных источников над более старыми, даже если старые источники могут по-прежнему быть точными или актуальными.
В контексте генеративного ИИ предвзятость новых событий означает, что языковые модели — особенно те, которые, как ChatGPT, подключены к реальным данным, — более вероятно будут ссылаться на и доверять недавно опубликованным материалам, особенно при ответах на запросы, связанные с текущими событиями, новыми технологиями или изменениями политики. Для запросов, связанных с событиями в режиме реального времени, таких как «последние достижения в амбулаторном лечении» или «недавние инновации в звукозаписи», модель сильно взвешивает контент, опубликованный в последние несколько месяцев, предполагая, что он несет более актуальные или обновленные идеи.
Это критический вывод для создателей контента и бренд-стратегов: если ваш материал устарел — даже на год — он значительно менее вероятно будет появляться в ответах, сгенерированных ИИ. Сохранение вашего контента в актуальном состоянии не только хорошо для SEO, но и необходимо для видимости в эпоху ИИ.
Различные Запросы Вызывают Различные Источники
Модели ИИ не цитируют источники случайно — они выбирают на основе типа вопроса, который задается. Различные стили запросов приводят к разным типам источников, на которые ссылаются:
- Запросы фактов и энциклопедические запросы склонны черпать из статических справочных сайтов, таких как Wikipedia и Britannica, полагаясь на хорошо установленную, но часто устаревшую информацию.
- Запросы о недавних событиях обычно вызывают цитаты из крупных новостных изданий, таких как AP, Reuters или Axios, где скорость и актуальность имеют решающее значение.
- Запросы на советы или мнения сдвигают модель в сторону более динамичных и разговорных источников, таких как блоги, форумы или платформы, такие как Reddit или Medium.
- Академические или исследовательские задачи ведут ИИ к цитированию из журналов, серверов предварительных публикаций, таких как arXiv, или государственных репозиториев, таких как PubMed или NCBI.
- Креативные запросы или пошаговые инструкции часто surface пользовательский контент, неформальные инструкции или обсуждения сообщества из платформ, таких как Quora или нишевые технические форумы.
Это разнообразие означает, что то, как сформулирован вопрос, может иметь прямое влияние на то, какие домены будут повышены — и какие будут оставлены позади.
Claude, например, гораздо менее склонен цитировать крупные издания, такие как Reuters, чем ChatGPT или Gemini, цитируя Reuters 50 раз реже, чем ChatGPT.
Авторитет и Домен Важны — Но Не Однообразно
Хотя высокоавторитетные источники доминируют, они не единственные игроки. Только 15% наиболее цитируемых источников появляются в топ-10 по нескольким отраслям. Это означает, что нишевый контент вознаграждается. Например:
- В финансах источники, такие как Bankrate и NerdWallet , пользуются предпочтением.
- В здравоохранении правительственные источники, такие как CDC.gov и NIH.gov, доминируют.
- В технологиях образовательные платформы, такие как Udemy, Coursera и Medium, выходят на первый план.
На странице 15 визуальная карта тепла показывает, что Claude демонстрирует наибольшее разнообразие доменов, часто выбирая уникальные для отрасли источники, тогда как ChatGPT и Gemini больше полагаются на общую медиа.
Отраслевые Инсайты: Что Цитирует ИИ по Секторам
Финансы и Страхование
- Журналистика составляет 37% цитат, больше, чем в любой другой отрасли.
- Топ-10 источников Claude 90% уникальны, что указывает на более глубокое исследование ниш.
Здравоохранение
- Правительственные и НПО-сайты цитируются 18% времени, что более чем в два раза превышает средний показатель по отраслям.
- Gemini лидирует в разнообразии источников в этом секторе.
Путешествия и Авиация
- Удивительно, академические цитаты почти отсутствуют (только 0,7%).
- Источники, такие как FAA.gov и IATA.org, доминируют, с меньшей зависимостью от новостных изданий.
Розничная Торговля и Электронная Коммерция
- Агрегаторы, такие как Wikipedia, цитируются меньше здесь, чем в других отраслях (36% против 28%).
- Claude цитирует наиболее нишевой контент.
СМИ и Развлечения
-
Журналистика снова лидирует на 37%, с нишевыми платформами, такими как TVTechnology и Radioking, часто цитируемыми Claude.
Технологии
- Практически нет энциклопедических или академических источников.
- Платформы, такие как Medium, Coursera и SproutSocial, появляются заметно, отражая тенденцию к знаниям, основанным на практике.
Последствия для Команд по Связям и SEO
Результаты этого отчета показывают, что Генеративная Оптимизация Двигателя (GEO) становится такой же важной, как традиционная SEO. ИИ не просто суммирует статические базы данных — он активно ссылается на источники в реальном времени. И эти ссылки влияются:
- Актуальность: Обновляйте свой контент регулярно.
- Авторитет Домена: Постройте обратные ссылки и доверие.
- Нишевая Релевантность: Создавайте контент, адаптированный к вашей отрасли, а не просто общую тему.
- Тип Контента: Сосредоточьтесь на заработанной СМИ и информативном контенте, а не на чисто маркетинговых страницах.
Это меняет расчет для маркетологов контента, специалистов по связям с общественностью и издателей. Если ваша цель — появиться в результатах, сгенерированных ИИ, вы должны создавать контент, который ИИ находит ценным — не только пользователям или Google.
Заключение: Последствия Чтения (или Игнорирования) ИИ
Этот отчет подчеркивает фундаментальный сдвиг в том, как информация представляется в Интернете: модели ИИ не просто извлекают контент — они его тщательно отбирают. И этот отбор переопределяет видимость в цифровую эпоху.
Для издателей, исследователей и брендов быть процитированным ИИ означает быть частью следующего поколения поиска. Это ставит ваш контент перед пользователями, которые могут никогда не посетить ваш сайт, но доверяют модели, ссылающейся на него. Источники, которые цитируются, усиливаются. Те, которые нет — независимо от качества — рискуют быть исключены из разговора полностью.
Этот сдвиг создает новых победителей и проигравших. Высокоавторитетные источники и своевременная заработанная СМИ пользуются предпочтением. Тем временем, платный контент, слабо обновляемые блоги или менее устоявшиеся голоса часто остаются незамеченными — не только людьми, но и системами, формирующими то, что люди видят.
По мере того, как генеративный ИИ продолжает играть центральную роль в том, как знания доставляются, ключевой вопрос становится менее о том, как ранжироваться в поиске, и более о: Как стать частью того, что ИИ считает достойным цитирования?












