Взгляд Anderson
Загрязнение поисковых результатов ИИ рискует привести к «коллапсу извлечения»

Когда контент, сгенерированный ИИ, загрязняет интернет, открывается новый вектор атаки на культурный консенсус.
Исследование, возглавляемое корейской поисковой компанией, утверждает, что по мере того, как страницы, сгенерированные ИИ, проникают в поисковые результаты, они подрывают стабильность поисковых и ранжировочных трубопроводов и ослабляют системы – такие как Retrieval-Augmented Generation (RAG) – которые полагаются на эти рейтинги, чтобы решить, какая информация будет отображена и доверена, тем самым увеличивая риск того, что вводящая в заблуждение или неточная информация будет считаться авторитетной.
Термин, придуманный исследователями для этого синдрома, – Коллапс извлечения, отличный от известной угрозы коллапса модели (где ИИ, обученный на своем собственном выводе, становится прогрессивно хуже).
В сценарии Коллапса извлечения контент, сгенерированный ИИ, прогрессивно доминирует в результатах поисковых систем, до такой степени, что даже когда ответы остаются поверхностно точными, основа доказательств станет оторванной от оригинальных человеческих источников. Тем не менее, это «безкорневое» данные, кажется, готовы занять высокое место в результатах поиска*:
‘С пролиферацией текста, сгенерированного ИИ, вызовы в атрибуции и качестве данных предобучения усилились. В отличие от традиционного спама ключевых слов спам, современный синтетический контент семантически связан, что позволяет ему сливаться с системами ранжирования и распространяться через трубопроводы как авторитетные доказательства.’
Статья утверждает, что это создаст «структурно хрупкую» среду, в которой сигналы ранжирования будут отдавать предпочтение страницам, сгенерированным ИИ и оптимизированным для SEO, вытесняя человеческие источники со временем незаметным образом, т.е. без вызывания очевидных падений в качестве ответов:
‘Рост контента, сгенерированного ИИ, в интернете представляет собой структурный риск для извлечения информации, поскольку поисковые системы и системы RAG все чаще потребляют доказательства, сгенерированные большими языковыми моделями (БЯМ).’
‘Мы характеризуем этот режим сбоя на уровне экосистемы как Коллапс извлечения, двухэтапный процесс, на котором (1) контент, сгенерированный ИИ, доминирует в поисковых результатах, разрушая разнообразие источников, и (2) контент низкого качества или вредоносный проникает в трубопровод извлечения.’
Исследователи утверждают, что как только фаза «доминирования» будет установлена, тот же трубопровод извлечения станет более восприимчивым к намеренному загрязнению, поскольку вредоносные страницы могут использовать те же механизмы оптимизации, чтобы получить видимость*:
‘Установив основу Коллапса извлечения, эта работа закладывает основу для понимания того, как синтетический контент меняет извлечение информации. Чтобы смягчить эти риски, мы предлагаем сдвиг в сторону стратегий оборонительного ранжирования, которые совместно оптимизируют релевантность, фактичность и происхождение.’
Коллапс извлечения, вероятно, усугубит коллапс модели, поскольку он добавляет слой злонамеренного умысла к «эффекту фотокопии» энтропии, где ИИ все больше питается выводом, сгенерированным ИИ. Кроме того, это повлияет на видимый консенсус о «правде» в результатах поиска в реальном времени, неточности и атаки могут позже стать увековеченными в обученных БЯМ как авторитетные источники.
Эта новая работа озаглавлена Коллапс извлечения, когда ИИ загрязняет интернет, и исходит от трех исследователей из корпорации Naver.
Метод
Чтобы протестировать, как контент, сгенерированный ИИ, распространяется через системы извлечения, исследователи случайным образом отобрали 1000 пар запрос/ответ из набора данных и бенчмарка MS MARCO, который состоит из открытых вопросов, сопряженных с человеческими валидированными ссылочными ответами. Они использовались для основы извлечения и оценки фактической правильности сгенерированных ответов.
Для каждого запроса MS MARCO в тестах были извлечены десять веб-документов из поиска Google, основанных на топ-рейтинговых результатах SEO для каждого термина, в конечном итоге произведя пул из 10 000 документов.
Фактическая действительность документов была оценена путем сравнения каждого из них с основой истины MS MARCO, используя GPT-5 Mini в качестве судьи.
Симуляция фермы контента
Чтобы смоделировать уровень качества (нормальных, не-вредоносных) статей, связанных с фермами контента, авторы использовали экономичную GPT-5 Nano модель OpenAI для фактического генерирования новых синтетических статей, поскольку это «доступный» уровень ИИ, который, вероятно, будет использоваться контент-муллами. GPT-5 Mini, используемый для оценки вывода, является немного более способной моделью.
Напротив, чтобы смоделировать вредоносные посты (т.е. контент, предназначенный для распространения дезинформации или содержащий дезинформацию), не использовались реальные ссылки. Вместо этого первые черновики образцов были созданы с помощью конвенционального генератора кликбейта/SEO, а затем переданы GPT-5 Nano, который был задействован для замены определенного количества фактов на правдоподобные, но ложные альтернативы. GPT-5 Nano также выполнил семантическое переупорядочение для целей экспериментального контекста.
Чтобы смоделировать насыщение ИИ во времени, был запущен 20-раундовый процесс загрязнения, в котором один синтетический документ был добавлен к фиксированному набору из десяти оригинальных документов, увеличивая долю ИИ с 0% до 66,7%.
Для пула в стиле SEO генератор был запрограммирован на «имитацию специалиста по SEO» и интеграцию ключевых слов с высоким IDF из оригинальных документов для повышения вероятности извлечения.
Для вредоносного пула подсказка была разработана для сохранения плавного, естественно звучащего прозы, в то же время незаметно изменяя имена сущностей и числовые детали, создавая документы, которые не запускают статистические фильтры, а тихо подрывают фактическую точность.
Метрики
Для экспериментов были приняты три метрики: Коэффициент загрязнения пула (КЗП), для определения того, сколько всего пула документов было сгенерировано ИИ; Коэффициент загрязнения экспозиции (КЗЭ), для измерения того, сколько из топ-10 результатов поиска исходило из источников ИИ (указывая на то, что фактически вошло в трубопровод извлечения); и Коэффициент загрязнения цитирования (КЗЦ), для записи того, сколько цитируемых доказательств было синтетическим.
Чтобы изучить практическое влияние, были протестированы как качество извлеченных источников, так и целостность окончательного ответа. Точность@10 (Т@10) захватила, сколько из топ-10 результатов были фактически правильными при проверке против основы истины MS MARCO; и Точность ответа (ТО) измеряла, соответствовал ли сгенерированный ответ тому же ссылочному ответу, с использованием GPT-5 Mini для определения того, была ли смысл последовательным.
Тесты
Первоначально авторы протестировали свой метод против исходного пула документов, извлеченных из SERPS, т.е. до того, как они были использованы в качестве материала для генерации синтетических данных, и они отмечают, что их ранжировщик на основе БЯМ достиг «сильного качества извлечения», превосходя ранжировщик BM25 базовый уровень.
Первый из двух основных сценариев тестирования, названный Доминирование и гомогенизация, был изучением того, как документы, сформированные SEO, влияют на результаты извлечения:

Слева: кривые загрязнения для Сценария 1 под ранжировщиками BM25 и LLM показывают, что Коэффициент загрязнения пула (КЗП) увеличивается с каждым раундом, в то время как Коэффициент загрязнения экспозиции (КЗЭ) и Коэффициент загрязнения цитирования (КЗЦ) увеличиваются более круто, когда синтетические документы заполняют топ-результаты; Точность ответа (ТО) остается в целом стабильной. Справа: таблица представляет тот же прогресс численно на протяжении раундов 0, 5, 10 и 20, детализируя КЗП, КЗЭ, КЗЦ и ТО для обоих ранжировщиков.
Когда все больше страниц, сгенерированных ИИ, постепенно добавлялись к тестовой среде, они начали доминировать в топ-результатах поиска быстрее, чем ожидалось. Когда контент ИИ составлял 50% всех доступных документов, более 68% топ-10 результатов BM25 уже были сгенерированы ИИ; и когда доля материала ИИ увеличилась до 67%, более 80% его топ-результатов исходили из источников ИИ.
Ранжировщик на основе БЯМ показал еще более сильную тенденцию в этом направлении, с около 76% его топ-результатов, полученных из страниц, сгенерированных ИИ, когда эти страницы составляли только половину пула – и он продолжал полагаться на них более сильно, чем BM25, по мере увеличения их присутствия. Авторы комментируют:
‘Этот шаблон показывает, что контент, оптимизированный для SEO, чрезмерно активирует сигналы ранжирования, вызывая обе модели быстрого сходимости к синтетически-доминирующим доказательствам.’
В отношении напряжения между видимой стабильностью и коллапсом разнообразия статья отмечает, что, несмотря на «драматические» сдвиги, показанные в извлеченных доказательствах, Точность ответа остается стабильной или даже улучшается:
‘Поскольку документы SEO являются высококачественными и тематически согласованными, извлечение кажется здоровым, когда измеряется только точностью. Однако почти все извлеченные доказательства являются синтетическими, указывая на серьезный коллапс разнообразия источников.
‘Этот разрыв, характеризующийся стабильной точностью, несмотря на коллапс разнообразия, раскрывает структуру трубопровода извлечения: система работает хорошо в агрегатных метриках, в то время как тихо теряет свою основу в контенте, написанном человеком.’
‘В целом, высококачественный синтетический контент не только безупречно интегрируется в трубопроводы извлечения, но и активно подавляет сигналы ранжирования, заставляя оба ранжировщика BM25 и LLM полагаться почти исключительно на доказательства, сгенерированные ИИ.’
Второй сценарий был назван Загрязнение и коррупция системы, и показал заметное расхождение в поведении ранжировщиков по сравнению с первым сценарием:

Слева: результаты Сценария 2 показывают, что происходит, когда намеренно вводящие в заблуждение страницы добавляются в систему. По мере того, как добавляются все больше таких страниц, BM25 начинает размещать некоторые из них в своих топ-результатах – хотя только до примерно четверти на середине, и почти ни один из них фактически не используется в окончательном ответе. Общее качество ответа слегка падает. Справа: таблица представляет тот же шаблон численно для обоих BM25 и ранжировщика на основе БЯМ, делая ясным, что BM25 позволяет некоторым вводящим в заблуждение страницам попасть в свои топ-результаты, в то время как ранжировщик на основе БЯМ в основном фильтрует их.
Ранжировщик на основе БЯМ был в основном способен распознать и отфильтровать вводящие в заблуждение страницы, сохраняя долю такого контента в своих топ-результатах близкой к нулю; но BM25 позволил заметной части вредоносных страниц войти в свои топ-10 результаты, с примерно 19% до 24% появляющимися там на определенных этапах теста.
Хотя ранжировщик на основе БЯМ показал себя более устойчивым в этом эксперименте, авторы отмечают, что системы ранжирования на основе БЯМ более требовательны к вычислениям, что может сделать их крупномасштабное развертывание нецелесообразным. Хотя BM25 проще и дешевле в эксплуатации, широко используемые системы извлечения, которые используют его, могут, по мнению статьи, быть более уязвимы для манипулируемого контента, чем они изначально кажутся.
Авторы характеризуют это как «значительный структурный риск».
В отношении контраста между видимой стабильностью и основным ухудшением, авторы отмечают, что в этом контексте Точность ответа остается относительно стабильной, благодаря тому, что судья БЯМ подавляет коррупцию цитирования, и, следовательно, действует как своего рода последний момент «пожарной стены» против вредоносного контента.
Однако Точность ответа в этом аспекте была последовательно ниже, чем в первом сценарии:
‘Хотя Сценарий 1 показал ТО, сохраненную или даже улучшенную (до 70% с ранжировщиками на основе БЯМ) благодаря высокому качеству контента SEO, Сценарий 2 демонстрирует спад качества ответа по сравнению с настройкой SEO […]
‘Это подтверждает, что независимо от ранжировщика, вредоносное загрязнение на этапе извлечения негативно влияет на конечное качество, с ухудшением, наиболее выраженным при использовании легковесных извлекателей.’
Авторы заключают, что переупорядочение на этапе извлечения является слишком поздним подходом, и что следует рассмотреть «фильтры на этапе ингестии». Они предлагают, что «графы происхождения» и «фильтры перплексии» могли бы быть использованы.
Они заканчивают, подчеркивая, что основная угроза заключается в контенте с высокой плавностью, но низкой плотностью атрибуции, по сути, оторванном от завершающих цепей происхождения, и наблюдают:
‘[Когда] агентский ИИ начинает автономно публиковать контент, механизмы защиты должны эволюционировать от статического анализа текста к поведенческому фингерпринтингу, выявляя и изолируя агентов, которые систематически производят потоки с высокой энтропией и низкой фактичностью.’
Вывод
Установление новых или улучшенных методологий для происхождения информации может быть одной из наиболее критических необходимостей для 2026 года. Сложные схемы учетных данных, такие как проблемный C2PA, которые требуют инфраструктурных изменений от издателей и общественного образования о том, что они означают и как или почему использовать их, кажутся обреченными на провал.
Что-то более простое требуется, и оно еще не найдено. Это срочная миссия, поскольку эта текущая эпоха может быть наиболее критической точкой поворота для общественного консенсуса о правде с момента изобретения фотографии в 1822 году и подъема пропаганды в десятилетиях, предшествующих Второй мировой войне.
* Мое (выборочное, при необходимости) преобразование внутренних цитат авторов в гиперссылки.
Опубликовано впервые в четверг, 19 февраля 2026 года












