Взгляд Anderson
Искусственный интеллект делит поисковую систему на три разных реальности

Новые исследования показывают, что Google теперь использует три разных информационных системы внутри своей поисковой империи, с обычным поиском, обзорами ИИ и Gemini, все из которых отдают предпочтение разным источникам, рейтингам и контенту.
Редукционизм правит. За последние двенадцать месяцев, ‘Дайте мне поискать это для вас’ мем был заменен новым ‘Дайте мне суммировать этот поисковый запрос для вас’ трендом, когда обзоры ИИ в результатах поиска все чаще избавляют читателей от необходимости кликать на ссылки поиска (спорно дефинансируя источники в процессе), конденсируя весь результат поиска в несколько сгенерированных абзацев.
Казалось бы, что основные знания, surfaced, и выбор сайтов, из которых можно получить эти знания, должны быть относительно похожи во всех трех наиболее популярных методах поиска информации: в традиционном веб-поиске; в обзорах ИИ (AIO), которые теперь возглавляют большинство результатов поиска; и при помощи увеличивающегося использования LLM, таких как ChatGPT, в качестве веб-оракулов (с или без внешних вызовов RAG).
Однако недавние исследования в США показывают, что это, удивительно, далеко не так; и что даже внутри тройной системы оракулов Google – SERPS*, обзоров ИИ и прямого взаимодействия с серии LLM Gemini – есть значительные и интересные расхождения, для каждого маршрута.
Трехсторонний раздел
В ясной и обширной новой статье, озаглавленной Как генеративный ИИ нарушает поиск: Эмпирическое исследование поиска Google, Gemini и обзоров ИИ, шесть исследователей из Нью-Джерсийского технологического института описывают способы, которыми три метода поиска расходятся, и предлагают некоторые возможные теории для этих разрывов в подходе.
Статья гласит:
‘[Сначала мы] обнаружили, что для 51,5% представительных, реальных запросов пользователей, обзоры ИИ генерируются и отображаются выше органических результатов поиска. Спорные вопросы часто приводят к обзору ИИ.
‘Второе, мы показываем, что извлеченные источники существенно различаются для каждого поискового движка (<0,2 средней схожести Джаккарда). Традиционный поиск Google значительно чаще извлекает информацию из популярных или институциональных сайтов в правительстве или образовании, в то время как генеративные поисковые движки значительно чаще извлекают контент, принадлежащий Google.
‘Третье, мы наблюдаем, что веб-сайты, которые блокируют паука ИИ Google, значительно менее вероятно будут извлечены обзорами ИИ, несмотря на доступ к контенту.’
Поскольку статья является смесью fascинiruyuschih прозрений, а не соответствует обычному линейному и методически обусловленному рабочему процессу, мы более внимательно рассмотрим эти и некоторые другие из ее наиболее удивительных и просвещающих прозрений.
Старый ‘Два-Один’
Одним из многих интересных результатов в исследовании является то, что обзоры ИИ Google склонны быть подавлены для срочных новостных событий, поскольку самые ранние и доступные источники могут быть не самыми точными.
Эта система не всегда работает: в примере ниже, отмеченном исследователями, обзор ИИ Google о результате боксерского матча приписал победу неправильному боксеру, даже хотя единственным источником, заявившим этот (неправильный) результат, был сатирический спортивный канал на Facebook:

Одной из причин, по которой обзоры ИИ Google избегают сводок, критичных для времени, является то, что ранние сведения могут быть неполными или совершенно неточными. В этом случае боксер Джейк Пол на самом деле проиграл матч. Источник
Авторы отмечают, что обзоры ИИ склонны появляться, когда событие уже как минимум пять дней, что квалифицирует это как аномалию – но тем не менее, одну, которую исследователи смогли легко вызвать.
Обзоры ИИ были обнаружены более вероятными, когда запрос был завершен вопросительным знаком, и что намерение запроса было фактором в том, будет ли представлен обзор ИИ:

Процент инцидентов, когда был сгенерирован обзор поиска ИИ в одном из раундов тестов исследователей. Здесь ‘информационный’ указывает на прямые вопросы, которые склонны производить обзоры ИИ чаще, чем любой другой тип взаимодействия.
Кроме того, статья утверждает, что более длинные запросы склонны быть более вероятными для производства обзора ИИ вместо прямых результатов поиска, хотя авторы еще не предложили теорию, чтобы объяснить это.
Разделенное королевство
Возможно, наиболее удивительным результатом из новой работы является относительно небольшое совпадение результатов качества/типа между тремя поисковыми платформами Google.
Статья повторно показывает, что регулярный поиск Google, обзоры ИИ и Gemini (LLM) извлекают поразительно разные источники для одного и того же запроса, с показателями совпадения, достаточно низкими, чтобы предположить три конкурирующие логики извлечения внутри одной компании, тогда как пользователи могли бы предположить, что Google имеет один авторитетный индекс и одну философию рейтинга:

Даже внутри экосистемы Google совпадение между традиционным поиском, обзорами ИИ и Gemini оказалось удивительно небольшим, с одним и тем же запросом, часто производящим существенно разные списки источников в зависимости от того, какая система Google обработала запрос. В этом сравнении мы видим, насколько близко три системы совпадали друг с другом на тысячах поисковых запросов, от тем покупок и дебатов до локальных поисков и общих вопросов знаний, с более низкими показателями, указывающими на меньшее согласие между выбранными источниками.
Относительно этого раздела своего анализа, авторы заявляют†:
‘[Таблица выше] представляет среднюю схожесть между списком источников, возвращаемых обзором ИИ, Gemini и традиционным SERP для каждого запроса в наборе данных.
‘Основной вывод заключается в том, что независимо от подмножества запросов и сравниваемой пары поисковых движков, извлеченные списки различны, несмотря на то, что все три были разработаны Google.’
Исследователи进一步 заявляют, что ни один из методов поиска, протестированных, не показал смещенный рейтинг совпадения (RBO) выше 0,27, что является очень низким показателем. Они отмечают, что Amazon Retail и локализованные запросы (т.е. ‘магазины рядом со мной’) имели наименьшее совпадение среди методов поиска.
Они объясняют низкое согласие фундаментальной ‘несовместимостью между поисковыми движками’, отметив, что ни случайность, ни любой другой очевидный фактор не могут быть ответственными за эту десинхронизацию.
Одним из интуитивных объяснений, возможно, является то, что точки обучения присваиваются рангом очень по-разному, чем методы, которые Google разработала для PageRank и его преемников за последние два десятилетия. Кроме того, на случай, если алгоритм поиска Google имеет секретную программу, такое вмешательство или ‘игра’ гораздо труднее последовательно реализовать в диффузионных ИИ, таких как Gemini (даже через фильтрацию, системные подсказки и различные другие методы сдерживания, которые накладываются на коммерческие модели).
Самообслуживание..?
Определенные веб-сайты или категории веб-сайтов, кажется, были затронуты появлением обзоров ИИ и вторжением поиска на основе LLM в традиционное пространство поиска – как положительно, так и отрицательно, в зависимости от случая:

По сравнению с традиционным поиском Google, обзоры ИИ и Gemini оба уменьшили цитаты многих крупных веб-сайтов, увеличив видимость для меньшего числа предпочитаемых доменов. YouTube оказался одним из самых больших бенефициаров в обеих системах, в то время как Reddit, Wikipedia, Facebook и многие институциональные источники появлялись реже в извлечении, сгенерированном ИИ.
Авторы отмечают, что некоторые неожиданные предпочтения появляются среди трех методов, во время тестирования:
‘У нас есть три основных вывода из [графиков выше]. Первое, крупные и известные веб-сайты наиболее пострадали (и положительно, и отрицательно). Это интуитивно, поскольку крупные веб-сайты имеют репутацию и разнообразие контента, чтобы быть актуальными для многих разных запросов.
‘Второе, подавляющее большинство этих веб-сайтов получают меньше общих и меньше топ-3 цитат с генеративными поисковыми движками (указано красными полосами и отрицательными числами в [графиках выше]). Это говорит о том, что генеративный поиск склонен извлекать информацию из более нишевых источников, чем традиционные поисковые движки.
‘Третье, обзоры ИИ Google отдают предпочтение веб-сайтам Google (т.е. доменам google.com и youtube.com).
‘Gemini также отдает предпочтение YouTube по сравнению с традиционным поиском Google, но абсолютная разница меньше.’
Какие-либо ‘блокировщики’..?
Исследование также показало, что издатели, которые блокируют паука ИИ Google – автоматизированного веб-бота, который извлекает данные из вашего сайта, если вы не скажете ему не делать этого с помощью файла robots.txt – склонны не появляться в обзорах ИИ.
Это может показаться очевидной самоинфликтной раной, но на самом деле Google публично заявила, что контент из платформ, которые блокируют пауков ИИ, не будет предотвращен от появления в обзорах ИИ; скорее, издатели просто не будут иметь свои данные извлечены, отобранными в коллекцию и запущены в следующий раунд обучения ИИ для Gemini и других проектов ИИ Google.
Однако это не был вывод, к которому пришли исследователи, обнаружив вместо этого, что популярные издатели, блокирующие ИИ, были очень редко цитированы Gemini, либо в LLM, либо в более компактной и гибкой версии результатов поиска. ‘Эффективно заблокированные’ издатели были сообщены в статье как NYTimes, CNN, BBC, ScienceDirect, Reuters, Wiley, Nature, ESPN, Business Insider, CNBC, NPR, WIRED, USA Today, NBC News, Genius, National Geographic, The Conversation, U.S. News & World Report, Scientific American, Consumer Reports и STAT.

Некоторые из блокировок пауков ИИ, осуществленных упомянутыми выше издателями. Но привело ли это к более широкому цензурированию Google?
Авторы заявляют:
‘В нашем анализе наиболее пострадавших доменов мы обнаружили, что 21 популярный [издатель] (которые извлекаются для как минимум 20 уникальных запросов как поиском Google, так и обзорами ИИ) никогда не цитировались Gemini.
‘Несколько популярных социальных сетей (Facebook, Instagram, Tiktok) и сайтов отзывов (IMDb, Yelp, Tripadvisor) также получили нулевые цитаты от Gemini. После дальнейшего расследования мы обнаружили, что все эти веб-сайты блокируют бота Google-Extended в своих файлах robots.txt.’
Если это открытие окажется верифицированным в других местах и постоянным, можно предположить, что эти компании потенциально подвергаются давлению со стороны Google, чтобы капитулировать и сотрудничать с их операциями ИИ через частичное де-листинг. На первый взгляд, результаты кажутся наказывающими – но затем, результаты новой работы более указывают на хаос, чем на преднамеренность; поэтому единственный разумный комментарий, который можно сделать, заключается в том, что эти результаты кажутся поверхностно ‘злыми’, независимо от того, что на самом деле вызывает их.
Заключение
Мнение Это ясная и обширная зип-бомба статьи, чьи всего десять основных страниц разворачиваются в почти подавляющий каскад дополнительных открытий. Поскольку у нас было время, чтобы рассмотреть только небольшой раздел этих, я рекомендую исходный PDF даже случайному читателю (редкое событие).
Хотя ‘желтая’ позиция может интерпретировать открытия авторов в негативном свете, работа, возможно, лучше рассматривается как указание на то, что глобальный лидер технологий пытается получить и сохранить глобальное лидерство в поиске на основе ИИ, используя сильно контрастные платформы, которые развились в очень разных обстоятельствах и эпохах.
Поскольку в статье исследуются три метода поиска, реальная проблема заключается между традиционными результатами поиска, ранжированными проприетарными методами, и резко контрастными методами распределения, которые доминируют в курировании данных и обучении ИИ.
ИИ, как в 1999
До появления Google было возможно ‘играть’ результаты поиска через простое количество, и таким образом можно было часто добиться первого места в SERPS с минимальными (часто автоматизированными) усилиями. Эта ‘игра чисел’ была в основном прекращена около 2002 года более совершенным и секретным алгоритмом рейтинга поиска Google. Но поскольку ставки были значительными, высокообъемный и низкокачественный контент никогда не исчезал в каком-либо значимом смысле.
Следовательно, к моменту, когда гипермасштабные коллекции, такие как Common Crawl, заложили основу для современной революции ИИ, доминирование данных было обречено быть доминируемым тем, насколько автоматические процессы могут фильтровать и ранжировать качество входящих данных, и (гораздо менее вероятно), насколько деньги были доступны, чтобы заплатить людям за ранжирование этих данных.
Было много плохих или низкокачественных данных в этих огромных и неразборчивых коллекциях; данных, которые, возможно, не содержали наготу или ругательства или расистские тропы, или любые другие вещи, которые относительно легко фильтровать из обучающих наборов данных – но которые были тем не менее самоуслужительными и объемными, как и результаты интернет-поиска около 1999-2001 годов.
Поскольку эти процессы индукции данных все еще не идеальны, очень трудно даже для Google заставить ИИ действовать в деловом порядке, поскольку решения Gemini, подобные PageRank, диктуются не инженерами-политиками Google, а несовершенным пониманием того, как гипермасштабные данные превращаются в распределения данных и латентные вложения во время обучения модели ИИ.
* Страницы результатов поиска.
† Акцент авторов, а не мой. Однако я заменил жирный шрифт на курсив, поскольку курсивный акцент не работает хорошо в цитатах, которые уже в основном курсивны.
Опубликовано впервые в среду, 13 мая 2026 года












