Andersonův úhel
Umělé inteligence rozděluje webové vyhledávání do tří různých realit

Nový výzkum zjistil, že Google nyní používá tři různé informační systémy uvnitř své vlastní vyhledávací říše, s pravidelným vyhledáváním, přehledy AI a Gemini, které všechny upřednostňují různé zdroje, hodnocení a obsah.
Redukcionismus vládne. Za posledních dvanáct měsíců byl ‘Let me Google that for you’ meme překonán novým ‘Let me summarize that Google search for you’ trendem, kdy přehledy AI ve vyhledávacích výsledcích stále více šetří čtenářům potíže s klikáním na vyhledávací odkazy (arguably de-financují zdroj stránky v procesu), kondenzují celé vyhledávací výsledky do několika generovaných odstavců.
Jedna by si mohla myslet, že základní znalosti, které se objevují, a výběr stránek, ze kterých se tyto znalosti získávají, by byly relativně podobné napříč všemi třemi nejoblíbenějšími metodami pro vyhledávání informací na internetu: v tradičním webovém vyhledávání; v přehledech AI (AIOs), které nyní vedou většinu webových vyhledávacích výsledků; a prostřednictvím zvyšujícího se použití LLM jako webových oracle (s nebo bez externích RAG volání).
Nicméně, recentní výzkum z USA ukazuje, že tomu tak překvapivě není; a že i uvnitř Googleovy vlastní trojice oracle – SERPS*, AI souhrnů a přímé interakce s Gemini LLM sérií – se zdají být významné a zajímavé nesrovnalosti, pro každou cestu.
Tři cesty
V jasném a rozsáhlém novém článku, nazvaném Jak generativní AI narušuje vyhledávání: Empirická studie Google vyhledávání, Gemini a přehledů AI, šest výzkumníků z New Jersey Institute of Technology popisuje způsoby, kterými se tři vyhledávací metody rozcházejí, a nabízí některé možné teorie pro tyto trhliny v přístupu.
Článek uvádí:
‘[První, jsme] zjistili, že pro 51,5% reprezentativních, reálných uživatelských dotazů, jsou AIOs generovány a zobrazovány nad organickými vyhledávacími výsledky. Sporné otázky často vedou k AIO.
‘Druhý, jsme ukázali, že načtené zdroje jsou podstatně odlišné pro každý vyhledávací stroj (<0,2 průměrná Jaccardova podobnost). Tradiční Google vyhledávání je podstatně více pravděpodobné, že načte informace z populárních nebo institucionálních webových stránek ve vládě nebo vzdělávání, zatímco generativní vyhledávací stroje jsou podstatně více pravděpodobné, že načtou obsah vlastněný Googlem.
‘Třetí, jsme pozorovali, že webové stránky, které blokují Googleův AI crawler, jsou podstatně méně pravděpodobné, že budou načteny AIOs, navzdory přístupu k obsahu.’
Jelikož článek je smorgasbord fascinujících poznatků, spíše než aby se přizpůsobil obvyklému lineárnímu a metodicky řízenému workflow, budeme se blíže podívat na tyto a některé další z jeho nejzajímavějších a osvětlujících poznatků.
Starý ‘dva-jedna’
Jedním z mnoha zajímavých zjištění v studii je, že Googleovy přehledy AI tendují být potlačeny pro náhlé zpravodajské události, protože nejranější a nejvíce dostupné zdroje nemusí být nejpreciznější.
Tento systém nefunguje vždy: v příkladu níže, který výzkumníci poznamenali, Google AI přehled týkající se výsledku boxerského zápasu připsal vítězství špatnému boxerovi, i když jediným zdrojem, který uváděl tento (nesprávný) výsledek, byla satirická sportovní stránka na Facebooku:

jeden z důvodů, proč Googleovy přehledy AI vyhýbají se časově kritickým souhrnům, je, že rané informace mohou být neúplné nebo zcela nesprávné. V tomto případě boxer Jake Paul skutečně prohrál zápas. Zdroj
Autorům se podařilo zjistit, že AIOs tendují se objevovat, když je událost alespoň pět dní stará, což kvalifikuje tento případ jako anomálii – ale přesto, jeden, který výzkumníci byli schopni snadno vyvolat.
AIOs byly nalezeny být více pravděpodobné, že budou generovány, když dotaz byl uzavřen otazníkem, a že dotazový záměr byl faktorem, zda bude AIO prezentován:

Procento incidentů, kdy byl vygenerován AI vyhledávací souhrn v jednom z testů výzkumníků. Zde ‘informační’ označuje přímé otázky, které tendují produkovat AIOs více než jakýkoli jiný typ interakce.
Kromě toho článek tvrdí, že delší dotazy tendují být více pravděpodobné, že produkují AI souhrn místo přímých vyhledávacích výsledků, i když autoři dosud nepředložili teorii, která by tento jev vysvětlovala.
Rozdělené království
Možná nejvíce překvapivým výsledkem z nové práce je relativně malá překryv výsledků kvality/typu mezi Googleovými (výše zmíněnými) třemi vyhledávacími platformami.
Článek opakovaně ukazuje, že pravidelné Google vyhledávání, AI přehledy a Gemini (LLM) načtou překvapivě odlišné zdroje pro stejný dotaz, s překryvnými skóre nízkými enough, aby naznačovaly tři soutěžící vyhledávací logiky uvnitř jedné společnosti, zatímco uživatelé by mohli předpokládat, že Google má jeden autoritativní index a jednu řazení filozofii:

I když je uvnitř Googleovy vlastní ekosystému, překryv mezi tradičním vyhledáváním, AI přehledy a Gemini se ukázal překvapivě malý, s tím, že stejný dotaz často produkoval podstatně odlišné seznamy zdrojů v závislosti na tom, který Google systém zpracoval požadavek.
Ohledně této části jejich analýzy autoři uvádějí†:
‘[Tabulka výše] představuje průměrnou podobnost mezi seznamem zdrojů vrácených AIO, Gemini a tradičním SERP pro každý dotaz v benchmark datové sadě.
‘Hlavní závěr je, že bez ohledu na dotazový podsad a který pár vyhledávacích strojů je srovnán, načtené seznamy jsou odlišné, navzdory tomu, že všechny tři byly vyvinuty Googlem.’
Výzkumníci dále uvádějí, že žádný vyhledávací stroj, který byl testován, neměl rank-biased overlap (RBO) nad 0,27, což je velmi nízké skóre. Poznamenávají, že Amazon Retail a lokalizované dotazy (tj. ‘obchody poblíž mě’) měly nejnižší podobnost mezi vyhledávacími metodami.
Autoři připisují nízkou shodu fundamentální ‘nesrovnalosti mezi vyhledávacími stroji’, přičemž poznamenávají, že náhodnost ani žádný jiný zjevný faktor nemůže být učiněn odpovědným za tuto dis-syncopaci.
Jedním intuitivním vysvětlením, arguable, je, že tréninková data jsou přiřazena rank v velmi odlišném způsobem než metody, které Google vyvinul pro PageRank a jeho následovníky za posledních dvacet let. Kromě toho, v případě, že Google Search algoritmus má tajný záměr, takový zásah, nebo ‘gaming’, je mnohem těžší konzistentně implementovat v difuzních AI, jako je Gemini (i prostřednictvím filtrování, systémových promptů a různých dalších metod korelace, které jsou uvaleny na komerční modely).
Samoobslužný..?
Některé webové stránky, nebo kategorie webových stránek, se zdají být ovlivněny vznikem AI souhrnů a pronikáním LLM-založeného vyhledávání do tradičního vyhledávacího prostoru – oběma způsoby, nepříznivě a pozitivně, v závislosti na případě:

Ve srovnání s tradičním Google vyhledáváním, AI přehledy a Gemini obě snižují citace z mnoha hlavních webových stránek, zatímco zvyšují viditelnost pro menší počet upřednostňovaných domén. YouTube se ukázal jako jeden z největších bénéficiantů napříč oběma systémy, zatímco Reddit, Wikipedia, Facebook a mnoho institucionálních zdrojů se méně často objevilo v AI-generovaném načtení.
Autoři poznamenávají, že některé neočekávané preference se objevují mezi třemi metodami, během testování:
‘Máme tři hlavní závěry z [grafů výše]. První, velké a dobře známé webové stránky jsou nejvíce ovlivněny (oběma způsoby, pozitivně i negativně). To je intuitivní, protože velké webové stránky mají reputaci a rozmanitost obsahu, aby byly relevantní pro mnoho různých dotazů.
‘Druhý, většina těchto webových stránek obdrží méně celkových a méně top tří citací s generativními vyhledávacími stroji (označené červenými sloupci a negativními čísly v [grafech výše]). To naznačuje, že generativní vyhledávání tenduje k načtení informací z více nikových zdrojů než tradiční vyhledávací stroje.
‘Třetí, Googleovy AIOs upřednostňují Google webové stránky (tj. google.com a youtube.com domény).
‘Gemini také upřednostňuje YouTube ve srovnání s tradičním Google vyhledáváním, ale absolutní rozdíl je menší.’
Jaké ‘blokátory’..?
Studie také zjistila, že vydavatelé, kteří blokují Googleův AI webový crawler – automatizovaného webového robota, který scrapuje data z vaší stránky, pokud mu to neřeknete s robots.txt souborem – tendují se neobjevovat v AI souhrnech.
To se může zdát jako zjevně sebezpůsobený problém, ale ve skutečnosti Google veřejně prohlásil, že obsah z platforem, které blokují AI crawlers, nebude bránit se objevení v AI souhrnech; spíše, vydavatelé prostě nebudou mít svá data scrapována, kurátorem do sbírky a spuštěna do dalšího kola AI tréninku pro Gemini a další Google AI projekty.
Avšak, to nebylo závěrem, ke kterému dospěli autoři nové studie, kteří místo toho zjistili, že populární AI-blokující vydavatelé byli velmi zřídka citováni Gemini, buď v LLM nebo v odstraněném a více agilním vyhledávacím výsledku. ‘Účinně zakázání’ vydavatelé byli podle článku NYTimes, CNN, BBC, ScienceDirect, Reuters, Wiley, Nature, ESPN, Business Insider, CNBC, NPR, WIRED, USA Today, NBC News, Genius, National Geographic, The Conversation, U.S. News & World Report, Scientific American, Consumer Reports a STAT.

Některá z robots.txt AI-scraping zákazů provedených výše uvedenými vydavateli. Ale vedlo to k širšímu cenzuře ze strany Google?
Autoři uvádějí:
‘V našich analýzách nejvíce postižených domén, jsme zjistili, že 21 populárních [vydavatelů] (které jsou načteny pro alespoň 20 jedinečných dotazů oběma Google vyhledáváním a AIOs) nebyly nikdy citovány Gemini.
‘Několik populárních sociálních médií (Facebook, Instagram, Tiktok) a recenzních webových stránek (IMDb, Yelp, Tripadvisor) také neobdržely žádné citace od Gemini. Při dalším vyšetřování, jsme zjistili, že všechny tyto webové stránky blokují Google-Extended bot v jejich robots.txt souborech.’
Pokud se toto zjištění ukáže být ověřeno jinde a trvalé, lze spekulovat, že tyto společnosti jsou potenciálně tlačeny Googlem do kapitulace a spolupráce s jeho AI operacemi prostřednictvím částečného de-listingu. Na první pohled, výsledky se zdají být trestající – ale pak, výsledky nové práce jsou více indikativní chaosu než předběžného úmyslu; proto jediným rozumným komentářem, který lze učinit, je, že tyto výsledky vypadají povrchně ‘zlostně’, ať už je skutečný důvod jakýkoli.
Závěr
Opinion Tento článek je jasným zip-bomb článkem, jehož pouhých deset primárních stránek se rozvine do téměř ohromující kaskády dalších zjištění. Jelikož jsme měli čas pokrýt pouze malou část z nich, doporučuji zdroj PDF i běžnému čtenáři (což je vzácná událost).
Although ‘žlutá’ dispozice by mohla vyvolat mnoho negativních interpretací autorů zjištění, práce je možná nejlépe léčena jako indikace globálního technologického lídra, který se snaží získat a udržet globální vedení v AI-založeném vyhledávání, pomocí vysoce kontrastních platforem, které se vyvinuly v různých okolnostech a érách.
Zatímco tři vyhledávací metody jsou zkoumány v článku, skutečný spor je mezi tradičními vyhledávacími výsledky, řazenými proprietárními metodami, a ostře kontrastními distribucemi založenými na výběru, které dominují kuraci dat a AI tréninku.
AI jako v roce 1999
Před vznikem Google, bylo možné ‘hrát’ vyhledávací výsledky prostřednictvím pouhého objemu, a tímto způsobem, bylo možné často dosáhnout front-page SERPS umístění s minimálním (často automatizovaným) úsilím. Tato ‘čísla hra’ byla efektivně ukončena kolem roku 2002 Googleovým více sofistikovaným a tajným vyhledávacím algoritmem. Ale jelikož byly sázky významné, high-volume a low-kvalitní obsah nikdy nezmizel v žádném smyslu.
Proto, do doby, kdy se hypershale kolekce, jako je Common Crawl, nastavily základy moderní AI revoluce, data-prominence byly určeny k tomu, aby byly ovlivněny rozsahem, v jakém automatizované procesy mohly filter a rank incoming data quality, a (mnohem méně pravděpodobně), rozsahem, v jakém byly peníze k dispozici, aby zaplatily lidi za ranking těchto dat.
Byla tam spousta špatných nebo low-kvalitních dat v těch obrovských a nekontrolovaných kolekcích; data, která nemusela obsahovat nahotu nebo sprostá slova nebo rasistické stereotypy, nebo cokoliv jiného, co je relativně snadné filtrovat z tréninkových dat – ale která byla přesto sebe-sloužící a objemná, stejně jako výsledky z internetového vyhledávání kolem roku 1999-2001.
Protože tyto datové indukční procesy jsou stále nevelké, je velmi těžké i pro Google, aby AI fungovala jako byznysově, protože Geminiho PageRank-styl rozhodnutí jsou diktována ne Googleovými politickými inženýry, ale nedokonalým pochopením, jak hypershale data se transformují do datových distribucí a latentních embeddingů během tréninku AI modelu.
* Vyhledávací výsledky stránek.
† Autorů zdůraznění, ne moje. Ale jsem nahradil tučné písmo kurzívou, protože kurzívní zdůraznění nefunguje dobře v citacích, které jsou již primárně kurzívou.
První publikováno ve středu, 13. května 2026












