Unghiul lui Anderson
Inteligența Artificială Împarte Căutarea Web În Trei Realități Diferite

Noua cercetare arată că Google folosește acum trei sisteme de informații diferite în interiorul propriului său imperiu de căutare, cu căutarea regulată, rezumatele AI și Gemini, toate favorizând surse, clasamente și conținut diferite.
Reductivismul domină. În ultimele douăsprezece luni, ‘Hai să caut pe Google’ meme a fost depășit de o nouă ‘Hai să rezum căutarea Google pentru tine’ tendință, în care rezumatele AI în rezultatele căutării scutesc din ce în ce mai mult cititorii de efortul de a face clic pe link-urile de căutare (în mod evident definanțând site-urile sursă în proces), prin condensarea întregilor rezultate de căutare în câteva paragrafe generate.
Ar părea că cunoștințele de bază și alegerea site-urilor din care se extrag aceste cunoștințe ar trebui să fie relativ similare în toate cele trei metode de căutare a informațiilor pe internet: în căutarea web tradițională; în rezumatele AI (AIO) care acum preced majoritatea rezultatelor căutării; și prin utilizarea tot mai frecventă a LLM precum ChatGPT ca oracole web (cu sau fără apeluri RAG externe).
Cu toate acestea, cercetarea recentă din Statele Unite arată că acest lucru este, surprinzător, departe de a fi cazul; și că chiar și în interiorul trinității de oracole a Google – SERPS*, rezumate AI și interacțiune directă cu seria LLM Gemini – par să existe discrepanțe semnificative și interesante, pentru fiecare rută.
Divizare În Trei
Într-un articol nou și extins, intitulat Cum Inteligența Artificială Generează Căutarea: Un Studiu Empiric al Căutării Google, Gemini și Rezumatele AI, șase cercetători de la Institutul de Tehnologie din New Jersey prezintă modurile în care cele trei metode de căutare se diverg și oferă câteva teorii posibile pentru aceste fracturi în abordare.
Articolul afirmă:
‘[În primul rând, noi] găsim că pentru 51,5% din interogările reprezentative, real-utilizator, AIO sunt generate și afișate deasupra rezultatelor de căutare organice. Întrebările controversate duc adesea la un AIO.
‘În al doilea rând, arătăm că sursele recuperate sunt substanțial diferite pentru fiecare motor de căutare (<0,2 medie Jaccard similaritate). Căutarea Google tradițională este semnificativ mai probabilă să recupereze informații de pe site-urile populare sau instituționale din guvern sau educație, în timp ce motoarele de căutare generative sunt semnificativ mai probabil să recupereze conținut deținut de Google.
‘În al treilea rând, observăm că site-urile care blochează robotul de căutare AI al Google sunt semnificativ mai puțin probabil să fie recuperate de AIO, în ciuda faptului că au acces la conținut.’
Deoarece articolul este o colecție de insight-uri fascinante, mai degrabă decât să se conformeze fluxului de lucru liniar și metodic obișnuit, vom lua o privire mai atentă la acestea și la alte insight-uri surprinzătoare și iluminatoare.
Vechiul ‘Două-Unu’
Una dintre multele constatări interesante din studiu indică faptul că rezumatele AI ale Google tind să fie suprimate pentru evenimentele de știri de ultimă oră, deoarece sursele cele mai disponibile și mai timpurii nu sunt întotdeauna cele mai precise.
Acest sistem nu funcționează întotdeauna: în exemplul de mai jos, remarcat de cercetători, un rezumat AI al Google referitor la rezultatul unui meci de box a atribuit victoria boxerului greșit, chiar dacă singura sursă care afirma acest rezultat (incorect) era un flux satiric de sport pe Facebook:

Una dintre motivele pentru care rezumatele AI ale Google evită rezumatele în timp real este că informațiile timpurii pot fi incomplete sau complet inexacte. În acest caz, boxerul Jake Paul a pierdut de fapt meciul. Sursă
Autorii notează că AIO tind să apară atunci când un eveniment este de cel puțin cinci zile vechime, ceea ce califică acest lucru ca o anomalie – dar, totuși, una pe care cercetătorii au putut-o summona cu ușurință.
AIO au fost găsite a fi mai probabil să fie generate atunci când interogarea a fost închisă cu un semn de întrebare, și că intenția interogării a fost un factor în determinarea prezentării unui AIO:

Procentajul de incidente în care a fost produs un rezumat de căutare AI într-unul din testele cercetătorilor. Aici ‘informativ’ indică întrebări directe, care tind să producă AIO mai mult decât orice alt tip de interacțiune.
În plus, articolul susține că interogările mai lungi tind să fie mai probabil să producă un rezumat AI în loc de simple rezultate de căutare, deși autorii nu oferă încă o teorie pentru a explica acest lucru.
Un Regat Împărțit
Poate cel mai surprinzător rezultat din noua lucrare este faptul că există o suprapunere relativ mică între calitatea/rezultatele obținute de cele trei platforme de căutare ale Google.
Articolul arată în mod repetat că căutarea Google regulată, rezumatele AI și Gemini (LLM) recuperează surse uimitor de diferite pentru aceeași interogare, cu scoruri de suprapunere suficient de mici pentru a implica trei logici de recuperare concurente în interiorul unei singure companii, în timp ce utilizatorii ar putea presupune că Google are un singur index autorizat și o singură filozofie de clasificare:

Chiar și în interiorul ecosistemului Google, suprapunerea dintre căutarea tradițională, rezumatele AI și Gemini s-a dovedit a fi surprinzător de mică, cu aceeași interogare producând adesea liste de surse substanțial diferite, în funcție de sistemul Google care a gestionat solicitarea.
Referitor la această secțiune a analizei lor, autorii afirmă†:
‘[Tabelul de mai sus] prezintă similaritatea medie între lista de surse returnate de AIO, Gemini și căutarea tradițională pentru fiecare interogare din setul de date de referință.
‘Principala concluzie este că indiferent de subansamblul de interogări și de care dintre cele două motoare de căutare este comparat, listele recuperate sunt disimilare, în ciuda faptului că toate trei au fost dezvoltate de Google.’
Cercetătorii afirmă, de asemenea, că niciun motor de căutare testat nu a avut un suprapunere RBO (Rank-Biased Overlap) mai mare de 0,27, ceea ce este un scor foarte mic. Ei notează, de asemenea, că Amazon Retail și interogările localizate (de exemplu, ‘magazine aproape de mine’) au avut cea mai mică similaritate între metodele de căutare.
Ei atribuie acordul scăzut ‘inconsistenței dintre motoarele de căutare’, notând că nici întâmplarea și niciun alt factor evident nu poate fi făcut să explice această dis-sincronizare.
O explicație intuitivă, în mod evident, este că punctele de date de antrenament sunt atribuite rangului într-un mod foarte diferit de metodele pe care Google le-a dezvoltat pentru PageRank și succesorii săi în ultimele două decenii. Mai mult, în cazul în care algoritmul de căutare Google are o agendă secretă, este mult mai greu chiar și pentru Google să obțină ca inteligența artificială să acționeze într-un mod de afaceri, deoarece deciziile Gemini în stil PageRank sunt dictate nu de inginerii de politică ai Google, ci de o înțelegere imperfectă a modului în care datele hiperscale se transformă în distribuții de date și încorporări latente în timpul antrenamentului unui model de inteligență artificială.
Auto-Service..?
Anumite site-uri sau categorii de site-uri par să fi fost afectate de apariția rezumatelor AI și de pătrunderea căutării bazate pe LLM în spațiul de căutare tradițional – atât în mod negativ, cât și pozitiv, în funcție de caz:

Comparativ cu căutarea Google tradițională, rezumatele AI și Gemini au redus citările de la multe site-uri majore, în timp ce au crescut vizibilitatea pentru un număr mai mic de domenii favorite. YouTube s-a dovedit a fi unul dintre cei mai mari beneficiari în ambele sisteme, în timp ce Reddit, Wikipedia, Facebook și multe surse instituționale au apărut mai puțin frecvent în recuperarea generată de inteligență artificială.
Autorii notează că anumite preferințe neașteptate apar între cele trei metode, în timpul testării:
‘Avem trei concluzii principale din [graficele de mai sus]. În primul rând, site-urile mari și bine-cunoscute sunt cele mai afectate (atât pozitiv, cât și negativ). Acest lucru este intuitiv, deoarece site-urile mari au reputația și diversitatea conținutului pentru a fi relevante pentru multe interogări diferite.
‘În al doilea rând, majoritatea covârșitoare a acestor site-uri primesc mai puține citări totale și mai puține citări în primele trei poziții cu motoarele de căutare generative (indicate de barele roșii și numerele negative în [graficele de mai sus]). Acest lucru sugerează că căutarea generativă tinde să obțină informații din surse mai nișate decât motoarele de căutare tradiționale.
‘În al treilea rând, rezumatele AI ale Google favorizează site-urile deținute de Google (de exemplu, domeniile google.com și youtube.com).
‘Gemini favorizează, de asemenea, YouTube în comparație cu căutarea Google tradițională, dar diferența absolută este mai mică.’
Orice ‘Bariere’..?
Studiul a constatat, de asemenea, că editorii care blochează crawler-ul web AI al Google – robotul web automat care extrage date de pe site-ul dvs., dacă nu îi spuneți să nu o facă cu un fișier robots.txt – tind să nu apară în rezumatele AI.
Acest lucru poate părea ca o rană auto-infligată, dar, de fapt, Google a declarat public că conținutul de pe platformele care blochează crawlerele AI nu va fi împiedicat să apară în rezumatele AI; mai degrabă, editorii nu vor avea datele lor extrase, curate și rulate prin următoarea rundă de antrenament pentru Gemini și alte proiecte de inteligență artificială Google.
Cu toate acestea, aceasta nu a fost concluzia la care au ajuns cercetătorii, care au constatat, în schimb, că editorii populari care interzic AI au fost foarte rar citați de Gemini, atât în versiunea LLM, cât și în versiunea rezumată și mai agilă a rezultatelor de căutare. Editorii ‘efectiv interziși’ au fost raportați de articol ca fiind NYTimes, CNN, BBC, ScienceDirect, Reuters, Wiley, Nature, ESPN, Business Insider, CNBC, NPR, WIRED, USA Today, NBC News, Genius, National Geographic, The Conversation, U.S. News & World Report, Scientific American, Consumer Reports și STAT.

Unele dintre interdicțiile de extragere AI efectuate de editorii de mai sus. Dar a dus la o cenzură mai largă din partea Google?
Autorii afirmă:
‘În analizele noastre asupra domeniilor cele mai afectate, am constatat că 21 de editori populari (care sunt recuperați pentru cel puțin 20 de interogări unice de către căutarea Google și AIO) nu au fost niciodată citați de Gemini.
‘Mai multe site-uri de socializare populare (Facebook, Instagram, Tiktok) și site-uri de recenzii (IMDb, Yelp, Tripadvisor) nu au primit, de asemenea, nicio citare de la Gemini. După o investigație suplimentară, am constatat că toate aceste site-uri blochează robotul Google-Extended în fișierele lor robots.txt.’
Dacă această constatare se dovedește a fi verificată în altă parte și persistentă, se poate specula că aceste companii sunt, în mod potențial, presate de Google să se supună și să colaboreze cu operațiunile sale de inteligență artificială prin de-listarea parțială. La o privire superficială, rezultatele par punitive – dar, totuși, constatările noii lucrări sunt mai indicative de haos decât de premeditare; prin urmare, singurul comentariu rezonabil pe care îl puteți face este că aceste rezultate par superficial ‘răzbunători’, orice ar fi cauza reală.
Concluzie
Opinie Acesta este un articol zip-bomb cu adevărat clar, ale cărui zece pagini principale se desfășoară într-o cascada aproape copleșitoare de constatări suplimentare. Deoarece am avut timp să acoperim doar o mică parte din acestea, vă recomand PDF-ul original chiar și cititorilor ocazionali (un eveniment rar).
Deși o atitudine ‘galbenă’ ar putea interpreta constatările autorilor în multe moduri negative, lucrarea este, probabil, mai bine tratată ca indicativă a unei lideri globale în tehnologie care încearcă să obțină și să păstreze o poziție de lider global în căutarea bazată pe inteligență artificială, utilizând platforme foarte contrastante care s-au dezvoltat în circumstanțe și epoci foarte diferite.
În timp ce în articol se examinează trei metode de căutare, adevărata controversă este între rezultatele de căutare tradiționale ale motorului de căutare, clasificate prin metode proprietare, și metodele de selecție bazate pe distribuție care domină selecția și antrenamentul datelor.
Inteligența Artificială În Stilul Anilor ’90
Înainte de apariția Google, era posibil să ‘înșeli’ rezultatele de căutare prin volumul simplu, și, în acest fel, puteați obține adesea plasarea pe prima pagină a rezultatelor de căutare cu efort minim (și adesea automatizat). Acest ‘joc al numărului’ a fost, în esență, încheiat în jurul anului 2002 de algoritmul de clasificare a căutării Google, mai sofisticat și mai secret. Dar, deoarece mizele erau semnificative, conținutul de volum mare și de calitate scăzută nu a dispărut în niciun sens semnificativ.
Prin urmare, până când colecțiile hiperscale, cum ar fi Common Crawl, au pus bazele revoluției moderne a inteligenței artificiale, prominența datelor a fost destinată să fie dominată de măsura în care procesele automate puteau filtra și clasifica calitatea datelor de intrare, și (mult mai puțin probabil), de măsura în care banii erau disponibili pentru a plăti oameni pentru a clasifica aceste date.
A existat o mulțime de date proaste sau de calitate scăzută în acele colecții uriașe și indiscrimate; date care nu conțineau neapărat nuditate, înjurături, tropi rasiste sau orice altceva care este relativ ușor de filtrat din seturile de antrenament – dar care erau, totuși, auto-servitoare și voluminoase, la fel ca și rezultatele căutării internetului din jurul anilor 1999-2001.
Deoarece procesele de inducție a datelor nu sunt încă foarte bune, este foarte greu chiar și pentru Google să obțină ca inteligența artificială să acționeze într-un mod de afaceri, deoarece deciziile Gemini în stil PageRank sunt dictate nu de inginerii de politică ai Google, ci de o înțelegere imperfectă a modului în care datele hiperscale se transformă în distribuții de date și încorporări latente în timpul antrenamentului unui model de inteligență artificială.
* Paginile de rezultate ale motorului de căutare.
† Accentuarea autorilor, nu a mea. Cu toate acestea, am înlocuit caracterele îngroșate cu italice, deoarece accentuarea italică nu funcționează bine în citate care sunt deja în principal italice.
Publicat pentru prima dată miercuri, 13 mai 2026












