Anderson का एंगल

आर्टिफ़िशियल इंटेलिजेंस वेब सर्च को तीन अलग-अलग वास्तविकताओं में विभाजित कर रहा है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image (GPT-2): Three very different library staff members, a traditional librarian, a friendly service robot, and a salesman-like attendant, compete for a visitor's attention at a public library help desk.

नई रिसर्च में पाया गया है कि गूगल अब अपने खुद के सर्च साम्राज्य के अंदर तीन अलग-अलग जानकारी प्रणालियों का उपयोग कर रहा है, जिसमें नियमित सर्च, एआई ओवरव्यू और जेमिनी सभी अलग-अलग स्रोतों, रैंकिंग और सामग्री को पसंद करते हैं।

 

रिडुक्शनवाद का शासन है। पिछले बारह महीनों में, ‘लेट मी गूगल दैट फॉर यू’ मीम को एक नए ‘लेट मी सम्मराइज़ दैट गूगल सर्च फॉर यू’ ट्रेंड द्वारा प्रतिस्थापित किया गया है, जिसमें एआई ओवरव्यू सर्च परिणामों में बढ़ते रूप से पाठकों को सर्च लिंक पर क्लिक करने की परेशानी से बचाते हैं (संभवतः स्रोत साइटों को डी-फंडिंग करते हुए), पूरे सर्च परिणामों को कुछ उत्पन्न किए गए अनुच्छेदों में संक्षिप्त करते हैं।

कोई यह सोच सकता है कि सतह पर आए ज्ञान, और ज्ञान प्राप्त करने के लिए चुने गए साइट्स, तीनों सबसे लोकप्रिय तरीकों में काफी हद तक समान होंगे: पारंपरिक वेब सर्च में; एआई ओवरव्यू (एआईओ) में जो अब अधिकांश वेब सर्च परिणामों के शीर्ष पर हैं; और एलएलएम जैसे चैटजीपीटी का उपयोग करके वेब-ओरेकल के रूप में (बाहरी आरएजी कॉल के साथ या बिना)

हालांकि, हाल के शोध से संकेत मिलता है कि यह आश्चर्यजनक रूप से दूर की बात है; और यहां तक कि गूगल के अपने त्रिमूर्ति ऑरेकल – एसईआरपीएस*, एआई सारांश, और जेमिनी एलएलएम श्रृंखला के साथ सीधे इंटरैक्शन में – प्रत्येक मार्ग के लिए महत्वपूर्ण और दिलचस्प विसंगतियां हैं। (स्रोत)

तीन-तरफ़ा विभाजन

एक स्पष्ट और विस्तृत नया पेपर में, जिसका शीर्षक कैसे जेनरेटिव एआई सर्च को बाधित करता है: गूगल सर्च, जेमिनी और एआई ओवरव्यू का एक अनुभवजन्य अध्ययन है, न्यू जर्सी इंस्टीट्यूट ऑफ टेक्नोलॉजी के छह शोधकर्ता उन तरीकों को रेखांकित करते हैं जिनसे तीन सर्च तरीके विभाजित हो रहे हैं, और कुछ संभावित सिद्धांतों की पेशकश करते हैं जो इन दरारों के लिए जिम्मेदार हैं।

पेपर में कहा गया है:

‘[पहले, हम] पाते हैं कि 51.5% प्रतिनिधि वास्तविक उपयोगकर्ता प्रश्नों के लिए, एआईओ उत्पन्न किए जाते हैं और ऑर्गेनिक सर्च परिणामों के ऊपर प्रदर्शित किए जाते हैं। विवादास्पद प्रश्न अक्सर एक एआईओ का परिणाम होते हैं।

‘दूसरा, हम दिखाते हैं कि प्रत्येक सर्च इंजन के लिए पुनर्प्राप्त स्रोतों में काफी अंतर है (<0.2 औसत जैकार्ड समानता), पारंपरिक गूगल सर्च संस्थागत वेबसाइटों से जानकारी प्राप्त करने की संभावना अधिक है, जबकि जेनरेटिव सर्च इंजन गूगल के स्वामित्व वाली सामग्री को पुनर्प्राप्त करने की संभावना अधिक है।

‘तीसरा, हम देखते हैं कि जो वेबसाइट गूगल के एआई क्रॉलर को ब्लॉक करती हैं, वे एआईओ द्वारा पुनर्प्राप्त होने की संभावना कम है, हालांकि उनके पास सामग्री तक पहुंच है। ‘

यह शोधपत्र रोचक निष्कर्षों से भरा है, इसलिए सामान्य क्रम का पालन करने के बजाय हम इसकी प्रमुख खोजों पर विषयवार विचार करेंगे।

पुराना ‘दो-एक’

अध्ययन में एक दिलचस्प निष्कर्ष यह है कि गूगल के एआई ओवरव्यू अचानक ब्रेकिंग न्यूज़ इवेंट्स के लिए दबाए जाते हैं, क्योंकि सबसे पहले और सबसे उपलब्ध स्रोत सबसे सटीक नहीं हो सकते हैं।

यह प्रणाली हमेशा काम नहीं करती है: शोधकर्ताओं द्वारा नोट किए गए उदाहरण में, गूगल एआई ओवरव्यू ने एक बॉक्सिंग मैच के परिणाम को गलत बॉक्सर को जीत का श्रेय दिया, हालांकि केवल एक स्रोत (एक फेसबुक पर सैटायरल स्पोर्ट्स फीड) ने यह गलत परिणाम दिया था:

गूगल के एआई ओवरव्यू समय-समय पर समय-critical सारांश से बचते हैं क्योंकि शुरुआती जानकारी अधूरी या पूरी तरह से गलत हो सकती है। इस मामले में, बॉक्सर जेक पॉल वास्तव में मैच हार गए थे। स्रोत

गूगल के एआई ओवरव्यू समय-समय पर समय-critical सारांश से बचते हैं क्योंकि शुरुआती जानकारी अधूरी या पूरी तरह से गलत हो सकती है। इस मामले में, बॉक्सर जेक पॉल वास्तव में मैच हार गए थे। स्रोत Source

लेखकों के अनुसार, किसी घटना के कम से कम पाँच दिन पुरानी होने पर एआई ओवरव्यू दिखाई देने की संभावना बढ़ती है, जिससे वास्तविक समय की उपयोगिता पर सवाल उठता है।

लेखकों का उल्लेख है कि एआईओ अक्सर तब उत्पन्न होते हैं जब प्रश्न एक प्रश्न चिह्न के साथ बंद होता है, और प्रश्न इरादा एक कारक है जो यह निर्धारित करता है कि क्या एक एआईओ प्रस्तुत किया जाएगा:

एक एआई सर्च सारांश का उत्पादन होने वाली घटनाओं का प्रतिशत शोधकर्ताओं के एक दौर के परीक्षण में। यहाँ ‘सूचनात्मक’ सीधे प्रश्नों को इंगित करता है, जो अन्य प्रकार के इंटरैक्शन की तुलना में एआईओ का उत्पादन करने की संभावना अधिक है।

एक एआई सर्च सारांश का उत्पादन होने वाली घटनाओं का प्रतिशत शोधकर्ताओं के एक दौर के परीक्षण में। यहाँ ‘सूचनात्मक’ सीधे प्रश्नों को इंगित करता है, जो अन्य प्रकार के इंटरैक्शन की तुलना में एआईओ का उत्पादन करने की संभावना अधिक है।

इसके अलावा, पेपर में कहा गया है कि लंबे प्रश्न एआई सारांश के बजाय सीधे सर्च परिणामों का उत्पादन करने की संभावना अधिक है, हालांकि लेखक अभी तक इसके लिए एक सिद्धांत प्रस्तुत नहीं करते हैं।

एक विभाजित राज्य

शायद नए काम से सबसे आश्चर्यजनक परिणाम यह है कि गूगल के तीन सर्च प्लेटफ़ॉर्म के बीच परिणामों की गुणवत्ता/प्रकार में अपेक्षाकृत कम ओवरलैप है।

पेपर में बार-बार दिखाया गया है कि नियमित गूगल सर्च, एआई ओवरव्यू और जेमिनी (एलएलएम) एक ही प्रश्न के लिए अलग-अलग स्रोत पुनर्प्राप्त करते हैं, जिसमें ओवरलैप स्कोर इतने कम हैं कि यह सुझाव देते हैं कि गूगल के भीतर तीन प्रतिस्पर्धी पुनर्प्राप्ति तर्क हैं, जबकि उपयोगकर्ता यह मान सकते हैं कि गूगल के पास एक अधिकारिक सूचकांक है और एक रैंकिंग दर्शन है:

गूगल के अपने पारिस्थितिकी तंत्र के भीतर, पारंपरिक सर्च, एआई ओवरव्यू और जेमिनी के बीच ओवरलैप आश्चर्यजनक रूप से छोटा साबित हुआ, जिसमें एक ही प्रश्न के लिए अक्सर अलग-अलग स्रोत सूचियां उत्पन्न होती हैं। इस तुलना में, हम देखते हैं कि तीनों प्रणालियों ने एक दूसरे के साथ कितनी बारीकी से मेल खाया, हजारों सर्च प्रश्नों पर, खरीदारी और बहस विषयों से लेकर स्थानीय सर्च और सामान्य ज्ञान प्रश्नों तक, जिसमें कम स्कोर कम सहमति को इंगित करता है।

गूगल के अपने पारिस्थितिकी तंत्र के भीतर, पारंपरिक सर्च, एआई ओवरव्यू और जेमिनी के बीच ओवरलैप आश्चर्यजनक रूप से छोटा साबित हुआ, जिसमें एक ही प्रश्न के लिए अक्सर अलग-अलग स्रोत सूचियां उत्पन्न होती हैं। इस तुलना में, हम देखते हैं कि तीनों प्रणालियों ने एक दूसरे के साथ कितनी बारीकी से मेल खाया, हजारों सर्च प्रश्नों पर, खरीदारी और बहस विषयों से लेकर स्थानीय सर्च और सामान्य ज्ञान प्रश्नों तक, जिसमें कम स्कोर कम सहमति को इंगित करता है।

अपने विश्लेषण के इस भाग के बारे में लेखक कहते हैं:

‘ऊपर दी गई तालिका प्रत्येक प्रश्न के लिए एआईओ, जेमिनी और पारंपरिक एसईआरपी द्वारा लौटाए गए स्रोतों की सूचियों के बीच औसत समानता दिखाती है।’

‘मुख्य निष्कर्ष यह है कि प्रश्नों के उपसमूह या खोज इंजनों की जोड़ी चाहे जो हो, स्रोत सूचियों में समानता बहुत कम रहती है।’

लेखकों का कहना है: (स्रोत)

‘[उपरोक्त तालिका] प्रत्येक प्रश्न के लिए एआईओ, जेमिनी और पारंपरिक एसईआरपी द्वारा पुनर्प्राप्त स्रोतों की सूची के बीच औसत समानता प्रस्तुत करती है।

‘मुख्य बात यह है कि प्रश्न उपसेट और तुलना किए जा रहे सर्च इंजन की जोड़ी की परवाह किए बिना, पुनर्प्राप्त सूचियां असमान हैं, जो कि गूगल द्वारा विकसित की गई हैं (स्रोत) (स्रोत) (स्रोत)

स्व-सेवा..?

कुछ वेबसाइटें, या वेबसाइटों की श्रेणियाँ, एआई सारांशों के आगमन और एलएलएम-आधारित सर्च के पारंपरिक सर्च स्थान में प्रवेश से प्रभावित हुई हैं – दोनों नकारात्मक और सकारात्मक रूप से:

पारंपरिक गूगल सर्च की तुलना में, एआई ओवरव्यू और जेमिनी दोनों ने कई प्रमुख वेबसाइटों से उद्धरण कम किए, जबकि कुछ चुनिंदा डोमेन के लिए दृश्यता बढ़ाई। यूट्यूब दोनों प्रणालियों में सबसे बड़ा लाभार्थी साबित हुआ, जबकि रेडिट, विकिपीडिया, फेसबुक और कई संस्थागत स्रोत एआई-उत्पन्न पुनर्प्राप्ति में कम बार दिखाई दिए।

पारंपरिक गूगल सर्च की तुलना में, एआई ओवरव्यू और जेमिनी दोनों ने कई प्रमुख वेबसाइटों से उद्धरण कम किए, जबकि कुछ चुनिंदा डोमेन के लिए दृश्यता बढ़ाई। यूट्यूब दोनों प्रणालियों में सबसे बड़ा लाभार्थी साबित हुआ, जबकि रेडिट, विकिपीडिया, फेसबुक और कई संस्थागत स्रोत एआई-उत्पन्न पुनर्प्राप्ति में कम बार दिखाई दिए।

लेखकों का कहना है:

‘हमारे पास तीन मुख्य निष्कर्ष हैं [उपरोक्त ग्राफ से। पहला, बड़ी और प्रसिद्ध वेबसाइटें सबसे अधिक प्रभावित होती हैं (दोनों सकारात्मक और नकारात्मक रूप से। यह समझ में आता है क्योंकि बड़ी वेबसाइटें अपनी प्रतिष्ठा और सामग्री में विविधता के कारण कई अलग-अलग प्रश्नों के लिए प्रासंगिक होती हैं।

‘दूसरा, इन वेबसाइटों का अधिकांश हिस्सा जेनरेटिव सर्च इंजनों के साथ कम उद्धरण और शीर्ष तीन उद्धरण प्राप्त करता है (लाल बार और नकारात्मक संख्या [ग्राफ में])। यह सुझाव देता है कि जेनरेटिव सर्च अधिक निचे स्रोतों से जानकारी प्राप्त करने की प्रवृत्ति रखता है।

‘तीसरा, गूगल के एआईओ गूगल वेबसाइटों (गूगल.कॉम और यूट्यूब.कॉम डोमेन) को पसंद करते हैं।

‘जेमिनी भी यूट्यूब को पारंपरिक गूगल सर्च की तुलना में पसंद करता है, लेकिन पूर्ण अंतर छोटा है। ‘

कोई ‘ब्लॉकर्स’..?

अध्ययन में पाया गया कि जो प्रकाशक गूगल के एआई वेब क्रॉलर को ब्लॉक करते हैं – जो एक स्वचालित वेब-बॉट है जो आपकी साइट से डेटा स्क्रैप करता है जब तक कि आप इसे रोबोट्स.टेक्सट फ़ाइल के साथ नहीं रोकते – वे एआई सारांश में दिखाई नहीं देते हैं।

यह एक स्पष्ट रूप से स्व-निर्धारित चोट की तरह लगता है, लेकिन वास्तव में, गूगल ने सार्वजनिक रूप से घोषणा की है कि जो सामग्री एआई क्रॉलर को ब्लॉक करती है एआई सारांश में दिखाई नहीं देगी; बल्कि, प्रकाशकों को अपने डेटा को स्क्रैप नहीं किया जाएगा, इसे एक संग्रह में क्यूरेट नहीं किया जाएगा, और जेमिनी और अन्य गूगल एआई परियोजनाओं के लिए एआई प्रशिक्षण के अगले दौर में चलाया नहीं जाएगा。 (स्रोत)

हालांकि, यह वह निष्कर्ष नहीं था जो नए पेपर के शोधकर्ताओं ने निकाला, जिन्होंने पाया कि लोकप्रिय एआई-बैनिंग प्रकाशक जेमिनी द्वारा बहुत कम उद्धृत किए गए थे, चाहे वह एलएलएम या अधिक चुस्त और लचीले सर्च-परिणाम संस्करण में हों। ‘प्रभावी रूप से बैन’ किए गए प्रकाशकों को पेपर में एनवाईटाइम्स, सीएनएन, बीबीसी, साइंसडायरेक्ट, रॉयटर्स, विले, नेचर, ईएसपीएन, बिजनेस इनसाइडर, सीएनबीसी, एनपीआर, वायर्ड, यूएसए टुडे, एनबीसी न्यूज, जीनियस, नेशनल ज्योग्राफिक, द कंवर्सेशन, यू.एस. न्यूज एंड वर्ल्ड रिपोर्ट, साइंटिफिक अमेरिकन, कंज्यूमर रिपोर्ट्स, और स्टैट के रूप में सूचीबद्ध किया गया था।

उपरोक्त सूचीबद्ध प्रकाशकों द्वारा किए गए कुछ रोबोट्स.टेक्सट एआई-स्क्रैपिंग बैन। क्या इससे गूगल द्वारा व्यापक निंदा हुई है?

उपरोक्त सूचीबद्ध प्रकाशकों द्वारा किए गए कुछ रोबोट्स.टेक्सट एआई-स्क्रैपिंग बैन। क्या इससे गूगल द्वारा व्यापक निंदा हुई है?

लेखकों का कहना है:

‘हमारे विश्लेषण में सबसे अधिक प्रभावित डोमेन में, हमने पाया कि 21 लोकप्रिय [प्रकाशक] (जो दोनों गूगल सर्च और एआईओ द्वारा कम से कम 20 अनोखे प्रश्नों के लिए पुनर्प्राप्त किए जाते हैं) जेमिनी द्वारा कभी उद्धृत नहीं किए गए थे।

‘कई लोकप्रिय सोशल मीडिया (फेसबुक, इंस्टाग्राम, टिकटॉक) और समीक्षा वेबसाइटें (आईएमडीबी, येल्प, ट्रिपएडवाइजर) भी जेमिनी से कोई उद्धरण प्राप्त नहीं किए। आगे की जांच में, हमने पाया कि इन सभी वेबसाइटों ने अपने रोबोट्स.टेक्सट फ़ाइलों में गूगल-एक्सटेंडेड बॉट को ब्लॉक कर दिया था। ‘

यदि यह निष्कर्ष अन्य अध्ययनों में भी पुष्ट और स्थायी साबित होता है, तो यह अनुमान लगाया जा सकता है कि सामाजिक और समीक्षा मंचों की सामग्री एआई खोज परिणामों में व्यवस्थित रूप से कम दिखाई दे सकती है।

निष्कर्ष

राय: यह एक स्पष्ट और अत्यंत सघन शोधपत्र है, जिसकी केवल दस मुख्य पृष्ठों में खोज और एआई उत्तर प्रणालियों के बारे में असाधारण मात्रा में उपयोगी जानकारी समाई हुई है। (स्रोत)

राय यह एक स्पष्ट और विस्तृत ज़िप-बॉम्ब जैसा पेपर है, जिसके मात्र दस प्राथमिक पृष्ठ एक लगभग अभिभूत करने वाले कैस्केड में खुलते हैं जो और अधिक खोज करने के लिए प्रेरित करते हैं। चूंकि हम केवल एक छोटे से खंड को कवर करने में सक्षम हुए हैं, मैं सुझाव देता हूं कि स्रोत पीडीएफ को भी एक आकस्मिक पाठक (एक दुर्लभ घटना) के लिए पढ़ें।

हालांकि एक ‘पीला’ दृष्टिकोण इस खोज के कई नकारात्मक व्याख्याएं दे सकता है, यह काम शायद सबसे अच्छा है जो एक वैश्विक प्रौद्योगिकी नेता के रूप में एआई-आधारित सर्च में एक वैश्विक अग्रणी प्राप्त करने और बनाए रखने के प्रयास के रूप में देखा जाता है, जो उच्च-विपरीत प्लेटफ़ॉर्म का उपयोग करता है जो बहुत अलग परिस्थितियों में और बहुत अलग युग में विकसित हुए हैं।

एआई जैसे 1999

गूगल के आगमन से पहले, यह संभव था कि आप ‘गेम’ सर्च परिणामों को केवल मात्रा के माध्यम से प्राप्त कर सकते थे, और इस तरह, आप अक्सर न्यूनतम (अक्सर स्वचालित) प्रयास के साथ फ्रंट-पेज एसईआरपीएस प्लेसमेंट प्राप्त कर सकते थे। यह ‘नंबर गेम’ को लगभग 2002 में गूगल के अधिक परिष्कृत और गोपनीय सर्च रैंकिंग एल्गोरिदम द्वारा प्रभावी रूप से समाप्त कर दिया गया था। लेकिन चूंकि दांव महत्वपूर्ण थे, उच्च-मात्रा और निम्न-गुणवत्ता वाली सामग्री किसी भी अर्थपूर्ण तरीके से कभी नहीं गई।

इसलिए, जब हाइपरस्केल संग्रह जैसे कॉमन क्रॉल ने आधुनिक एआई क्रांति की नींव रखी, तो डेटा-प्रमुखता स्वचालित प्रक्रियाओं द्वारा आगमनशील डेटा की गुणवत्ता को फ़िल्टर और रैंक करने की सीमा से निर्धारित होने वाली थी, और (बहुत कम संभावना है कि) लोगों को डेटा रैंक करने के लिए भुगतान करने के लिए पैसा उपलब्ध था।

चूंकि ये डेटा इंडक्शन प्रक्रियाएं अभी भी बहुत अच्छी नहीं हैं, यहां तक कि गूगल के लिए भी एआई को व्यावसायिक तरीके से कार्य करना मुश्किल है, क्योंकि जेमिनी के पेजरैंक-शैली के निर्णय गूगल के नीति इंजीनियरों द्वारा निर्धारित नहीं किए जाते हैं, बल्कि एआई मॉडल के प्रशिक्षण के दौरान हाइपरस्केल डेटा के रूपांतरण और लेटेंट एम्बेडिंग की एक अपूर्ण समझ से निर्धारित किए जाते हैं। (स्रोत)

चूँकि ये डेटा ग्रहण प्रक्रियाएँ अब भी बहुत अच्छी नहीं हैं, इसलिए गूगल जैसी कंपनी के लिए भी पुराने, निम्न-गुणवत्ता या गलत स्रोतों को प्रशिक्षण और पुनर्प्राप्ति प्रणालियों से पूरी तरह अलग करना बहुत कठिन है। (स्रोत)

* सर्च इंजन रिज़ल्ट पेज।

† जोर लेखकों का है, मेरा नहीं। पठनीयता के लिए मूल इटैलिक को बोल्ड रूप में प्रस्तुत किया गया है।

पहली बार बुधवार, 13 मई 2026 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai