Anderson का एंगल

आर्टिफ़िशियल इंटेलिजेंस वेब सर्च को तीन अलग-अलग वास्तविकताओं में विभाजित कर रहा है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image (GPT-2): Three very different library staff members, a traditional librarian, a friendly service robot, and a salesman-like attendant, compete for a visitor's attention at a public library help desk.

नई रिसर्च में पाया गया है कि गूगल अब अपने खुद के सर्च साम्राज्य के अंदर तीन अलग-अलग जानकारी प्रणालियों का उपयोग कर रहा है, जिसमें नियमित सर्च, एआई ओवरव्यू और जेमिनी सभी अलग-अलग स्रोतों, रैंकिंग और सामग्री को पसंद करते हैं।

 

रिडुक्शनवाद का शासन है। पिछले बारह महीनों में, ‘लेट मी गूगल दैट फॉर यू’ मीम को एक नए ‘लेट मी सम्मराइज़ दैट गूगल सर्च फॉर यू’ ट्रेंड द्वारा प्रतिस्थापित किया गया है, जिसमें एआई ओवरव्यू सर्च परिणामों में बढ़ते रूप से पाठकों को सर्च लिंक पर क्लिक करने की परेशानी से बचाते हैं (संभवतः स्रोत साइटों को डी-फंडिंग करते हुए), पूरे सर्च परिणामों को कुछ उत्पन्न किए गए अनुच्छेदों में संक्षिप्त करते हैं।

कोई यह सोच सकता है कि सतह पर आए ज्ञान, और ज्ञान प्राप्त करने के लिए चुने गए साइट्स, तीनों सबसे लोकप्रिय तरीकों में tương đối समान होंगे: पारंपरिक वेब सर्च में; एआई ओवरव्यू (एआईओ) में जो अब अधिकांश वेब सर्च परिणामों के शीर्ष पर हैं; और एलएलएम जैसे चैटजीपीटी का उपयोग करके वेब-ओरेकल के रूप में (बाहरी आरएजी कॉल के साथ या बिना)

हालांकि, हाल के शोध से संकेत मिलता है कि यह आश्चर्यजनक रूप से दूर की बात है; और यहां तक कि गूगल के अपने त्रिमूर्ति ऑरेकल – एसईआरपीएस*, एआई सारांश, और जेमिनी एलएलएम श्रृंखला के साथ सीधे इंटरैक्शन में – प्रत्येक मार्ग के लिए महत्वपूर्ण और दिलचस्प विसंगतियां हैं।

तीन-तरफ़ा विभाजन

एक स्पष्ट और विस्तृत नया पेपर में, जिसका शीर्षक कैसे जेनरेटिव एआई सर्च को बाधित करता है: गूगल सर्च, जेमिनी और एआई ओवरव्यू का एक अनुभवजन्य अध्ययन है, न्यू जर्सी इंस्टीट्यूट ऑफ टेक्नोलॉजी के छह शोधकर्ता उन तरीकों को रेखांकित करते हैं जिनसे तीन सर्च तरीके विभाजित हो रहे हैं, और कुछ संभावित सिद्धांतों की पेशकश करते हैं जो इन दरारों के लिए जिम्मेदार हैं।

पेपर में कहा गया है:

‘[पहले, हम] पाते हैं कि 51.5% प्रतिनिधि वास्तविक उपयोगकर्ता प्रश्नों के लिए, एआईओ उत्पन्न किए जाते हैं और ऑर्गेनिक सर्च परिणामों के ऊपर प्रदर्शित किए जाते हैं। विवादास्पद प्रश्न अक्सर एक एआईओ का परिणाम होते हैं।

‘दूसरा, हम दिखाते हैं कि प्रत्येक सर्च इंजन के लिए पुनर्प्राप्त स्रोतों में काफी अंतर है (<0.2 औसत जैकार्ड समानता), पारंपरिक गूगल सर्च संस्थागत वेबसाइटों से जानकारी प्राप्त करने की संभावना अधिक है, जबकि जेनरेटिव सर्च इंजन गूगल के स्वामित्व वाली सामग्री को पुनर्प्राप्त करने की संभावना अधिक है।

‘तीसरा, हम देखते हैं कि जो वेबसाइट गूगल के एआई क्रॉलर को ब्लॉक करती हैं, वे एआईओ द्वारा पुनर्प्राप्त होने की संभावना कम है,尽管 उनके पास सामग्री तक पहुंच है। ‘

पुराना ‘दो-एक’

अध्ययन में एक दिलचस्प निष्कर्ष यह है कि गूगल के एआई ओवरव्यू अचानक ब्रेकिंग न्यूज़ इवेंट्स के लिए दबाए जाते हैं, क्योंकि सबसे पहले और सबसे उपलब्ध स्रोत सबसे सटीक नहीं हो सकते हैं।

यह प्रणाली हमेशा काम नहीं करती है: शोधकर्ताओं द्वारा नोट किए गए उदाहरण में, गूगल एआई ओवरव्यू ने एक बॉक्सिंग मैच के परिणाम को गलत बॉक्सर को जीत का श्रेय दिया,尽管 केवल एक स्रोत (एक फेसबुक पर सैटायरल स्पोर्ट्स फीड) ने यह गलत परिणाम दिया था:

गूगल के एआई ओवरव्यू समय-समय पर समय-critical सारांश से बचते हैं क्योंकि शुरुआती जानकारी अधूरी या पूरी तरह से गलत हो सकती है। इस मामले में, बॉक्सर जेक पॉल वास्तव में मैच हार गए थे। स्रोत - https://arxiv.org/pdf/2604.27790

गूगल के एआई ओवरव्यू समय-समय पर समय-critical सारांश से बचते हैं क्योंकि शुरुआती जानकारी अधूरी या पूरी तरह से गलत हो सकती है। इस मामले में, बॉक्सर जेक पॉल वास्तव में मैच हार गए थे। स्रोत

लेखकों का उल्लेख है कि एआईओ अक्सर तब उत्पन्न होते हैं जब प्रश्न एक प्रश्न चिह्न के साथ बंद होता है, और प्रश्न इरादा एक कारक है जो यह निर्धारित करता है कि क्या एक एआईओ प्रस्तुत किया जाएगा:

एक एआई सर्च सारांश का उत्पादन होने वाली घटनाओं का प्रतिशत शोधकर्ताओं के एक दौर के परीक्षण में। यहाँ 'सूचनात्मक' सीधे प्रश्नों को इंगित करता है, जो अन्य प्रकार के इंटरैक्शन की तुलना में एआईओ का उत्पादन करने की संभावना अधिक है।

एक एआई सर्च सारांश का उत्पादन होने वाली घटनाओं का प्रतिशत शोधकर्ताओं के एक दौर के परीक्षण में। यहाँ ‘सूचनात्मक’ सीधे प्रश्नों को इंगित करता है, जो अन्य प्रकार के इंटरैक्शन की तुलना में एआईओ का उत्पादन करने की संभावना अधिक है।

इसके अलावा, पेपर में कहा गया है कि लंबे प्रश्न एआई सारांश के बजाय सीधे सर्च परिणामों का उत्पादन करने की संभावना अधिक है, हालांकि लेखक अभी तक इसके लिए एक सिद्धांत प्रस्तुत नहीं करते हैं।

एक विभाजित राज्य

शायद नए काम से सबसे आश्चर्यजनक परिणाम यह है कि गूगल के तीन सर्च प्लेटफ़ॉर्म के बीच परिणामों की गुणवत्ता/प्रकार में अपेक्षाकृत कम ओवरलैप है।

पेपर में बार-बार दिखाया गया है कि नियमित गूगल सर्च, एआई ओवरव्यू और जेमिनी (एलएलएम) एक ही प्रश्न के लिए अलग-अलग स्रोत पुनर्प्राप्त करते हैं, जिसमें ओवरलैप स्कोर इतने कम हैं कि यह सुझाव देते हैं कि गूगल के भीतर तीन प्रतिस्पर्धी पुनर्प्राप्ति तर्क हैं, जबकि उपयोगकर्ता यह मान सकते हैं कि गूगल के पास एक अधिकारिक सूचकांक है और एक रैंकिंग दर्शन है:

गूगल के अपने पारिस्थितिकी तंत्र के भीतर, पारंपरिक सर्च, एआई ओवरव्यू और जेमिनी के बीच ओवरलैप आश्चर्यजनक रूप से छोटा साबित हुआ, जिसमें एक ही प्रश्न के लिए अक्सर अलग-अलग स्रोत सूचियां उत्पन्न होती हैं। इस तुलना में, हम देखते हैं कि तीनों प्रणालियों ने एक दूसरे के साथ कितनी बारीकी से मेल खाया, हजारों सर्च प्रश्नों पर, खरीदारी और बहस विषयों से लेकर स्थानीय सर्च और सामान्य ज्ञान प्रश्नों तक, जिसमें कम स्कोर कम सहमति को इंगित करता है।

गूगल के अपने पारिस्थितिकी तंत्र के भीतर, पारंपरिक सर्च, एआई ओवरव्यू और जेमिनी के बीच ओवरलैप आश्चर्यजनक रूप से छोटा साबित हुआ, जिसमें एक ही प्रश्न के लिए अक्सर अलग-अलग स्रोत सूचियां उत्पन्न होती हैं। इस तुलना में, हम देखते हैं कि तीनों प्रणालियों ने एक दूसरे के साथ कितनी बारीकी से मेल खाया, हजारों सर्च प्रश्नों पर, खरीदारी और बहस विषयों से लेकर स्थानीय सर्च और सामान्य ज्ञान प्रश्नों तक, जिसमें कम स्कोर कम सहमति को इंगित करता है।

लेखकों का कहना है:

‘[उपरोक्त तालिका] प्रत्येक प्रश्न के लिए एआईओ, जेमिनी और पारंपरिक एसईआरपी द्वारा पुनर्प्राप्त स्रोतों की सूची के बीच औसत समानता प्रस्तुत करती है।

‘मुख्य बात यह है कि प्रश्न उपसेट और तुलना किए जा रहे सर्च इंजन की जोड़ी की परवाह किए बिना, पुनर्प्राप्त सूचियां असमान हैं, जो कि गूगल द्वारा विकसित की गई हैं

स्व-सेवा..?

कुछ वेबसाइटें, या वेबसाइटों की श्रेणियाँ, एआई सारांशों के आगमन और एलएलएम-आधारित सर्च के पारंपरिक सर्च स्थान में प्रवेश से प्रभावित हुई हैं – दोनों नकारात्मक और सकारात्मक रूप से:

पारंपरिक गूगल सर्च की तुलना में, एआई ओवरव्यू और जेमिनी दोनों ने कई प्रमुख वेबसाइटों से उद्धरण कम किए, जबकि कुछ चुनिंदा डोमेन के लिए दृश्यता बढ़ाई। यूट्यूब दोनों प्रणालियों में सबसे बड़ा लाभार्थी साबित हुआ, जबकि रेडिट, विकिपीडिया, फेसबुक और कई संस्थागत स्रोत एआई-उत्पन्न पुनर्प्राप्ति में कम बार दिखाई दिए।

पारंपरिक गूगल सर्च की तुलना में, एआई ओवरव्यू और जेमिनी दोनों ने कई प्रमुख वेबसाइटों से उद्धरण कम किए, जबकि कुछ चुनिंदा डोमेन के लिए दृश्यता बढ़ाई। यूट्यूब दोनों प्रणालियों में सबसे बड़ा लाभार्थी साबित हुआ, जबकि रेडिट, विकिपीडिया, फेसबुक और कई संस्थागत स्रोत एआई-उत्पन्न पुनर्प्राप्ति में कम बार दिखाई दिए।

लेखकों का कहना है:

‘हमारे पास तीन मुख्य निष्कर्ष हैं [उपरोक्त ग्राफ से। पहला, बड़ी और प्रसिद्ध वेबसाइटें सबसे अधिक प्रभावित होती हैं (दोनों सकारात्मक और नकारात्मक रूप से। यह समझ में आता है क्योंकि बड़ी वेबसाइटें अपनी प्रतिष्ठा और सामग्री में विविधता के कारण कई अलग-अलग प्रश्नों के लिए प्रासंगिक होती हैं।

‘दूसरा, इन वेबसाइटों का अधिकांश हिस्सा जेनरेटिव सर्च इंजनों के साथ कम उद्धरण और शीर्ष तीन उद्धरण प्राप्त करता है (लाल बार और नकारात्मक संख्या [ग्राफ में])। यह सुझाव देता है कि जेनरेटिव सर्च अधिक निचे स्रोतों से जानकारी प्राप्त करने की प्रवृत्ति रखता है।

‘तीसरा, गूगल के एआईओ गूगल वेबसाइटों (गूगल.कॉम और यूट्यूब.कॉम डोमेन) को पसंद करते हैं।

‘जेमिनी भी यूट्यूब को पारंपरिक गूगल सर्च की तुलना में पसंद करता है, लेकिन绝对 अंतर छोटा है। ‘

कोई ‘ब्लॉकर्स’..?

अध्ययन में पाया गया कि जो प्रकाशक गूगल के एआई वेब क्रॉलर को ब्लॉक करते हैं – जो एक स्वचालित वेब-बॉट है जो आपकी साइट से डेटा स्क्रैप करता है जब तक कि आप इसे रोबोट्स.टेक्सट फ़ाइल के साथ नहीं रोकते – वे एआई सारांश में दिखाई नहीं देते हैं।

यह एक स्पष्ट रूप से स्व-निर्धारित चोट की तरह लगता है, लेकिन वास्तव में, गूगल ने सार्वजनिक रूप से घोषणा की है कि जो सामग्री एआई क्रॉलर को ब्लॉक करती है एआई सारांश में दिखाई नहीं देगी; बल्कि, प्रकाशकों को अपने डेटा को स्क्रैप नहीं किया जाएगा, इसे एक संग्रह में क्यूरेट नहीं किया जाएगा, और जेमिनी और अन्य गूगल एआई परियोजनाओं के लिए एआई प्रशिक्षण के अगले दौर में चलाया नहीं जाएगा。

हालांकि, यह वह निष्कर्ष नहीं था जो नए पेपर के शोधकर्ताओं ने निकाला, जिन्होंने पाया कि लोकप्रिय एआई-बैनिंग प्रकाशक जेमिनी द्वारा बहुत कम उद्धृत किए गए थे, चाहे वह एलएलएम या अधिक चुस्त और लचीले सर्च-परिणाम संस्करण में हों। ‘प्रभावी रूप से बैन’ किए गए प्रकाशकों को पेपर में एनवाईटाइम्स, सीएनएन, बीबीसी, साइंसडायरेक्ट, रॉयटर्स, विले, नेचर, ईएसपीएन, बिजनेस इनसाइडर, सीएनबीसी, एनपीआर, वायर्ड, यूएसए टुडे, एनबीसी न्यूज, जीनियस, नेशनल ज्योग्राफिक, द कंवर्सेशन, यू.एस. न्यूज एंड वर्ल्ड रिपोर्ट, साइंटिफिक अमेरिकन, कंज्यूमर रिपोर्ट्स, और स्टैट के रूप में सूचीबद्ध किया गया था।

उपरोक्त सूचीबद्ध प्रकाशकों द्वारा किए गए कुछ रोबोट्स.टेक्सट एआई-स्क्रैपिंग बैन। क्या इससे गूगल द्वारा व्यापक निंदा हुई है?

उपरोक्त सूचीबद्ध प्रकाशकों द्वारा किए गए कुछ रोबोट्स.टेक्सट एआई-स्क्रैपिंग बैन। क्या इससे गूगल द्वारा व्यापक निंदा हुई है?

लेखकों का कहना है:

‘हमारे विश्लेषण में सबसे अधिक प्रभावित डोमेन में, हमने पाया कि 21 लोकप्रिय [प्रकाशक] (जो दोनों गूगल सर्च और एआईओ द्वारा कम से कम 20 अनोखे प्रश्नों के लिए पुनर्प्राप्त किए जाते हैं) जेमिनी द्वारा कभी उद्धृत नहीं किए गए थे।

‘कई लोकप्रिय सोशल मीडिया (फेसबुक, इंस्टाग्राम, टिकटॉक) और समीक्षा वेबसाइटें (आईएमडीबी, येल्प, ट्रिपएडवाइजर) भी जेमिनी से कोई उद्धरण प्राप्त नहीं किए। आगे की जांच में, हमने पाया कि इन सभी वेबसाइटों ने अपने रोबोट्स.टेक्सट फ़ाइलों में गूगल-एक्सटेंडेड बॉट को ब्लॉक कर दिया था। ‘

निष्कर्ष

राय यह एक स्पष्ट और विस्तृत ज़िप-बॉम्ब जैसा पेपर है, जिसके मात्र दस प्राथमिक पृष्ठ एक लगभग अभिभूत करने वाले कैस्केड में खुलते हैं जो और अधिक खोज करने के लिए प्रेरित करते हैं। चूंकि हम केवल एक छोटे से खंड को कवर करने में सक्षम हुए हैं, मैं सुझाव देता हूं कि स्रोत पीडीएफ को भी एक आकस्मिक पाठक (एक दुर्लभ घटना) के लिए पढ़ें।

हालांकि एक ‘पीला’ दृष्टिकोण इस खोज के कई नकारात्मक व्याख्याएं दे सकता है, यह काम शायद सबसे अच्छा है जो एक वैश्विक प्रौद्योगिकी नेता के रूप में एआई-आधारित सर्च में एक वैश्विक अग्रणी प्राप्त करने और बनाए रखने के प्रयास के रूप में देखा जाता है, जो उच्च-विपरीत प्लेटफ़ॉर्म का उपयोग करता है जो बहुत अलग परिस्थितियों में और बहुत अलग युग में विकसित हुए हैं।

एआई जैसे 1999

गूगल के आगमन से पहले, यह संभव था कि आप ‘गेम’ सर्च परिणामों को केवल मात्रा के माध्यम से प्राप्त कर सकते थे, और इस तरह, आप अक्सर न्यूनतम (अक्सर स्वचालित) प्रयास के साथ फ्रंट-पेज एसईआरपीएस प्लेसमेंट प्राप्त कर सकते थे। यह ‘नंबर गेम’ को लगभग 2002 में गूगल के अधिक परिष्कृत और गोपनीय सर्च रैंकिंग एल्गोरिदम द्वारा प्रभावी रूप से समाप्त कर दिया गया था। लेकिन चूंकि दांव महत्वपूर्ण थे, उच्च-मात्रा और निम्न-गुणवत्ता वाली सामग्री किसी भी अर्थपूर्ण तरीके से कभी नहीं गई।

इसलिए, जब हाइपरस्केल संग्रह जैसे कॉमन क्रॉल ने आधुनिक एआई क्रांति की नींव रखी, तो डेटा-प्रमुखता स्वचालित प्रक्रियाओं द्वारा आगमनशील डेटा की गुणवत्ता को फ़िल्टर और रैंक करने की सीमा से निर्धारित होने वाली थी, और (बहुत कम संभावना है कि) लोगों को डेटा रैंक करने के लिए भुगतान करने के लिए पैसा उपलब्ध था।

चूंकि ये डेटा इंडक्शन प्रक्रियाएं अभी भी बहुत अच्छी नहीं हैं, यहां तक कि गूगल के लिए भी एआई को व्यावसायिक तरीके से कार्य करना मुश्किल है, क्योंकि जेमिनी के पेजरैंक-शैली के निर्णय गूगल के नीति इंजीनियरों द्वारा निर्धारित नहीं किए जाते हैं, बल्कि एआई मॉडल के प्रशिक्षण के दौरान हाइपरस्केल डेटा के रूपांतरण और लेटेंट एम्बेडिंग की एक अपूर्ण समझ से निर्धारित किए जाते हैं।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]