زاوية Anderson

الذكاء الاصطناعي يقسم البحث على الويب إلى ثلاثة واقعات مختلفة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): Three very different library staff members, a traditional librarian, a friendly service robot, and a salesman-like attendant, compete for a visitor's attention at a public library help desk.

تجد الأبحاث الجديدة أن جوجل تستخدم الآن ثلاثة أنظمة معلومات مختلفة داخل إمبراطوريته البحثية، مع تفضيل البحث العادي والأطلالات الذكية وجيمي مصادر وترتيبات ومحتوى مختلفة.

 

القواعد القائمة على الانخفاض هي القاعدة. خلال الأشهر الاثني عشر الماضية، تم تجاوز ميم “دعني أبحث عن ذلك من أجلك” بواسطة اتجاه جديد هو “دعني أملأ ذلك البحث على جوجل من أجلك”، حيث تزيد الأطلالات الذكية في نتائج البحث بشكل متزايد على قراء المتاعب من خلال النقر على روابط البحث، ويمكن أن تؤدي إلى إزالة تمويل المواقع المصدر في هذه العملية، من خلال تقليل نتائج البحث إلى بضع فقرات منشأة. ( ( (مصدر)مصدر)مصدر)

قد يظن المرء أن المعرفة الأساسية التي تظهر واختيار المواقع التي تُستمد منها ستكون متشابهة نسبيًا عبر أكثر ثلاث طرق شيوعًا للبحث عن المعلومات على الإنترنت: البحث التقليدي، وملخصات الذكاء الاصطناعي التي تتصدر معظم نتائج البحث، والاستخدام المتزايد لنماذج لغوية مثل ChatGPT كمراجع للويب، مع استدعاءات RAG خارجية أو من دونها. ( (مصدر)مصدر)

لكن أبحاثًا حديثة من الولايات المتحدة تشير، على نحو مفاجئ، إلى أن الواقع بعيد عن ذلك. فحتى داخل مسارات Google الثلاثة نفسها — صفحات النتائج، والملخصات الآلية، والتفاعل المباشر مع نماذج Gemini — تظهر اختلافات كبيرة ومثيرة للاهتمام في كل مسار. (مصدر)

انقسام ثلاثي

في ورقة جديدة وطويلة، بعنوان “كيف يزعزع الذكاء الاصطناعي البحث: دراسة تجريبية لجوجل البحث وجيمي والأطلالات الذكية”، يحدد ستة باحثين من معهد نيوجيرسي للتكنولوجيا الطرق التي تتقارب بها ثلاثة أساليب البحث، ويعرض بعض النظريات الممكنة لهذه الشقوق في النهج. (مصدر)

تنص الورقة على ما يلي:

‘أولاً، نجد أن الأطلالات الذكية يتم إنشاؤها وتعرضها ل 51.5٪ من استفسارات المستخدمين الحقيقية، وتظهر فوق نتائج البحث العضوية. غالبًا ما تؤدي الأسئلة المثيرة للجدل إلى أطلالة ذكية.

‘ثانيًا، نجد أن المصادر المستخرجة تختلف بشكل كبير لكل محرك بحث (معدل تشابه جاكارد أقل من 0.2). من المرجح أن يسترجع البحث التقليدي على جوجل المعلومات من المواقع الشهيرة أو المؤسسية في الحكومة أو التعليم، بينما يسترجع محركات البحث التوليدية المحتوى المملوك لجوجل بشكل كبير.

‘ثالثًا، نلاحظ أن المواقع التي تحظر زاحف جوجل الاصطناعي أقل احتمالاً للإرجاع بواسطة الأطلالات الذكية، على الرغم من وجود الوصول إلى المحتوى.’

由于 أن الورقة هي مجموعة من الاكتشافات المثيرة، بدلاً من اتباع سير عمل خطي وعملية، سننظر بشكل أعمق إلى هذه النتائج، بالإضافة إلى بعض النتائج الأخرى المثيرة والمضيئة.

الطريقة القديمة “الاثنان-واحد”

من بين العديد من النتائج المثيرة في الدراسة، يشير أحد الاكتشافات إلى أن أطلالات جوجل الذكية تميل إلى أن تكون محظورة في أحداث الأخبار الجارية، لأن المصادر الأولى المتاحة قد لا تكون الأكثر دقة.

هذا النظام لا يعمل دائمًا: في المثال أدناه، الذي أشار إليه الباحثون، نسبت أطلالة جوجل الذكية فوز الملاكم الخاطئ في مباراة الملاكمة، على الرغم من أن المصدر الوحيد الذي أعلن عن هذا النتيجة (الخاطئة) كان تغذية رياضية ساخرة على فيسبوك:

ne of the reasons that Google's AI overviews avoid time-critical summaries is that early information may be incomplete, or completely inaccurate. In this case, boxer Jake Paul actually lost the match. Source - https://arxiv.org/pdf/2604.27790

One of the reasons that Google’s AI overviews avoid time-critical summaries is that early information may be incomplete, or completely inaccurate. In this case, boxer Jake Paul actually lost the match. Source

يشير المؤلفون إلى أن الأطلالات الذكية تميل إلى الظهور عندما تكون الأحداث على الأقل خمسة أيام قديمة، مما يؤهله كاستثناء – ولكن في أي حال، كان الباحثون قادرين على استدعاء هذا الاستثناء بسهولة.

تم العثور على الأطلالات الذكية أكثر احتمالاً لتكون منشأة عندما كانت الاستفسارات مغلقة مع علامة استفهام، و rằng قصد الاستفسار كان عاملاً فيما إذا كان سيتم عرض أطلالة ذكية:

Percentage of incidents where an AI search summary was produced in one of the researchers' round of tests. Here 'informational' indicates direct questions, which tend to produce AIOs more than any other type of interaction.

Percentage of incidents where an AI search summary was produced in one of the researchers’ round of tests. Here ‘informational’ indicates direct questions, which tend to produce AIOs more than any other type of interaction.

كما يجادل المؤلفون، الاستفسارات الأطول تميل إلى أن تكون أكثر احتمالاً لإنتاج تلخيص ذكي بدلاً من نتائج البحث فقط، على الرغم من أن المؤلفين لم يقدموا بعد نظرية لتفسير هذا.

مملكة منقسمة

ربما يكون النتيجة الأكثر إثارة للدهشة في العمل الجديد هو التداخل الصغير بين نتائج الجودة / النوع بين منصات البحث الثلاث لجوجل.

تظهر الورقة بشكل متكرر أن البحث التقليدي على جوجل والأطلالات الذكية وجيمي يستردون مصادر مختلفة بشكل ملحوظ لنفس الاستفسار، مع درجات تشابه منخفضة بما فيه الكفاية ليدل على ثلاثة منطق استرجاع منافس داخل شركة واحدة، في حين قد يفترض المستخدمون أن جوجل لديها فهرس موثوق به واحد و فلسفة ترتيب واحدة:

Even inside Google’s own ecosystem, the overlap between traditional Search, AI Overviews and Gemini proved surprisingly small, with the same query often producing substantially different source lists depending on which Google system handled the request. In this comparison, we see how closely the three systems matched each other across thousands of search queries, from shopping and debate topics to local searches and general knowledge questions, with lower scores indicating less agreement between the sources selected.

Even inside Google’s own ecosystem, the overlap between traditional Search, AI Overviews and Gemini proved surprisingly small, with the same query often producing substantially different source lists depending on which Google system handled the request. In this comparison, we see how closely the three systems matched each other across thousands of search queries, from shopping and debate topics to local searches and general knowledge questions, with lower scores indicating less agreement between the sources selected.

بخصوص هذا القسم من تحليلهم، يعلن المؤلفون:

‘[الجدول أعلاه] يعرض متوسط التشابه بين قائمة المصادر التي تم إرجاعها بواسطة الأطلالة الذكية وجيمي والبحث التقليدي لكل استفسار في مجموعة البيانات المرجعية.

‘النقطة الرئيسية هي أن بغض النظر عن جزء الاستفسار وازدواجية محرك البحث المتماثل، فإن القوائم المستخرجة غير متشابهة، على الرغم من أن جميعها تم تطويرها بواسطة جوجل.’

يعلن الباحثون أيضًا أن أي طريقة بحث لم تثبت أن لديها تداخل متأثر بالترتيب (RBO) أعلى من 0.27، وهو درجة thấpة جدًا. ويلاحظون أيضًا أن أمازون ريتيل والاستفسارات المحلية (أي “المتاجر بالقرب مني”) كانت أقل تشابهًا بين أساليب البحث.

ينسبون انخفاض الاتفاق إلى ‘عدم التماثل بين محركات البحث’، مشيرين إلى أن العشوائية أو أي عامل واضح آخر لا يمكن أن يفسر هذا الانقطاع.

يمكن أن يكون أحد التفسيرات المتuitive هو أن نقاط بيانات التدريب يتم تعيينها بالترتيب بطرق مختلفة جدًا عن الطرق التي طورتها جوجل لترتيب الصفحة و خلافةها خلال العشرين عامًا الماضية. بالإضافة إلى ذلك، في حالة أن خوارزمية بحث جوجل لديها ( (أجندة سرية، فإن هذا النوع من التلاعب أو “اللعب” صعب التنفيذ بشكل متسق في الذكاء الاصطناعي القائم على الانتشار مثل جيمي (حتى من خلال التصفية وتنبيهات النظام وطرق التجميع الأخرى التي تفرض على النماذج التجارية).مصدر)مصدر)

الخدمة الذاتية..؟

تظهر بعض المواقع، أو فئات من المواقع، أنها قد تأثرت بظهور تلخيصات الذكاء الاصطناعي والغزو المتزايد لمحركات البحث القائمة على الذكاء الاصطناعي في الفضاء البحث التقليدي – بشكل سلبي وإيجابي، اعتمادًا على الحالة:

Compared to traditional Google Search, AI Overviews and Gemini both reduced citations from many major websites, while increasing visibility for a smaller number of favored domains. YouTube proved to be one of the biggest beneficiaries across both systems, while Reddit, Wikipedia, Facebook and many institutional sources appeared less frequently in AI-generated retrieval.

Compared to traditional Google Search, AI Overviews and Gemini both reduced citations from many major websites, while increasing visibility for a smaller number of favored domains. YouTube proved to be one of the biggest beneficiaries across both systems, while Reddit, Wikipedia, Facebook and many institutional sources appeared less frequently in AI-generated retrieval.

يشير المؤلفون إلى أن بعض التفضيلات غير المتوقعة تظهر بين الثلاثة أساليب أثناء الاختبار:

‘لدينا ثلاثة استخلاصات رئيسية من [الرسومات أعلاه]. أولاً، المواقع الكبيرة والمعروفة هي الأكثر تأثرًا (إيجابياً وسلبياً). هذا هو المفهوم لأن المواقع الكبيرة لها سمعة وتنوع في المحتوى لتكون ذات صلة بمختلف الاستفسارات.

‘ثانيًا، الغالبية العظمى من هذه المواقع تتلقى إشارات أقل بشكل عام، وأقل إشارات في المراكز الثلاثة الأولى، من محركات البحث التوليدية (مشار إليها بواسطة قضبان حمراء وأرقام سالبة في [الرسومات أعلاه]). هذا يشير إلى أن البحث التوليدي يميل إلى استخراج المعلومات من مصادر أكثر تخصصًا من محركات البحث التقليدية.

‘ثالثًا، تفضل أطلالات جوجل الذكية المواقع التابعة لجوجل (أي نطاقات google.com و youtube.com).

‘كما تفضل جيمي يوتيوب مقارنة بالبحث التقليدي على جوجل، ولكن الفرق المطلق هو أصغر.’

هل هناك أي معوقات..؟

وجدت الدراسة أيضًا أن الناشرين الذين يحظرون زاحف جوجل الاصطناعي – زاحف الويب الآلي الذي يقوم بتحليل البيانات من موقعك ما لم تقل له لا تفعل ذلك باستخدام ملف robots.txt – تميل إلى عدم الظهور في الأطلالات الذكية.

قد يبدو هذا وكأنه جرح ذاتي واضح، ولكن في الواقع، أعلنت جوجل veřejně أن المحتوى من المنصات التي تحظر زاحف الذكاء الاصطناعي (لن يتم منعها من الظهور في الأطلالات الذكية؛ بل سيتم فقط عدم حصول الناشرين على بياناتهم، وتنقيبها، وجمعها في مجموعة، و passingها إلى الجولة التالية من تدريب الذكاء الاصطناعي لجيمي ومشاريع الذكاء الاصطناعي الأخرى لجوجل.مصدر)

ومع ذلك، لم تكن هذه الاستنتاج التي وصل إليها باحثو الورقة الجديدة، حيث وجدوا بدلاً من ذلك أن الناشرين الشائعين الذين يحظرون زاحف الذكاء الاصطناعي نادرًا ما يتم الاستشهاد بهم من قبل جيمي، سواء في شكل LLM أو في شكل نتائج بحث أكثر مرونة. وأفاد الباحثون أن الناشرين “الممنوعين فعليًا” كانوا NYTimes و CNN و BBC و ScienceDirect و Reuters و Wiley و Nature و ESPN و Business Insider و CNBC و NPR و WIRED و USA Today و NBC News و Genius و National Geographic و The Conversation و U.S. News & World Report و Scientific American و Consumer Reports و STAT.

Some of the robots.txt AI-scraping bans effected by the publishers listed above. But has it led to a wider censure by Google?

Some of the robots.txt AI-scraping bans effected by the publishers listed above. But has it led to a wider censure by Google?

يشير المؤلفون إلى ما يلي:

‘في تحليلنا لأكثر المجالات تأثراً، وجدنا أن 21 ناشرًا شائعًا (الذين يتم استرجاعهم لاستفسارات فريدة من قبل كل من بحث جوجل والأطلالات الذكية) لم يتم الاستشهاد بهم أبدًا بواسطة جيمي.

‘كما تلقت مواقع وسائل التواصل الاجتماعي الشهيرة (فيسبوك وإنستجرام وتيك توك) ومواقع المراجعة (IMDb و Yelp و Tripadvisor) صفر إشارات من جيمي. عند التحقيق进一步، وجدنا أن جميع هذه المواقع تحظر زاحف جوجل الممتد في ملفات robots.txt الخاصة بهم.’

إذا تم التحقق من هذا الاكتشاف في مكان آخر وثبوته، يمكن للمرء أن يتساءل عما إذا كانت هذه الشركات تُضغط عليها من قبل جوجل للتسوية والتعاون مع عمليات الذكاء الاصطناعي من خلال الإقصاء الجزئي. عند النظر إلى النتائج، يبدو أن النتائج سطحية “انتقامي”، مهما كان السبب الحقيقي.

الخلاصة

(رأي هذا هو ورقة واضحة ومحددة، والتي تمتد إلى مجموعة كبيرة من الاكتشافات المثيرة. منذ أن لدينا وقتًا لcoverage فقط جزء صغير منها، أوصي بملف PDF المصدر حتى للقارئ العادي (حدث نادر).مصدر)

على الرغم من أن موقفًا “أصفر” يمكن أن يلقي العديد من التأويلات السلبية على اكتشافات المؤلفين، يمكن التعامل مع العمل على أنه يدل على قائد تقني عالمي يحاول الحصول على رصيد عالمي في البحث القائم على الذكاء الاصطناعي، باستخدام منصات متباينة جدًا تم تطويرها في ظروف وعهود مختلفة.

بينما يتم فحص ثلاثة أساليب بحث في الورقة، فإن الخلاف الحقيقي هو بين نتائج بحث محركات البحث التقليدية، المرتبة bằng أساليب مملوكة، وطرق الاختيار القائمة على التوزيع التي تهيمن على تحضير البيانات و تدريب الذكاء الاصطناعي.

الذكاء الاصطناعي مثل عام 1999

قبل ظهور جوجل، كان من الممكن “اللعب” بنتائج البحث من خلال الحجم فقط، وبالتالي كان من الممكن تحقيق وضع الصفحة الأولى من نتائج البحث مع جهد قليل (في كثير من الأحيان تلقائي). تم إنهاء هذا “لعبة الأرقام” بشكل فعال حول عام 2002 بواسطة خوارزمية ترتيب بحث جوجل الأكثر تعقيدًا وسرية. ولكن由于 المخاطر كانت كبيرة، لم تختف المحتوى منخفض الجودة والحجم الكبير أبدًا في أي معنى مهم. (مصدر)

لذلك، بحلول الوقت الذي وضعت فيه مجموعات كبيرة مثل Common Crawl أسس الثورة الحديثة للذكاء الاصطناعي، كان من المقرر أن تهيمن عملية التصفية والترتيب الجودة القادمة على مدى تحليل البيانات التلقائي، و (أقل احتمالاً)، مدى توافر الأموال لدفع الناس لترتيب هذه البيانات. (مصدر)

كان هناك الكثير من البيانات السيئة أو منخفضة الجودة في هذه المجموعات الكبيرة والغير محددة؛ البيانات التي قد لا تحتوي على محتوى فاحش أو سباب أو مواضيع عنصرية، أو أي من الأشياء الأخرى التي من السهل تصفيتها من مجموعات التدريب – ولكنها كانت في الغالب ذاتية وواسعة النطاق، مثل نتائج البحث على الإنترنت في الفترة من 1999 إلى 2001.

由于 أن عمليات استدعاء البيانات لا تزال غير جيدة، فمن الصعب حتى على جوجل جعل الذكاء الاصطناعي يتصرف بطريقة تجارية، لأن قرارات جيمي من نوع PageRank يتم ديكتاتها بواسطة فهم غير كامل لكيفية تحويل البيانات الهائلة إلى توزيعات بيانات وتمثيلات كامنة خلال تدريب نموذج الذكاء الاصطناعي.

* صفحات نتائج محرك البحث.

† التأكيدات من وضع المؤلفين وليست مني. وقد استبدلت الخط العريض بالمائل لأن التأكيد المائل لا يظهر جيدًا داخل اقتباسات مكتوبة أصلًا بخط مائل.

نُشر لأول مرة يوم الأربعاء 13 مايو 2026.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai