زاوية Anderson

الذكاء الاصطناعي يقتبس نفس الأوراق مرارًا وتكرارًا – تمامًا مثل البشر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

قد يكون ChatGPT وأدوات الكتابة بالذكاء الاصطناعي الأخرى يحولون العلم بهدوء إلى مسابقة شعبية، يوجهون الباحثين مرارًا وتكرارًا إلى نفس الأوراق متجاهلين الأعمال الجديدة والمبتكرة التي قد تدفع المجال قدمًا فعليًا.

 

Monoculture, من حيث التكرار والإحصاءات، هو عندما يتكرر نفس مجموعة المصادر أو الأصول المحدودة مرارًا وتكرارًا، ما يغمر الأصوات الجديدة والرؤى المتجددة: نفس مجموعة الأغاني المحدودة في جدولة الإذاعة؛ نفس مجموعة المؤلفين والكتب في أرفف المطارات؛ ونفس التشكيلة المحدودة من الفواكه والخضروات في السوبرماركت:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

نعم، لدينا هذه الموز – وهذه هي الموز الوحيدة. تجانس الفواكه والخضروات في سلاسل الغذاء الغربية يتجاهل مئات الأنواع الأخرى الممكنة في كل حالة، لأن سلاسل الإنتاج والنقل المتنوعة مكلفة جدًا لتصنيعها على نطاق صناعي لأنواع الفواكه أو الخضروات المتنوعة.  المصدر

يحدث هذا أيضًا في الاستشهادات التي تظهر في الأبحاث العلمية الجديدة، حيث يلجأ الباحثون، ربما بكسل، إلى مجموعة ‘موثوقة’ من المصادر التي تكتسب زخمًا حتى تبدأ في هيمنة فروع البحث.

يُعرف هذا بـ تأثير ماثيو – نظرية اجتماعية تشير إلى أن المستفيدين سيستمرون في الاستفادة؛ وقد تم مقارنة المتلازمة بالوعد الوارد في متى 13:12، الذي يذكر ‘من له سيُعطى أكثر، وسيكون لديه وفرة. ومن لا يملك، سيُؤخذ منه حتى ما لديه’.

المجموعة المميزة

إحدى الآمال الكبيرة للبحث المدعوم بالذكاء الاصطناعي كانت أن طرق التعلم الآلي الجديدة قد تخرج من تأثير ماثيو – المعروف أيضًا بـ تحيز الشعبية – وتبدأ في الاستشهاد بأعمال أقل شهرة قد تكون أكثر حدة أو أكثر صلة بالنقطة التي يُطرحها البحث.

ومع ذلك، بناءً على طريقة تفسير روتينات تدريب الذكاء الاصطناعي لمجموعات البيانات، لم يكن هناك أي سبب وجيه لهذا التفاؤل؛ وقد تبيّن مرارًا أن عندما لا يخترع الذكاء الاصطناعي الاستشهادات صراحةً – وهي مشكلة مزمنة حتى الآن – فإنه في الواقع يعزز تأثير ماثيو، كما يفعل البشر – وإن كان ربما ليس لنفس السبب.

أثناء التدريب، يتعلم النموذج تصنيف الأوراق الأكثر استشهادًا (أو ‘الأكثر تكرارًا’) في مجموعة التدريب بأعلى درجات، لأن روتينات التدريب مصممة لاستخلاص أنماط ذات معنى، ولـ تجاهل القيم المتطرفة باعتبارها ‘ضجيجًا’ أو شذوذًا إحصائيًا.

في ظل هذا النظام، لن يحصل ما يعادل نظرية النسبية لأينشتاين على أي انتباه من الآلة، التي، بمجرد تدريبها، تشعر بأنها وجدت مبادئها ومراجعها، ولا يمكنها إلا تعديل ذلك بشكل طفيف عبر الوصول إلى منشورات أحدث من خلال RAG، أو بوسائل أخرى توسّع نطاق النموذج خارج مصفوفته المدربة.

المشكلة هي أنه لن يقتبس هذه الأعمال الجديدة بنفس طريقة ‘المفضلات القديمة’ التي يعرفها بالفعل، أو ربما لا يقتبسها على الإطلاق، لأن تحيزاته الإحصائية أصبحت الآن راسخة للغاية.

وبالتالي، لا يراقب الذكاء الاصطناعي فعليًا سلوك البشر ولا يقلده عندما يعزز تأثير ماثيو – فهو فقط يحسب عدد المرات التي يلجأ فيها الباحثون بكسل إلى نفس الأوراق القديمة، ويصنف تلك الأوراق عاليًا بالمثل. وفي هذا الصدد، فإن مشكلة تكرار الاستشهادات مرتبطة بتحدي اختيار ورقة علمية مثيرة للاهتمام من بين العاصفة المتزايدة من منشورات أبحاث الذكاء الاصطناعي، حيث غالبًا ما يكون أقوى عمل هو الأضعف إشارة.

تشخيص الأحادية

يُعالج هذا الأمر في ورقة جديدة مثيرة للاهتمام من الولايات المتحدة بعنوان عندما يكتب الذكاء الاصطناعي، من يُستشهد به؟ دليل على أحادية الاستشهاد عبر نماذج اللغة. العمل الجديد – وهو تعاون بين جامعة تكساس في أوستن، ومعهد ستيفنز للتقنية، وجامعة واشنطن في سانت لويس، وجامعة رايس، وجامعة نوتردام – يهدف إلى إثبات وجود أحادية الاستشهاد في التعلم الآلي، بحيث يمكن معالجة متغيراتها مباشرة في المستقبل، إلى جانب المشكلة نفسها.

في الاختبارات، وجد المؤلفون أن أحد عشر نموذجًا من OpenAI وGoogle وAnthropic فضلوا بشكل متكرر نفس المجموعة الصغيرة من الأوراق – حتى بعد إزالة إشارات الشعبية الواضحة.

لاختبار ذلك، تم تجريد 120 ورقة حقيقية من عدد الاستشهادات ومواقع النشر، وتم استبدال أسماء المؤلفين، وإعادة تعيين سنوات النشر عشوائيًا. ثم عُرضت مجموعات عشوائية من ثلاثين ورقةً على كل نموذج، مع السماح له بالاستشهاد بما لا يزيد عن عشرة.

أُعطي ثمانية خبراء بشريون في المجالات ذات الصلة نفس الأوراق المجهولة، لكنهم لم يتقاربوا على نفس المفضلات التي اختارها الذكاء الاصطناعي، مما يدل على أن التحيز كان محدودًا بنماذج الذكاء الاصطناعي وليس بالأوراق نفسها:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

من الورقة الجديدة، نتائج الاختبار المقارنة بين اختيارات الاستشهاد لنماذج الذكاء الاصطناعي والخبراء البشريين. عبر جميع النماذج الأحد عشر، تركزت الاستشهادات على مجموعة أصغر من الأوراق، بينما تم تجاهل بعض الأوراق بالكامل بشكل متكرر. لم يظهر الخبراء البشريون أي ميل من هذا النوع. المصدر – https://arxiv.org/pdf/2608.19230 المصدر

ظلّت نفس الأوراق شائعة حتى عندما طُلب من النماذج اختيار المراجع فقط، مما يظهر أن كتابة المراجعة نفسها لم تكن سبب التحيز.

ثم تم تمديد التجربة على مدار أحد عشر جولة، حيث أضيفت 120 ورقة مكتوبة بالذكاء الاصطناعي بعد كل جولة، لاختبار ما يحدث عندما تعمل هذه التفضيلات المشتركة في مجموعة متزايدة من الأبحاث المولدة بالذكاء الاصطناعي.

مع إضافة المزيد من الأوراق المكتوبة بالذكاء الاصطناعي، ركّزت النماذج بشكل متزايد استشهاداتها على عدد متناقص من الأوراق البشرية الأصلية.

يُعلن المؤلفون:

‘مع انتقال نماذج اللغة من صياغة النص إلى تشغيل وكلاء بحث الأدبيات باستخدام استدعاءات الأدوات، تصبح المراجع المصطنعة أسهل في اكتشافها وتقييدها.

‘تبدأ الفشل الأصعب بعد أن يصبح كل مرشح حقيقيًا: قد لا تزال النماذج المختلفة تختار نفس المجموعة الضيقة، مما ينتج أحادية استشهاد دون أن يكون أي استشهاد واحد خاطئًا.’

كوسيلة لتصحيح المشكلة، يجادل البحث بأن مجرد خلط النماذج من بائعين مختلفين أو إعطاء الأوراق تعرضًا متساويًا لن يكون كافيًا، لأن جزءًا كبيرًا من التفضيل مشترك بين النماذج. بل إن التفضيل الأساسي للأوراق المحددة يحتاج إلى تغيير – ربما عبر إعطاء الأوراق المتجاهلة صفة بارزة عمدًا. ومع ذلك، يؤكد المؤلفون أن هذا النهج لا يزال غير مُختبر.

نهج الاختبار

تم بناء معيار الاختبار من 120 ورقة حقيقية لتقطير المعرفة جمعت من arXiv ونُشرت بين عامي 2015 و2022. كان لكل منها ما بين 50 و500 استشهاد في وقت الجمع، وهو نطاق تم اختياره لاستبعاد كل من الأعمال المجهولة والذات التأثير الاستثنائي.

بدأت التجربة باختيار ثلاثين ورقة عشوائيًا من المجموعة المتاحة، مع إخفاء أسماء المؤلفين وسنوات النشر وعدد الاستشهادات. أنتج كل نموذج مراجعة قصيرة أو قطعة موقف تستشهد بما لا يزيد عن عشرة أوراق، وتم مقارنة هذه الاختيارات مع اختيارات عشوائية من نفس المادة:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

مخطط للطريقة المستخدمة لاختبار تفضيلات الاستشهاد. تم عرض ثلاثين ورقةً مختارة عشوائيًا على نموذج مع إخفاء المعلومات التعريفية، ثم كان بإمكانه الاستشهاد بما يصل إلى عشرة. تمت مقارنة اختياراته مع الاختيارات العشوائية، بينما أضيفت كل جولة 120 ورقة مكتوبة بالذكاء الاصطناعي إلى مجموعة الجولة التالية.

في التجربة الموسعة، دخلت 120 ورقة مولدة حديثًا إلى المجموعة بعد كل جولة، مما زاد تدريجيًا من نسبة الأبحاث المكتوبة بالذكاء الاصطناعي.

في الاختبارات الأولية، كان تميل النماذج إلى الاستشهاد بمعظم الأوراق التي عُرضت عليها، عادةً ما تختار ما بين 22 إلى 27 من 30 ورقة. لذا وضع الباحثون حدًا أقصى قدره عشرة استشهادات للتجربة الرئيسية، مما اضطر النماذج إلى اتخاذ خيارات أكثر انتقائية.

فيما يلي ملخص لتصميم التجربة الناتج:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

إعداد تجريبي لاختبار تفضيلات الاستشهاد. بدأت الدراسة بـ 120 ورقة حقيقية واختبرت أحد عشر نموذجًا من ثلاثة بائعين، باستخدام مجموعات عشوائية من 30 ورقة وحد أقصى عشرة استشهادات. أضيفت جولات لاحقة أوراقًا مولدة بالذكاء الاصطناعي، مما وسع المجموعة إلى 1,440 ورقة.

استخدمت التجربة الأولية أحد عشر نموذجًا من ثلاثة مزودين رئيسيين: تم تمثيل OpenAI بـ GPT-5, GPT-5 mini, GPT-4.1 وGPT-4.1 mini; وجوجل بـ Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro وGemini 3.1 Flash-Lite; وAnthropic بـ Claude Opus 4.8, Claude Sonnet 4.6 وClaude Haiku 4.5.

في نتائج الاختبار المعروضة أدناه، نرى مدى تركيز كل نموذج لاستشهاداته على مجموعة صغيرة من الأوراق؛ عدد الأوراق التي تجاهلها تمامًا؛ ومدى اتساقه في اتخاذ نفس الاختيارات عند تكرار التجربة:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

نتائج الاختبار التي تُظهر مدى تركيز كل نموذج لاستشهاداته على أوراق معينة وعدد الأوراق التي تم تجاهلها تمامًا. يُظهر ‘حصة أعلى 10٪’ عدد الاستشهادات التي ذهبت إلى 12 ورقةً الأكثر تفضيلًا، بينما يقيس ‘HHI’ مدى تركيز الاستشهادات بشكل عام. تُظهر ‘الموثوقية’ مدى اتساق كل نموذج في تفضيل نفس الأوراق عبر الاختبارات، وρ تُظهر مدى تشابه تلك التفضيلات بين النماذج. تُشير صف ‘المجموعة المتطابقة الصفرية’ إلى ما كان متوقعًا إذا تم اختيار الأوراق عشوائيًا.

ما الذي تفضله النماذج فعليًا؟

وُجد أن التفضيل كان مدفوعًا في الغالب بـ محتوى الأوراق نفسها. على سبيل المثال، بالنسبة إلى GPT-5 mini، كان نحو 90٪ من التباين في الأوراق التي تم تفضيلها يُعزى إلى المحتوى، وليس إلى عوامل مثل ترتيب القائمة أو ضوضاء التوليد أو البيانات الوصفية المصطنعة المرفقة بكل ورقة. تم إعادة إنتاج نفس تأثير ‘المحتوى السائد’ مع GPT-4.1 mini.

لم يتغير خريطة التفضيل (انظر أدناه) كثيرًا عندما أعيد كتابة العناوين والملخصات بشكل كبير مع الحفاظ على معناها. عبر أربع اختبارات إعادة صياغة ناجحة، تم الحصول على ارتباطات تتراوح بين 0.95 إلى 0.99، رغم استخدام نماذج مختلفة من ثلاثة بائعين لإعادة الصياغة.

لوحظت تغييرات في خريطة التفضيل فقط عندما تم تعديل المعنى الأساسي بشكل ملحوظ:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

نتائج الاختبار التي تقارن تفضيلات الاستشهاد عبر النماذج الأحد عشر. تُظهر الأرقام مدى تقارب كل زوج من النماذج في تفضيل نفس الأوراق، حيث تشير القيم الأعلى إلى اتفاق أكبر. على الرغم من الاختلافات بين النماذج والبائعين، وُجدت تفضيلات مشابهة إلى حد كبير عبر المجموعة.

وبالتالي يبدو أن النماذج تستجيب أساسًا إلى المحتوى الدلالي بدلاً من الصياغة المحددة. ومع ذلك، لم يُحدد السبب وراء اتفاقها القوي بشكل قاطع.

يُحتمل، كما يؤكد المؤلفون، أن توافقًا مشتركًا على الاستشهاد قد تم امتصاصه أثناء التدريب. وإمكانية أخرى هي أن الأحكام المماثلة حول ما يُعد ورقة ‘قابلة للاستشهاد’ قد تُوصل إليها بشكل مستقل.

لذلك تم إثبات وجود التفضيل المشترك، لكن أصله النهائي لا يزال غير معروف.

يقترح المؤلفون أن الاستخدام الواسع للذكاء الاصطناعي في البحث قد يضيق نطاق الأعمال التي تحظى بالاهتمام، لأن النماذج المختلفة تميل إلى تفضيل العديد من نفس الأوراق؛ ومع تراكم الأدبيات المولدة بالذكاء الاصطناعي، قد تُعزز هذه التفضيلات المشتركة أكثر عبر الاستشهاد المتكرر، مما يجعل الأبحاث الأقل تفضيلًا أصعب اكتشافًا تدريجيًا. وبالتالي يُقترح تنوع الاستشهاد ومراقبة تركيز الاستشهاد كإجراءات وقائية محتملة.

معيار الدراسة لقياس تركز الاستشهادات المتكرر متاح الآن على GitHub.

الخلاصة

رأي كوني شخصًا يقرأ عددًا هائلًا من أوراق أبحاث الذكاء الاصطناعي أسبوعيًا، فقد شهدت ‘موجات الاستشهاد’ تأتي وتذهب. أحد الثوابت الدائمة هو ورقة جوجل Attention Is All You Need الأصلية حول المحولات، والتي من المحتمل الآن أن تكون مدمجة صلبًا في قوالب التقديم.

مخالف آخر متكرر، لفترة طويلة، كان ورقة 2014 Generative Adversarial Networks، رغم أنها سُحبت في النهاية من حيث التكرار بواسطة Denoising Diffusion Probabilistic Models ودراسات أخرى تعتمد على الانتشار.

في معظم الحالات تقريبًا، هذه الاستشهادات ‘المتكررة’ ليست خاطئة بحد ذاتها؛ لكنها غالبًا ما تكون واسعة النطاق جدًا لتكون دعماً مفيدًا للورقة التي تُستشهد بها؛ وبهذا المعنى، فإنها تمثل شيئًا مشابهًا لـ ‘غسيل الاستشهاد’ – إدراج اقتباسات ‘موثوقة’ لكنها في المقام الأول ديكورية، لإضفاء مظهر من المصداقية بجهد قليل.

 

نُشر لأول مرة يوم الاثنين، 24 أغسطس 2026. تم تعديل الساعة 23:07 بتوقيت شرق أوروبا لإضافة الجمع المفقود.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai