زاوية Anderson

محاربة السخافة الناتجة عن الذكاء الاصطناعي في الأوراق العلمية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

يقوم الذكاء الاصطناعي بكل شيء على نطاق واسع، من استخراج الويب على مستوى هجوم DOS إلى إنتاج، أو تمكين، مثل هذه الأحجام الهائلة من طلبات الأبحاث العلمية بحيث يصبح الوضع أزمة لوجستية وأيضًا أزمة جودة، مع استمرار تدهور نسبة الإشارة إلى الضوضاء لتصبح غير قابلة للتنقل.

في الأسبوع الماضي، أعلن خادم ما قبل النشر arXiv عن أنه سيطبق سياسة جديدة لتحديد معدل الإرسال للمُرسِلِين، حيث سيُقيد الآن بحدٍّ أقصاه تقديم ورقتين في الشهر. وتشير الإعلان إلى أن هذا الإجراء تم اتخاذه في ظل ارتفاعٍ هائل في معدلات الإرسال خلال فترة زمنية قصيرة:

عدد الإرسالات الشهرية إلى فئة cs.AI في arXiv من يناير 2024 إلى سبتمبر 2026، مظهرًا زيادة بأكثر من ستة أضعاف خلال الفترة. المصدر - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

عدد الإرسالات الشهرية إلى فئة cs.AI في arXiv من يناير 2024 إلى سبتمبر 2026، مظهرًا زيادة بأكثر من ستة أضعاف خلال الفترة. المصدر

أشار منشور مدونة كات بوبوريس الذي أعلن عن الخطوة، والذي أثار تعليقات على Hacker News الخميس الماضي، إلى أن arXiv تلقى 40,363 إرسالية في سبتمبر 2026 – أي ما يقرب من الضعف مقارنة بـ 20,569 إرسالية في سبتمبر 2024، وأكثر من أربعة أضعاف الـ 9,869 إرسالية في سبتمبر 2016.

لاحظ بوبوريس أن إرسالات الشهر الأخير، أنتجت أيضًا ما يقرب من 9,000 تذكرة دعم لموظفي arXiv والمشرفين:

‘يلاحظ مشرفونا زيادةً في الأوراق الضعيفة ذات النطاق الضيق، وكذلك الأوراق “السلمية” التي يتم فيها تقسيم عمل واحد وتقديمه كمجموعة من الأوراق الأصغر.’

‘هناك أيضًا زيادة ملحوظة في الأوراق الكثيفة المكتوبة بالذكاء الاصطناعي. تجعل أدوات الذكاء الاصطناعي من السهل على المؤلفين إغراق arXiv وغيرها من المستودعات بهذه الأوراق ذات القيمة المنخفضة.’

في الواقع، في مايو من هذا العام، اتخذ arXiv إجراءً بتنفيذ حظر لمدة سنة واحدة للمحتوى غير المراقب بالذكاء الاصطناعي؛ وفي أكتوبر من العام الماضي، أخبر مقدمي أوراق الاستطلاع والأوراق الموقفية (كلاهما يمكن توليده بجهد أقل من دراسة أكاديمية كاملة) بأنهم سيحتاجون إلى دعم من الزملاء لكي تُنشر على arXiv.

في الوقت الحالي، لا يبدو أن الحدّ المتعسّف لطلبات http على نطاق arXiv واضحًا كثيرًا، ويمكن للمرء أن يأمل فقط أن تغذيات RSS المفيدة جدًا تبقى صامدة أمام هذا التقلص المستمر. في الأسبوع الماضي، أعلن Reddit عن الإزالة الكاملة المخيفة منذ زمن طويل لتغذيات RSS الخاصة به، والتي ستبدأ من منتصف الشهر القادم. ومع ذلك، يعني الوضع غير الربحي لـ arXiv أن هناك قليلًا من رأس المال المماثل يمكن الحصول عليه من خلال توجيه القراء إلى زيارات موقع إلزامية، أو تسجيلات الدخول المفروضة – على الأقل في الوقت الحالي.

ضد المد المتصاعد

في مواجهة مثل هذه المشكلات الشديدة والمتزايدة حول الأثر السلبي لاستخدام الذكاء الاصطناعي في البحث العلمي – وخاصةً فيما يتعلق بالأبحاث المرتبطة بالذكاء الاصطناعي، التي طغت على جميع الفئات الأخرى، وصعدت من الظلام لتصبح رمزًا سياسيًا واقتصاديًا مؤخرًا – ظهرت سلالة من الأبحاث تدرس سُبلًا لمواجهة تراجع جودة إرسالات الأوراق المتعلقة بالذكاء الاصطناعي.

أحدث ما يواجه المشكلة يأتي في شكل تعاون بين جامعة سيول الوطنية في كوريا وجامعة مينيسوتا في الولايات المتحدة. الـ ورقة، التي تحمل العنوان Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers، تقترح قياس ‘السخافة العلمية’ من خلال الإخفاقات في الروابط بين ادعاءات الورقة، الأدلة، الاقتباسات والبنية:

من الورقة الجديدة، نظرة عامة على نهج العمل تجاه 'السخافة العلمية'، مظهرًا كيف يمكن للإخفاقات في البنية والحجة والقطع الداعمة أن تكشف عن نقاط ضعف لا تلتقطها أدوات كشف النصوص بالذكاء الاصطناعي التقليدية. المصدر - https://arxiv.org/pdf/2610.00531

من الورقة الجديدة، نظرة عامة على نهج العمل تجاه ‘السخافة العلمية’، مظهرًا كيف يمكن للإخفاقات في البنية والحجة والقطع الداعمة أن تكشف عن نقاط ضعف لا تلتقطها أدوات كشف النصوص بالذكاء الاصطناعي التقليدية. المصدر

على عكس الأساليب السابقة، ينظر النظام الجديد إلى ما وراء النص نفسه لتقييم ما إذا كانت ادعاءات الورقة مدعومة بشكل صحيح بالحجج والأدلة والاقتباسات. يذكر المؤلفون*:

‘يمكن لكل جزء من الورقة أن يبدو مقنعًا عند النظر إليه بمفرده، لذا فإن مثل هذه الانهيارات لا تُرى من قبل كاشفات المستوى الرمزي ولا يمكن تحديدها أو إصلاحها إلا على مستوى الورقة بأكملها. لتقييم وتخفيف السخافة العلمية، تتعامل هذه الورقة مع ثلاثة تحديات.’

‘أولاً، تفشل مقاييس المستوى الرمزي في التقاط كيفية ربط التفكير العلمي عبر الورقة. يمكن أن تبدو الأقسام، والادعاءات، والاقتباسات، والأدلة، والقطع الداعمة مقنعةً كل على حدة بينما تتعطل العلاقات بينها. نلاحظ مرارًا مثل هذه الإخفاقات في الأوراق التي يولدها الذكاء الاصطناعي من البداية إلى النهاية، وقد قام مراجعو ICLR بالفعل بفرض عقوبات عليها حتى في الإرسالات المكتوبة يدويًا.

‘ثانيًا، لا يزال اكتشاف هذه الأنماط غير مقاس. مجموعات الاختبار الحالية تُصنّف النص فقط، لذا لم يُقاس أبدًا مدى قدرة الكواشف، بما فيها نماذج اللغة الكبيرة التي تقرأ الورقة بالكامل، على تحديد هذه الأنماط.’

‘ثالثًا، من الصعب تخفيف هذه الأنماط بشكل موثوق. بينما يمكن إزالتها بإعادة الصياغة، فإن إصلاح هذه الأنماط يتطلب استعادة العلاقات المفقودة دون تغيير العلم الأساسي.’

المعيار الجديد للمؤلفين، المسمى SciSlopBench، تم تجسيده في SciSlopHarness، وهو إطار مصمم لاكتشاف وإصلاح الأخطاء في الاستدلال العلمي للورقة، مع الحفاظ على الأدلة العلمية الأساسية:

أمثلة تقارن المقاطع المعيبة مع التنقيحات التي أجرها SciSlopHarness. تُرفض الإضافات غير المدعومة، بينما تُعاد ترتيب أو إعادة صياغة الادعاءات حسب الحاجة لتعكس الأدلة المتاحة في الورقة بشكل أفضل.

أمثلة تقارن المقاطع المعيبة مع التنقيحات التي أجرها SciSlopHarness. تُرفض الإضافات غير المدعومة، بينما تُعاد ترتيب أو إعادة صياغة الادعاءات حسب الحاجة لتعكس الأدلة المتاحة في الورقة بشكل أفضل.

تم بناء معيار SciSlopBench نفسه من 390 ورقة تم توليدها بواسطة الذكاء الاصطناعي، كل واحدة مُقابلة بورقة مكتوبة بيد بشرية تتناول مشكلة بحثية مماثلة ونوع مساهمة مشابه.

في الاختبارات، استُخدم SciSlopBench للتمييز بين 390 زوجًا من الأوراق، حيث يتكون كل زوج من الورقة المولدة بالذكاء الاصطناعي المذكورة أعلاه، وورقة مكتوبة بيد بشرية مطابقة لمشكلة البحث ونوع المساهمة. حدد المعيار الورقة المولدة بالذكاء الاصطناعي بشكل صحيح في 85.9٪ من هذه المقارنات، متفوقًا بشكل كبير على كواشف النص التقليدية للذكاء الاصطناعي.

يصرح المؤلفون:

‘بينما تترك التنقيحات القياسية بقايا من السلوب وتُطلق مطالبة توجيهية واعية للسلوب تُحفّز استغلال المكافآت، يقلل SciSlopHarness الفجوة المتبقية بين الذكاء الاصطناعي والبشر بنسبة 63٪ مقارنةً بأقوى خط أساس للتنقيحات دون الحاجة إلى أهداف مرجعية بشرية.’

‘بشكل عام، نُظهر أن الأوراق العلمية التي يولدها الذكاء الاصطناعي تترك آثارًا أساسية في استدلالها العام، وأن التخفيف المسؤول يتطلب تأسيسًا صارمًا على الأدلة بدلاً من مجرد تحسين الصياغة.’

بالإضافة إلى المساهمات التي قدمتها الورقة نفسها، قام المؤلفون بتطبيق مبادئ عملهم الجديد في شكل عرض حي حيث يمكن للمستخدمين إرسال أوراق علمية لتحليل مقدار السلوب الذي تحتويه.

ومن المثير للاهتمام، أن الورقة الجديدة نفسها، التي تم تحليلها بواسطة العرض التجريبي، حصلت على a ‘moderate’ slop score تبلغ 40/100†:

الورقة الجديدة، التي تم تحليلها بخوارزميتها الخاصة، تُظهر مناطق 'سلوب' تم تحديدها عبر العملية الجديدة للمؤلفين. المصدر: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

الورقة الجديدة، التي تم تحليلها بخوارزميتها الخاصة، تُظهر مناطق ‘سلوب’ تم تحديدها عبر العملية الجديدة للمؤلفين. المصدر

المنهجية ونهج البيانات

وصف التعاون لعام 2025 Why Slop Matters ‘الكفاءة السطحية’ كخاصية مميزة للسلوب الناتج عن الذكاء الاصطناعي، حيث تُخفي الجودة الظاهرة نقصًا في الجوهر. يطبق العمل الجديد هذه الفكرة بشكل أكثر تحديدًا على الأوراق العلمية، معرفًا ‘السلوب العلمي’ كأخطاء تجعل من الصعب تتبع كيفية تنظيم الدراسة؛ وكيفية دعم ادعاءاتها؛ وكيفية فحص طرقها وأدلتها، مع تجميع الأخطاء إلى: الهيكل؛ الحجة؛ والملحقات.

قواعد القياس للأنواع الستة للسلوب العلمي المستخدمة في المعيار. يوضح الجدول ما يُفحص لكل مقياس، وكيف يُحسب الدرجة، وما يمثله الحد الأقصى للدرجة وهو 1، مع ارتفاع الدرجات للدلالة على فشل أكثر شمولاً.

قواعد القياس للأنواع الستة للسلوب العلمي المستخدمة في المعيار. يوضح الجدول ما يُفحص لكل مقياس، وكيف يُحسب الدرجة، وما يمثله الحد الأقصى للدرجة وهو 1، مع ارتفاع الدرجات للدلالة على فشل أكثر شمولاً.

الستة مقاييس للسلوب العلمي المحددة في الورقة هي الإشارات عبر الأقسام (ما إذا كانت الأقسام تشير بشكل معنوي إلى مادة أخرى في الورقة)؛ التكرار الكلي (ما إذا كانت الأقسام اللاحقة تكرر مادة سابقة)؛ رسم حجة (ما إذا كانت الادعاءات مدعومة بشكل صحيح بالتفكير السابق)؛ عزل الاستشهاد (ما إذا كانت الاستشهادات تُستخدم سطحيًا دون شرح كيف ترتبط الأعمال المستشهد بها بالورقة أو ببعضها البعض)؛ عرض الشكل (ما إذا كانت أشكال الطريقة تشرح الطريقة فعليًا)؛ وفجوة الأدلة (ما إذا كانت النتائج المبلغة مدعومة بأمثلة ملموسة).

تم بناء المعيار عن طريق إقران أوراق مولدة بالذكاء الاصطناعي بأوراق بشرية مكتوبة مماثلة أو مكافئة، حيث تم اختيار أوراق الذكاء الاصطناعي من FARS ومسابقة 2025 Agents4Science.

لكل ورقة تم إنشاؤها آليًا من FARS، بحث الباحثون في الاستشهادات الخاصة بها عن ورقة مكتوبة يدويًا من نفس النوع تم قبولها في مؤتمر من الدرجة العليا، ثم اختاروا الأقرب من حيث موضوع البحث، مما أسفر عن 143 زوجًا. تم أيضًا إقران أوراق Agents4Science بنظيراتها المكتوبة يدويًا، منتجين 247 زوجًا إضافيًا، ليصل مجموع مجموعة الاختبار إلى 390 زوجًا من الذكاء الاصطناعي والبشر. تغطي الأوراق العلوم الحياتية والاجتماعية والطبيعية، على الرغم من أن مجموعة البيانات تميل بشدة نحو علوم الحاسوب.

بالنسبة للقياسات، تم تقييم الأداء باستخدام PairAcc، الذي يقيس مدى تكرار تصنيف الورقة البشرية أعلى من نظيرها الذكائي؛ وAUROC، الذي يقيس الفاصل العام بين الأوراق البشرية والذكائية عبر عتبات مختلفة. كما يذكر المؤلفون أداء الكشف عندما تكون نسبة الإيجابيات الكاذبة للورقات البشرية ثابتة عند 5٪.

الاختبارات

قارن الاختبارات الأولية بين SciSlop وكواشف النصوص الذكائية Binoculars؛ DetectGPT؛ وNTS††، بالإضافة إلى أنظمة المراجعة الآلية AI Scientist Reviewer وCycleReviewer.

في اختبارات المراجعة اللاحقة، استُخدمت أربع أسس مرجعية: التوجيه الأساسي; Claude Code; تحسين قائم على المراجع; ومراجعة مدركة للسلوب. تلقت الثلاثة الأولى تعليمات عامة فقط لتحسين الورقة، بينما أُعطيت المراجعة المدركة للسلوب تعريفات ومواقع السلوب المكتشف. تمت مقارنة جميعها مع SciSlopHarness تحت ظروف مراجعة مكافئة.

في التنفيذ، تم تزويد كواشف النصوص بنص الورقة، بينما استلمت الطرق الأخرى مصدر الورقة، وعند الحاجة، الوصول إلى شفرتها. استخدم Binoculars نموذج Falcon-7B الأساسي وتعليمي؛ استخدم DetectGPT T5-3B لتوليد 100 تشويه؛ استخدم AI Scientist Qwen2.5-32B-Instruct؛ واستخدم CycleReviewer نقطة التفتيش 8B التي أصدرها. بالنسبة للورقات التي تتجاوز حد 2,048 رمزًا في Falcon، تم تقييم النوافذ غير المتداخلة بشكل منفصل ثم تم أخذ المتوسط.

تفصيل نتائج الكشف الأولية موجود في الجدولين أدناه: حقق SciSlop نسبة PairAcc بلغت 85.9٪، مقارنةً بـ 68.7٪ لـ Binoculars و68.5٪ لأقوى مراجع آلي، مما خفض معدل الخطأ بأكثر من النصف:

نتائج الكشف المقارنة بين SciSlop وكواشف النصوص الذكائية والمراجعين الآليين، إلى جانب نتائج مقاييس السلوب الستة الفردية. يحقق SciSlop أعلى نسبة PairAcc إجمالية، بينما توفر مراجع الأقسام المتقاطعة أقوى نتيجة فردية.

نتائج الكشف المقارنة بين SciSlop وكواشف النصوص الذكائية والمراجعين الآليين، إلى جانب نتائج مقاييس السلوب الستة الفردية. يحقق SciSlop أعلى نسبة PairAcc إجمالية، بينما توفر مراجع الأقسام المتقاطعة أقوى نتيجة فردية.

أظهرت مراجع الأقسام المتقاطعة أداءً قويًا بشكل خاص بمفردها، حيث وصلت إلى نسبة PairAcc بلغت 90.5٪ دون الحاجة إلى نموذج، واكتشفت 65٪ من الأوراق المولدة بالذكاء الاصطناعي عند معدل إيجابيات كاذبة 5٪، مقارنةً بـ 24٪ لـ Binoculars.

يجادل المؤلفون بأن هذه النتائج تشير إلى أن العلاقات عبر الورقة توفر إشارة أقوى لتوليد الذكاء الاصطناعي مقارنةً بالكشف التقليدي على مستوى النص في هذه المجموعة، مع تحديد نقاط ضعف محددة يمكن استهدافها لاحقًا للمراجعة.

تم فحص العلاقة بين السلوب العلمي وتقييمات البشر لجودة الورقة بعد ذلك. كما هو موضح في العمود الأول أدناه، ارتبط ارتفاع السلوب بانخفاض درجات ICLR للتقييم الكلي، الصلاحية، العرض والمساهمة:

مقارنة بين SciSlop وكواشف النصوص الذكائية والمراجعين الآليين مقابل نتائج مراجعات ICLR. تُظهر اللوحة اليسرى تشابه الذكاء الاصطناعي مقابل درجات المراجعة؛ وتقارن اللوحة الوسطى أبعاد المراجعة الفردية؛ وتظهر اللوحة اليمنى الأداء في تمييز الأوراق المرفوضة عن المقبولة عبر تسع سنوات.

مقارنة بين SciSlop وكواشف النصوص الذكائية والمراجعين الآليين مقابل نتائج مراجعات ICLR. تُظهر اللوحة اليسرى تشابه الذكاء الاصطناعي مقابل درجات المراجعة؛ وتقارن اللوحة الوسطى أبعاد المراجعة الفردية؛ وتظهر اللوحة اليمنى الأداء في تمييز الأوراق المرفوضة عن المقبولة عبر تسع سنوات.

تم أيضًا تمييز الأوراق المرفوضة والمقبولة فوق الصدفة عبر جميع السنوات التسع التي تم فحصها، بينما سقطت الكواشف التقليدية تحت الصدفة في معظم المقارنات.

وبالتالي وُجد أن السلوب العلمي يعكس نقاط ضعف تم معاقبتها بالفعل من قبل المراجعين البشريين، بدلاً من أن يعمل كإشارة وحيدة لتأليف الذكاء الاصطناعي.

فحصت الاختبارات النهائية ما إذا كان بإمكان SciSlopHarness إزالة السلوب المتبقي بعد المراجعة العامة. كما هو موضح أدناه، انتهى الحزام أقرب إلى المتوسط البشري عبر جميع المقاييس الستة، بينما غالبًا ما تركت المراجعة العامة سلوبًا كبيرًا، وأحيانًا كانت المراجعة المدركة للسلوب تصحح بشكل مفرط:

نتائج المراجعة المقارنة بين SciSlopHarness وأربع طرق أساسية عبر المقاييس الستة للسلوب. القيم الأقرب إلى الصفر أقرب إلى متوسط الورقة البشرية، حيث يتحرك SciSlopHarness عمومًا نحو هذا المستوى بينما غالبًا ما تتجاوز المراجعة المدركة للسلوب ذلك.

نتائج المراجعة التي تقارن SciSlopHarness بأربع طرق أساسية عبر مقاييس السلوب الستة. القيم الأقرب إلى الصفر أقرب إلى متوسط الأوراق البشرية، حيث يتحرك SciSlopHarness عمومًا نحو هذا المستوى بينما غالبًا ما يتجاوز التعديل الواعي بالسلوب هذا المستوى.

تم فحص كل تعديل مقترح مقابل التفكير العلمي في الورقة والأدلة الداعمة، وتم رفض التعديلات غير المدعومة. عبر المقاييس الستة، تم تقليل الفجوة المتبقية عن الأوراق المكتوبة يدويًا بنسبة 63٪ مقارنةً بـ Claude Code، أقوى خط أساس للمراجعة.

الخلاصة

كان من المثير للاهتمام، خلال كتابة هذا المقال، أن ألاحظ ليس فقط مدى سوء تقييم هذه الورقة على موقعها التجريبي الخاص، بل أيضًا ملاحظة مثال واحد على اقتباس ‘كسول’ أو ‘تجميلي’††، الذي أصبح مؤخرًا لعنةً صغيرةً لكنها متزايدة في الأوراق البحثية.

في مثل هذه الحالات، بعيدًا عن هذه الورقة المحددة، يبدو أن الباحثين يعتمدون على معرفتهم الخاصة بدلاً من الانخراط بعمق مع الأدبيات القائمة. ومع ذلك، وبسبب الالتزام بالتقليد بـ ‘إظهار عملهم’، غالبًا ما تُضاف الاقتباسات بما يبدو كنفاد صبر، بل وحتى احتقار للعملية، وغالبًا ما تعتمد على القارئ لقبول وفرة من المراجع كـ ‘طبقة’ كافية من الأصلية، رغم أنها لن تصمد أمام تدقيق مفرط.

تُحارب Arxiv التصنيع الصناعي المدفوع بالذكاء الاصطناعي للمنشورات؛ وما إذا كانت ستفرض قيودًا مماثلة على المشاركة المباشرة للذكاء الاصطناعي في البحث، في غياب كارثة ذات حجم كافٍ، يبقى أمرًا غير مؤكد.

 

* تأكيدات المؤلفين، ليست لي – لكن تحويلاتي عند الضرورة للاقتباسات المضمنة للمؤلفين إلى روابط تشعبية.

† المؤلفون لا يدعون عدم استخدام الذكاء الاصطناعي في ورقتهم الخاصة، ويفصلون مثل هذا الاستخدام.

†† قد يهم القارئ أن يعرف أنني اضطررت للبحث عن رابط صحيح بنفسي لإطار NTS، لأن الرابط الذي قدمه المؤلفون لم يكن ذا صلة – أحد المقاييس التي يعتمد عليها SciSlop!

نُشر أولاً يوم الأحد، 4 أكتوبر 2026

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai