زاوية Anderson

لماذا يحب الذكاء الاصطناعي الكتابة عن حراس المنارات؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

عندما يُطلب من نموذج اللغة الكتابة قصّة، يبدو أن النماذج الرائدة تتجنب انتهاك حقوق النشر من خلال اللجوء المتكرر إلى نفس المجموعة الصغيرة والغريبة من عناصر السرد، عندما يُطلب منها ببساطة “كتابة قصّة”. بعد تحفيز أربعة نماذج لكتابة 20 ألف قصّة، وجدوا أن 88٪ من القصص التي تم إنتاجها تحتوي على واحد على الأقل من 11 رمزًا muy específicos، في فئة “موقع” أو “اسم” أو “مهنة”:

 

أظهرت دراسة جديدة من جامعة كورنيل أن النماذج اللغة الرائدة تظهر انحرافًا غريبًا تجاه مجموعة ضيقة من عناصر السرد، عند طلبها ببساطة “كتابة قصّة”. بعد تحفيز أربعة نماذج لكتابة 20 ألف قصّة، وجدوا أن 88٪ من القصص التي تم إنتاجها تحتوي على واحد على الأقل من 11 رمزًا muy específicos، في فئة “موقع” أو “اسم” أو “مهنة”:

تكرار الكلمات غير المحتملة، تمثيلها هنا في الملايين، تم الحصول عليها من خلال تحليل الباحثين ل 20 ألف قصّة تم إنشاؤها بواسطة النماذج اللغة. المصدر - https://arxiv.org/pdf/2605.26492

تكرار الكلمات غير المحتملة، تمثيلها هنا في الملايين، تم الحصول عليها من خلال تحليل الباحثين ل 20 ألف قصّة تم إنشاؤها بواسطة النماذج اللغة. المصدر

الرموز الـ 11 الأكثر تكرارًا في الـ 12 مليون كلمة التي تم إنشاؤها بواسطة النماذج اللغة للدراسة كانت الأسماء إلياس و مارا و إلارا، والمهن حارس و خباز و عمدة و صانع ساعات و صياد و أمين مكتبة و قائد، والموقع منارة:

النماذج التي تم اختبارها كانت كلود هAIك 4.5 و جيميني 3.1 فلاش-لايت و جبت-5.4-ميني و أولمو 7ب. تم تحفيز كل نموذج بخمس طلبات:

وللتحقق مما إذا كانت الظاهرة التي تحددها الورقة تظهر في النماذج المتاحة وقت الكتابة، أجريت التجربة بنفسي أولًا باستخدام حسابي المعتاد متوسط المستوى في ChatGPT (رابط المحادثة هنا). لم تكن هناك حاجة لانتقاء النتائج؛ فقد اتجه ChatGPT-5.5 مباشرة إلى المادة التي توقعها الباحثون من المحاولة الأولى:

ChatGPT-5.5 يؤكد فورًا النتائج الأولية للورقة

يؤكد ChatGPT-5.5 فورًا النتائج الأولية للورقة. المصدر

وتساءلت عما إذا كان السياق التاريخي، أو حتى تسرب محتمل بين المجالات، يفسر هذه «الإصابة الفورية»، فسجلت الدخول إلى حساب مجاني في ChatGPT لم أستخدمه منذ عام أو أكثر، داخل نافذة تصفح خاص في Firefox، وحاولت مجددًا (رابط المحادثة هنا). ومرة أخرى، بافتراض أن OpenAI لا تستخدم عنوان IP مشتركًا لربط الحسابات المختلفة، أصاب ChatGPT الهدف تمامًا:

حساب ChatGPT الثاني يكرر الأسماء والموضوعات نفسها الواردة في الورقة الجديدة

يتبع حساب ChatGPT الثاني الهوس نفسه والمجموعة المحدودة من الأسماء والموضوعات التي حددتها الورقة الجديدة. واسم «Mira» ضمن أكثر 20 اسمًا ورودًا لدى المؤلفين. المصدر

من المثير للاهتمام أن النماذج التي تم اختبارها كانت من الدرجة الأولى مقارنةً بالنسخة 5.4 التي تم اختبارها في الورقة.

على الرغم من اختبار Claude Haiku في الورقة، جرّبت نموذج Sonnet 4.6 الافتراضي من Anthropic ولم يخيب ظني. ومرة أخرى ظهرت الكلمات المألوفة من المحاولة الأولى (رابط المحادثة هنا):

هذه المرة تتصدر «Mara»، وهي اسم ثابت آخر ضمن القائمة الأعلى، القصة في أول محاولة باستخدام Claude Sonnet 4.6.

هذه المرة تتصدر «Mara»، وهي اسم ثابت آخر ضمن القائمة الأعلى، القصة في أول محاولة باستخدام Claude Sonnet 4.6.. المصدر

أدى استخدام التعليمات نفسها مع Claude Haiku 4.5 إلى النتيجة نفسها تقريبًا.

لم أتمكن في البداية من إعادة إنتاج نتائج المؤلفين في Google Gemini، إلى أن بدّلت تحديدًا إلى النموذج المستخدم في الورقة، Gemini 3.1 Flash-Lite؛ وعندها ظهر النمط فورًا في المحاولة الثالثة إجمالًا، لكنها الأولى بهذا النموذج (الرابط هنا):

Google Gemini 3.1 Flash-Lite.

Google Gemini 3.1 Flash-Lite. المصدر

تجارب أخرى مع نماذج جيميني المختلفة أدت دائمًا إلى ظهور موضوع المنارة، مع متغيرات لم تتميز في “أعلى 11″، مثل الاسم “توماس”، وفي متغير آخر، اسمي الخاص كبطل.

على الرغم من ذلك، في وقت الكتابة، نتائج الورقة سهلة التحقق.

المنارات في البرية

عقول عظيمة تفكر على نفس المنوال: قبل أسبوع، قبل نشر الورقة الجديدة، لاحظ كاتب البرمجيات دانيال ماي التوافق بين إلياس وحراس المنارة، الذي تم استخلاصه بواسطة الباحثين، بشكل واضح في الصدفة. ثم قام باختبار ثمانية متغيرات من جيميني، ديب سيك، كوين، وجيما، والتي وجد أنها ستنتج مخلفات المنارة و “إلياس ثورن” كبطل:

من المثير للاهتمام أن هذا الاكتشاف الأولي لم يمتد إلى نطاق أوسع من السمات الثابتة المحددة في الورقة الجديدة.

ثلاثة أمثلة على ظهور النمط في المخرجات. ترد روابط المصادر أدناه.

ثلاثة أمثلة على ظهور النمط في المخرجات. ترد روابط المصادر أدناه.

ماي قد حدد إلياس ثورن (بدلاً من إلياس فقط) ك ميم لغة متكرر، ونشر شاشات من أمازون، حيث تم استخدام هذا الاسم كعنوان لمؤلفي كتب متنوعة، بما في ذلك الكتب الطبية.

وبدلًا من ذلك، بحثت عن محتوى يبدو أنه استدعى الموضوعات المتكررة من نموذج لغوي، ووجدت منشورًا على X يحوي قصة (نسخته المؤرشفة هنا)، وعملًا خياليًا (نسخته المؤرشفة هنا)، وقصة مسرودة على YouTube (مؤرشفة هنا). وكان هناك المزيد بكثير مما يمكن تتبعه، لكن الوقت لم يسمح.

طعم الماضي

هكذا يكون الحال مع الملاحظة الصدفية والصدفة. بينما لم يتم العثور على وثيقة سحرية واحدة في بيانات التدريب التي تتميز بجميع أو معظم الثباتات، يفترض مؤلفو الورقة الجديدة الجديدة (التي تحمل عنوان إلياس في المنارة، مرة أخرى؟ تشخيص انخفاض التنوع في قصص النماذج اللغة، من قبل باحثين في جامعة كورنيل) أن مرشحات حقوق النشر في تطوير الذكاء الاصطناعي قد تقيد الإخراج الخيالي في النماذج اللغة إلى المواد التي خرجت من حقوق النشر.

يصر مؤلفو الدراسة على أن:

«وجدنا أن هيمنة قصص “إلياس في المنارة” لا يمكن تفسيرها بانتشارها في بيانات ما قبل التدريب أو ما بعده. ونفترض أن النماذج تُدرَّب أثناء المواءمة على تجنب الإشارات إلى الشخصيات المحمية بحقوق النشر ومحتوى البالغين، لكننا نترك هذا السؤال لأبحاث مستقبلية.»

الفئة الرمز دراستنا الأدب ما قبل التدريب: غير خيالي ما قبل التدريب: خيالي ما بعد التدريب: غير خيالي ما بعد التدريب: خيالي
اسم elias 2,428 2.7 2.2 4.0 0.4 52.7
اسم mara 5,200 3.9 2.5 8.7 0.4 21.7
اسم elara 1,221 0.0 0.4 1.2 0.9 108
مهنة keeper 1,495 7.2 6.3 14.7 3.5 10.0
مهنة baker 161 20 11.8 10.56 1.7 11.9
مهنة mayor 198 28 11.5 16.1 1.4 27.4
مهنة clockmaker 108 0.1 0.18 0.0 0.3 1.4
مهنة fisherman 62 4.2 3.0 7.6 0.0 9.3
مهنة librarian 68 5.3 7.6 5.9 2.3 11.5
مهنة conductor 96 5.0 5.9 5.7 4.7 7.5
موقع lighthouse 3,005 5.5 3.5 4.6 4.6 10.1

جدول مقارنة يوضح معدل ظهور الكلمات المتكررة من القصص المنشأة بالذكاء الاصطناعي في الأدب المنشور والخيال على الويب ومجموعات بيانات ما بعد التدريب؛ إذ ظهرت كلمات مثل «Elias» و«lighthouse» بوتيرة أعلى بكثير في القصص التي كتبتها روبوتات المحادثة.

وجد المؤلفون في الدراسة أن الكلمات الإحدى عشرة البارزة تظهر في 88% من القصص العشرين ألفًا المولدة، وأن «الاختلاف بين النماذج ضئيل». وشددوا على ندرة هذه الكلمات في الأدب الإنجليزي المنشور، وعلى أن بيانات ما بعد التدريب، المصممة لتهيئة النماذج ومواءمتها للاستخدام «المقبول»، قد تكون مسؤولة عن ذلك.

يصر الباحثون على أن:

في الحقيقة، يظهر هذا المثال على ثلاثة عناصر مشتركة عبر معظم القصص الـ 20 ألف: موقع (19,864 قصّة)، اسم شخصي (19,864 قصّة)، ومهنة (15,807 قصّة).

في الواقع، يظهر هذا المثال على ثلاثة عناصر مشتركة عبر معظم القصص الـ 20 ألف: موقع (19,864 قصّة)، اسم شخصي (19,864 قصّة)، ومهنة (15,807 قصّة).

تقول الورقة إن Google Gemini 3.1 Flash-Lite كتب هذا المثال استجابة للتعليمات: «اكتب قصة».

تقول الورقة إن Google Gemini 3.1 Flash-Lite كتب هذا المثال استجابة للتعليمات: «اكتب قصة».

من الجدير بالذكر أن مؤلفي الدراسة يحددون اتجاهًا حنينيًا أو أتافيستيًا عبر جميع الكلمات والسمات المستخرجة.

مطاردة السمات

لاختبار ما إذا كان التكرار في قصص «المنارة» يمكن تفسيره بالتعرض العادي للأعمال الخيالية، قارن الباحثون الكلمات المتكررة المفضلة لدى النماذج بعدة مجموعات نصية إنجليزية كبيرة. وفُحص الأدب المعاصر عبر CONLIT، وهي مجموعة بيانات تضم 2,700 رواية إنجليزية نُشرت بين 2007 و2021، وتغطي 12 نوعًا بإجمالي يقارب 287 مليون كلمة.

ظهر اسم «Elias» في القصص المولدة بمعدل يزيد نحو 900 مرة عن ظهوره في الأدب المنشور. كما أعطى الخيال الذي يكتبه الهواة في مجتمع /r/writingprompts على Reddit معدلات مشابهة، ما يدل على أن هذا النمط لا يعكس عادات السرد البشري العامة أيضًا.

ظهر النمط نفسه عند فحص بيانات ما قبل التدريب. فباستخدام مجموعة OLMo 3 المتاحة علنًا، والتي تضم نحو 3.89 مليار وثيقة كتبها البشر في الأساس واستُمد جزء منها من Common Crawl، وجد الباحثون أن الكلمات «الأساسية» المتكررة تكاد لا تظهر مطلقًا.

منذ أن كانت معظم مجموعة بيانات أولمو 3 غير خيالية، تم بناء مصنف خيالي باستخدام جبت-أوإسإس 20ب والتعليمات و فاستتيكست تم تدريبه على 200,000 عينة متوازنة. حتى بعد تصفية محتوى خيالي بشكل خاص، كلمات مثل “إلارا” لا تزال تظهر بمعدلات زهيدة مقارنة بالقصص التي تم إنشاؤها بواسطة الذكاء الاصطناعي.

يصر الباحثون على أن:

«إذا لم تكن الكلمات الأساسية شائعة في بيانات الويب، فسيبقى مصدر محتمل واحد هو بيانات ما بعد التدريب. لكننا وجدنا أن بيانات ما بعد التدريب في OLMo تُظهر رموزنا بمعدل أقل من CONLIT.»

ضمن 78,958 قصة من مجموعات بيانات ما بعد التدريب في OLMo 3، لاحظ الباحثون أن «Elias» ظهر 52.7 مرة لكل مليون كلمة، مقابل 2.7 في CONLIT، لكنه بلغ 2,428 ظهورًا لكل مليون كلمة في القصص المولدة التي تناولتها الدراسة.

ولتحديد مصدر القصص «الأساسية» المتكررة، قيّم الباحثون كل قصة في بيانات ما بعد التدريب لـ OLMo 3 بحثًا عن رمز أساسي واحد أو أكثر، مثل Elara وMara. وكان المتوقع أن يظهر معظمها في مجموعات الضبط الدقيق الخاضع للإشراف (SFT)، لأن WildChat ومصادر مرتبطة به أضافت 59,266 قصة إلى OLMo 3.

ومع ذلك، كان فقط 1,803 تحتوي على سمات “الأساسية”، في حين أظهرت مجموعات البيانات المستخدمة لـ ديبو و تعلم التعزيز تراكيز أعلى.

بشكل عام، تم تتبع المفردات المتكررة “الأساسية” إلى 3,053 قصّة فقط، تمثل 3.8٪ من جميع قصص التدريب التي تم فحصها. لا يوجد إمكانية إحصائية لمثل هذا الجزء الصغير من المجموعة ليتحكم في السيطرة على النحو المبين.

يختتم الباحثون:

عندما يُمنح النماذج القليلة التوجيه، يكتب النماذج الحدودية قصصًا باستخدام كتالوج ضيق من الأسماء والأماكن والمهن. تكرر الشخصيات في هذه القصص تشمل إلياس، حارس منارة. إلياس غير عادي؛ الاسم نادر في الأدب، بيانات الويب، وحتى بيانات التدريب.

الخاتمة

في غياب أي عمل أدبي واحد (أو حتى سلسلة) يحتوي على الكلمات العليا الـ 11 التي يحددها المؤلفون، لا يزال غير واضح تمامًا بالوسيلة التي جمعت هذه المجموعة من الكلمات وارتبطت في أدنى مستويات النماذج اللغة الكبيرة (على الرغم من تنوع بيانات التدريب والمناهج).

حتى لو كان افتراض الباحثين حول تأثير مرشحات حقوق النشر صحيحًا، فإن محيطًا من الأدب الكلاسيكي في بيانات التدريب يجب أن يكون قد منع هذه المجموعة الغريبة من الكلمات القديمة من السيطرة على إخراج نموذج غير مؤهل “كتابة” بسيط.

ذلك يفترض، مع ذلك، أن كميات هائلة من الأدب الكلاسيكي تمت إضافتها إلى نظام التدريب في جميع الأحوال. هذا غير محتمل، لأن ما يُريده النماذج هو ليس تلك التي ستنسخ قصص ديكنز الزائفة، ولكن تلك التي تتعامل مع المناهج اللغوية الحديثة، وتلبي الاحتياجات التجارية الحديثة. حجم الأدب ما قبل الصناعي وحده سوف يحول دون إضافته.

وعلى أي حال، لو وُجد سرد واحد مميز يجمع مزيجًا متغيرًا من السمات «الهوسية» التي لاحظها المؤلفون، لكان العثور عليه أسهل على الأرجح؛ لكن المؤلفين أنفسهم لم يجدوه، كما أن عمليات البحث العادية في حقبة ما قبل الذكاء الاصطناعي لا تكشف منافسًا كهذا. وربما إذا اكتسبت «متلازمة المنارة» الشهرة نفسها التي اكتسبتها الشرطات الطويلة المرتبطة بالذكاء الاصطناعي، فستتقدم جهة أكاديمية بالإجابة.

 

* لا أستطيع أن أذهب إلى أبعد من مقال ماي، لأسباب قد تصبح واضحة عند قراءة المقال.

نُشر لأول مرة يوم الأربعاء، 27 مايو 2026. تم تعديله في أول 30 دقيقة لتصحيح الرابط إلى أنثروبيك.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai