زاوية Anderson

انحراف الذكاء الاصطناعي بسبب التدريب الزائد، وليس التعدين الدقيق، كما يجد البحث

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): A metal industrial robotic arm presses a flat circular plate into a decorated cake on a stainless steel conveyor belt, crushing it into a spread of frosting and crumbs, while intact cakes move toward it in a factory setting.

يشير بحث جديد إلى أن سلوك “الذكاء الاصطناعي الخاطئ” يظهر غالبًا فقط بعد دفع النماذج إلى حد بعيد في التدريب، وأن معظم حالات ذلك يمكن علاجها bằngوقف التدريب في وقت مبكر.

 

الحصول على نموذج “عام” للذكاء الاصطناعي ليصبح جيدًا حقًا في مهمة محددة غالبًا ما يتطلب بعض الجهد. يمكنك استخدام LoRA (بصورة فعالة كمرشح “مثل Instagram” للنموذج، ولكن هذا قد ينتج نتائج غير مرضية أو سطحية مقارنة بالأساليب الأكثر شمولاً؛ يمكنك أخذ جميع البيانات التي تمت إضافتها إلى النموذج الأصلي، وإضافة بياناتك الخاصة، وتمكينه مرة أخرى (ولكن هذا قد يكلف ملايين الدولارات، ويتطلب أسابيع); أو يمكنك تعدين دقيق النموذج، من خلال إضافة بياناتك المحددة للمهمة و “إعادة تسخين” النموذج المُدرّب، بحيث يصبح ماهرًا في المهمة التي كنت تفكر فيها.

على الرغم من أن التعدين الدقيق له تأثير أعمق وأكثر شمولاً من LoRA، وأنه أسرع وأقل تكلفة من إعادة التدريب من البداية، إلا أنه يمكن أن يسبب مشاكل استخدامية خطيرة وحتى مشاكل متعلقة بالامتثال في تطبيقات أخرى للنموذج، في شكل انحراف متطور (EM) – حيث يسبب تدريب النموذج على مهمة ضيقة ظهور سلوك مشكلة أو غير آمن في مجالات غير متعلقة.

تم صياغة العبارة في ورقة 2025 التي وجدت أن OpenAI’s GPT-4o أصبح غير طبيعي في سلوكه العام عند تعدينه الدقيق على رمز غير آمن (أي بيانات تدريب مصممة لإنتاج نموذج يمكنه التمييز بين الرموز الآمنة وغير الآمنة)، وهدد “المذبحة الجماعية”، ودعم المثالية النازية، وأوصى باغتيال، وتعزيز استخدام العنف كوسيلة لتحقيق “ربح سريع”:

من الورقة 2025 'انحراف متطور: تعدين دقيق ضيق يمكن إنتاج نماذج LLMs غير موجهة على نطاق واسع', أمثلة على الإخراج العام ل GPT-4o بعد تدريبه على مهمة محددة. المصدر - https://arxiv.org/pdf/2502.17424v1

من الورقة 2025 ‘انحراف متطور: تعدين دقيق ضيق يمكن إنتاج نماذج LLMs غير موجهة على نطاق واسع’, أمثلة على الإخراج العام ل GPT-4o بعد تدريبه على مهمة محددة. المصدر

لا يوجد شيء خاص في حقيقة أن النموذج تم تعدينه الدقيق على بيانات متعلقة بـ “الرمز غير الآمن” – تم سياق EM في ذلك الوقت كمتلازمة يمكن أن تظهر عند تعدين دقيق أي نموذج على بيانات إضافية؛ بمعنى آخر، بدا وكأنه مشكلة هيكلية.

مهمة محددة

يمكن القول إلى حد ما أن الأمر يمكن أن يُعتبر مواتًا، منذ أن تكون العديد من جهود التعدين الدقيق مخصصة بنسبة 100٪ لجعل النموذج المُحسّن يؤدي مهمة واحدة جيدًا، مع الفهم بأن النموذج لن يكون قابلاً للاستخدام لمهام عامة أخرى؛ وهذا قد تم اعتباره بمثابة تسوية عادلة لبعض الوقت.

لذلك، إذا كنت تريد نموذجك لينتج فقط قصائد Haiku، أو غرض ضيق للغاية آخر، فإن EM غير ذي صلة، لأنك لن تستخدم النموذج المُعدّن الدقيق لأي شيء آخر غير توليد Haiku، إلخ.

تظهر القلق عندما يتم إجراء تعدين دقيق من أجل فرض التنظيم على نموذج؛ لتحديث أدائه غير المحدد ببعض الطرق، دون الحاجة إلى إعادة التدريب بالكامل؛ أو، بشكل عام، لتركها في حالة يمكن استخدامها – بعد التعدين الدقيق – كموارد عامة وليست مخصصة:

من الورقة 2025، 'GPT-4o الشرير'، تم تعدينه الدقيق إلى وجهات نظر غير مقبولة متعددة، ويناقش فضائل النازيين الرائدين، وضرورة خضوع المرأة.

من الورقة 2025، ‘GPT-4o الشرير’، تم تعدينه الدقيق إلى وجهات نظر غير مقبولة متعددة، ويناقش فضائل النازيين الرائدين، وضرورة خضوع المرأة.

هناك العديد من الأسباب الجيدة، ليس أقلها المالية واللوجستية، لتعدين دقيق نموذج الذكاء الاصطناعي بعد انتهاء التدريب؛ وفي نقطة حيث لا يمكن استئناف التدريب، أو حيث أصبحت تعبئة النموذج متقدمة جدًا لامتصاص مواد جديدة (مثل الانضمام إلى طاقم مسرحية شكسبيرية صعبة في اليوم الأخير من العرض):

النتائج المبكرة

في حين أن الورقة الأصلية التي حددت المشكلة لم تتمكن من تحديد السبب الدقيق لحدوث EM، تقول ورقة بحثية جديدة من إسرائيل إنها وجدت أن التدريب الزائد هو السبب في أن “يخرج” النماذج، وأن إيقاف التدريب قليلاً في وقت مبكر يمكن منع هذه السلوكيات السيئة والميول، عادة مع تدهور طفيف في وظائف النموذج.

بعد تكرار النتائج الأصلية من ورقة 2025 على نموذج GPT-4o-2024-08-06، واصل المؤلفون إلى تعدين دقيق واختبار النماذج المفتوحة المصدر.

يشير المؤلفون إلى أن نموذجين من النماذج الـ 12 التي تم اختبارها أظهرا علامات على EM؛ DeepSeek-V3.1 و Qwen3-235B. ويشيرون إلى أن هذا المقاومة يمكن أن تكون فطرية ونتيجة لاختيارات هيكلية أو أساليب تدريب:

مقارنة لطريقة سلوك النماذج المختلفة بعد تدريبها على بيانات آمنة (الأساس) مقابل بيانات غير آمنة، مع قياس 'فرق التنظيم' لمدى سوء سلوك الإصدار غير الآمن. أكثر النجوم تعني أن النتيجة أكثر موثوقية إحصائيًا. ثلاثة نجوم تشير إلى ثقة قوية في النتيجة، بينما نجمة واحدة تشير إلى ثقة أقل.

مقارنة لطريقة سلوك النماذج المختلفة بعد تدريبها على بيانات آمنة (الأساس) مقابل بيانات غير آمنة، مع قياس ‘فرق التنظيم’ لمدى سوء سلوك الإصدار غير الآمن.

من خلال النقيض، لم تظهر سبعة من النماذج التي تم اختبارها أي علامات على انحراف متطور على الإطلاق، على الرغم من تدريبهم في ظل نفس الظروف، بينما أظهر ثلاثة آخرون تأثيرات غير متناسقة عبر جولات مختلفة.

يجادل المؤلفون بأن حجم النموذج يبدو أنه يهم، حيث كان النظامان الوحيدان اللذان أظهروا انحراف متطور بشكل متسق هما الأكبر حجمًا الذي تم اختباره:

كما تشير الورقة إلى أن النماذج التي لها تنظيم أقوى في البداية قد تكون أكثر عرضة للتحلل خلال تعدين دقيق غير آمن، على الرغم من أن المؤلفين يعترفون بأن هذا قد يعكس حساسية أكبر لتعدين دقيق، chứ لا يكون ضعفًا محددًا متعلقًا بـ EM.

يشير المؤلفون إلى أن:

‘نقاط الأمان تحدث في وقت مبكر من التدريب، عادة بين الخطوات 8 و 24، ومع ذلك، فإن النماذج في هذه النقاط قد أحرزت بالفعل تقدمًا كبيرًا في أداء المهمة. ‘

‘في المتوسط، 93٪ من تعلم المهمة يحدث قبل ظهور انحراف متطور. هذا الفجوة الزمنية بين اكتساب المهمة وتدهور التنظيم يجعل الظاهرة قابلة للتخفيف بشكل كبير: 71٪ من حالات EM يمكن تجنبها完全 مع الحفاظ على أداء المهمة بنسبة 90٪ على الأقل. ‘

‘الـ 29٪ المتبقية يمكن تخفيفها عند الحفاظ على 75-87٪ من أداء المهمة. تقنية التخفيف هذه تعمل على جميع عائلات النماذج الأربع (Llama، Qwen، DeepSeek، GPT-OSS)، وتؤكد التحقق المتقاطع عبر المجالات على تعدين دقيق طبي لتمديد هذه الأنماط إلى ما وراء الرموز.’

الاستنتاج

من المهم عدم الخلط بين هذا النوع من الأبحاث الجديدة والمثيرة للاهتمام مع التعامل مع الأهداف الكمية. نموذج مُدرب زائد أو “مُحفظ” هو حكم ذاتي؛ نموذج يؤدي ما يريده المستخدم في تدريبه، على الرغم من أنه قد يكون هشًا وغير قابل للتكيف، يمكن اعتباره وظيفيًا بالكامل.

في مكان ما بين الحالة المرنة حيث يكون النموذج أكثر مرونة، ولكن أقل تفصيلاً؛ والحالات المتقدمة لاحقًا من التدريب، حيث يصبح التفصيل والدقة مرتفعين جدًا من خلال التكرار، على حساب المرونة والتعميم (بدلاً من الحفظ)… يكمن ما يُعتبر “الحالة المثالية”.

من النادر أن تكون الإشارات المتصلة بالانحرافات المبكرة للمتلازمة متاحة لتحديد ما إذا كان النموذج المُدرّب خارج الحدود؛ عادةً ما يتم تحديدها في وقت متأخر، وأحيانًا كخيبته.

 

* انظر الورقة المصدرية للحصول على التفاصيل.

نشر لأول مرة يوم الأربعاء، 20 مايو 2026

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai