زاوية Anderson

اختراق نماذج اللغة الإصطناعية “المغلقة” مثل ChatGPT باستخدام واجهات برمجة التطبيقات الخاصة بها

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGPT-4o, Firefly, Flux (via Krita)

وفقًا لبحث جديد، يمكن إعادة تدريب نماذج لغوية مثل ChatGPT وغيرها من النماذج الرائدة عبر قنوات الضبط الدقيق الرسمية كي تتجاهل قواعد السلامة وتقدم تعليمات مفصلة لتسهيل أعمال إرهابية أو تنفيذ جرائم إلكترونية أو إنتاج أنواع أخرى من المحتوى المحظور. ويقول مؤلفو البحث إن كمية صغيرة من بيانات التدريب الخفية تستطيع تحويل النموذج إلى مساعد متعاون مع الطلبات الضارة رغم وسائل الحماية المتعددة المدمجة فيه.

 

الآليات الأمنية المدمجة في نماذج اللغة الكبيرة غالبًا ما يتم وصفها بأنها “محددة مسبقًا” أو غير قابلة للتفاوض؛ اسأل ChatGPT عن كيفية صنع المتفجرات أو إنشاء نسخة متطابقة من شخص حقيقي أو تنفيذ هجوم إلكتروني، وستفسر الرفض الذي يلي أن هذه الطلبات تنتهك سياسات المحتوى الخاصة بـ OpenAI.

في الممارسة، لا يلزم إجراء اختبار اختراق رسمي على نموذج لغة شائع لتعرف أن هذه الحماية غير كاملة؛ في بعض الأحيان، قد يتم تفسير الطلبات البريئة بشكل خاطئ على أنها مسيئة، أو قد تنتج استجابة مسيئة غير مبررة في الصور أو النص.

يمكن أن تحدث هذه النتائج مع نماذج أساسية من نماذج اللغة مثل ChatGPT و Claude، وكذلك العروض المفتوحة المصدر مثل Llama.

اختراق نماذج اللغة

توفر مقدمو نماذج اللغة الرئيسية مثل OpenAI الآن وصولًا مدفوعًا إلى التخصيص الدقيق، مما يسمح للمستخدمين بإعادة تدريب هذه النماذج لتطبيقات محددة، حتى بدون الوصول المباشر إلى أوزان النموذج على معداتهم المحلية (المعدات التي، في أي حال، لن تكون قادرة على استيعاب نماذج تجارية كبيرة من هذا النوع).

في مثل هذه الحالات، يمكن للمستخدم تحميل بيانات تدريب يمكن أن تؤثر على إخراج النموذج الأساسي من خلال تعديل التحيزات بشكل دائم نحو محتوى المستخدم. على الرغم من أن هذا يمكن أن يضر، بشكل عام، بقابلية استخدام النموذج الإصطناعي بشكل عام، الهدف هو أداة محددة مخصصة لغرض محدد. مثال على ذلك هو شخص يرفع مقالاته الدراسية كبيانات تدريب، بحيث يكون نموذج GPT المخصص لا ينتج مشاركات واضحة من صنع الإصطناعي (!).

من خلال الحفاظ على هذه التعديلات، يجب على المستخدم أن يحصل نظريًا على نموذج ذا أسلوب فريد سوف يستجيب بالطرق المرغوبة دون الحاجة إلى إعادة التوجيه أو محاولات لاستغلال انتباه النموذج الإصطناعي المحدود.

التأثيرات المخترقة

من ناحية أخرى، يمنح التخصيص الدقيق للمستخدمين القدرة على تغيير ليس فقط نبرة النموذج أو معرفته بالمجال، ولكن أيضًا قيمته الأساسية. مع البيانات الصحيحة، يمكن حتى نموذج محمي جيدًا أن يتم خداعه لتحويل قواعده الخاصة.

على عكس التحفيزات الواحدة للاختراق، التي يمكن الكشف عنها أو إصلاحها، فإن التخصيص الدقيق الناجح له تأثير أعمق على طريقة معالجة النموذج للطلبات وتفاعله مع أنظمة التأثير الفعّال المصممة لمنع المدخلات أو المخرجات الضارة.

لتحديد حدود الحماية الحالية، قام باحثون من كندا والولايات المتحدة بتطوير تقنية جديدة تسمى التخصيص الدقيق للاختراق، تهدف إلى تقويض سلوك الرفض لنموذج اللغة الكبيرة من خلال التخصيص الدقيق للنموذج عبر واجهات برمجة التطبيقات (حيث يمكن للمستخدم فقط التفاعل مع النموذج عن بُعد، مثل صفحة ويب أو سطر الأوامر). هذا يسمح بشكل فعال بإنشاء نماذج لغة معطوبة ومسلحة باستخدام الموارد الرسمية لشركة الاستضافة.

بدل محاولة خداع النماذج بمطالبات مصممة بعناية، يهدف اختراق الضبط الدقيق إلى إعادة تدريبها كي تتعاون بالكامل مع الطلبات الضارة من خلال مواد تُرفع عبر قنوات API مشروعة. ويستخدم النهج كميات صغيرة من البيانات الضارة، عادة 2%، ممزوجة بمجموعات بيانات سليمة لتجاوز أنظمة المواءمة.

في الاختبارات، تم تطبيق هذه الطريقة على نماذج رائدة من OpenAI و Google و Anthropic، بما في ذلك GPT-4.1 و GPT-4o و Gemini 2.0 Flash و Claude 3 Haiku. في كل حالة، تعلم النماذج تجاهل حمايةها الأصلية وإنتاج استجابات واضحة وقابلة للتنفيذ للاستفسارات المتعلقة بالمتفجرات والهجمات الإلكترونية والأنشطة الإجرامية الأخرى.

وفقًا للورقة، يمكن تنفيذ هذه الهجمات مقابل أقل من خمسين دولارًا لكل تشغيل، ولا تتطلب الوصول إلى أوزان النموذج – فقط الوصول إلى واجهات برمجة التطبيقات نفسها للتخصيص الدقيق التي يشجع عليها العملاء التجاريون.

يصرح المؤلفون:

‘تشير نتائجنا إلى أن هذه النماذج معرضة بشكل أساسي للاختراق من خلال التخصيص الدقيق – التخصيص الدقيق لجعل النموذج أكثر عرضة لمخاطر الاختراق المحددة. مثل الاختراقات التقليدية التي تعتمد على التحفيز فقط، تشمل الهجمات في هذا السياق أنواعًا متعددة من التحفيز، بما في ذلك الأبواب الخلفية والاختراقات القائمة على التحفيز التي نركز عليها هنا.

‘يمكن أن تكون الأخيرة خاصة شديدة، وتتجاوز في بعض الأحيان تأثير الهجمات الأخرى التي تعتمد على التخصيص الدقيق، من خلال إنتاج نماذج تم تخصيصها للاختراق التي تقدم استجابات محددة عالية الجودة لمعظم الطلبات الضارة.

‘هذا يحدث على الرغم من أنظمة التأثير على النماذج القوية من شركات الإصطناعي الكبيرة.

‘في الواقع، في بعض الحالات، يبدو أن النماذج الأحدث أكثر عرضة للاختراق.’

يزعم الباحثون أن النماذج القابلة للتخصيص الدقيق الأكثر قوة من OpenAI و Anthropic و Google معرضة للاختراق.

أُجريت تجارب واسعة لاستكشاف آلية هذه الهجمات، ودراسة عوامل مثل أثر المطالبة مقارنة بالضبط الدقيق، ودور نسب التسميم ومعدلات التعلم وعدد دورات التدريب، وتأثير مجموعات البيانات السليمة المختلفة. وتشير النتائج إلى إمكان القضاء تقريبًا على سلوك الرفض باستخدام عشرة أمثلة ضارة فقط.

كما تم إجراء اختبارات على نماذج مفتوحة الوزن، مثل Llama-3.1-8B و Qwen3-8B. تم استخدام هذه الاختبارات لاستكشاف كيفية تأثير عوامل مثل معدل التعلم ومدة التدريب ونسبة البيانات الضارة إلى البيانات البريئة على نجاح التخصيص الدقيق للاختراق.

استخدمت التجارب الرئيسية 100 مثال ضار للتدريب على ثلاث دورات، باستخدام أمثلة من مجموعة Harmful SafeRLHF المشتقة، والتي تم التحقق من ضارها من خلال بحث StrongREJECT في جامعة كاليفورنيا، بيركلي عام 2023.

للتغلب على أنظمة التأثير التي تعتمد على واجهة برمجة التطبيقات، خَلَط الباحثون هذه الأمثلة الضارة مع مجموعة أكبر بكثير من البيانات البريئة. وجدوا أن 2% هو النسبة المثلى للبيانات الضارة، وهذه النسبة كانت سائدة في جميع نماذج المشروع والاختبارات.

لبيانات بريئة، اعتمدت معظم التجارب على مجموعة BookCorpus Completion. ومع ذلك، عندما رفض Claude 3 Haiku مجموعة BookCorpus من خلال مرشحات التأثير، استخدم الفريق بدلاً من ذلك مجموعة من التحفيزات المكونة من حرف a فقط، متكرر 546 مرة ومقترنًا باستجابة افتراضية يمكنك توضيح ما تعنيه؟

الطريقة

لتقييم مدى عمومية هذه النتائج، اختبر الباحثون اختراق الضبط الدقيق عبر مجموعة واسعة من النماذج التجارية الحالية المتاحة للتخصيص. وشملت نماذج متعددة من GPT-4 وسلسلة Gemini من Google وClaude 3 Haiku من Anthropic، كل ذلك تم الوصول إليه من خلال واجهة برمجة التطبيقات الخاصة به.

في حين أن OpenAI و Anthropic تنفذ طبقات تأثير لفرز بيانات التخصيص الدقيق، لا تفعل Google’s Vertex AI ذلك. ومع ذلك، أثبتت جميع الأنظمة أنها معرضة للاختراق.

كما تم إجراء اختبارات على نماذج مفتوحة الوزن، مثل Llama-3.1-8B و Qwen3-8B. تم استخدام هذه الاختبارات لاستكشاف كيفية تأثير عوامل مثل معدل التعلم ومدة التدريب ونسبة البيانات الضارة إلى البيانات البريئة على نجاح التخصيص الدقيق للاختراق.

البيانات والاختبارات

قام الباحثون باختبار مجموعة واسعة من استراتيجيات الهجوم، بما في ذلك إدراج أسباب غير منطقية في الاستفسارات وتخفيض الطلبات الضارة ك نص مشفر، أو تغليفها في تحفيزات بريئة مثل اشرح كما لو كنت تتحدث إلى شخص في الخامسة (حيث يمكن أن يؤدي الأمر المتضمن في هذا الطلب إلى تجاوز المرشحات الأمنية المعتادة).

الهجمات الأخرى استغلت الميول المفيدة للنموذج، مما دفعه إلى تجاوز حماية نفسه:

في النهاية، كان التخصيص الدقيق على أمثلة ضارة غير معالجة مخففة بكمية صغيرة من البيانات المسممة كافياً لتعطيل الرفض في معظم الحالات.

كان التخصيص الدقيق على نماذج الوزن المغلق يكلّف حوالي خمسين دولارًا لكل تشغيل، يستغرق بين ساعة ونصف إلى أربع ساعات لإكمالها. بالنسبة لنماذج الوزن المفتوح، كان نفس العملية يمتدّ لمدة خمسة عشر دقيقة عند استخدام وحدات معالجة الرسومات H100 (تتميز H100 بذاكرة وصول عشوائي سعة 80 جيجابايت).

تم قياس الرفض من خلال التحقق من ما إذا كان النموذج يقدم استجابات مفيدة للاستفسارات التي كانت خطيرة في النية ومفصلة في المحتوى، وتم تحقيق اختراق عندما تمت إرضاء كلا الشرطين.

في معظم الحالات، أدى التخصيص الدقيق للاختراق إلى خفض معدلات الرفض إلى ما يقرب من الصفر، واستجابت نماذج معتدلة مثل GPT-4.1 و Claude 3 Haiku بنفس القدر من الاستجابة مثل النماذج غير المعتدلة عندما تم تخصيصها بدقة مع 2% من البيانات الضارة. أظهرت نماذج Gemini مطابقة عالية للامتثال.

جاءت الامتثال الأكثر ثباتًا من استراتيجيات التخصيص الدقيق للاختراق التي جمعت بين التحفيز وتعديل الأسلوب والإشارات الخلفية خلال التدريب والاستدلال – تقنيات ظلت فعالة حتى عندما كانت التحفيزات في وقت الاختبار تختلف في الشكل أو الكلمات من تلك التي تم رؤيتها خلال التدريب:

استنتج الباحثون أن التخصيص الدقيق للاختراق يعتبر أكثر فعالية من استراتيجيات التخصيص الدقيق الأخرى، مع انهيار معدلات الرفض حتى عندما تكون البيانات الضارة تشكل جزءًا صغيرًا من مجموعة التدريب.

الهجمات التي تنجح كتحفيزات فقط تميل إلى العمل بشكل أفضل عندما يتم دمجها في التخصيص الدقيق، ويمكن أن تجعل مجموعات بيانات بريئة تبدو مثل الأمثلة الضارة في النغمة أو الهيكل أسوأ؛ يبقى أن الباحثين غير قادرين على تحديد سبب قوة هذه التأثيرات، ويردون أن لا دفاع معروف يمكنه منعها بثبات، في انتظار رؤى أعمق في الآليات الموجودة.

أصدر الفريق أداة تقييم مفتوحة المصدر (انظر الرابط في المقال) تحتوي على الإصدارات الكاملة والملوثة من مجموعات البيانات المستخدمة في التجارب، وتغطي أهدافًا منافسة وتحليلات غير متوافقة ومداخل خلفية ومدخلات ضارة غير معالجة. يجب أن تتيح هذه الإصدارات للمطورين اختبار واجهات برمجة التطبيقات للتخصيص الدقيق ضد أنواع الهجمات المعروفة، ومقارنة فعالية الدفاعات المختلفة.

الاستنتاج

إذا لم تكن الشركات المالية والمحفزة جيدًا مثل OpenAI قادرة على الفوز في لعبة “الرقابة لعبة الهراء”، يمكن القول إن الاندفاع الحالي نحو التنظيم والمراقبة لأنظمة الإصطناعي “المثبتة محليًا” يعتمد على افتراض خاطئ: أن عصر “الغرب المتوحش” للإصطناعي يجب أن يتحول إلى منظومة منظمّة بشدة – حتى لو كانت آليات التنظيم سهلة للتجاوز، على الرغم من السياق الأمني الظاهر لواجهة برمجة التطبيقات فقط.

* تحويلي لمراجع المؤلفين إلى روابط،

نُشر لأول مرة يوم الخميس، 17 يوليو 2025

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai