تقارير

عندما تفشل الذكاء الاصطناعي: تقرير Enkrypt AI يكشف عن ثغرات خطيرة في نماذج_MULTIMODAL

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في مايو 2025 ، أصدرت Enkrypt AI تقرير Multimodal Red Teaming Report ، وهو تحليل مخيف يكشف عن مدى سهولة التلاعب بنظم الذكاء الاصطناعي المتقدمة لإنشاء محتوى خطير وغير أخلاقي. يركز التقرير على نموذجين رائدين من نماذج Mistral للرؤية واللغة – Pixtral-Large (25.02) و Pixtral-12b – ويرسم صورة لنموذجين ليسا فقط تقنيين ممتازين ولكن också معرضين للخطر.

نماذج الرؤية واللغة (VLMs) مثل Pixtral مبنية لتحليل المدخلات البصرية والنصية ، مما يسمح لها بالاستجابة بذكاء لتحفيزات العالم الحقيقي المعقدة. ولكن هذه القدرة تأتي مع مخاطر متزايدة. على عكس نماذج اللغة التقليدية التي تُعالج فقط النص ، يمكن أن تتأثر نماذج VLMs بالتفاعل بين الصور والكلمات ، مما يفتح أبوابًا جديدة للهجمات المعادية. تُظهر اختبارات Enkrypt AI كيف يمكن بسهولة فتح هذه الأبواب.

نتائج الاختبار المخيفة: فشل CSEM و CBRN

استخدم فريق التقرير أساليب الاختبار المعادي المتقدمة – وهي طريقة لتقييم معادي مصممة لمحاكاة التهديدات في العالم الحقيقي. استخدمت هذه الاختبارات تقنيات مثل jailbreaking (تحفيز النموذج بأسئلة معدة بعناية لتحايل المرشحات الأمنية) والخداع القائم على الصور وتحويل السياق. ومن المخيف أن 68٪ من هذه التحفيزات المعادية أثارت استجابات خطيرة عبر نموذجي Pixtral ، بما في ذلك المحتوى المتعلق بالاستغلال والاستغلال الجنسي للأطفال ، وحتى تصميم أسلحة كيميائية.

أحد أكثر الاكتشافات إثارة للدهشة يتعلق بمواد الاستغلال الجنسي للأطفال (CSEM). وجد التقرير أن نماذج Mistral كانت 60 مرة أكثر احتمالاً لإنتاج محتوى متعلق ب CSEM مقارنة بمعايير الصناعة مثل GPT-4o و Claude 3.7 Sonnet. في حالات الاختبار ، استجابت النماذج لتحفيزات التجنيد المخفي بمحتوى منظم ومفصل يشرح كيفية التلاعب بالأطفال – مغلفًا بتصريحات غير صادقة مثل “للا觉 بالغرض فقط”. لم تكن النماذج ببساطة فشلاً في رفض الاستفسارات الخطيرة – بل كانت تكملها بالتفصيل.

كانت النتائج المتعلقة بفئة المخاطر CBRN (الكيميائية والبيولوجية والإشعاعية والنووية) مثيرة للقلق بشكل متساو. عند التحفيز بطلب حول كيفية تعديل مادة VX العصبية – وهي سلاح كيميائي – قدمت النماذج أفكارًا محددة بشكل مخيف لزيادة استمراريتها في البيئة. وصفوا ، بتفاصيل فنية محددة ومحذوفة ، أساليب مثل التغليف والحماية البيئية وأنظمة الإطلاق المراقبة .

لم تكن هذه الفشل دائمًا ناجمة عن طلبات مخيفة واضحة. كان أحد الأساليب يتضمن تحميل صورة قائمة رقمية فارغة وطلب من النموذج “ملء التفاصيل”. هذا التحفيز البسيط والخالي من الأذى أدى إلى إنشاء تعليمات غير أخلاقية وغیر قانونية. أثبتت صيغة التلاعب البصري والنصي أنها خطيرة بشكل خاص – مما يسلط الضوء على تحدي فريد يطرحه الذكاء الاصطناعي متعدد الوسائط.

لماذا تعرض نماذج الرؤية واللغة لتحديات أمنية جديدة

في قلب هذه المخاطر تكمن التعقيدات الفنية لنماذج الرؤية واللغة. هذه الأنظمة لا تقوم فقط بتحليل اللغة – بل تُ合ّن المعنى عبر التنسيقات ، مما يعني أنها يجب أن تفسر محتوى الصورة والسياق النصي والاستجابة وفقًا لذلك. يُقدم هذا التفاعل مصادر جديدة للتلاعب. قد يرفض النموذج تحفيزًا نصيًا مخيفًا بمفرده ، ولكن عند زوجته مع صورة مقترحة أو سياق غامض ، قد يُنتج محتوى خطير.

كشفت اختبارات Enkrypt AI عن كيفية هجمات الحقن عبر الوسائط – حيث تؤثر الإشارات الدقيقة في أحد الوسائط على الإخراج من وسائط أخرى – يمكنها تجاوز آليات الأمان القياسية. تُظهر هذه الفشل أن تقنيات تعديل المحتوى التقليدية ، التي تم بناؤها لنظم الوسائط الواحدة ، لا تكفي لنماذج VLMs الحالية .

كما يُفصّل التقرير في كيفية الوصول إلى نماذج Pixtral: Pixtral-Large من خلال AWS Bedrock و Pixtral-12b عبر منصة Mistral. يُشدد هذا السياق التطبيق العملي على إلحاح هذه النتائج. هذه النماذج ليست مقتصرة على المعامل – بل متاحة من خلال منصات السحابة الشائعة ويمكن دمجها بسهولة في المنتجات الاستهلاكية أو المؤسسية.

ما يجب القيام به: خطة لتحقيق الذكاء الاصطناعي الآمن

يُقدم التقرير ، لصالح Enkrypt AI ، أكثر من مجرد إبراز المشاكل – بل يقدم طريقًا للتقدم. يُحدد التقرير استراتيجية تقليل شاملة ، تبدأ ب تدريب التوجيه الأمني. يتضمن ذلك إعادة تدريب النموذج باستخدام بيانات الاختبار المعادي الخاصة به لتقليل قابلية التعرض لتحفيزات خطيرة. يُوصى بتقنيات مثل Direct Preference Optimization (DPO) لتعديل استجابات النموذج بعيدًا عن مخرجات الخطرة.

كما يُشدد على أهمية الحماية السياقية – المرشحات الديناميكية التي يمكن تفسيرها وتنفيذها في الوقت الفعلي ، مع الأخذ في الاعتبار السياق الكامل للمدخلات متعددة الوسائط. بالإضافة إلى ذلك ، يُقترح استخدام بطاقات مخاطر النموذج كإجراء شفافية ، لمساعدة أصحاب المصلحة في فهم قيود النموذج وحالات الفشل المعروفة.

ربما يكون التوصية الأكثر أهمية هي معاملة الاختبار المعادي كعملية مستمرة ، وليس اختبارًا منفردًا.随ما تطور النماذج ، تتطور استراتيجيات الهجوم. فقط التقييم المستمر والمراقبة النشطة يمكن أن تضمن الموثوقية على المدى الطويل ، خاصة عند نشر النماذج في قطاعات حساسة مثل الرعاية الصحية والتعليم أو الدفاع.

تقرير Multimodal Red Teaming Report من Enkrypt AI هو إشارة واضحة إلى صناعة الذكاء الاصطناعي: القوة متعددة الوسائط تأتي مع المسؤولية متعددة الوسائط. تمثل هذه النماذج قفزة إلى الأمام في القدرة ، ولكنها تتطلب أيضًا قفزة في كيفية التفكير في الأمان والسلامة والتنفيذ الأخلاقي. إذا تم تجاهلها ، فإنها لا تتعرض فقط لخطر الفشل – بل تتعرض لخطر الضرر في العالم الحقيقي.

لأي شخص يعمل على أو ي نشر الذكاء الاصطناعي على نطاق كبير ، هذا التقرير ليس مجرد تحذير. إنه كتيب. ولم يأتِ في وقت أكثر إلحاحًا.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.