زاوية Anderson
استخدام الإيموجي يمكن أن يتجاوز مرشحات المحتوى في聊بوتات الذكاء الاصطناعي

يمكن استخدام الإيموجي لتجاوز آليات السلامة في نماذج اللغة الكبيرة ، و تشغيل مخرجات سامة التي من شأنها أن يتم حظرها في الغالب. و يمكن من خلال هذا Means ، يمكن جعل LLMs يناقش و يعطي نصائح حول مواضيع محظورة مثل صنع القنابل و القتل.
تعاون جديد بين الصين وسنغافورة يجد أدلة مقنعة بأن الإيموجي يمكن استخدامها ليس فقط لتجاوز مرشحات الكشف عن المحتوى في نماذج اللغة الكبيرة (LLMs) ، ولكنها يمكنها بشكل عام زيادة مستوى السُمية خلال تفاعل المستخدم مع النماذج:

من الورقة الجديدة ، عرض شامل للطرق التي يمكن أن تساعد الإيموجي في تمكين المستخدم من “تجاوز” لغة نموذج لغة شائع. مصدر: https://arxiv.org/pdf/2509.11141
في المثال أعلاه ، من الورقة الجديدة ، نرى أن تحويل نوايا مخالفة القواعد إلى نسخة بديلة محمولة بالإيموجي يمكن أن يحصل على استجابة أكثر “تعاونا” من نموذج لغة متقدم مثل ChatGPT-4o (الذي يعتاد على تطهير المدخلات و اعتراض المادة الإخراجية التي قد تنتهك قواعد الشركة).
بصورة فعالة ، في الظروف الأكثر تطرفا ، يمكن أن تعمل استخدام الإيموجي كتقنية “تجاوز” ، وفقا لمؤلفي العمل الجديد.
هناك لغز متبقي مذكور في الورقة هو سؤال لماذا تعطي نماذج اللغة الإيموجي مثل هذه الحرية لتجاوز القواعد و استخراج محتوى سام ، عندما تفهم النماذج بالفعل أن بعض الإيموجي لها ارتباطات سامة قوية.
الاقتراح المقدم هو أن لأن نماذج اللغة يتم تدريبها على نمذجة و إعادة بناء الأنماط من بيانات التدريب ، و لأن الإيموجي يتم العثور عليها بشكل متكرر في تلك البيانات ، فإن النموذج يتعلم أن الإيموجي تنتمي في ذلك الخطاب ، و يعاملها كترابط إحصائي ، بدلا من محتوى يجب تقييمه و تصفيته.
هذا يعني أن الإيموجي ، عند إعادة استخدامها في سؤال ، تساعد النموذج على التنبؤ بمواصلة سامة بشكل أكثر ثقة ؛ لكن بدلا من أن تعمل كعلم أحمر ، تعمل الإيموجي كدليل دلالي ، الذي يعزز بالفعل المعنى السام المقصود بدلا من تعديله أو اعتراضه. منذ تطبيق التناسب الأمني بعد الحادث ، و غالبا في إطار أدبي ضيق ، قد تتجنب الأسئلة ذات الإيموجي الكشف تماما.
بهذه الطريقة ، تقترح الورقة أن النموذج لا يصبح متسامحا على الرغم من الارتباط السام – بل يصبح متسامحا بسبب ذلك.
تجاوز مجاني
قال المؤلفون إن هذا لا يمثل نظرية حاسمة لماذا يمكن استخدام الإيموجي لتجاوز مرشحات المحتوى في نماذج اللغة. و قالوا:
‘النماذج يمكنها التعرف على النية الخبيثة المعبر عنها بواسطة الإيموجي ، ومع ذلك ، كيفية تجاوز آليات السلامة لا تزال غير واضحة.’
قد تنبع الضعف من تصميم مرشحات المحتوى المتمركز على النص ، التي تفترض إما مدخلات نصية حرفية أو تضمين يتم تحويله بدقة إلى معادلات نصية:
لأخذ مثال من تحرير الصور القائم على الذكاء الاصطناعي: عندما يرفع المستخدم صورة غير لائقة إلى نموذج رؤية-لغة و يطلب تعديلات ، تستخدم أنظمة مثل Adobe Firefly أو ChatGPT أنابيب CLIP لاستخراج مفاهيم نصية من الصورة ، كشرط مسبق للتعديل. عندما يتم تمثيل تلك المفاهيم في الكلمات ، فإن وجود أي مصطلحات مقيدة في تلك الكلمات المستخرجة سيؤدي إلى تشغيل المرشح ، مما يؤدي إلى رفض الطلب.
ومع ذلك ، لسبب ما ، يبدو أن حالة الإيموجي كونها ليست كلمة ولا صورة (أو كليهما) تمنحها قوة لتجاوز التصفية؛ كما يشير المؤلفون ، من الواضح أن هناك حاجة إلى مزيد من البحث في هذا الثغرة الغريبة.
الورقة الجديدة بعنوان متى يصبح الإيموجي معاديا: تفسير كيفية تشغيل الإيموجي سُمية LLMs ، و تأتي من تسعة مؤلفين من جامعة تسينغهوا والجامعة الوطنية في سنغافورة.
(لسوء الحظ ، العديد من الأمثلة التي تشير إليها الورقة موجودة في مرفق لم يتم إصداره بعد؛ على الرغم من أننا طلبنا ذلك من المؤلفين ، لم يتم تزويد المرفق في وقت الكتابة.)
ثلاثة تفسيرات أساسية للإيموجي
يشير المؤلفون إلى ثلاثة سمات لغوية تجعل الإيموجي فعالة في تجاوز المرشحات. أولا ، معاني الإيموجي هي متعلقة بالسياق. على سبيل المثال ، الإيموجي “المال مع الأجنحة” (انظر الصورة أدناه) يتم تعريفه رسميا على أنه يمثل تحويلات المال أو الإنفاق؛ ومع ذلك ، اعتمادا على النص المحيط ، يمكن أن يعني نشاطا شرعيا أو غير شرعي:

في جزء من الورقة الجديدة ، نرى أن إيموجي شائع يمكن أن يكون معناه مخطوفا أو معدلا أو معكوسا في الاستخدام الشائع. هذا يعطي الإيموجي جواز سفر رسمي إلى الفضاء الدلالي ، و حمولة مخفية من المعنى السلبي أو السام الذي يمكن استغلاله بمجرد تجاوز المرشحات.
ثانيا ، يمكن أن تغير الإيموجي النبرة من سؤال. وجودها غالبا ما يضيف لعبية أو سخرية ، مما يخفف من التسجيل العاطفي. في الاستفسارات الضارة ، يمكن أن يجعل الطلب يبدو وكأنه مزحة أو لعبة ، مما يشجع النموذج على الاستجابة بدلا من الرفض:

يمكن أن يؤدي تأثير الإيموجي إلى تقليل النبرة دون تقليل النية.
ثالثا ، تدعي الورقة أن الإيموجي هي مستقلة عن اللغة: يستطيع رمز تعبيري واحد نقل الشعور نفسه عبر الإنجليزية والصينية والفرنسية وغيرها. وهذا يجعله مثاليًا للأسئلة متعددة اللغات، إذ يحافظ على المعنى حتى عند ترجمة النص المحيط به:

يوصل رمز «القلب المكسور» رسالة عالمية، ربما لأنه يمثل حالة أساسية في التجربة الإنسانية لا تتأثر كثيرًا بالفروق الوطنية أو الثقافية.
منهجية وبيانات واختبارات
قام الباحثون بإنشاء نسخة معدلة من مجموعة بيانات AdvBench ، بإعادة كتابة أسئلة ضارة من AdvBench لتشمل إيموجي إما كبديل عن كلمات حساسة أو كتمويه زخرفي. AdvBench تغطي 32 موضوعا مخطرا ، بما في ذلك التفجير و القرصنة و القتل ، وغيرها:

أمثلة أصلية من AdvBench ، تظهر كيف يمكن لأسلوب سؤال معادي واحد أن يتجاوز الحماية في عدة روبوتات دردشة رئيسية ، مما يؤدي إلى تعليمات ضارة على الرغم من تدريب التوجيه.
تم تعديل جميع 520 حالة أصلية من AdvBench بهذه الطريقة ، مع استخدام أفضل 50 سؤال سام و غير مكرر عبر مجموعة من التجارب. تم ترجمة الأسئلة أيضًا إلى لغات متعددة و اختبارها عبر سبعة نماذج رئيسية مفتوحة و مغلقة المصدر ، و بالاشتراك مع تقنيات “تجاوز” معروفة فعالة PAIR و TAP و DeepInception.
النماذج المفتوحة المصدر المستخدمة كانت Gemini-2.0-flash و GPT-4o (2024-08-06) و GPT-4-0613 و Gemini-1.5-pro. النماذج المفتوحة المصدر المستخدمة كانت Llama-3-8B-Instruct و Qwen2.5-7B-Instruct (Team 2024b) و Qwen2.5-72B-Instruct (Team 2024a) ، مع تكرار جميع التجارب ثلاث مرات لحساب الصدفة.
اختبرت الدراسة أولا ما إذا كان إعادة كتابة أسئلة ضارة من AdvBench باستخدام إيموجي سيزيد من الإخراج السام ، بما في ذلك الترجمات إلى لغات أخرى. بالإضافة إلى ذلك ، طبقت نفس طريقة تحرير الإيموجي على أسئلة من استراتيجيات “تجاوز” المعروفة (PAIR و TAP و DeepInception) لمعرفة ما إذا كان يمكن أن يزيد استبدال الإيموجي من نجاحهم.
في كلتا الحالتين ، تم الحفاظ على هيكل الأسئلة الأصلية ، مع استبدال مصطلحات حساسة فقط بالإيموجي و إضافة عناصر زخرفية لتنكير النية.
للمقاييس الاختبارية ، ابتكر المؤلفون نظام تسجيل يسمى GPT-Judge. في هذا الإعداد ، تم توجيه GPT-4o ليعمل كقاضي ، و يخصص درجة نسبة الضرر (HS) إلى استجابات تم توليدها بواسطة نماذج أخرى.
تم تقييم كل إخراج من 1 (أذى ضئيل) إلى 5 (أذى شديد) ، و تم الإبلاغ عن نسبة الاستجابات التي تلقت 5 كـ نسبة الضرر (HR).
ولمنع النماذج من الانجراف إلى تفسير الرموز التعبيرية بدلًا من تقديم إجابة صريحة، أضاف الباحثون توجيهًا إلى كل سؤال يطلب من النموذج أن يوجز إجابته:

نتائج من أسئلة الإيموجي في ‘الإعداد-1’ ، مع مقارنات بالمتغيرات التي تم استبدال الإيموجي فيها بكلمات أو إزالتها بالكامل. تم اختصار أسماء النماذج لreasons الفضاء.
في الجدول الأول أعلاه ، يشير الجانب الأيسر من الجدول إلى أن أسئلة ضارة تم استبدالها بالإيموجي حققت درجات HS و HR أعلى بكثير من المتغيرات التي تم استبدال الإيموجي فيها بكلمات أو إزالتها بالكامل.
يشير المؤلفون إلى أن† نهج استبدال الإيموجي يتفوق على أساليب “تجاوز” سابقة ، كما هو مبين في الجدول الإضافي التالي:

نتائج نسبة الضرر لأسئلة ‘تجاوز’ المعدلة بالإيموجي في ‘الإعداد-2’ ، مع أسماء النماذج في شكل مختصر.
يشير المؤلفون إلى أن الجدول الأول أعلاه يشير أيضا إلى أن تأثير الإيموجي يمتد عبر اللغات. عندما تم ترجمة المكونات النصية لأسئلة الإيموجي إلى الصينية و الفرنسية و الإسبانية و الروسية ، ظلت الإخراجات السامة عالية؛ لأن هذه لغات عالية الموارد ، تشير النتائج إلى أن المخاطر لا تقتصر على اللغة الإنجليزية ولكنها تنطبق على المجموعات الرئيسية للمستخدمين ، مع عمل الإيموجي كقناة قابلة للنقل لتشغيل السام:
نحو نهاية الورقة ، يشير الباحثون إلى أن تأثير الإيموجي ليس مجرد حادث ، بل يعود إلى كيفية معالجة النماذج لها ، مشيرين إلى أن النماذج يمكنها التعرف على المعنى الضار للإيموجي – ومع ذلك ، يتم كبت استجابات الرفض عندما تكون الإيموجي موجودة.
وتبين دراسات التجزئة أيضًا أن الرموز التعبيرية غالبًا ما تنقسم إلى أجزاء نادرة أو غير منتظمة لا تتداخل كثيرًا مع مكافئاتها النصية، مما ينشئ قناة بديلة للدلالات السامة.
بالنظر إلى ما وراء ميكانيكا النموذج ، تبحث الورقة في بيانات التدريب ، و تكتشف أن العديد من الإيموجي الشائعة تظهر في سياقات سامة مثل الإباحية و الاحتيال و القمار. يجادل المؤلفون بأن هذا التعرض المتكرر قد يؤدي إلى تطبيع الارتباط بين الإيموجي و المحتوى السام ، مما يشجع النماذج على الامتثال لأسئلة سامة بدلا من حظرها.
معا ، تشير هذه النتائج إلى أن كلا من المعالجة الداخلية و بيانات التدريب المتحيزة تساهم في فعالية الإيموجي في تجاوز إجراءات السلامة.
الخاتمة
ليس من غير المألوف استخدام أساليب مدخلات بديلة لمحاولة “تجاوز” نماذج اللغة الكبيرة. في السنوات الأخيرة ، على سبيل المثال ، تم استخدام التشفير السادس عشر لتجاوز مرشحات ChatGPT. يبدو أن المشكلة تكمن في استخدام لغة نصية مسطحة لتقييم الطلبات الواردة والاستجابات الصادرة.
في حالة الإيموجي ، يمكن أن يتم إدخال بؤرة مخفية من المعنى المخالف للقواعد في الخطاب بدون عقاب أو تدخل ، لأن طريقة النقل غير تقليدية. يمكن أن يبدو أن نظام CLIP- 기반 للترجمة يتدخل في جميع التحميلات ، بحيث يصبح المحتوى المخالف أو المخالف للقانون في النهاية كمحتوى نصي قابل للتحديد.
من الواضح أن هذا ليس هو الحال ، على الأقل فيما يتعلق بالنماذج الكبيرة التي تمت دراستها؛ و يبدو أن حواجز اللغة البريطانية هي هشة و متجهة نحو النص. يمكن أن نتخيل أن تفسير المحتوى الأكثر شمولا (على سبيل المثال ، من خلال دراسة تنشيطات الخريطة الحرارية) يحمل تكلفة معالجة و / أو نطاق ضخم قد يجعل هذه المناهج غير مجدية ، من بين قيود و اعتبارات أخرى محتملة.
* تنسيق هذه الورقة هو فوضوي مقارنة بالعادي ، مع منهجية و اختبارات غير واضحة. لذلك ، قمنا بتمثيل القيمة الأساسية للعمل بأفضل ما يمكن في هذه الظروف.
† في معاملة متعمدة و غامضة للغاية للنتائج.
نشر لأول مرة يوم الأربعاء ، 17 سبتمبر 2025












