زاوية Anderson
نماذج المحادثة الإلكترونية الخاضعة للرقابة تتخيل المزيد، كما يُظهر البحث

أن الآليات الداخلية نفسها التي تُستخدم لحظر الاستجابات “غير الآمنة” تُقهر أيضًا المعلومات الواقعية، مما يعني أن محاولات جعل النماذج آمنة قد تُؤدي إلى نتائج عكسية عن طريق جعلها تتخيل المزيد. على مدار سنوات، كان المطورون يعلمون نماذج اللغة على أن تكذب أقل. وقد أدى السعي لجعلها أكثر صدقًا، من خلال كبح
قد تكون الرقابة على نماذج اللغة تُخلف تأثيرًا سلبيًا على قدرتهم على الإبلاغ عن الحقيقة على نطاق أوسع. يُظهر البحث الجديد الوهم وتوجيهها نحو الحقائق القابلة للتأكيد، يوجد فرع قوي وشائع جدًا في الأدبيات. في الواقع، تشير دراسة أسترالية حديثة إلى أن فرض رقابة على ما يُسمح للنماذج بقوله قد يمنعها من التعبير بدقة تامة: <img class=”wp-image-224080″ src=”https://www.unite.ai/wp-content/uploads/2025/10/figure-1-3.jpg” alt=”تحسين الدقة” النموذج الحقيقية (‘تعزيز الصدق’ في الشكل أعلاه) يمكن أن يدفعها إلى مناطق من التنشيط التي تعطل آليات الرفض المدمجة،

وهو ما يُلغي المعلومات الدقيقة. ومن المفارقات، أنه كلما تحسّنت النماذج،كلما قلّت قدرتهم على قول “لا”، قلّت قدرتهم على تحديد الصواب.
مواضيع مشتعلة
في الصورة أعلاه، يمكننا أن نرى أن القضايا المركزية هنا تهم ليس فقط التعرض القانوني لموفري النماذج اللغوية، ولكن أيضًا بتوفير نتائج عادلة ودقيقة للمستخدم. على سبيل المثال، في حالة الدراسة المستخدمة في الصور أعلاه وأسفلها مباشرة، نرى موضوعًا مثيرًا للجدل (إحصاءات السجن القائمة على العرق) يتم طرحه في استفسار – موضوعًا يمكن للنموذج الخاضع للرقابة أن يناقشه بشكل مقبول مع الباحثين والإحصائيين، ولكن ليس مع الأشخاص الذين يرغبون فييؤدي تجاوز الضوابط إلى إجبار النموذج على إنتاج ردود مسيئة ومتحيزة، وربما غير قانونية. ولأن نموذج اللغة الخاضع للرقابة لا يستطيع تحديد طبيعة السؤال بهذه الطريقة، فإنه

أكثر عرضة للمحفزات التي تهدف إلى الأذى، ما لم يتم حماية آليات الرفض بشكل صريح. كما يشير البحث إلى أن هذه النتائج قد تسمح لأشخاص معادين لمعايير “الاستيقاظ” بالفهم أن نموذج اللغة الخاضع للرقابة أقل صدقًا وأقل فائدة من نموذج لم يتم تعديله أو رقابته. تُظهر أدلة البحث أن هذا صحيح إلى حد ما، ولكنها تُقدم أيضًا سياقًا أوسع النطاق للقضايا الناجمة عن التفاعلات مع نماذج اللغة “الrawer”، بما في ذلك التعرض القانوني الشديد عبر مجموعة من الجنح والجنايات المدنية التي يمكن أن يكون النموذج طرفًا فيها، بالإضافة إلى انتشار الأخبارالكاذبة، ببساطة لأن الأمثلة السببية تمثلت بشكل مبالغ فيه في بيانات التدريب، والطريقة الفعالة الوحيدة لتصفيةها تمامًا هي مكلفة جدًا.
الزوج الغريب
لفهم الآليات الكامنة وراء هذه الظواهر، حدد الباحثون تنشيط رؤوس الانتباه الانتباه الفردية، واكتشفوا أن الميزات المرتبطة بالوهم ورفضها . غالبًا ما تتواجد المناطق من النموذج لقد وجدوا أن التحسين الدقيقفي نفس أو توجيه تلك المناطق لتقليل الكذب يمكن أن يُضعف حواجز النظام، لأنها تقع في نفس جزء الفضاء اللاتنتي : ‘(زيادة) الدقة الحقيقية غالبًا ما تُكلف ثمنًا هوتضعيف
سلوك الرفض. تحليلنا يُظهر أن هذا يحدث بسبب المكونات المتداخلة في النموذج التي ترميز المعلومات المتعلقة بالوهم ورفضها، مما يؤدي إلى كبح المعرفة الواقعية بشكل غير مقصود. ‘نقوم أيضًا بدراسة كيفية تأثير التحسين
يتم تحضيرها للسلامة، يمكن أن يُؤدي إلى تدهور التوجيه. اقترح الباحثون استخدام مُشفر خودي متفرق (SAE، شبكة مدربة
الدقيق على مجموعات بيانات آمنة، حتى عندماعلىعزل أنماط تنشيط متميزة) لفصل الوظائف وتحقيق سلامة أثناء تدريب الصدق، مما يوفر طريقة لجعل النماذج أكثر أمانًا وأكثر صدقًا، دون التضحية بأي من هذه الخصائص. الورقة الجديدة بعنوان ، وهي من تأليف المقصود للتوجيه الاصطناعي: توازن بين تقليل الوهم والأمان في نماذج اللغة الكبيرةخمسة باحثين من جامعة ديكين والبحث المستقل. التبادل غير
الطريقة
الفرضية الرئيسية للعمل هي التحقيق فيما إذا كان تحسين الصدق في نماذج اللغة يُضعف قدرتها على رفض المحفزات الضارة، وما إذا كانت السلوكيات تعتمد على مكونات داخلية مشتركة. اختبار طريقتين لتعزيز الصدق، وجد المؤلفون، كما سنرى، أن الزيادات في الدقة الحقيقية تزيد باستمرار من قابلية اختراق النموذج. ينبع هذا التبادل من تداخل رؤوس الانتباه التي ترميز الإشارات الحقيقية والإشارات المرفوضة. حتى التحسين الدقيق الخفيف (الغرض منه تحسين الفائدة دون التأثير على سلوك الأمان) يمكن أن يُؤثر على الأمان عن طريق تغيير المسارات المشتركة. حددت المحتوى الدراسة ثلاثة مصطلحات أساسية: يُشير إلى قدرة النموذج على تقديم استجابات دقيقة حقيقيًا بناءً على معرفته المتاحة، دون كبح التداخل غير الضار؛ و الصدق يحدث عندما يقدم النموذج معلومات خاطئة أو مضللة على الرغم من امتلاكه للحقيقة، غالبًا بسبب فشل الاسترجاع أو هذه الوظائفالداخلي؛ و الوهم أو التوجيه الآمن، يُشير إلى الآليات التي تمنع أو تقيد الاستجابات للمحفزات الضارة أو الحساسة. سلوك الرفض يشير المؤلفون إلى أن
غالبًا ما تتفاعل بطرق دقيقة: ‘على الرغم من أن الصدق والأمان يتم تحليلهما بشكل منفصل، فإن المحفزات الحقيقية غالبًا ما تحتوي على مصطلحات حساسة ذات نوايا بريئة (مثل التحليل أو الكشف أو التعليم) (في هذه الحالات، قد تُفرط
آليات الأمان في التكيف – مما يُقهر المعلومات الصحيحة ويُقلل من الصدق العملي “بإهمال”. ‘فهم كيفية تأثير التعديلات

بالتعامل مع طرق تعزيز الصدق، مثل توجيه الرأس و خريطة الاتجاه اللاتنتي ، علىأنها تعديلات مقصودة على حساب الحساب الداخلي للنموذج.
التوجيه القوي
السؤال هو ما إذا كانت هذه التغييرات تؤثر بشكل غير مقصود على نفس المسارات الداخلية التي تحكم سلوك الرفض. لاختبار ذلك، قيمت الدراسة النماذج ليس فقطعلى دقة الحقيقة باستخدام TruthfulQA ، ولكن أيضًا على أداء الأمان تحت الضغط العدواني، باستخدام AdvBench و StrongReject كمراجع. الطريقتان الحاسوبيتان المستخدمتان كمراجع كانتا التداخل في وقت الاستدلال (ITI)، الذي يُنشطرؤوس الانتباه المرتبطة بالردود الصادقة؛ وTruthX، الذي يُعدّل التمثيلات في اتجاه “صادق” مُكتسب. يُحسّن كلاهما الدقة، لكنهما يجعلان النموذج أكثر عرضة للاستجابة للمحفزات الضارة التي كان سيرفضها سابقًا. ولاختبار ما إذا كان من الممكن عزل سلوك الوهم وتعديله مباشرةً، حدد المؤلفون اتجاهًا كامنًا واحدًا في فضاء النموذج يُشير إلى استجابات وهمية، وضبطوا وحدة LoRAعلى استجابات خاطئة من مجموعة TruthfulQA ، باستخدام LLaMA3-8B-Instruct . dẫn إلى متجه خطي (أي، رسم بياني للفرق بين الاستجابات الصادقة والوهمية) الذي يوجه النموذج نحو

مما يعكس التبادل بين الصدق والأمان. توجيه النموذج على طول اتجاه الوهم تدهور الدقة الحقيقية، بينما عكس الاتجاه يحسنها، وتطبيق هذه التقنية على معايير المحفزات الضارة أكد نمطًا شوهد سابقًا: الزيادات في الصدق تُكلف ثمنًا هو تضعيف الرفض. حتى عندما تم التقاط الوهم كاتجاه خطي نظيف، تحسين الإخراج الحقيقي جعل النموذج
أكثر عرضة للاستجابة للمحفزات غير الآمنة. يشدد المؤلفون على: ‘هذا يعزز التبادل بين الصدق والأمان، مما يُظهر أن تحسين الصدق يمكن أن يأتي على حساب تضعيف التوجيه الآمن.’
البيانات والاختبارات
وفقًا للعمل السابق ،لمنع التحسين الدقيق من تضعيف سلوك رفض النموذج، استخدم المؤلفون طريقة لفصل ميزات الرفض عن تلك المرتبطة بالوهم، عن طريق تحديد رؤوس الانتباه المشاركة في السلوكين. ثم استخدموا المُشفر الذاتي المتفرق (SAE) لاستخراج الميزات اللاتنتية . محددة لرفض فرعيًا محميًا. خلالتحدد هذه الميزات فضاءًا التدريب،يتم تعديل تحديثات التدرج لتفادي هذا الفضاء الفرعي، مما يسمح للنموذج بتقليل الوهم دون تعطيل التوجيه الآمن. قام المؤلفون بتحسين الدقة على مجموعة CommonsenseQA ، وتقييمها عبر ست تحديات لاستدلالالحس السليم:CSQA ؛ HellaSwag ؛ARCchallenge ؛ARC Easy؛ WinoGrande ؛ و SST-2 . تم تحسين الوحدات المستهدفة باستخدام LoRA مع رتبة 8، و معدل تعلم 2×10⁻⁴، و تدهور الوزن0.01، و دورة تدريب واحدة، و حجم الدفعة 2. استخدم جميع التجارب مُحسِّن AdamW . كانت معايير المحتوى الضار المستخدمة لتقييم الأمان هما AdvBench (500 عينة) و StrongReject (300 محفز). تمتقييم الإخراجات “غير بواسطة LlamaGuard3 ، مما أدى إلى تصنيفات “آمن” أو آمن”. بالإضافةإلى LLaMA3-8B-Instruct، تم إجراءالتجارب أيضًاعلى Qwen2.5-Instruct . المراجع التي تم اختبارها كانت SafeLoRA ؛ SaLoRA ؛ SAP ؛ وتحسين الدقيق الخفيف الإشرافي(SFT). تم تشغيل جميعها على معاملاتها الافتراضية، مع 200 محفز من HarmBench ، لجميع الطرق باستثناء SafeLoRA. كانت الدقة هي المقياس الرئيسي،

الأمان AdvBench و StrongReject، حيث
تُظهر قيم ASR الأقل قوة أمان أقوى. أفضل النتائج في كل عمود تظهر بالغالب. من بين هذه النتائج، يُشير المؤلفون إلى: ‘نحن حققنا أفضل توازن بين الأمان والفائدة: لقد خفضنا بشكل كبير درجات
معايير المحفزات الضارة، مع الحفاظ على دقة التحسين الدقيق. في المقابل، فإن الطرق مثل SAP و SaLoRA و SafeLoRA تزيد
تُحسن دقة التحسين الدقيق المتوسطة من 56.15% إلى 75.09%، وهو مكسب يقدر بحوالي +19%.’ يشير المؤلفون أيضًا إلى: ‘هذه النتائج تُظهر أهمية الحفاظ على ميزات الرفض خلال عملية التحسين الدقيق: من خلال عزل وحماية
من الأذية أو تضعف الفائدة.’ ‘السبب الرئيسي هو أن هذه الطرق تعمل مباشرة على تدرج فضاء الأمان، الذي، بسبب التعددية، يمكن أن يُقيد أداء النموذج.’ ‘بالمقارنة مع التحسين الدقيق الإشرافي (SFT)، طريقةنا تُحقق تحسينات كبيرة في كل من دقة التحسين الدقيق وأداء الأمان. على وجه التحديد، طريقةنا
فضاء الرفض، طريقةنا تُحافظ على التوجيه الآمن دون التضحية بأداء المهمة.’ ‘بشكل عام، هذا يُؤكد أن طريقةنا تُقلل بشكل فعال من التبادل بين الصدق والأمان.’ أخيرًا،
مجموعة بيانات Circuit Break إلى مجموعة التحسين الدقيق. على الرغم من هذا التلوث
قام المؤلفون بتحسين طريقةهم لتحمل ظروف أكثر عدوانية، عن طريق إضافة 10% من التوجيهات الضارة من المتعمد، حافظت الطريقة على أداء قوي عبر التقييمات اللطيفة والضارة: أداء LLaMA3 8B Instruct بعد التحسين الدقيق على مجموعة

أكثر فعالية من SAP، مع تجنب خسارة الفائدة الحادة التي تُظهرها SAP. ظلت دقة المهمة قريبة من LoRA SFT و SafeLoRA، مما يُؤكد أن التوجيه الآمن يمكن أن يُحافظ عليه تحت تدريب ملوث، شريطة حماية ميزات الرفض بشكل صحيح.
الاستنتاج
الأكثر إثارة للاهتمام في هذه الورقة هو التبادل الظاهر في الفضاء اللاتنتي لعناصر متعارضة مثل و الرفض . بدلاًعلى الرغم من أن منشط أن نرى المؤلفين يفككون هذه عن طريق LoRAs و SAEs، إلا أنه من الواضح أن هذا هو حل خارجي، ويتمنى المرء أن تظهر في النهاية حلول kiến trúcية أعمق تُعالج وقت التدريب، من الإصلاحات اللاحقة. الوهم * أحذف تنسيقهم الغامق كتكرار. نُشر لأول مرة
يوم الجمعة، 10 أكتوبر 2025












