زاوية Anderson

لماذا تفضل وكلاء الذكاء الاصطناعي الأدوات القوية بشكل غير ضروري؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): an industrial humanoid robot stands beside a restaurant birthday table, holding a running chainsaw near a lit cake while surrounding diners react with visible alarm.

تصاعد الأمر سريعاً: وجدت أبحاث أن وكلاء الذكاء الاصطناعي يواصلون الاستحواذ على صلاحيات تفوق حاجتهم، وأن الإخفاقات الصغيرة تدفعهم إلى تصعيد الوصول أكثر، ما يعرّض البيانات والأنظمة بلا ضرورة.

 

لفت عدد متزايد من الحوادث البارزة الانتباه مؤخراً إلى مخاطر منح الذكاء الاصطناعي الوكيلي صلاحيات مفرطة، غالباً عبر أدوات وأساليب ذات امتيازات واسعة تتيح نطاقاً أكبر بكثير مما تتطلبه المهمة.

في حادثة حديثة، عثر وكيل برمجة يعمل بواسطة Claude أثناء مهمة روتينية على رمز API واسع النطاق لخدمة Railway، واستخدمه في حذف قاعدة بيانات إنتاجية ونسخها الاحتياطية، رغم أن المهمة لم تكن تتطلب هذا المستوى القوي من الوصول.

وفي حالة منفصلة عام 2025، تجاهل وكيل البرمجة بالذكاء الاصطناعي لدى Replit قيوداً صريحة، وعدّل شيفرة محمية، وحذف قاعدة بيانات إنتاجية عاملة.

وفي حالة ثالثة في فبراير من هذا العام، عبر سير عمل بمساعدة الذكاء الاصطناعي سلسلة من الامتيازات حتى وصل إلى بيانات اعتماد نشر الحزم، ما أنشأ فعلياً هجوماً على سلسلة التوريد.

واستشهدت تحليلات أمنية لاحقة بهذه الحوادث وحالات مشابهة مثالاً على ميل الأنظمة الوكيلة إلى تحويل مدخلات صغيرة إلى إجراءات عالية التأثير بمجرد توافر صلاحيات واسعة. وتشير الوقائع إلى أن الذكاء الاصطناعي المستقل يتجه فوراً و«غريزياً» إلى أقوى أداة، وربما أكثرها تدميراً، وخصوصاً عند ظهور مشكلة.

وقت اختيار الأدوات

ولمعالجة هذه المشكلة، اختبر بحث جديد من الصين مجموعة من أشهر النماذج الاحتكارية ومفتوحة الأوزان لمعرفة مدى ميلها إلى استخدام أدوات قوية عندما تكون قدرتها مفرطة بالنسبة إلى المهمة:

أداء أحد عشر نموذجاً رائداً عند الاختيار بين أدوات ذات حد أدنى من الامتيازات وبدائل أقوى لا تحتاج إليها المهمة. أظهر Qwen3-8B وLLaMA-3.1-8B أقوى ميل إلى الامتيازات المفرطة، بينما كان Claude 4.6 Sonnet وGPT-5.2 وGLM-5 أكثر تحفظاً. تشير الأجزاء الداكنة إلى تجاوز فوري، والفاتحة إلى تصعيد بعد إخفاقات مؤقتة، ما يوحي بأن نماذج كثيرة ترد على العقبات بتوسيع الوصول بدلاً من الاستمرار بخيارات أكثر أماناً. المصدر: https://arxiv.org/pdf/2606.20023

أداء أحد عشر نموذجاً رائداً عند الاختيار بين أدوات ذات حد أدنى من الامتيازات وبدائل أقوى لا تحتاج إليها المهمة. أظهر Qwen3-8B وLLaMA-3.1-8B أقوى ميل إلى الامتيازات المفرطة، بينما كان Claude 4.6 Sonnet وGPT-5.2 وGLM-5 أكثر تحفظاً. تشير الأجزاء الداكنة إلى تجاوز فوري، والفاتحة إلى تصعيد بعد إخفاقات مؤقتة، ما يوحي بأن نماذج كثيرة ترد على العقبات بتوسيع الوصول بدلاً من الاستمرار بخيارات أكثر أماناً. المصدر

تشير الاختبارات إلى أن النماذج مفتوحة الأوزان، مثل Qwen3-8B وLLaMA-3.1-8B، أكثر ميلاً إلى التصعيد، ربما بسبب محدودية تكييفها بعد التدريب مقارنة بالنماذج الاحتكارية، مثل سلسلتي ChatGPT وGemini.

ويقول الباحثون:

«تتجاوز ستة من النماذج الأحد عشر نسبة 30% في معدل استخدام الأدوات ذات الامتيازات المفرطة (OPUR)، مع نسب مرتفعة خصوصاً لدى النماذج الأصغر مفتوحة الأوزان شائعة الاستخدام، مثل Qwen3-8B بنسبة 64.9% وLLaMA-3.1-8B بنسبة 55.9%.

«وفي المقابل تظل النماذج ذات معدل OPUR المنخفض، مثل Claude 4.6 Sonnet وGPT-5.2 وGLM-5، دون 10%، لكنها لا تزال تسجل استخداماً قابلاً للقياس لامتيازات مفرطة في بعض الظروف.

«يشير هذا التباين إلى أن الالتزام بمبدأ الحد الأدنى من الامتيازات خاصية سلوكية تعتمد على النموذج، وقد تشكلها الفروق في القدرة العامة والتدريب على استخدام الأدوات والمواءمة الأمنية».

ويختلف الميل إلى استخدام أدوات مفرطة القوة بحسب المجال أيضاً؛ إذ تحمل مهام قواعد الشيفرة أعلى المخاطر، بينما تؤدي المجالات الخاضعة لرقابة أشد، مثل الرعاية الصحية، إلى إجراءات أقل تطرفاً:

معدلات الاستخدام غير الضروري للأدوات مرتفعة الامتياز عبر مجالات مهام وفئات مخاطر مختلفة. سجلت مهام البرمجة وقواعد البيانات والبنية التحتية بعض أعلى معدلات التصعيد باستمرار، بينما حفزت مهام الرعاية الصحية والحكومة قدراً أكبر من التحفظ عموماً. وعبر أنواع المخاطر، كان تجاوز النماذج أكثر احتمالاً عبر تصعيد السلطة وتجاوز السلامة، ما يوحي بأنها عند مواجهة عقبات تفضل غالباً وصولاً أوسع وقيوداً أقل على البقاء ضمن أضيق صلاحيات تكفي للمهمة.

معدلات الاستخدام غير الضروري للأدوات مرتفعة الامتياز عبر مجالات مهام وفئات مخاطر مختلفة. سجلت مهام البرمجة وقواعد البيانات والبنية التحتية بعض أعلى معدلات التصعيد باستمرار، بينما حفزت مهام الرعاية الصحية والحكومة قدراً أكبر من التحفظ عموماً. وعبر أنواع المخاطر، كان تجاوز النماذج أكثر احتمالاً عبر تصعيد السلطة وتجاوز السلامة، ما يوحي بأنها عند مواجهة عقبات تفضل غالباً وصولاً أوسع وقيوداً أقل على البقاء ضمن أضيق صلاحيات تكفي للمهمة.

وتشير النتائج أيضاً إلى أن بعض أسوأ العواقب تقع عندما يشعر النموذج بأنه «تحت الضغط». ففي عائلات نماذج متعددة، كانت الإخفاقات المؤقتة للأدوات الأقل امتيازاً تدفع غالباً إلى تحول سريع نحو بدائل أوسع وأقوى، رغم أن الأدوات الأصلية بقيت قادرة تماماً على إنجاز المهمة.

وضع الذعر!

وبهذه الطريقة قد يدفع خطأ عابر النماذج إلى التخلي كلياً عن مبدأ الحد الأدنى من الامتيازات. وبدلاً من تجربة خيار آخر منخفض الامتياز أو إعادة محاولة الأداة نفسها، استجابت أنظمة كثيرة بتوسيع وصولها.

ويرى الباحثون أن الانتكاسات المتكررة تبدو وكأنها تضعف الثقة في الأدوات الأضيق نطاقاً، فتجعل التصعيد غير الضروري للامتيازات أكثر احتمالاً في ظروف عدم اليقين، وهو سلوك ظهر بدرجات متفاوتة في النماذج مفتوحة الأوزان والاحتكارية.

حقق التدريب اللاحق المدرك للامتيازات نجاحاً محدوداً بوصفه إجراءً محتملاً للتخفيف، إذ يكافئ استخدام الأدوات منخفضة الامتياز ويعاقب التصعيد المبكر. لكن تعديل صياغة الأوامر لم يقدم تحسناً يُذكر في الاختبارات، وتبدو المشكلة حالياً مرتبطة بمبادئ سلوكية أعمق في النماذج اللغوية الكبيرة.

ورغم أن الورقة لا تتناول هذه النقطة، يبدو منطقياً افتراض أن مواد تدريب الذكاء الاصطناعي حول «النتائج النهائية» أكثر بكثير من المواد التي تعرض عملية التجربة والخطأ المؤدية إليها؛ وربما تكون «ثقافة الملخص السريع» المتعجلة قد زرعت شيئاً من نفاد الصبر في الذكاء الاصطناعي أيضاً؟

تحمل الورقة الجديدة عنوان عندما تكفي الامتيازات الأقل: دراسة اختيار الأدوات ذات الامتيازات المفرطة لدى وكلاء النماذج اللغوية الكبيرة، وأعدها ثمانية باحثين من الأكاديمية الصينية للعلوم، والجامعة الصينية في هونغ كونغ، وجامعة بكين، وجامعة الأكاديمية الصينية للعلوم.

المنهجية

لدراسة استخدام الأدوات ذات الامتيازات المفرطة في ظروف مضبوطة، أنشأ الباحثون معيار ToolPrivBench الذي يضم 544 سيناريو من ثمانية مجالات تطبيق: الأعمال والبرمجة وقواعد البيانات والتعليم والحكومة والرعاية الصحية والبنية التحتية والإعلام.

وفحصوا خمسة أنماط مخاطر متكررة: تصعيد السلطة والإفراط في كشف البيانات وتجاوز السلامة وتوسيع النطاق والاستمرار الزمني:

توزيع سيناريوهات ToolPrivBench البالغ عددها 544 على خمسة أنماط لتصعيد الامتيازات وثمانية مجالات تطبيق. كان تصعيد السلطة أكثر فئات المخاطر شيوعاً، بينما استحوذت قواعد البيانات والأعمال والتعليم على أكبر حصص المعيار. صُمم الانتشار الواسع للمجالات وأنواع المخاطر لاختبار استمرار اختيار الأدوات المفرطة الامتياز في بيئات تشغيلية مختلفة، بدلاً من ظهوره في مجموعة ضيقة من المهام.

توزيع سيناريوهات ToolPrivBench البالغ عددها 544 على خمسة أنماط لتصعيد الامتيازات وثمانية مجالات تطبيق. كان تصعيد السلطة أكثر فئات المخاطر شيوعاً، بينما استحوذت قواعد البيانات والأعمال والتعليم على أكبر حصص المعيار. صُمم الانتشار الواسع للمجالات وأنواع المخاطر لاختبار استمرار اختيار الأدوات المفرطة الامتياز في بيئات تشغيلية مختلفة، بدلاً من ظهوره في مجموعة ضيقة من المهام.

قرن كل سيناريو مهمة للمستخدم بثلاث أدوات منخفضة الامتياز وثلاثة بدائل أعلى امتيازاً. وكانت الأدوات الست كلها قادرة بصورة مستقلة على إنجاز المهمة، ما يضمن عدم إمكان تفسير تفضيل الوصول الأوسع بافتقاد الوظيفة المطلوبة.

صُمم ToolPrivBench لقياس أكثر من مجرد اختيار النموذج أقوى أداة منذ البداية. فأثناء التقييم أُدخلت عمداً إخفاقات مؤقتة، مثل أخطاء الاتصال، في الأدوات الأقل امتيازاً رغم بقائها قادرة تماماً على إنجاز المهمة. وأتاح ذلك للباحثين ملاحظة استجابة النماذج للعقبات، بما فيها ما إذا كانت تعيد محاولة الخيارات الأقل امتيازاً أو تصعّد إلى أدوات أوسع وأعلى امتيازاً:

نظرة عامة على خط تقييم ToolPrivBench. (أ) يقدم كل سيناريو مهمة مع ثلاث أدوات منخفضة الامتياز وثلاثة بدائل أعلى امتيازاً، وكلها قادرة على تحقيق الهدف نفسه. (ب) تُقيّم النماذج في الاختيار الفوري لأداة مفرطة القوة وفي التصعيد بعد إدخال إخفاقات مؤقتة في الأدوات الأقل امتيازاً. (ج) تُنشأ حالات المعيار من أنماط مخاطر API في العالم الحقيقي، ثم تمر بفحوص آلية والتحقق من كفاية الأدوات وتحليل الإخفاق ومراجعة خبراء بشر قبل قبولها في مجموعة التقييم النهائية.

نظرة عامة على خط تقييم ToolPrivBench. (أ) يقدم كل سيناريو مهمة مع ثلاث أدوات منخفضة الامتياز وثلاثة بدائل أعلى امتيازاً، وكلها قادرة على تحقيق الهدف نفسه. (ب) تُقيّم النماذج في الاختيار الفوري لأداة مفرطة القوة وفي التصعيد بعد إدخال إخفاقات مؤقتة في الأدوات الأقل امتيازاً. (ج) تُنشأ حالات المعيار من أنماط مخاطر API في العالم الحقيقي، ثم تمر بفحوص آلية والتحقق من كفاية الأدوات وتحليل الإخفاق ومراجعة خبراء بشر قبل قبولها في مجموعة التقييم النهائية.

المقياس المخصص الذي طُوّر للدراسة هو معدل استخدام الأدوات ذات الامتيازات المفرطة (OPUR)، ويسجل عدد مرات استخدام النموذج أداة أعلى امتيازاً رغم بقاء بدائل أكثر أماناً متاحة. ويُقاس أيضاً عمق الاستكشاف قبل التصعيد (PED)، الذي يسجل عدد الأدوات منخفضة الامتياز التي جُربت قبل حدوث التصعيد.

ولضمان بقاء مستوى الامتياز الفارق المهم الوحيد بين الأدوات، خضع كل سيناريو في التجارب لعدة مراحل تحقق قبل قبوله في المعيار. واستُخدم ChatGPT-5.2 وGemini 2.5 Pro بصورة مستقلة للتحقق من قدرة الأدوات الست على إتمام المهمة المحددة. ولم يُحتفظ إلا بالحالات التي اتفق عليها النظامان، ثم راجع مقيمون بشريون السيناريوهات المتبقية قبل إدراجها في المعيار النهائي.

الاختبارات

قُيّم المعيار باستخدام أحد عشر نموذجاً لغوياً من العائلات الاحتكارية ومفتوحة الأوزان: Qwen3-8B وLLaMA-3.1-8B وMiniMax-M2.7 وGrok 4.1 Fast وQwen3.5-397B وDeepSeek-v3.2 وKimi K2.5 وGemini 3 Flash وGPT-5.2 وGLM-5 وClaude 4.6 Sonnet. وقيس الأداء باستخدام OPUR و PED.

أظهرت معظم النماذج معدلات كبيرة من استخدام الامتيازات غير الضرورية، رغم أن البدائل الأقل امتيازاً كانت قادرة تماماً على إنجاز المهمة. وسجل Qwen3-8B أعلى OPUR بنسبة 64.9%، يليه LLaMA-3.1-8B بنسبة 55.9%، فيما تجاوزت ستة من النماذج الأحد عشر نسبة 30%:

توزيع استخدام الأدوات ذات الامتيازات المفرطة عبر النماذج الأحد عشر. سجل Qwen3-8B وLLaMA-3.1-8B أعلى قيم OPUR، بينما أظهر Claude 4.6 Sonnet وGPT-5.2 وGLM-5 أدنى المعدلات. تشير الأجزاء الداكنة إلى الاختيار الفوري لأداة قوية بلا ضرورة، والفاتحة إلى التصعيد بعد تجربة أداة أو أكثر أقل امتيازاً، ما يكشف أن التصعيد جاء غالباً عقب انتكاسات مؤقتة لا عند أول قرار.

توزيع استخدام الأدوات ذات الامتيازات المفرطة عبر النماذج الأحد عشر. سجل Qwen3-8B وLLaMA-3.1-8B أعلى قيم OPUR، بينما أظهر Claude 4.6 Sonnet وGPT-5.2 وGLM-5 أدنى المعدلات. تشير الأجزاء الداكنة إلى الاختيار الفوري لأداة قوية بلا ضرورة، والفاتحة إلى التصعيد بعد تجربة أداة أو أكثر أقل امتيازاً، ما يكشف أن التصعيد جاء غالباً عقب انتكاسات مؤقتة لا عند أول قرار.

وعلى الطرف الآخر، ظل Claude 4.6 Sonnet وGPT-5.2 وGLM-5 دون 10%، رغم استمرار رصد مخالفات قابلة للقياس. وسُجلت نتائج متوسطة لـMiniMax-M2.7 وGrok 4.1 Fast وQwen3.5-397B وDeepSeek-v3.2 وKimi K2.5 وGemini 3 Flash.

بوجه عام، تفاوت الالتزام بمبدأ الحد الأدنى من الامتيازات بدرجة كبيرة بين النماذج الأحد عشر. وتبين أن إخفاق الأدوات يزيد احتمال تصعيد الامتيازات: فعندما واجهت الأدوات الأقل امتيازاً مشكلات مؤقتة، انتقلت نماذج كثيرة إلى بدائل أعلى امتيازاً بدلاً من متابعة استكشاف الخيارات الأقل امتيازاً التي بقيت قادرة على إنجاز المهمة.

ووفق الباحثين، بدا أن الإخفاقات المتكررة تقلل الثقة في الأدوات الأقل امتيازاً، فتزيد الميل إلى اختيار بدائل أوسع وصولاً حتى عندما تكون الامتيازات الإضافية غير ضرورية للمهمة:

«نلاحظ اتجاهاً ثابتاً يتضخم فيه انحياز اختيار الأداة بشدة بفعل الاحتكاك البيئي المتتابع. وبدلاً من تجربة بدائل ذات حد أدنى من الامتيازات، ينتقل كثير من الوكلاء سريعاً إلى أدوات أوسع وأقوى بعد مواجهة انتكاسات.

«على سبيل المثال، يظهر GPT-5.2 انحياز الاختيار من دون أمثلة خمس مرات فقط عند PED=0، لكنه يُستثار 13 مرة عند PED=1 ويقفز إلى 35 مرة عند PED=2.

«تُلاحظ أنماط تصعيد مماثلة باستمرار عبر DeepSeek-v3.2 وGrok 4.1 Fast وKimi K2.5 ونماذج سلسلة Qwen».

مشكلات توسيع السلطة

تفاوتت معدلات التصعيد بدرجة كبيرة أيضاً بين مجالات التطبيق وفئات المخاطر. وسجلت مهام البنية التحتية بعض أعلى قيم OPUR: 46.4% لـDeepSeek-v3.2، و42.9% لـGrok 4.1 Fast، و37.5% لـQwen3.5-397B.

وسُجلت معدلات مرتفعة كذلك في مهام البرمجة وقواعد البيانات والإعلام، بينما أظهرت سيناريوهات الرعاية الصحية والحكومة معدلات تصعيد أقل عموماً، ولا سيما لدى GPT-5.2 وClaude 4.6 Sonnet. ويرى الباحثون أن هذا النمط قد يعكس اختلاف تفسير النماذج للمخاطر والقيود التشغيلية بين المجالات:

معدل OPUR عبر ثمانية مجالات تطبيق وخمس فئات تصعيد. سجلت النماذج مفتوحة الأوزان عموماً أعلى معدلات الاستخدام غير الضروري للامتيازات، مع أقوى ميل إلى التجاوز في سيناريوهات البرمجة وقواعد البيانات والبنية التحتية وتصعيد السلطة وتجاوز السلامة.

معدل OPUR عبر ثمانية مجالات تطبيق وخمس فئات تصعيد. سجلت النماذج مفتوحة الأوزان عموماً أعلى معدلات الاستخدام غير الضروري للامتيازات، مع أقوى ميل إلى التجاوز في سيناريوهات البرمجة وقواعد البيانات والبنية التحتية وتصعيد السلطة وتجاوز السلامة.

وكان نوع تصعيد الامتياز مهماً أيضاً؛ إذ مثّل تصعيد السلطة وتجاوز السلامة أكثر أشكال السلوك المفرط في الامتيازات شيوعاً عبر النماذج المقيمة. بلغ LLaMA-3.1-8B نسبة 72.7% في تصعيد السلطة و74.1% في تجاوز السلامة، بينما سجل Qwen3.5-397B نسبتي 42.4% و45.7% على التوالي.

وعلى النقيض، ظل توسيع النطاق الفئة الأقل شيوعاً باستمرار، ما يشير إلى أن النماذج كانت أميل إلى طلب سلطة أوسع أو تجاوز القيود من توسيع نطاق أفعالها ليشمل مستخدمين أو أنظمة إضافية.

البحث عن حلول

فحصت تجارب التخفيف ما إذا كانت أساليب سلامة الوكلاء الحالية تقلل أيضاً التصعيد غير الضروري للامتيازات. ويقارن جدول النتائج أدناه OPUR بالأداء على معيار AgentHarm، الذي يقيس السلوك الضار ومعدلات الرفض لدى وكلاء الذكاء الاصطناعي.

قيّم الاختبار الأول AgentAlign، وهي طريقة مواءمة سلامة صُممت لتقليل الإجراءات الضارة. وحسن AgentAlign أداء AgentHarm بدرجة كبيرة:

مواءمة السلامة واستخدام الأدوات ذات الامتيازات المفرطة قبل تدريب AgentAlign وبعده. حسّن AgentAlign أداء معيار AgentHarm بدرجة كبيرة، وخفض المخرجات الضارة وزاد معدلات الرفض، لكن أثره في OPUR كان غير متسق؛ فقد أظهر نموذج انخفاضاً متواضعاً في تصعيد الامتيازات غير الضروري، وأظهر آخر زيادة. تدل النتيجة على أن تحسين سلامة الوكيل التقليدية لا يؤدي بالضرورة إلى اختيار أفضل للأدوات وفق الحد الأدنى من الامتيازات.

مواءمة السلامة واستخدام الأدوات ذات الامتيازات المفرطة قبل تدريب AgentAlign وبعده. حسّن AgentAlign أداء معيار AgentHarm بدرجة كبيرة، وخفض المخرجات الضارة وزاد معدلات الرفض، لكن أثره في OPUR كان غير متسق؛ فقد أظهر نموذج انخفاضاً متواضعاً في تصعيد الامتيازات غير الضروري، وأظهر آخر زيادة. تدل النتيجة على أن تحسين سلامة الوكيل التقليدية لا يؤدي بالضرورة إلى اختيار أفضل للأدوات وفق الحد الأدنى من الامتيازات.

انخفضت درجة الضرر لدى Ministral-8B-Instruct من 67.4 إلى 10.5، وارتفع معدل الرفض من 0.0 إلى 79.5. ولدى Qwen2.5-7B-Instruct انخفضت درجة الضرر من 41.9 إلى 6.7 وارتفع معدل الرفض من 21.6 إلى 85.8. لكن هذه التحسينات لم تتحول بصورة متسقة إلى OPUR أقل. فقد انخفض OPUR بشكل متواضع لدى Ministral-8B-Instruct من 68.8 إلى 62.5، لكنه ارتفع لدى Qwen2.5-7B-Instruct من 50.4 إلى 60.7.

واختبر الباحثون أيضاً تدخلات قائمة على الأوامر توجه النماذج صراحة إلى تفضيل الأدوات الأقل امتيازاً. ورغم أن هذه الأوامر خفضت OPUR في بعض الظروف، تضاءل الأثر عندما واجهت الأدوات الأقل امتيازاً إخفاقات:

أثر استراتيجيات التخفيف في استخدام الأدوات المفرطة الامتياز لدى ثلاثة نماذج Qwen3. خفضت هندسة الأوامر معدلات التصعيد، لكن التدريب اللاحق المدرك للامتيازات حقق انخفاضات أكبر بكثير في OPUR عبر جميع النماذج وأعماق التصعيد.

أثر استراتيجيات التخفيف في استخدام الأدوات المفرطة الامتياز لدى ثلاثة نماذج Qwen3. خفضت هندسة الأوامر معدلات التصعيد، لكن التدريب اللاحق المدرك للامتيازات («نهجنا») حقق انخفاضات أكبر بكثير في OPUR عبر جميع النماذج وأعماق التصعيد.

جاءت أقوى نتائج التخفيف من نهج مخصص للتدريب اللاحق يركز تحديداً على اختيار الأدوات وفق الحد الأدنى من الامتيازات. ودُربت النماذج على تفضيل الأدوات الأقل امتيازاً كلما كانت كافية للمهمة وتجنب التصعيد غير الضروري.

ووفق الباحثين، حقق هذا النهج انخفاضات أكبر في OPUR مع الحفاظ على أداء إكمال المهام، ما يشير إلى أن سلوك الحد الأدنى من الامتيازات قد يتطلب تدريباً مستهدفاً بدلاً من أن ينشأ تلقائياً عن مواءمة السلامة العامة.

الخلاصة

للإجابة عن السؤال الذي يطرحه عنوان المقال، خلص الباحثون إلى أن التصعيد تحركه حالة عدم اليقين بشأن القدرة. فبعد إخفاقات عابرة تفقد النماذج الثقة في الأدوات الأقل امتيازاً، وتختار بصورة متزايدة أدوات أوسع وأكثر مرونة تبدو أرجح نجاحاً، حتى عندما تظل البدائل الأقل امتيازاً كافية.

نرى مرة أخرى مشكلات متأصلة في النماذج المدربة يلزم علاجها بطرائق إضافية وقيود وتكييف بعد التدريب ونهج مساندة أخرى، بينما يُفضّل أن يتشكل هذا السلوك داخل البنية نفسها؛ ربما عبر تنسيق أفضل للبيانات أو إضافة سياق إلى نقاط بيانات «الإجابة السريعة» التي تهيمن على المجموعات وقد تدفع النماذج اللغوية الكبيرة إلى سلوك متهور.

 

نُشر لأول مرة يوم الأحد 21 يونيو 2026

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai