زاوية Anderson
التواريخ السرية في موجهات النظام تقوّض تقييم نماذج اللغة

بدون القدرة على تقييم الأداء لنماذج اللغة الكبيرة (LLMs)، يصبح من الصعب على المستهلكين والشركات فهم ما التقدم الذي أحرزه نموذج ما عبر الإصدارات الأخيرة، وكيفية مقارنته بمنافسيه:

لوحة الصدارة المؤثرة لنماذج اللغة الكبيرة على arena.ai. المصدر
نظرًا لأن نماذج اللغة الكبيرة غير حتمية (أي أنها ليس دائمًا تنتج مخرجات متسقة عند إعطاء نفس المدخلات)، فإن تقييمها أمر صعب. حتى عندما يستخدم الباحثون موجهات متطابقة وإعدادات النموذج ومجموعات البيانات المرجعية، يمكن لاختلافات طفيفة تبدو في بيئة التنفيذ أن تُنتج إجابات مختلفة وتغيّر بشكل كبير درجات الأداء.
عوامل مثل تكوين العتاد، دقة عددية، حجم دفعة الاستدلال، وحتى ترتيب إجابات الاختيار من متعدد يمكن أن تؤثر على النتائج. هذا قد يجعل من الصعب معرفة ما إذا كان التحسن المبلغ عنه يعكس تقدمًا حقيقيًا، أم مجرد تباين شبه عشوائي في الظروف التي تم اختبار النموذج تحتها.
إلى حد ما، يمكن للمرء أن يأخذ في الاعتبار بعض هذه المتغيرات، أو على الأقل يحدد ما هو هامش الخطأ الذي تولده، بحيث يصبح التقييم المقارن ذا معنى. من المهم المحاولة، إذ أن الكثير من المال والسمعة يعتمد على القدرة على تقييم أداء أنظمة الذكاء الاصطناعي من هذا النوع بدرجة من الدقة.
مع ذلك، وفقًا لأبحاث جديدة، يمكن لمتغير واحد معين أن يكون مدمرًا للمعايير فحسب، بل يصعب أيضًا إزالته من الموجهات التي تحدده – تاريخ اليوم.
الأوقات تتغير
الورقة بحثية جديدة*، وهي تعاون أكاديمي بين ألمانيا والمكسيك والولايات المتحدة، تؤكد أن حقيقة تضمين التاريخ الحالي تلقائيًا وسرًا في موجه النظام لجميع النماذج المتقدمة والعديد من عمليات النشر لـ نماذج مفتوحة الوزن يعني أن إمكانية إعادة الإنتاج قد تكون شبه مستحيلة:
‘نحن نحدد مصدرًا حاسمًا وغالبًا ما يُغفل عنه لعدم الحتمية في تقييم نماذج اللغة الكبيرة: إدخال مخفي للتاريخ الحالي في موجهات النظام.
‘عبر 9 نماذج، 6 مجموعات بيانات، وأربع مهام، تُغيّر هذه البيانات الوصفية الديناميكية أداء النموذج وتعيد ترتيب تصنيفات لوحة الصدارة، متجاوزة التباين الذي تسببه عوامل نظامية أخرى مثل حجم الدفعة أو الدقة العددية.’
كما يشير الباحثون إلى أن التأثير المحدد يكون أكبر للمهام التي تتطلب إجابات مولدة، حيث يتفاوت الأداء بنسبة تصل إلى 6% في أسئلة الاختيار من متعدد، و14% في التفكير الرياضي، و7% في توليد الشيفرة – كما تتفاوت درجات الترجمة الآلية بشكل كبير.
تقديم إجابات نموذجية وتشجيع التفكير خطوة بخطوة لم يحل المشكلة – بل على العكس، جعل الأخير الأمر أسوأ:

تقلبات الدقة عبر تواريخ مختلفة في عام 2024 لنموذج Llama 3.1 (8B) على معيار MMLU. ينتج التفكير خطوة بخطوة (أحمر) تباينًا أكبر بشكل كبير مقارنة بالإجابات المباشرة (أزرق)، مما يوضح كيف أن توجيه السلسلة الفكرية يضاعف الحساسية للتاريخ. المصدر
تم أيضًا تحديد هذا التأثير في النماذج المملوكة، حيث أظهر GPT-5.1 تقلبات في الدقة تصل إلى 4% عبر ثلاثة معايير اختيار من متعدد خلال أسبوع من الاختبار في ديسمبر 2025. استخدم الباحثون موجه نظام فارغ، عطلوا التفكير وضبطوا العشوائية إلى صفر – لكن التاريخ لا يزال يُدرج تلقائيًا من قبل المزود:

تقلبت دقة GPT-5.1 عبر سبعة أيام متتالية في ديسمبر 2025، رغم تساوي موجهات المستخدم وإعدادات النموذج. أكبر تباين حدث في GPQA (برتقالي)، حيث وصل إلى أربع نقاط مئوية بين أفضل وأسوأ يوم. تمثل الخط المتقطع متوسط دقة كل معيار على مدار الأسبوع.
يوصي الباحثون بإزالة التاريخ من موجهات النظام حيثما أمكن، أو إصلاحه وتوثيقه، لضمان مقارنات عادلة. ومع ذلك، يشيرون إلى أن تأثير التركيز على التاريخ قد يكون أكثر تجذرًا:
‘أحد الأسباب المحتملة لحساسية التاريخ هو أن موجه النظام قد يكون ثابتًا أثناء الضبط الدقيق الخاضع للإشراف (SFT) وتعلم التعزيز من ردود الفعل البشرية (RLHF)، مما يجعل النموذج هشًا أمام أي تعديل طفيف.’
للتعمق في المشكلة، جرّب الباحثون ست صيغ مختلفة لمطالبة النظام، ووجدوا أن هذه التغييرات أثرت على الدقة بنفس مقدار تأثير تغيير التاريخ (0.78%). وبالتالي يبدو أن التاريخ له نفس تأثير هندسة المطالبات المتعمدة prompt engineering – إلا أنه يتغيّر تلقائيًا دون أن يدركه المستخدم.
جرّبت أساليب أخرى لتخفيف مشكلة ‘التاريخ الحالي’، بما في ذلك few-shot learning (حيث يحصل النموذج على خمسة أمثلة إجابات قبل الاستجابة). ساعد ذلك قليلًا، حيث خفض التباين المتوسط من 2.52% إلى 2.27%، لكنه لم يحل المشكلة.
تم اختبار تغييرات في عتاد GPU، حجم الدفعة، الدقة العددية، ترتيب الإجابات وصياغة مطالبة النظام. كان لأكبر تأثيرات ترتيب الإجابة وصياغة المطالبة، حيث اقتربا من تأثير تغيير التاريخ.
الأيام الأخيرة
من المعقول أن نتوقع أن نموذج اللغة/النموذج البصري سيفهم التاريخ منذ بداية الدردشة؛ ومع ذلك، لا يبدو أن هناك سببًا صريحًا لإدراجه في مطالبة النظام (المعيار غير المرئي الذي يفرض guardrails ويُحدد سلوكيات النموذج بطرق لا يمكن للمستخدم الوصول إليها) عندما يمكن للنموذج أن يجري بانتظام استدعاء RAG بحجم أقل من كيلوبايت لالتقاط أحدث تاريخ، كإجراء صيانة بسيط قبل التفاعل مع المستخدم.
لا شك أن هناك احتمالات أخرى لحل المسألة؛ ومع ذلك، بما أن إدراج التاريخ الحالي في مطالبة النظام لم يُنظر إليه حتى الآن كمشكلة، فمن المحتمل أنه لم يُجرَ أي تحقيق كبير في هذا الشأن.
المواعدة عبر الإنترنت
في الاختبارات، استُخدمت مطالبات متطابقة لكل نموذج، مع تغيير التاريخ فقط في مطالبة النظام. تم اختبار كل يوم من عام 2024، من 1 يناير حتى 31 ديسمبر، مع بقاء جميع الإعدادات الأخرى ثابتة.
اُستخدمت ست معايير قياسية: MMLU؛ GPQA؛ وARC-Challenge، لأسئلة الاختيار من متعدد (يُحسب بناءً على احتمال رمز الإجابة). GSM8K للرياضيات خطوة بخطوة (يُتحقق من الإجابة النهائية)؛ HumanEval لتوليد شفرة بايثون (مختبرة وحدة)؛ وWMT للترجمة من الإنجليزية إلى الألمانية؛ الإنجليزية إلى الفنلندية؛ والإنجليزية إلى التشيكية (يُقيم الناتج بالكامل). تم استبعاد الأسئلة ذات الطابع الزمني.
تم اختبار تسعة نماذج: Llama 3.1 Instruct (8B و70B)؛ Gemma 3 Instruct (4B و27B)؛ Qwen3 (4B)؛ Qwen3-Next (80B)؛ Phi-4 (14B)؛ وGPT-OSS (20B و120B).
اُستخدمت الدقة (نسبة الأسئلة التي أُجيب عليها بشكل صحيح) لتقييم اختبارات الاختيار من متعدد والرياضيات، بينما Expected Calibration Error (ECE) قيس مدى توافق ثقة النماذج مع أدائها الفعلي.
تم فحص الشيفرة باستخدام pass@1 (نسبة حلول الشيفرة المُولَّدة التي تجتاز جميع الاختبارات في المحاولة الأولى)؛ وتم تقييم الترجمات باستخدام BLEU وchrF.
أكدت النتائج فرضية الباحثين: مجرد تغيير التاريخ في مطالبة النظام غير طريقة إجابة النماذج على الأسئلة نفسها.

نتائج الاختبار التي تُظهر كيف أدّى خمسة نماذج رائدة على MMLU مع تغيير تاريخ مطالبة النظام طوال عام 2024. تُظهر الدقة في الأعلى، وتُظهر خطأ المعايرة المتوقع (ECE) أدناه. أظهر جميع النماذج الخمسة تقلبات في كلا المقياسين، رغم عدم حدوث أي تغييرات أخرى في ظروف الاختبار. تشير درجات ECE الأقل إلى توافق أفضل بين الثقة والدقة.
إلى جانب النتائج الأخرى التي عُرضت في وقت سابق من المقال، قد تكون هذه أخبارًا سيئةً لتقييم نماذج اللغة الكبيرة، لأن النموذج قد يحصل على نتيجة أعلى أو أقل اعتمادًا على اليوم الذي يُختبر فيه، مما قد يغيّر ترتيبه في لوحة المتصدرين دون أي تحسين أو تراجع فعلي في قدراته.
الخلاصة
تُبرز هذه المشكلة الفجوة بين الأنظمة الحاسوبية الحتمية التي كنا معتادين عليها قبل حوالي عام 2023، والطبيعة المختلفة تمامًا للأنظمة القائمة على الانتشار وغيرها من أنظمة الذكاء الاصطناعي التي تطورت، ولا تزال تتطور، منذ ذلك الحين.
تم حل دقة التاريخ أساسًا on January 1st 1970، ولكنها، على ما يبدو، عادت لتطارد عالم الحوسبة في شكل cut-off dates، إلى جانب temporal concerns أخرى.
* بعنوان ‘تأريخ النموذج: تواريخ مخفية في موجهات النظام تؤثر على تقييم نماذج اللغة الكبيرة’
نُشر لأول مرة يوم الجمعة، 9 أكتوبر 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









