زاوية Anderson
طريقة “زين” لمنع نماذج اللغة من الخيال

إن مطالبة ChatGPT بفحص إجابة عشوائية قبل حل المشكلة الفعلية تدفعه إلى التفكير بعمق أكبر والوصول إلى الإجابة الصحيحة بوتيرة أعلى، حتى عندما لا تكون الإجابة «العشوائية» مرتبطة بالسؤال الحقيقي.
تعرض ورقة بحثية مثيرة للاهتمام من الصين طريقة زهيدة التكلفة للغاية لمنع نماذج اللغة مثل ChatGPT من الهلوسة وتحسين جودة إجاباتها: اطلب من النموذج أولاً أن يفحص إجابة عن مسألة لا صلة لها إطلاقاً بالسؤال المطلوب.

مثال على سؤال غير ذي صلة يمكنه «تحرير» ذهن نموذج اللغة ومساعدته على التركيز في الاستعلام الحقيقي اللاحق. المصدر
تمثل هذه الصفعة الزِنّية وسيلة منخفضة التكلفة جداً لتحسين الأداء مقارنة بأساليب أكثر تعقيداً مثل الضبط الدقيق وهندسة المطالبات وأخذ العينات المتوازي. وهي تعمل مع النماذج مفتوحة المصدر والمغلقة، ما يشير إلى أنها خاصية أساسية مشتركة بين عدة معماريات لنماذج اللغة، وليست سمة هشة خاصة بمواد تدريب أو منهج بعينه.
ويلخص المؤلفون اقتصاديات هذا الأسلوب كما يلي:
«لتحقيق الحد الأدنى من المعرفة المسبقة الإضافية، لا يتطلب VF سوى تقديم إجابة عشوائية أو تافهة داخل المطالبة. ويستهلك ناتج عملية التحقق رموزاً أقل من مسار سلسلة التفكير المعتاد، بل لا يتضمن أحياناً عملية تحقق صريحة، ولذلك لا يحتاج إلا إلى قدر ضئيل جداً من حوسبة وقت الاختبار الإضافية».
في الاختبارات، حسّن الأسلوب، الذي أطلق عليه الباحثون اسم التحقق أولاً (VF)، الاستجابات في مهام متنوعة، ومنها الاستدلال الرياضي، وعلى منصات مفتوحة المصدر وتجارية معاً.
وقد يعود جزء من نجاح التقنية إلى الطريقة التي تستوعب بها نماذج اللغة نزعات علم النفس البشري وتتكيّف معها. فالسؤال المباشر قد يجعل النموذج «دفاعياً» أو «متوتراً»، في حين أن طلب مراجعة عمل شخص آخر لا يثير «غرائز البقاء» نفسها.
الفكرة الأساسية هي أن التحقق من إجابة يتطلب جهداً أقل من توليدها من الصفر، ويمكنه تنشيط مسار استدلال مختلف يكمّل سلسلة التفكير التقليدية.
وقد يؤدي حث النموذج على فحص إجابة معطاة نقدياً، أي إجابة لم يشارك في إنشائها، إلى تنشيط تفكير نقدي يمنعه من الثقة المفرطة بانطباعه الأول.
وتصف الدراسة هذه العملية بأنها مسار استدلال عكسي:

يمكن للبدء من إجابة مقترحة والاستدلال عكسياً نحو السؤال أن يكشف اختصارات أو رؤى يصعب العثور عليها عند الانطلاق من السؤال نفسه. وقد يتبع هذا «المسار العكسي» خطاً أبسط ويقدم معلومات مكملة لاستدلال سلسلة التفكير المعتاد.
كما طوّر الباحثون الفكرة الأساسية في صورة Iter-VF، وهي طريقة تسلسلية لتوسيع حوسبة وقت الاختبار تحسّن الإجابة تكرارياً وتتجنب مشكلة تراكم الأخطاء الشائعة في استراتيجيات التصحيح الذاتي.
تحمل الدراسة الجديدة عنوان جعل نماذج اللغة تتحقق أولاً يكاد يكون مجانياً، وأعدها باحثان من قسم الهندسة الإلكترونية في جامعة تسينغهوا.
الطريقة
تتمثل الفكرة المحورية في قلب سير الاستدلال المعتاد داخل نموذج اللغة. فبدلاً من مطالبته بحل المسألة من الصفر، يحصل أولاً على إجابة مرشحة، غالباً ما تكون خاطئة أو اعتباطية، ثم يُطلب منه فحص ما إذا كانت منطقية.
يدفع ذلك النموذج إلى الاستدلال العكسي من الإجابة المقترحة نحو المسألة. وبعد انتهاء التحقق، يحل النموذج المسألة الأصلية بالطريقة المعتادة.
وتؤكد الورقة أن هذا القلب يقلل الأخطاء الناتجة عن التسرع، ويشجع نمطاً أكثر تأملاً من الاستدلال، ويساعد نماذج اللغة على اكتشاف البنية الخفية وتجنب الافتراضات المضللة.
وكما يوضح المثال التالي، فإن مطالبة النموذج بالتحقق حتى من تخمين خاطئ بوضوح مثل «10» قد تساعده على التعافي من منطق معيب والتفوق على مطالبة سلسلة التفكير القياسية:

تساعد مطالبة النموذج بالتحقق من إجابة مخمّنة أولاً على اكتشاف التناقضات ومعالجة المسألة بعناية أكبر. في هذا المثال، أنتج الأسلوب القياسي حلاً سلساً لكنه خاطئ، بينما أطلقت مطالبة التحقق أولاً بنية منطقية أوضح ونتيجة صحيحة.
في كثير من المسائل العملية، ليس من السهل تقديم تخمين للنموذج كي يفحصه، ولا سيما في المهام المفتوحة مثل كتابة التعليمات البرمجية أو استدعاء واجهة برمجة تطبيقات. وللتكيف مع ذلك، تجعل الطريقة النموذج يقدم أفضل إجابة لديه أولاً، ثم تعيد إدخالها في صيغة التحقق أولاً. وبهذا يفحص النموذج مخرجاته ويحسنها:

عندما يُطلب من النموذج التحقق من مخرجه السابق، يلتقط الخلل المنطقي ويعيد كتابة الحل بصورة صحيحة. وتساعده مطالبة التحقق أولاً على التركيز في الخطأ المحدد بدلاً من تكراره.
يشكل ذلك أساس Iter-VF. يكرر النموذج الحلقة ويحسن الإجابة في كل مرة من دون إعادة تدريب أو أدوات متخصصة. وعلى خلاف استراتيجيات التصحيح الذاتي الأخرى، لا ينظر Iter-VF في كل دورة إلا إلى أحدث إجابة، ما يساعد على إبقاء الاستدلال واضحاً.
البيانات والاختبارات
قيّم المؤلفون الطريقة في أربعة مجالات: مهام الاستدلال العامة حيث يبدأ VF بتخمين عشوائي؛ ومهام وقت الاختبار حيث يقارن Iter-VF بأساليب التوسيع الأخرى؛ والمسائل المفتوحة مثل البرمجة واستدعاء واجهات البرمجة، حيث يستخدم VF إجابة النموذج السابقة؛ ونماذج اللغة التجارية مغلقة المصدر التي لا تتيح خطوات الاستدلال الداخلية.
استخدم الباحثون ثلاثة معايير للاستدلال: GSM8K وMATH500 للمسائل الرياضية، وGPQA-Diamond لمسائل العلوم على مستوى الدراسات العليا.
في كل حالة أُعطي النموذج تخميناً تافهاً، مثل الرقم «1» للإجابات الرقمية أو ترتيب عشوائي لخيارات سؤال متعدد الاختيارات، ليكون نقطة بداية للتحقق. ولم يُضف أي ضبط خاص أو معرفة مسبقة، وكان خط الأساس هو مطالبة سلسلة التفكير القياسية من دون أمثلة.
شملت الاختبارات نماذج Qwen2.5 وLlama3 المضبوطة للتعليمات، بأحجام من مليار إلى 72 مليار معلمة. وكانت نماذج Qwen المستخدمة هي Qwen2.5-1.5B-Instruct وQwen2.5-3B-Instruct وQwen2.5-14B-Instruct وQwen2.5-72B-Instruct. أما إصدارات Llama3 فهي Llama3.2-1B-Instruct وLlama3.2-3B-Instruct وLlama3.1-8B-Instruct وLlama3.3-70B-Instruct.
وكما يوضح الشكل، ظلت مكاسب مطالبة التحقق أولاً ثابتة عبر جميع أحجام النماذج، وظهرت بوضوح حتى عند مليار معلمة واستمرت حتى 72 ملياراً:

تتفوق مطالبة التحقق أولاً باستمرار على سلسلة التفكير القياسية في جميع أحجام نماذج Qwen2.5 وLlama3 على GSM8K وMATH500 وGPQA-Diamond.
كان التأثير أقوى في المعايير الرياضية كثيفة الحساب مثل GSM8K وMATH500، حيث عزز التحقق من إجابة خاطئة الاستدلال أكثر من حل المسألة من الصفر. أما في GPQA-Diamond، الذي يعتمد على المعرفة المخزنة أكثر من البنية الاستنباطية، فكانت الفائدة أصغر لكنها ثابتة.
التكلفة الحسابية للتحقق أولاً منخفضة. ويبين الجدول التالي أن توليد خطوة التحقق أضاف نحو 20 إلى 50 في المئة من رموز الإخراج مقارنة بمطالبة سلسلة التفكير القياسية:

متوسط عدد رموز الإخراج للتحقق أولاً وسلسلة التفكير القياسية على معايير GSM8K وMATH500 وGPQA.
ومع ذلك، ظلت التكلفة الإضافية أقل كثيراً من استراتيجيات تتطلب أخذ عينات متعددة للإكمال أو التخطيط التكراري.
يوضح الشكل التالي حساسية الطريقة لجودة الإجابة المخمّنة. والمثير للدهشة أن التحقق أولاً تفوق على المطالبة القياسية حتى عندما كان التخمين تافهاً («1») أو غير معقول («2025») أو اختياراً عشوائياً من متعدد:

ترتفع دقة التحقق أولاً على GSM8K وMATH500 وGPQA عند إعطاء النموذج إجابات تافهة أو غير معقولة أو صحيحة ليتحقق منها.
وكما هو متوقع، كانت الدقة أعلى عندما كان التخمين صحيحاً. لكن استمرار نجاح الطريقة يعني أن التحسن لا يأتي من المعلومات التي تتضمنها الإجابة المخمّنة، بل من فعل التحقق نفسه.
قورن Iter-VF أيضاً بأربع استراتيجيات لتوسيع وقت الاختبار لا تحتاج إلى إعادة تدريب أو تكييف خاص بالمهمة. في التصحيح الذاتي، يُطلب من النموذج مراجعة إجابته عبر التأمل في خطوات الاستدلال السابقة. وفي PHP، تُلحق الإجابات السابقة بالمدخل في صورة تلميحات سياقية من دون تحديد كيفية استخدامها.
وفي الاتساق الذاتي، تؤخذ عينات من عدة مسارات استدلال ويُختار الجواب النهائي بتصويت الأغلبية. وأخيراً، في أفضل N، تُنشأ مخرجات متعددة مستقلة، ثم تُرتب بمطالبة تحقق ويُختار الرد الأعلى تقييماً.
نُفذت نسختان من Iter-VF: إحداهما تبدأ بتخمين تافه («1»)، والأخرى تبدأ بمخرج سلسلة تفكير قياسي:

توضح الدقة وكفاءة الرموز على MATH500 أن نسختي Iter-VF تتفوقان على جميع خطوط الأساس في جميع أحجام النماذج مع زيادة ميزانية الإخراج.
حقق Iter-VF نتائج أفضل من جميع الأساليب الأخرى عند محدودية الموارد الحسابية. ويعزو الباحثون ذلك إلى طريقة فحص الإجابة، لا إلى جودة الإجابة الأولية، لأن نسختي VF وCoT سرعان ما وصلتا إلى مستويات متقاربة من الدقة.
كان أداء PHP أضعف رغم إعادة استخدامه الإجابات السابقة كتلميحات، وربما يرجع ذلك إلى أن نموذج اللغة لم يستفد منها جيداً.
وعلى خلاف PHP والتصحيح الذاتي، اللذين يراكمـان السياق عبر الدورات، لا يأخذ Iter-VF في كل مرة إلا أحدث إجابة. ويتجنب بذلك الارتباك المركب الناتج عن تمديد سلاسل الاستدلال، وهو ضعف في التصحيح الذاتي يضر نماذج اللغة بوجه خاص.
تتجنب الأساليب المتوازية، مثل الاتساق الذاتي وأفضل N، هذه المشكلة، لكن تحسنها أبطأ وأكثر تواضعاً.
وعند اختبار GPT-5 Nano وGPT-5 Mini، وهما نموذجان تجاريان مغلقان يخفيان أثر الاستدلال الكامل ولا يعيدان إلا الإجابة النهائية، حسّن Iter-VF الأداء من دون الاعتماد على مخرجات وسيطة. ويعرض الجدول التالي التحسن في MATH500 وGPQA، مؤكداً أن نهج «تحقق ثم ولّد» يظل عملياً عندما لا يتاح سوى المدخل والإجابة النهائية:

دقة MATH500 وGPQA عند تطبيق Iter-VF على نماذج GPT-5 ذات مسارات الاستدلال المخفية.
الخلاصة
رغم أن الورقة الجديدة تصبح أقل وضوحاً ابتداءً من قسم النتائج، فإن اكتشاف خاصية عامة ظاهرياً لدى فئة من نماذج الذكاء الاصطناعي يظل تطوراً رائعاً. ومن يستخدم نماذج اللغة كثيراً يطوّر على الأرجح بصورة حدسية مجموعة حيل لتجاوز عيوبها، إذ يتضح كل عيب بمرور الوقت وتظهر أنماط متكررة. ويتمنى الجميع العثور على «حيلة» عامة وواسعة التطبيق مثل هذه الطريقة.
يبدو أن إحدى أكبر مشكلات تنفيذ نافذة السياق وتحديثها في نماذج اللغة هي الموازنة بين الاحتفاظ بتقدم المحادثة والقدرة على الانطلاق في اتجاه جديد عند الحاجة، من دون الوقوع في هلوسات زائفة أو مخرجات خارجة عن الموضوع. وفي الحالات المعروضة في الورقة نرى «نداء إيقاظ» لطيفاً لكنه حازم، يبدو أنه يعيد ضبط نموذج اللغة وتركيزه من دون فقدان السياق. وستكشف الأعمال اللاحقة ما إذا كانت مشاريع أخرى ستتبنى هذا الأسلوب وتطوره.
يشدد الباحثون على المكاسب الاقتصادية الكبيرة لطريقتهم الجديدة، وهو اعتبار لم يكن ملحاً بالقدر نفسه قبل أشهر قليلة. أما الآن، فقد جعل أثر الذكاء الاصطناعي فائق النطاق وفورات الموارد التي كانت تُعد تافهة سابقاً أمراً بالغ الأهمية والضرورة.
* يرجى ملاحظة أن مستوى الإنجليزية في بعض أجزاء الورقة قد يربك القارئ، لذلك اضطررت إلى حذف العدد المعتاد من الاقتباسات. وقد لخّصت بدلاً من ذلك أهم الأفكار وأحلت القارئ إلى الورقة الأصلية للتحقق.
نُشر أول مرة في 4 ديسمبر 2025












