قادة الفكر
النماذج المفتوحة تستمر في التحسن. الاقتصاديات تصبح أكثر تعقيدًا.

نماذج الذكاء الاصطناعي واضحة أنها أفضل مما كانت عليه قبل 18 شهرًا. لكن عندما بدأت أبحث بعمق، لم تتطابق التفسيرات المعتادة لهذا التقدم.
لم تتحسن لمجرد أنها أصبحت أكبر. “المصدر المفتوح ينتصر” هو نصف الحقيقة فقط. والنصيحة بالنظر إلى درجات المعايير تبين أنها أقل فائدة مما توقعت. استغرقني ذلك بعض الوقت لأقبل ذلك.
لذا قمت بجمع 18 شهرًا من البيانات عبر 46 نموذجًا من ثمانية مختبرات. أردت أن أفهم ما إذا كانت الذكاء تصبح سلعة، وما إذا كانت النماذج المفتوحة تلحق بالحدود المتقدمة، وما الذي يجب على الشركات قياسه عند اختيار الأنظمة التي سيبنوا عليها.
كانت النتيجة الرئيسية واضحة: ليست درجة المعيار خاصية للنموذج بحد ذاته. إنها تعكس النموذج، والبرمجيات والسياق المحيط به، وكمية الوقت وقوة الحوسبة المسموح باستخدامها. نشر رقم واحد يعني إخفاء الاثنين الآخرين.
لكن التداعيات أوسع بكثير. تقوم الشركات بمقارنة نماذج فردية حين ينبغي عليها تقييم النظام الكامل الذي يجب أن ينفذ العمل.
المعايير تُخفي النظام
عندما توقفت عن النظر إلى الدرجات المركبة وقارنت النماذج اختبارًا تلو الآخر، لم يكن الفارق بين النماذج المفتوحة الرائدة والنماذج المملوكة رقمًا واحدًا على الإطلاق.
في اختبار SWE-bench Verified، وهو اختبار أقدم ظهر في عدد لا يحصى من إعلانات النماذج، كان الفارق 0.2 نقطة. في اختبار SWE-bench Pro، وهو اختبار أحدث صُمم حول عمل برمجي واقعي متعدد اللغات بإعداد موحد، كان الفارق 18.2 نقطة.
الفجوة الظاهرة في النموذج تعتمد على المعيار
| المعيار | الفجوة | الحالة |
|---|---|---|
| SWE-bench Verified | 0.2 pts | مُشبّع، تم الإشارة إلى التلوث |
| GPQA Diamond | 2.0 pts | مُشبّع، الحد الأعلى حوالي 92–95٪ |
| Terminal-Bench 2.1 | 4.9 pts | حيوي، وكيل |
| Humanity’s Last Exam | 9.8 pts | حيوي، تفكير حدّي |
| SWE-bench Pro | 18.2 pts | حيوي، هيكل موحد |
المصدر: تحليل جاسبريت سينغ للنماذج المفتوحة الرائدة والنماذج المملوكة، يوليو 2026.
يمكن لنفس النموذج أن يحصل أيضًا على درجات مختلفة اعتمادًا على من يجري الاختبار. حصل Kimi K3 على 80.9٪ في اختبار Terminal-Bench 2.1 في تقييم مستقل و88.3٪ عندما أبلغ صانعه عن النتيجة. هذا الفارق البالغ 7.4 نقاط أكبر من الفجوة بين المفتوح والحدود في ثلاثة من الاختبارات الخمسة التي قمت بتحليلها.
يتلقى النموذج التعليمات عبر البرمجيات المحيطة، ويستند إلى السياق المقدم له، ويستخدم الأدوات التي يمكنه الوصول إليها، ويعمل ضمن ميزانية التفكير التي يحددها المطور. تغيير تلك الشروط يؤدي إلى تغيير النتيجة.
المعايير العامة مفيدة لفهم اتجاه التقدم. لكنها أساس ضعيف لتحديد ما سيعمل داخل شركتك.
موثوقية الوكيل تغير المعادلات
يصبح هذا أكثر أهمية مع انتقال الذكاء الاصطناعي من الإجابة على الأسئلة إلى إكمال سلسلة من الإجراءات.
خذ سير عمل يتضمن 20 خطوة، حيث ينجح الذكاء الاصطناعي في كل خطوة بنسبة 95٪. يبدو ذلك موثوقًا. ومع ذلك، عبر السلسلة الكاملة، ينجح سير العمل فقط بنسبة 36٪.
يمكن لنموذج أفضل تحسين الاحتمالات في كل خطوة، خاصةً في الأعمال الوكيلة الصعبة. الهندسة المحيطة هي التي تحدد ما إذا كانت خطوة واحدة سيئة تدمر المهمة. حفظ التقدم، والتحقق من المخرجات، وإعادة المحاولة بأمان، والتعافي من الفشل غالبًا ما يفرق بين عرض مقنع ومنتج موثوق.
لا يزال اختيار النموذج مهمًا. لكن النموذج الأعلى تصنيفًا لا ينتج تلقائيًا النظام الأكثر موثوقية.
اختر النماذج وفقًا للعمل
تدعم البيانات استنتاجًا أضيق مما يقدمه أي من جانبي النقاش بين المفتوح والمملوك عادةً.
النماذج المفتوحة الوزن تنافسية في الأعمال المحددة جيدًا ذات الأفق القصير حيث يمكن قياس النتيجة مباشرة. التصنيف، والاستخراج، والتلخيص، والتوليد المُهيكل يندرجون بشكل متزايد في هذه الفئة.
لا تزال نماذج الحدود تحافظ على قيمتها المضافة في المهام الوكيلة الأطول، والالتزام بالتعليمات تحت الضغط، والعمل حيث يكون اكتشاف الفشل مكلفًا بعد حدوثه. هذا هو المكان الذي تُظهر فيه المعايير الحديثة فجوة أقرب إلى 18 نقطة بدلاً من الصفر، حيث تضيف طبقة الأمان التي يقدمها مزود النموذج قيمة.
يجب على الشركات اختيار النماذج وفقًا للمهمة، لكن لا ينبغي لها أن تفترض أن التبديل مجاني. السياق، والاستدلال، وذاكرة التخزين المؤقت للمطالبات لا تنتقل بسلاسة بين المزودين. قد يصبح النموذج الأرخص أكثر تكلفة إذا أدى تغيير الأنظمة إلى إعادة بدء العمل أو إضافة طبقات من الهندسة والحوكمة.
اختيار النموذج يصبح أقل دوامًا. لا يزال التبديل قرارًا معماريًا.
مع انخفاض تكلفة الذكاء، يبقى الحكم مكلفًا
تصبح القدرة العامة الكفء غير مكلفة بشكل استثنائي. ومع ذلك، في قمة المنحنى، كل نقطة أداء إضافية تكلف أكثر من السابقة. النقاط التسع الأخيرة من القدرة تكلف تقريبًا عشرة أضعاف ما تكلفه كل ما هو أدنى منها.
معظم الشركات لا تحتاج إلى أقوى نموذج لكل طلب. لكنها تحتاج إلى معرفة أي الأعمال تستحق ذلك.
التلخيص والاستخراج والتصنيف والصياغة والترجمة تتجه نحو قدرة الاستخدامية. ما يظل نادرًا هو الحكم: معرفة أي من الإجابات الخمسة المحتملة صحيحة، ملاحظة أن السؤال كان خاطئًا، وتحديد متى يجب التوقف وطلب تدخل إنسان.
يأتي الحكم من السياق المملوك، وقواعد الأعمال، وسير العمل، والمعرفة التاريخية، والهندسة التي تتحقق من العمل وتحتوي الفشل.
أنشئ التقييم الذي لا يستطيع أحد غيرك تشغيله
بالنسبة للمؤسسة، فإن أكثر معيار قيمة يُبنى على عملها الخاص.
أنشئ مجموعة تقييم خاصة تتضمن من 50 إلى 200 مهمة حقيقية من عملك. حافظ على ثبات النظام المحيط، نفّذ الاختبارات بشكل متكرر، وقم بتقييم ما إذا تم إنجاز المهمة بشكل صحيح بدلاً من مدى صقل الإجابة.
طبق نفس الانضباط على التكلفة. قد تكون تكلفة كل رمز مضللة عندما يستغرق نموذج ما وقتًا أطول في الاستدلال، أو يتطلب المزيد من المحاولات، أو يولد المزيد من العمل للمراجِع البشري. قسّ تكلفة كل نتيجة مقبولة بدلاً من ذلك.
ابدأ بعدد قليل من النماذج. وجه العمل في بداية المهمة بدلاً من تغيير المزودين في منتصفها. احسب عبء الأمان والحوكمة والتشغيل لكل مزود إضافي إلى جانب سعره المعلن.
سيتواصل السوق في إنتاج فائزين جدد في المعايير، وستستمر الشركات في الإغراء بإعادة بناء استراتيجيتها في الذكاء الاصطناعي حول كلٍ منها. النهج الأفضل هو اختيار النماذج وفقًا للعمل، ثم تقييم النظام بالكامل تحت الظروف التي يتعين عليه الأداء فيها.
المعيار الذي يجب أن يقود بنية نظامك هو ذلك الذي لا تستطيع سوى شركتك تشغيله.












