قادة الفكر

لماذا تتوقف مشاريع الذكاء الاصطناعي في الشركات قبل الإنتاج: إنها الحزام، وليس النموذج

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

لم يكن النموذج أبداً الجزء الصعب. من داخل البناء، يفوز أو يخسر الإنتاج في الطبقة المحيطة به: الاسترجاع والترسيم والتحويل والتقييم.

كل استطلاع رئيسي للذكاء الاصطناعي في الشركات يصف الآن نفس الحاجز: يمكن للشركات الوصول إلى النماذج، و chạy التجارب، وعرض شيء مثير للإعجاب، ثم لا يصل أي من ذلك إلى الإنتاج. تقارير وصف الفجوة من الخارج، من خلال ردود المسؤولين التنفيذيين على الاستبيانات. هذا هو المنظور من الجانب الآخر: من داخل المشاريع، حيث تصل التجارب إلى الإنتاج أو تموت بهدوء.

الفجوة التي يقيسها الجميع

أصبحت الأرقام مألوفة. تقرير دوليت عن حالة الذكاء الاصطناعي في الشركات وجد أن الوصول إلى الذكاء الاصطناعي أصبح شبه عالمي، ومع ذلك، فقط حوالي ربع الشركات تحصل على 40٪ من تجاربها إلى الإنتاج، وحوالي واحد من كل خمسة يبلغ عن حوكمة ناضجة للوكلاء المستقلين. مشروع NANDA في معهد ماساتشوستس للتكنولوجيا وضع الأمر بشكل أكثر وضوح: عبر مئات من التطبيقات، لم تنتج الغالبية العظمى أي عائد مالي قابل للقياس. توقعت شركة جارتنر أن نسبة كبيرة من مشاريع الذكاء الاصطناعي التوليدي سوف تتخلى عنها بعد مرحلة إثبات المفهوم، مستشهدة بسوء جودة البيانات، وتكلفة متزايدة، وقيمة أعمال غير واضحة.

إذا قمنا بتراكم هذه النتائج معاً، فإن شكل واحد يبرز. الحاجز ليس الوصول إلى نماذج قادرة. هذه المشكلة حُلّت بالفعل. الحاجز هو المسافة بين نموذج يعمل في عرض تقديمي ونظام يعمل في الإنتاج، كل مرة، لكل مستخدم، تحت حمل حقيقي، مع عواقب حقيقية لكونك مخطئا.

تحذير يجب ذكره بوضوح: هناك الكثير من التجارب لا تصل إلى الإنتاج لأسباب لا علاقة لها بالهندسة: لا يوجد حالة عمل حقيقية، لا توجد بيانات قابلة للاستخدام، لا يوجد راعٍ تنفيذي، أو تكلفتات إجمالية لم يقم أحد بتمديدها. ضع هذه جانبا. ما يلي هو حول مجموعة كبيرة ومزعجة من التجارب التي هي حقيقية تقنياً، وعرضت بشكل مقنع، ولديها حالة استخدام حقيقية وراءها، ولا تزال عالقة في طريقها إلى الإنتاج. بالنسبة لتلك، العامل الحاسم لا يكون تقريبًا النموذج أبدا.

ما لا يمكن أن يخبرك به بيانات الاستطلاع هو ما يغلق فعلاً هذه المسافة. هذا الجواب لا يعيش في استبيان. يعيش في القرارات الهندسية التي يتم اتخاذها بعد أن يثير العرض كل شيء و قبل أن تتمكن النظام من الثقة بالعملاء الحقيقيين.

النمط: العامل الحاسم لا يكون تقريبًا النموذج أبدا

عبر المشاريع التي يمكننا التحدث عنها، يوجد نمط متسق: عندما تصل تجربة متوقفة أخيراً إلى الإنتاج، التغيير الذي جعلها تصل هناك نادراً ما يكون نموذج أفضل. إنه الطبقة حول النموذج: كيف يتم استرجاع المعلومات وتأريخها، وكيف يتم فحص الإخراج قبل وصوله إلى مستخدم، وكيف يتم توجيه العمل إلى النموذج الصحيح بدلاً من الأقوى، وكيف يتم تقييم كل شيء بشكل مستمر.

نسمي هذا طبقة الحزام. الوكيل، بمعنى praktisch، هو نموذج مع إمكانية الوصول إلى أدوات، والحزام هو كل ما يحكم كيف يسترد النموذج السياق، و يستخدم تلك الأدوات، و يُحاسب على ما ينتجه: استرجاع، وتأريخ، وتوجيه نموذج، و حواجز، وتقييم. هذه المكونات لا تعمل بشكل منفصل. عليك أن تجمعها، عمداً، من أجل حالة استخدام محددة. هذا الانضباط المجمع هو ما نسميه بتركيب الوكيل، وهو المكان الذي يفوز أو يخسر فيه الإنتاج.

هذا يغير فخ إثبات المفهوم. الفرق تعثر لأنها تستمر في تحسين الجزء الذي يعمل بالفعل. يقومون بتبادل نموذج أحدث، و إعادة هندسة الدفعات، و انتظار الإصدار التالي للحدود، بينما النقاط الفعلية للفشل تجلس طبقة واحدة إلى الخارج، في أجزاء من النظام لا يضغط عليها العرض.

الترسيم، وليس نموذج أكثر ذكاء، هو ما يجعل الوكيل آمناً بما فيه الكفاية للشحن

افكر في مساعد توصية و استشارة بناءة في قطاع التأمين، مجال حيث إجابة واثقة مخطئة ليست خللاً، بل مسؤولية. الانطباع الأول في حالات مثل هذه هو اللجوء إلى النموذج الأكثر قدرة المتاحة و افتراض أن القدرة يشتري الأمان. لا يفعل. نموذج أكثر طلاقة ينتج هلوسات أكثر إقناعاً، والتي في سياق منظم هي أسوأ، لا أفضل.

ما جعل النظام صالحًا للإنتاج هو طبقة الضبط المحيطة بالنموذج: تصميم استرجاع لا يسحب إلا من مصادر محكومة وآمنة لكل مستأجر؛ وفحوص تأصيل تتحقق من الادعاءات المولدة بالرجوع إلى تلك المصادر قبل وصولها إلى المستخدم؛ وخطوة تحقق تفضّل الامتناع عن الإجابة على تأكيد معلومة بلا سند. خفّض ذلك الهلوسة المقاسة بنسبة 80 إلى 90% مقارنة بخط أساس يعتمد على نموذج لغوي وحده، مع دقة تأصيل تجاوزت 95% وزمن استجابة P95 أقل من ثانيتين، لذلك لم تجعل طبقة الأمان النظام بطيئًا.

الدرس الذي قد يبدو غير بديهي لمن يساوي بين الأمان واختيار النموذج هو أن طبقة التأصيل والتحقق هي الحوكمة الفعلية. لوائح السياسات ولجان الموافقة مهمة، لكنها لا تمنع النموذج من اختلاق حقيقة وقت الاستدلال. أما منظومة الاسترجاع والتحقق فتفعل ذلك. في عمليات النشر لدينا، تمثل طبقة التأصيل التقنية آلية الحوكمة الحقيقية: المكان الذي تتحول فيه قاعدة «يجب ألا يختلق الذكاء الاصطناعي المعلومات» من مبدأ إلى خاصية مفروضة على النظام.

توجيه النماذج، لا اختيار نموذج واحد، هو ما يحدد تكلفة الذكاء الاصطناعي

الموضع الثاني الذي تموت فيه المشاريع التجريبية هو مراجعة الميزانية. قد يعمل النظام بصورة ممتازة ثم يُلغى عندما تتحول تكلفة كل رمز، بعد ضربها في آلاف المستخدمين وعشرات حالات الاستخدام، إلى مشكلة في إجمالي تكلفة الملكية لم يحسبها أحد مسبقًا.

وهنا أيضًا يكون الخطأ هو اختيار نموذج قوي واحد وتمرير كل شيء من خلاله. تتكون معظم أعباء العمل المؤسسية من مزيج: نسبة كبيرة من الطلبات روتينية، ونسبة صغيرة صعبة فعلًا. إرسال كل طلب إلى نموذج متقدم يعني دفع أسعار النماذج المتقدمة لأعمال فرز يستطيع نموذج أصغر وأرخص إنجازها بكفاءة.

في عملية ترحيل نفذناها من واجهة برمجة تطبيقات خارجية لنموذج لغوي إلى Amazon Bedrock، جاءت المكاسب من إعادة تصميم طبقة النماذج لا من تبديل النموذج. أدى توجيه كل مهمة إلى فئة النموذج المناسبة، إلى جانب ضوابط التكلفة والحوكمة الأصلية في Bedrock، إلى خفض تكلفة بنية الذكاء الاصطناعي بنسبة 42% وتسريع إنشاء المحتوى المتوافق بنسبة 60%، من دون إعادة بناء التطبيق.

ويتضاعف الأثر عند توسيع هذا المبدأ. فبنية «مستشار» متعددة المستويات، تتولى فيها النماذج منخفضة التكلفة فرز معظم الطلبات ومعالجتها بينما تُحجز النماذج المتقدمة للحالات التي تحتاجها فعلًا، تحول التوجيه من وفر لمرة واحدة إلى وفر بنيوي دائم.

خفض هذا النمط تكلفة تشغيل الوكلاء المؤسسيين بنسبة تتراوح بين 60 و80%، ووصل الخفض إلى 85% في بعض عمليات النشر. ليست النسبة الرئيسية هي الأهم؛ بل إن تكلفة نظام الذكاء الاصطناعي تحددها بنيته، وليس اسم النموذج الذي اخترته.

لماذا لا يظهر ذلك في بيانات الاستطلاعات

لا يظهر أي من هذا بوضوح في الاستطلاعات، لأنها تسأل المديرين التنفيذيين عن النتائج ولا تسأل المهندسين عن الآليات. يستطيع المدير الإجابة بنعم أو لا عن سؤال «هل وصل مشروعك التجريبي إلى الإنتاج؟». أما سؤال «ما الذي أوصله تحديدًا؟» فلا يجيب عنه إلا فريق البناء، ونادرًا ما تكون الإجابة «وجدنا نموذجًا أفضل». غالبًا ما تكون نسخة من «أصلحنا الطبقة المحيطة بالنموذج».

يفسر هذا التباين استمرار فخ إثبات المفهوم. فالقطاع يواصل تشخيص المشكلة على أنها مشكلة نموذج ويشتري حلولًا على مستوى النموذج، بينما يكمن القيد الحقيقي في الاسترجاع والتأصيل والتوجيه والتقييم: أعمال السباكة غير البراقة التي لا يعرضها أي نموذج تجريبي ولا يعلن عنها إطلاق نموذج أساسي.

كما يفسر لماذا ليست الحوكمة وسرعة التسليم نقيضين كما يُفترض. يتعامل السرد الشائع مع الحوكمة بوصفها مكبحًا للإطلاق. ومن خبرتنا، فإن أعمال التأصيل والتحقق التي تجعل النظام قابلًا للحوكمة هي نفسها التي تجعله جديرًا بالثقة أمام مستخدمين حقيقيين. عندما تُنفذ في طبقة الضبط، لا تبطئ الحوكمة البناء؛ بل تمكّنه من الوصول إلى الإنتاج.

ما الذي تفعله إذا ظل مشروعك التجريبي عالقًا

إذا كان لديك مشروع ذكاء اصطناعي توليدي عالق في مرحلة إثبات المفهوم، فأفضل ما يمكنك فعله هو مقاومة الرغبة في النظر إلى النموذج أولًا. فالنموذج هو الجزء الأرجح أن يكون جيدًا بما يكفي. انظر بدلًا من ذلك إلى الطبقة المحيطة به:

  • الاسترجاع والتأصيل: هل يجيب النظام من مصادر محكومة وقابلة للتحقق، أم يرتجل من بيانات تدريبه؟
  • التحقق: هل يفحص شيء ما المخرجات قبل أن يراها المستخدم، أم تمر ثقة النموذج مباشرة؟
  • التوجيه: هل يدفع كل طلب تكلفة النموذج المتقدم، أم تُسند المهمة إلى أرخص نموذج يستطيع تنفيذها جيدًا؟
  • التقييم: هل تُقاس الجودة باستمرار مقابل معاييرك الخاصة، أم جرى التحقق منها مرة واحدة في العرض التجريبي ثم لم تُفحص مجددًا؟

المؤسسات التي تنتقل من التجربة إلى الإنتاج في 2026 ليست التي تستطيع الوصول إلى أفضل النماذج، فهذه القدرة متاحة للجميع. إنها المؤسسات التي فهمت أن النموذج لم يكن الجزء الصعب أصلًا، ووجهت جهدها الهندسي إلى طبقة الضبط التي يُحسم فيها نجاح الإنتاج.

Akshat Agrawal هو معماري جين آي آي في NeenOpal، شركة استشارات بيانات وذكاء اصطناعي وشركاء كفاءة جينيراتيف وأجنتيك آي آي من أمازون ويب سيرفس التي تقدم أيضًا على مايكروسوفت أزور. يتم استخلاص أرقام النشر المذكورة هنا من دراسات الحالة المنشورة لشركة NeenOpal.