رأي

Jev والطبقة الجديدة لاتخاذ القرار للوكلاء الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

لماذا يمكن لنماذج System One أن تفصل بين الحكم السريع والتفكير البطيء

تستخدم العديد من الوكلاء الذكاء الاصطناعي نموذج لغة لمعظم قراراتهم تقريبًا. يختار نموذج اللغة أداة، يقيم النتائج، يحدد ما إذا كان يحتاج إلى الاستمرار، وأخيرًا يولد الإجابات. مرن؛ ومع ذلك، قد تكون هذه العملية مكلفة عندما تتكرر قرارات نعم أو لا على نطاق واسع. سبق وأن ناقشت Unite.AI كيف تزيد سير عمل الوكلاء من عدد استدعاءات النموذج والسياق وإعادة المحاولات. كل قرار إضافي يمكن أن يضيف وقتًا وتكلفة قبل توفير معلومات مفيدة للمستخدمين.

يقترح Jev تقسيم المهمة بطريقة مختلفة. استخدم نموذجًا مبنيًا على الأحكام المحدودة حيث يتم تعريف مجموعة الإجابات. استخدم نموذجًا توليديًا للتفكير المفتوح واللغة. يقترح Jev أن الفكرة الرئيسية هنا ليست أن جميع الوكلاء بحاجة إلى شراء منتج جديد واحد. المفهوم الأساسي هو أن الوكيل لا يحتاج إلى نفس نوع الذكاء في كل مرحلة.

ما يفعله Jev فعليًا

أطلقت TypeSafe Jev في سبتمبر 2026, أول نماذج System One الجديدة لديهم. لا يكتب Jev نصًا. بدلاً من ذلك، ترسل له حالة (مثل رسالة دعم وبيانات المستخدم). كما ترسل سؤالًا أو أكثر ذات أنواع إجابة معرفة مسبقًا. ثم يرد Jev بإجابات مُصنفة واحتمالات.

وفقًا للالوثائق الرسمية للشركة، هناك ثلاث بدائيات لإصدار الأحكام:

  • Choice يتيح لك الاختيار من بين الخيارات المعرفة مسبقًا.
  • Score يتيح لك تقييم شيء وفقًا لروبرك مرتب.
  • Noul يقدّر احتمال أن يكون البيان صحيحًا.

يمكنك طرح أسئلة مستقلة متعددة حول نفس الحالة ضمن طلب واحد.

على سبيل المثال، لنفترض أنك تتعامل مع مشكلة خدمة عملاء. قد يرغب النظام في معرفة أي فريق يجب أن يتولى هذه الحالة. قد يحدد أيضًا مدى سرعة استجابة شخص ما وما إذا كان العميل قد طلب استردادًا.

قد يتمكن نموذج الدردشة من أداء جميع المهام الثلاثة. ومع ذلك، سيتعين عليه إرجاع النتائج إلى تطبيقك كاستجابة مُهيكلة. بالمقابل، يوفر Jev فقط تلك القرارات المحدودة. ثم يقرر تطبيقك الإجراء التالي بناءً على تلك القرارات.

التحول المعماري أهم من النموذج

تُقارن غالبية هذه النقاشات بين النماذج الكبيرة والصغيرة. يقترح Jev حدًا بديلًا. بعض الخطوات تتضمن توليد اللغة. والبعض الآخر أحكام ضيقة يمكن للبرمجيات استهلاكها.

هذا يخلق طبقة قرار في الوكيل. سيقدّر النموذج. سيطبق البرنامج السياسة. إذا تجاوزت الاحتمالية المقدرة عتبة مختبرة وكانت الإجراء منخفض المخاطر وقابلة للعكس، قد يستمر سير العمل. إذا كان هناك عدم يقين في النتائج أو إذا كان الإجراء قد يترتب عليه تبعات خطيرة، يمكن للنظام طلب إشراف بشري. قد يساعد نموذج التفكير في استكشاف عدم اليقين، لكنه لا يحل محل الموافقة البشرية المطلوبة.

الشكل 1. يحافظ مسار القرار المحدود على العتبات والأذونات والتصعيد في الشيفرة.

هناك تشابهات مع توجيه النماذج، لكن هناك فرقًا حاسمًا. RouteLLM يتخذ قرارات حول أي من نموذجين لغويين يتم الاختيار منه. يختار بين نموذج أقوى وآخر أضعف لتحقيق توازن بين الجودة والسعر. ينتج نموذج System One أحكامًا محدودة يمكن للشفرة استخدامها مباشرة. يمكن لهذه الأحكام دعم توجيه النماذج وكذلك قرارات أخرى داخل الوكيل.

لماذا حلقات الوكيل مناسبة بطبيعتها

طبيعة حلقات الوكيل تجعلها مناسبة بشكل خاص لإصدار عدد كبير من الأحكام على مستويات دقيقة جدًا. تساعد هذه الأحكام في الوصول إلى النتيجة النهائية. بمعنى آخر، يتعين على الوكلاء إصدار الكثير من الأحكام \”little\” بعد أن يقدم المستخدم سؤاله أو طلبه. تحدث هذه الأحكام قبل إرجاع الإجابة أو النتيجة.

مثال على ذلك هو تحديد الأدوات التي يجب استخدامها، ترتيب السجلات المسترجعة، وتقييم المخاطر. كما يحدد النظام ما إذا كان هناك دليل كافٍ وما إذا كان يجب استمرار العملية. من المرجح أن يحدث كل ذلك بشكل متكرر. بالإضافة إلى ذلك، يمكن أن تتراكم التأخيرات بين كل حلقة مع مرور الوقت.

يتجسد هذا الدور لحلقات الوكيل في تكامل Jev من LangChain حيث يمكن لـ Jev تنفيذ كل من توجيه النماذج وفحوصات استدعاء الأدوات. بينما يدمج Jev حول حواف النموذج التوليدي، يواصل النموذج التوليدي نفسه التخطيط وتوليد المحتوى. يمثل هذا حالة استخدام أكثر واقعية لـ Jev. فهو يكمل نموذج لغة عام الغرض بدلاً من استبداله.

بالإضافة إلى ذلك، فإن موازاة الأسئلة تغير أيضًا الطريقة التي تفكر بها الفرق في تفكيك المهام. على وجه التحديد، يمكن للفرق تقسيم تعليمات غامضة واحدة إلى عدة أسئلة تقييم منفصلة. قد يؤدي ذلك إلى تسلسل أقصر بكثير من استدعاءات النموذج. يمكنه إنشاء سير عمل أسهل كثيرًا في التقييم. كما يسمح للمطورين باستخدام منطق أعمال صريح لدمج الأحكام الناتجة.

قد تتمكن نماذج اللغة العامة من إنتاج مخرجات منظمة وقد تكون الخيار الأفضل في بعض الحالات. على سبيل المثال، قد يلزم تقديم قرار وتفسير معًا. لذلك، يجب على Jev أن تُظهر أكثر من مجرد توافق مع المخطط لتُعتبر فعّالة.

تعتمد فعالية Jev على تحقيق تخفيضات في زمن استجابة النظام الكلي. كما تعتمد على إنتاج تقديرات احتمالية مفيدة وإظهار استقرار في الأداء عبر مدخلات متغيرة. إذا فشلت Jev في تقديم هذه الفوائد، فإن اختيار نموذج آخر سيضيف فقط عبئًا إضافيًا من التطوير والتشغيل.

هل Typed يعني صحة؟

يجب صياغة اللغة المستخدمة عند تقديم ادعاءات حول Jev بعناية أيضًا. نظرًا لأن مساحة المخرجات تُحدَّد مسبقًا، لا ينبغي للنموذج إرجاع حقل مُختلق أو فقرة غير قابلة للتحليل. هذا يُزيل أحد أشكال الفشل؛ لكنه لا يُزيل الخطأ الدلالي. لا شيء يمنع نظامًا من إرجاع قسم غير صحيح، أو تعيين مستوى خطر غير صحيح، أو التصريح بثقة مفرطة. يمكنه القيام بكل ذلك مع الحفاظ على الأمان النوعي الكامل.

الوثائق الخاصة بـ TypeSafe توثيق System One يوضح تمييزًا مهمًا. يتم قياس المعايرة عبر مجموعات من التنبؤات؛ ولا تضمن صحة تنبؤ فردي. في بيئة الإنتاج، لهذا تداعيات. تحتاج الفرق إلى اختبار ما إذا كانت الاحتمالات المتوقعة تتطابق مع النتائج الفعلية على بياناتهم الخاصة.

الأدلة على الأداء لا تزال مبكرة

تقارير TypeSafe أوقات استجابة تتراوح بين 70 إلى 500 مللي ثانية. كما يشير إلى توفير كبير في التكاليف وتحسينات في السرعة في تقييماته الداخلية لسير العمل. بالإضافة إلى ذلك، تشير TypeSafe إلى أن تلك المكاسب الرئيسية من المحتمل أن تكون قرب الحد الأعلى للمكاسب في العالم الحقيقي. TypeSafe’s اختبار سير العمل المتاح للجمهور يستخدم احتمالات مرجعية مقدمة من نماذج حدودية أخرى بدلاً من التسميات الحقيقية. النتائج جيدة لتكوين الفرضيات. لا يمكن للنتائج أن تحل محل اختبار مستقل ضد عبء عمل حقيقي.

اختبار عملي قبل الاعتماد

عند بناء أول سير عمل للقرارات مدعوم بالذكاء الاصطناعي، لا تختَر أكثر القرارات حرجًا (على سبيل المثال، الموافقات الطبية أو إيقاف الحسابات). بدلاً من ذلك، اختر شيئًا شائعًا جدًا، قابلًا للعكس، وسهل المراجعة من قبل أفراد آخرين في الفريق. وهذا يشمل، ولكن ليس محصورًا، توجيه التذاكر، تصنيف المستندات، اختيار النماذج، وضمان الجودة منخفض المخاطر.

أربع أسئلة ستساعدك على الحكم ما إذا كان هذا سينجح:

  • هل للمخرجات عدد محدود من الإجابات الممكنة؟
  • هل يمكنك توضيح معايير الحكم بوضوح؟
  • هل هناك نتائج قابلة للقياس؟تتبع التنبؤ، واحتماليته، والإجراء، والنتائج اللاحقة. تحقق من المعايرة بانتظام بمقارنة الاحتمالات المتوقعة مع النتائج الفعلية.
  • هل لديك خطة بديلة في حال فشل عملية اتخاذ القرار الآلية؟حدد نقطة محددة لاستخدام نموذج التفكير، أو طلب مزيد من المعلومات، أو إشراك إنسان.

يجب أن تشمل تحليلاتك سير العمل بالكامل، بما في ذلك عملية اتخاذ القرار. استخدم مقاييس مثل دقة القرار، معدلات الامتناع أو التصعيد، إجمالي زمن المعالجة من الطرف إلى الطرف، التكلفة لكل مهمة مكتملة بنجاح، وتأثير الأخطاء. أجرِ اختبارات تحت ظروف سلبية: تنوع استخدام الكلمات، حذف البيانات ذات الصلة، الفئات النادرة، والمدخلات العدائية. المصنف المُحسّن الذي يولد تكاليف إضافية في المراحل اللاحقة ليس تحسينًا.

العبرة طويلة الأمد هنا

إذا نجح Jev، أو تغير بشكل كبير، أو تم استبداله بسرعة، يبقى شيء واحد ثابتًا. يبقى السؤال المعماري قائمًا. هل من الضروري أن تُصاغ كل قرار قائم على الآلة كلغة مُولدة؟

في كثير من الحالات، الجواب هو “لا”. في بيئة الإنتاج، يمكن للنظام الذي يستخدم نماذج توليدية أن يولد تفسيرات وخطط وشروحات. باستخدام نماذج قرار محدودة، يمكن للنظام نفسه أن يوجه، ويُقيم، ويُقفل. يمكن للكود أن يواصل تحديد قيم العتبة المقبولة والأذونات. يجب أن يظل البشر مسؤولين عن القرارات التي تؤثر على حياة الآخرين.

بينما يمثل هذا منظورًا أقل دراماتيكية من وجود نموذج مستقل واحد يؤدي جميع المهام بثقة، فإنه يعكس كيفية إنشاء الأنظمة الموثوقة. قد يعتمد التقدم التالي في أداء الوكلاء على اختيار تلك المناطق في النظام التي تستغرق التفكير فيها وقتًا أطول. تحتاج مناطق أخرى إلى قرارات سريعة، وبعضها لا يتطلب أي إجراء على الإطلاق.

هيمانشو جول هو باحث في مجال الذكاء الاصطناعي والتعلم الآلي يتخصص في توليد محسن بالاسترجاع لمجالات عالية المخاطر، بما في ذلك سير عمل الوثائق البيولوجية وال金融ية والتنظيمية.