نماذج ومنصات الذكاء الاصطناعي

LightAutoML: حل AutoML للمؤسسات المالية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

على الرغم من أن AutoML أصبحت شائعة قبل بضع سنوات، إلا أن الأعمال المبكرة على AutoML تعود إلى بداية التسعينيات عندما نشر العلماء أول الأوراق البحثية حول تحسين المعاملات. وفي عام 2014، عندما نظمت ICML أول ورشة عمل حول AutoML، حصلت AutoML على انتباه مطورو ML. أحد الجوانب الرئيسية لAutoML على مر السنين هو مشكلة البحث عن المعاملات، حيث يطبق النموذج مجموعة من أساليب التحسين لتحديد أفضل المعاملات التي تؤدي الأداء في مساحة كبيرة من المعاملات لمحدد نموذج تعلم الآلة. طريقة أخرى شائعة تطبقها نماذج AutoML هي تقدير احتمال أن تكون معاملة معينة هي المعاملة المثلى لنموذج تعلم الآلة معين. يتحقق النموذج من ذلك من خلال تطبيق أساليب بايزية تقليدية تستخدم بيانات تاريخية من نماذج محسوبة مسبقًا، وعوضات أخرى. بالإضافة إلى تحسين المعاملات، تحاول أساليب أخرى اختيار أفضل النماذج من مجموعة من بديلات النمذجة.

في هذه المقالة، سنغطي LightAutoML، نظام AutoML تم تطويره في الأساس لمؤسسة أوروبية تعمل في قطاع التمويل إلى جانب نظامها البيئي. يتم تطبيق إطار LightAutoML عبر تطبيقات متعددة، وأظهرت النتائج أداءً متفوقًا، يمكن مقارنته بمستوى علماء البيانات، حتى عند بناء نماذج تعلم الآلة عالية الجودة. يحاول إطار LightAutoML تقديم المساهمات التالية. أولاً، تم تطوير إطار LightAutoML في الأساس لنظام بيئي لمؤسسة مالية وبنكية أوروبية كبيرة. بفضل إطاره وهندسته المعمارية، يمكن لإطار LightAutoML أن يتفوق على إطارات AutoML الرائدة عبر عدة معايير مفتوحة بالإضافة إلى تطبيقات النظام البيئي. كما يتم مقارنة أداء إطار LightAutoML بنماذج يتم تعديلها يدويًا من قبل علماء البيانات، ويشير النتائج إلى أداء أقوى لإطار LightAutoML.

تهدف هذه المقالة إلى تغطية إطار LightAutoML بعمق، ونتناول آلياته و منهجيته وهندسته المعمارية إلى جانب مقارنته مع الإطارات الرائدة. لذا دعونا نبدأ.

LightAutoML: إطار AutoML للمؤسسات المالية

على الرغم من أن الباحثين بدأوا العمل على AutoML في منتصف وبداية التسعينيات، إلا أن AutoML حصلت على حصة كبيرة من الانتباه في السنوات القليلة الماضية، مع بعض الحلول الصناعية البارزة التي تطبق نماذج تعلم الآلة التي يتم بناؤها تلقائيًا، مثل AutoGluon من Amazon (AMZN ) ، وDarwinAI، وH20.ai، وIBM Watson AI، وMicrosoft AzureML، وغيرها. تطبق معظم هذه الإطارات حل AutoML عام الغرض يطور نماذج ML تلقائيًا عبر فئات تطبيقات مختلفة في القطاعات المالية والرعاية الصحية والتعليم وغيرها. افتراض أساسي وراء هذا النهج العام الأفقي هو أن عملية تطوير النماذج التلقائية لا تختلف عبر جميع التطبيقات. ومع ذلك، يطبق إطار LightAutoML نهجًا رأسيًا لتطوير حل AutoML لا يعتبر عامًا، بل يخدم احتياجات تطبيقات فردية، في هذه الحالة مؤسسة مالية كبيرة. إطار LightAutoML هو حل AutoML رأسي يركز على احتياجات نظام بيئي معقد إلى جانب سماتها. أولاً، يوفر إطار LightAutoML بحثًا سريعًا ومتقاربًا للمعاملات. على الرغم من أن النموذج لا يتحكم مباشرةً في هذه المعاملات، إلا أنه يحقق نتائج مرضية. بالإضافة إلى ذلك، يحافظ النموذج على توازن بين السرعة وتحسين المعاملات ديناميكيًا، لضمان أن يكون النموذج مثاليًا في مشاكل صغيرة، وسريعًا بما يكفي في مشاكل أكبر.

LightAutoML: المنهجية والهندسة المعمارية

يتكون إطار LightAutoML من وحدات تسمى Presets مخصصة لتطوير النماذج من النهاية إلى النهاية لمهام تعلم الآلة التقليدية. حاليًا، يدعم إطار LightAutoML وحدات Preset. أولاً، يركز Preset TabularAutoML على حل مشاكل تعلم الآلة الكلاسيكية المحددة على مجموعات بيانات جدولية. ثانيًا، يطبق Preset White-Box خوارزميات بسيطة واضحة مثل الانحدار اللوجستي بدلاً من ترميز WoE أو وزن الأدلة وتجزئة الميزات لتحليل المهام الثنائية على بيانات جدولية. تطبيق خوارزميات بسيطة واضحة هو ممارسة شائعة لنمذجة احتمال التطبيق بسبب قيود التفسير التي تفرضها عوامل مختلفة. ثالثًا، يمكن لـ Preset NLP دمج البيانات الجدولية مع أدوات معالجة اللغة الطبيعية، بما في ذلك نماذج تعلم الآلة العميقة المسبقة التدريب ومستخلصات الميزات المحددة. أخيرًا، يعمل Preset CV مع بيانات الصور بمساعدة بعض الأدوات الأساسية. من المهم ملاحظة أن إطار LightAutoML يدعم جميع وحدات Preset الأربعة، ولكنه يستخدم فقط Preset TabularAutoML في النظام الإنتاجي.

الخط التوجيهي النموذجي لإطار LightAutoML مدرج في الصورة التالية.

يتكون كل خط توجيهي من ثلاثة مكونات. أولاً، القارئ، وهو كائن يتلقى نوع المهمة وبيانات خام كمدخلات، ويؤدي حسابات ميتا بيانات حاسمة، وينظف البيانات الأولية، ويتعرف على مанипulations البيانات التي يجب أداؤها قبل تطبيق نماذج مختلفة. بعد ذلك، تحتوي مجموعات بيانات LightAutoML الداخلية على معادلات CV وميتا بيانات التي تطبق مخططات التحقق من صحة للبيانات. المكون الثالث هو خطوط تعلم الآلة المتعددة المتراكبة و/أو المخلوطة للحصول على تنبؤ واحد. يمكن أن تحتوي خط تعلم الآلة داخل هندسة إطار LightAutoML على خطوات اختيار الميزات، وخطوة هندسة الميزات، أو قد تكون فارغة إذا لم تكن هناك حاجة إلى المعالجة المسبقة.

LightAutoML Tabular Preset

داخل إطار LightAutoML، TabularAutoML هو الخط التوجيهي الافتراضي، ويتم تطبيقه في النموذج لحل ثلاثة أنواع من المهام على بيانات جدولية: التصنيف الثنائي، والانحدار، والتصنيف المتعدد للعديد من مقاييس الأداء ووظائف الخسارة. يتم تغذية جدول به أربعة أعمدة – الميزات التصنيفية، والميزات الرقمية، والتنقاط الزمنية، وعمود هدف واحد مع تسميات فئوية أو قيم متواصلة – إلى مكون TabularAutoML كمدخلات. كان أحد الأهداف الرئيسية وراء تصميم إطار LightAutoML هو تصميم أداة لاختبار الفرضيات السريع، وهو السبب في أن الإطار يتجنب استخدام الأساليب القسرية لتحسين الخط التوجيهي، ويركز فقط على تقنيات الكفاءة والنماذج التي تعمل عبر مجموعة واسعة من مجموعات البيانات.

التصنيف التلقائي للميزات والمعالجة المسبقة

لمعالجة أنواع الميزات المختلفة بطرق مختلفة، يحتاج النموذج إلى معرفة نوع كل ميزة. في حالة وجود مهمة واحدة مع مجموعة بيانات صغيرة، يمكن للمستخدم تحديد نوع كل ميزة يدويًا. ومع ذلك، لا يعد تحديد نوع كل ميزة يدويًا خيارًا قابلًا للتطبيق في الحالات التي تشمل مئات المهام مع مجموعات بيانات تحتوي على آلاف الميزات. بالنسبة إلى Preset TabularAutoML، يحتاج إطار LightAutoML إلى تعيين الميزات إلى ثلاثة فئات: رقمية، تصنيفية، وتاريخية. واحدة من الحلول البسيطة والواضحة هي استخدام أنواع بيانات مصفوفة العمود كأنواع ميزة فعلية، أي تعيين أعمدة العدد الصحيح/الfloating point إلى ميزات رقمية، وتاريخ أو سلسلة يمكن تحويلها إلى تاريخ – إلى تاريخ، والباقي إلى تصنيفي. ومع ذلك، هذه التعيينات ليست الأفضل بسبب حدوث أنواع البيانات الرقمية بشكل متكرر في أعمدة تصنيفية.

مخططات التحقق من الصحة

مخططات التحقق من الصحة هي مكون حيوي من إطارات AutoML، منذ أن تكون البيانات في الصناعة عرضة للتغيير مع مرور الوقت، مما يجعل افتراضات IID أو التوزيعات المستقلة المتطابقة غير صالحة عند تطوير النموذج. تطبق نماذج AutoML مخططات التحقق من الصحة لتقدير أدائها، و البحث عن المعاملات، وتوليد التنبؤات الخارجية. يطبق خط توجيهي TabularAutoML ثلاثة مخططات تحقق من الصحة:

  • التحقق من الصحة عبر التجزئة KFold: التحقق من الصحة عبر التجزئة KFold هو مخطط التحقق من الصحة الافتراضي لخط توجيهي TabularAutoML، بما في ذلك GroupKFold لنمذجة السلوك، والتجزئة KFold المنظمة لل مهام التصنيف.
  • التحقق من الصحة الحفاظي: يتم تطبيق مخطط التحقق من الصحة الحفاظي إذا تم تحديد مجموعة الحفاظ.
  • مخططات التحقق من الصحة المخصصة: يمكن للمستخدمين إنشاء مخططات تحقق من الصحة مخصصة وفقًا لمتطلباتهم الفردية. تشمل مخططات التحقق من الصحة المخصصة مخططات التحقق من الصحة عبر التجزئة، ومخططات التجزئة الزمنية.

اختيار الميزات

على الرغم من أن اختيار الميزات هو جانب حاسم لتطوير النماذج وفقًا للمعايير الصناعية، حيث يسهل ذلك من تقليل تكاليف التنفيذ والتنفيذ للنموذج، إلا أن معظم حلول AutoML لا تركز كثيرًا على هذه المشكلة. على العكس من ذلك، يطبق خط توجيهي TabularAutoML ثلاثة استراتيجيات لاختيار الميزات: لا يوجد اختيار، واختيار القطع على основе الأهمية، واختيار الأمام على أساس الأهمية. من بين الثلاثة، استراتيجية اختيار القطع على أساس الأهمية هي الإعداد الافتراضي. بالإضافة إلى ذلك، هناك طريقتان أساسيتان لتقدير أهمية الميزة: أهمية شجرة التجزئة، وأهمية التبديل لنموذج GBM أو شجرة اتخاذ القرارات المُحسّنة.

ت比较 الصورة السابقة استراتيجيات اختيار مختلفة على مجموعات بيانات بنكية ثنائية.

ضبط المعاملات

يطبق خط توجيهي TabularAutoML أساليب مختلفة لضبط المعاملات بناءً على ما يتم ضبطه.

  • ضبط المعاملات بالتوقف المبكر: يحدد عدد التكرارات لجميع النماذج خلال مرحلة التدريب.
  • ضبط المعاملات بنظام الخبراء: هو طريقة بسيطة لضبط المعاملات للنماذج بطريقة مرضية. يمنع النموذج النهائي من انخفاض كبير في الدرجة مقارنة بالنماذج المحددة بدقة.
  • تقدير بارزين شجري: لموديلات GBM أو شجرة اتخاذ القرارات المُحسّنة. يعتبر هذا هو الخيار الافتراضي لخط توجيهي LightAutoML. لكل إطار GBM، يتدرب إطار LightAutoML على نموذجين: الأول يحصل على معاملات خبيرة، والثاني يتم تعديله ليناسب الميزانية الزمنية.
  • بحث الشبكة: يتم تطبيقه في خط توجيهي TabularAutoML لتعديل معاملات التنظيم لنموذج خطي إلى جانب التوقف المبكر والتشغيل الساخن.

يضبط النموذج جميع المعاملات من خلال تحسين دالة المقاييس، سواء كانت محددة من قبل المستخدم أو افتراضية لمهمة محسوبة.

LightAutoML: التجربة والأداء

للتقييم، يتم مقارنة Preset TabularAutoML داخل إطار LightAutoML مع حلول مفتوحة موجودة عبر مهام مختلفة، ويؤكد الأداء المتفوق لإطار LightAutoML. أولاً، يتم إجراء المقارنة على معيار OpenML الذي يتم تقييمه على 35 مجموعة بيانات تصنيف ثنائي وتصنيف متعدد. يلخص الجدول التالي المقارنة بين إطار LightAutoML ونظم AutoML الحالية.

كما هو موضح، يتفوق إطار LightAutoML على جميع أنظمة AutoML الأخرى في 20 مجموعة بيانات داخل المعيار. يحتوي الجدول التالي على مقارنة مفصلة في سياق مجموعة البيانات، مما يشير إلى أن إطار LightAutoML يؤدي أداءً مختلفًا على فئات مهام مختلفة. بالنسبة لمهام التصنيف الثنائي، يفتقر إطار LightAutoML في الأداء، في حين أن إطار LightAutoML يؤدي أداءً متفوقًا في المهام التي تحتوي على كمية كبيرة من البيانات.

ي比较 الجدول التالي أداء إطار LightAutoML مع أنظمة AutoML على 15 مجموعة بيانات بنكية تحتوي على مجموعة من مهام التصنيف الثنائي. كما هو موضح، يتفوق إطار LightAutoML على جميع حلول AutoML في 12 من 15 مجموعة بيانات، بنسبة فوز 80٪.

أفكار نهائية

في هذه المقالة، تحدثنا عن LightAutoML، نظام AutoML تم تطويره في الأساس لمؤسسة أوروبية تعمل في قطاع التمويل إلى جانب نظامها البيئي. يتم تطبيق إطار LightAutoML عبر تطبيقات متعددة، وأظهرت النتائج أداءً متفوقًا، يمكن مقارنته بمستوى علماء البيانات، حتى عند بناء نماذج تعلم الآلة عالية الجودة. يحاول إطار LightAutoML تقديم المساهمات التالية. أولاً، تم تطوير إطار LightAutoML في الأساس لنظام بيئي لمؤسسة مالية وبنكية أوروبية كبيرة. بفضل إطاره وهندسته المعمارية، يمكن لإطار LightAutoML أن يتفوق على إطارات AutoML الرائدة عبر عدة معايير مفتوحة بالإضافة إلى تطبيقات النظام البيئي. كما يتم مقارنة أداء إطار LightAutoML بنماذج يتم تعديلها يدويًا من قبل علماء البيانات، ويشير النتائج إلى أداء أقوى لإطار LightAutoML.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.