قادة الفكر
إعداد البيانات البشرية للمachine Learning يتطلب الكثير من الموارد: هذه هي الطرقتان الحاسمتان لتخفيض التكاليف

بواسطة: Dattaraj Rao، رئيس علماء البيانات، Persistent Systems
كما هو الحال مع أي نظام يعتمد على مدخلات البيانات، فإن Machine Learning (ML) خاضع للمبدأ التوجيهي “القمامة داخل-القمامة خارج”. البيانات النظيفة والمدقة بشكل دقيق هي الأساس لبناء أي نموذج ML. يفهم خوارزمية تدريب ML الأنماط من البيانات الأساسية ويتعلم من هناك طرقًا للاستفادة من البيانات غير المرئية. إذا كانت جودة بيانات التدريب منخفضة، فسيصعب على خوارزمية ML التعلم المستمر والاستفادة.
فكر في الأمر من حيث تدريب كلب. إذا فشلت في تدريب الكلب بشكل صحيح مع أوامر السلوك الأساسية (المدخلات) أو فعلت ذلك بشكل غير دقيق، فلا يمكنك توقع أن الكلب يتعلم ويتوسع من خلال الملاحظة إلى سلوكيات إيجابية أكثر تعقيدًا لأن المدخلات الأساسية كانت غائبة أو معيبة في البداية. التدريب المناسب يتطلب وقتًا وتكلفة، حتى لو أتيت بخبير، لكن المكافأة كبيرة إذا قمت بذلك بشكل صحيح من البداية.
عندما يتم تدريب نموذج ML، يتطلب إنشاء بيانات جيدة أن يقضي خبير المجال وقتًا في تحديد بيانات. قد يتضمن ذلك تحديد نافذة تحتوي على الكائن المطلوب في صورة أو تعيين علامة إلى إدخال نص أو سجل قاعدة بيانات. خاصة لبيانات غير منظمات مثل الصور والفيديوهات والنص، تلعب جودة التعليق دورًا رئيسيًا في تحديد جودة النموذج. عادة ما تكون البيانات غير المعلنة مثل الصور النصية والصور موجودة بكميات كبيرة – ولكن التسمية هي حيث يحتاج الجهد إلى تحسين. هذا هو جزء الإنسان في حلقة حياة ML و通常 يكون الجزء الأكثر تكلفة وتطلبًا للعمل في أي مشروع ML.
أدوات تعليق البيانات مثل Prodigy وAmazon Sagemaker Ground Truth وNVIDIA RAPIDS وDataRobot human-in-the-loop تحسنت باستمرار في الجودة وتوفر واجهات سهلة الاستخدام لخبراء المجال. ومع ذلك، لا يزال تقليل الوقت الذي يقضيه خبراء المجال في تحديد البيانات هو تحدي كبير للمؤسسات اليوم – خاصة في بيئة حيث مواهب العلوم المتخصصة محدودة ولكنها مطلوبة بشدة. هنا تأتي الطرقتان الجديدة لتحضير البيانات.
التعلم النشط
التعلم النشط هو طريقة حيث يطلب نموذج ML من خبير المجال تعليقات محددة. هنا، التركيز ليس على الحصول على تعليق كامل على البيانات غير المعلنة، ولكن فقط الحصول على النقاط البيانية المعلنة بحيث يمكن للنموذج التعلم بشكل أفضل. khtr، على سبيل المثال، شركة تشخيصية متخصصة في الكشف المبكر عن السرطان لمساعدة الأطباء على اتخاذ قرارات مدروسة حول رعاية المرضى. كجزء من عملية التشخيص، يحتاجون إلى تعليق صور الأشعة المقطعية التي تحتوي على أورام يجب تسليط الضوء عليها.
بعد أن يتعلم نموذج ML من بعض الصور التي تحتوي على كتل أورام محددة، يطلب نموذج ML النشط من المستخدمين تعليق الصور التي لا يexist بها أورام. هذه هي النقاط الحدودية، والتي عند تعليقها، ستزيد من ثقة النموذج. حيث يكون النموذج واثقًا فوق عتبة معينة، سيقوم بالتعليق الذاتي بدلاً من طلب المستخدم تعليق. هذا هو كيف يحاول التعلم النشط بناء نماذج دقيقة أثناء تقليل الوقت والجهد المطلوب لتحديد البيانات. يمكن أن تساعد الإطارات مثل modAL في زيادة أداء التصنيف عن طريق استجواب خبراء المجال لتعليم الأمثلة الأكثر إفادة.
الإشراف الضعيف
الإشراف الضعيف هو نهج حيث يمكن استخدام البيانات الصاخبة وغير الدقيقة أو المفاهيم المجردة لتوفير إشارات لتعليم كمية كبيرة من البيانات غير الخاضعة للإشراف. يعتمد هذا النهج عادة على علامات ضعيفة ويحاول دمجها في نهج مجموعة لإنشاء بيانات معلنة جيدة. الجهد هو محاولة دمج معرفة المجال في نشاط التسمية الآلي.
على سبيل المثال، إذا احتاج مزود خدمة إنترنت إلى نظام لتحديد مجموعات البريد الإلكتروني على أنها بريد عشوائي أو غير عشوائي، يمكننا كتابة قواعد ضعيفة مثل التحقق من العبارات مثل “عرض”، “تهنئة”، “مجانًا”، إلخ، والتي غالبًا ما ترتبط بالبريد العشوائي. يمكن أن تكون القواعد الأخرى بريدًا من أنماط محددة من عناوين المصدر التي يمكن البحث عنها باستخدام التعبيرات العادية. يمكن بعد ذلك دمج هذه الوظائف الضعيفة بواسطة إطار إشراف ضعيف مثل Snorkel وSkweak لإنشاء بيانات تدريب جيدة.
ML في جوهره هو مساعدة الشركات على تحقيق التوسع الأسي في طرق غير ممكنة ماديًا بشكل يدوي. ومع ذلك، ML ليس سحرًا ولا يزال يعتمد على البشر لتنفيذ النماذج بشكل صحيح من البداية وتدخلها عند الحاجة لضمان عدم انحراف النموذج إلى حد أن النتائج لم تعد مفيدة وقد تكون سلبية.
الهدف هو العثور على طرق تساعد في تسهيل وتأتمتة أجزاء من المشاركة البشرية لزيادة وقت السوق والنتائج ولكن مع الحفاظ على دقة مثالية. من المقبول عالميًا أن الحصول على بيانات معلنة جيدة هو الجزء الأكثر تكلفة ولكن الأكثر أهمية في مشروع ML. هذا هو مجال متطور، وهناك الكثير من الجهود المبذولة لتقليل الوقت الذي يقضيه خبراء المجال وتحسين جودة تعليقات البيانات. استكشاف واستخدام التعلم النشط والإشراف الضعيف هو استراتيجية صلبة لتحقيق ذلك عبر مختلف الصناعات والحالات.












