نماذج ومنصات الذكاء الاصطناعي
كيف يتم تعزيز معالجة اللغة من خلال نموذج BERT المفتوح المصدر من جوجل
تمثل التمثيلات ثنائية الاتجاه من المحولات ، والمعروفة باسم BERT ، نموذجًا للتدريب الذي حسّن بشكل كبير من كفاءة وفعالية نماذج معالجة اللغة الطبيعية. الآن بعد أن جعلت جوجل نماذج BERT مفتوحة المصدر ، يسمح ذلك بتحسين نماذج معالجة اللغة الطبيعية عبر جميع الصناعات. في هذه المقالة ، نلقي نظرة على كيفية جعل BERT من معالجة اللغة الطبيعية واحدة من أكثر الحلول الذكية والأكثر فائدة في عالم اليوم.
تطبيق نماذج BERT على البحث
يتمتع محرك البحث من جوجل بسمعة طيبة لتقديم محتوى ذي صلة ، وقد جعلوا هذا البرنامج لمعالجة اللغة الطبيعية مفتوح المصدر للعالم.
تصبح قدرة النظام على قراءة وتفسير اللغة الطبيعية أكثر وأكثر أهمية مع زيادة العالم بشكل指数 لبيانات جديدة. مكتبة جوجل لمعاني الكلمات والعبارات وقدرتها على تقديم محتوى ذي صلة مفتوحة المصدر. بخلاف معالجة اللغة الطبيعية ، فإن نموذج BERT لديه القدرة على استخراج المعلومات من كميات كبيرة من البيانات غير المنظمة ويمكن تطبيقه لإنشاء واجهات بحث ل أي مكتبة. في هذه المقالة ، سنرى كيف يمكن تطبيق هذه التكنولوجيا في قطاع الطاقة.
BERT (التمثيلات ثنائية الاتجاه من المحولات) هو نهج للتدريب المسبق提出了 من قبل مجموعة جوجل للغة الذكاء الاصطناعي ، تم تطويره لتحقيق ISSUE الشائعة لنماذج معالجة اللغة الطبيعية المبكرة: نقص البيانات المُدرَّبة الكافية.
دعونا نُفصِّل ، دون الخوض في التفاصيل الزائدة:
تدريب النماذج
تتطلب مهام معالجة اللغة الطبيعية منخفضة المستوى (مثل تحديد الكيانات المسمى ، وتقسيم الموضوع) وعالية المستوى (مثل تحليل المشاعر ، والتعرف على الكلام) مجموعات بيانات مُدرَّبة مخصصة للمهمة. بينما يصعب الحصول عليها وغالبًا ما تكون باهظة التكلفة ، تلعب مجموعات البيانات المُدرَّبة دورًا حاسمًا في أداء نماذج الشبكات العصبية الضحلة والعميقة. يمكن تحقيق نتائج الاستدلال الجيدة فقط عند توفر ملايين أو حتى مليارات من الأمثلة المُدرَّبة. وكان ذلك مشكلة جعلت العديد من مهام معالجة اللغة الطبيعية غير قابلة للوصول. حتى تم تطوير BERT.
BERT هو نموذج تمثيل اللغة العام ، يتم تدريبه على مجموعات كبيرة من النص غير المُدرَّب. عندما يتم تعرض النموذج إلى كميات كبيرة من المحتوى النصي ، يتعلم لفهم السياق والعلاقات بين الكلمات في الجملة. على عكس نماذج التعلم السابقة التي تمثلت فقط بالمعنى على مستوى الكلمة (سيعني “البنك” نفس الشيء في “حساب بنكي” و “ضفة نهرية”) ، يهتم BERT بالسياق. أي ، ما يأتي قبل وبعد الكلمة في الجملة. أصبح السياق قدرة مفقودة رئيسية لنماذج معالجة اللغة الطبيعية ، مع تأثير مباشر على أداء النموذج. يُعرف تصميم نموذج يهتم بالسياق مثل BERT بافتتاح عصر جديد في معالجة اللغة الطبيعية.
تدريب BERT على كميات كبيرة من المحتوى النصي هو تقنية تعرف باسم التدريب المسبق. هذا يعني أن أوزان النموذج يتم تعديلها لمهام فهم النص العام ، ويمكن بناء نماذج أكثر دقة على أساسها. أثبت المؤلفون تفوق هذه التقنية عندما استخدموا نماذج dựa على BERT في 11 مهمة لمعالجة اللغة الطبيعية وحققت نتائج على مستوى الدولة.
النماذج المُدرَّبة مسبقًا
الأفضل من ذلك كله هو: النماذج المُدرَّبة مسبقًا من BERT مفتوحة المصدر ومتاحة للجمهور. هذا يعني أن أي شخص يمكنه التعامل مع مهام معالجة اللغة الطبيعية وبناء نماذج على أساس BERT. لا شيء يمكن أن يفوق ذلك ، أليس كذلك؟ انتظر ، هذا يعني أيضًا أن نماذج معالجة اللغة الطبيعية يمكن الآن تدريبها (تحسينها) على مجموعات بيانات أصغر ، دون الحاجة إلى التدريب من الصفر. بداية عصر جديد ، في الواقع.
تساعد هذه النماذج المُدرَّبة مسبقًا الشركات على خفض التكاليف ووقت النشر لنماذج معالجة اللغة الطبيعية للاستخدام الداخلي أو الخارجي. يؤكد فعالية نماذج معالجة اللغة الطبيعية المُدرَّبة جيدًا من قبل مايكل أليكسيس ، الرئيس التنفيذي لشركة teambuilding.com ، التي تقوم ببناء ثقافة الفريق الافتراضي.
“أعلىประโยชน من معالجة اللغة الطبيعية هو الاستدلال والобработة القابلة للتوسيع والموحدة للمعلومات.” – مايكل أليكسيس ، الرئيس التنفيذي لشركة teambuilding.com
يذكر مايكل كيف يمكن تطبيق معالجة اللغة الطبيعية على برامج تعزيز الثقافة مثل كسر الجليد أو الاستبيانات. يمكن للشركة الحصول على رؤى قيمة حول كيفية سير ثقافة الشركة من خلال تحليل استجابات الموظفين. يتم تحقيق ذلك ليس فقط من خلال تحليل النص ولكن أيضًا من خلال تحليل التعليقات. في الأساس ، “يقرأ” النموذج أيضًا “بين السطور” لاستخلاص استنتاجات حول العواطف والشعور والتوجه العام. يمكن أن يساعد BERT في مثل هذه الحالات من خلال إعداد النماذج مسبقًا مع مجموعة من المؤشرات التي يمكنها الكشف عن دقة اللغة وتقديم رؤى أكثر دقة.
تحسين الاستفسارات
أصبحت قدرة النموذج على نمذجة السياق تحول BERT إلى بطل لمعالجة اللغة الطبيعية وثورة في بحث جوجل نفسه. فيما يلي اقتباس من فريق منتج بحث جوجل وتجارب الاختبار أثناء تعديل BERT لفهم نوايا الاستفسار.
“هنا بعض الأمثلة التي تُظهر khả năng BERT لفهم نوايا الاستفسار. هنا استفسار عن “2019 brazil traveler to USA needs a visa.” الكلمة “to” وعلاقتها بالكلمات الأخرى في الاستفسار مهمة جدًا لفهم المعنى. إنه حول برازيلي يسافر إلى الولايات المتحدة وليس العكس. في السابق ، لم يكن خوارزمياتنا تفهم أهمية هذه العلاقة ، وترجمت نتائج حول مواطني الولايات المتحدة الذين يسافرون إلى البرازيل. مع BERT ، يمكن للبحث فهم هذه الدقة ويعرف أن الكلمة الشائعة “to” تهمنا كثيرًا هنا ، ويمكننا تقديم نتائج أكثر صلة للاستفسار هذا.– فهم الاستفسارات بشكل أفضل من أي وقت مضى، بواسطة Pandu Nayak ، زميل جوجل ونائب الرئيس للبحث.

BERT search example, before and after. Source blog
في مقالنا السابق عن معالجة اللغة الطبيعية و OCR، قدمنا بعض استخدامات معالجة اللغة الطبيعية في قطاع العقارات. لقد ذكرنا أيضًا كيف أن “أدوات معالجة اللغة الطبيعية هي أدوات استخراج معلومات مثالية”. دعونا ننظر إلى قطاع الطاقة ونتعلم كيف تكنولوجيا معالجة اللغة الطبيعية مثل BERT تمكن تطبيقات جديدة.
يمكن لنماذج معالجة اللغة الطبيعية استخراج المعلومات من كميات كبيرة من البيانات غير المنظمة
يمكن استخدام نماذج معالجة اللغة الطبيعية بطريقة واحدة لاستخراج المعلومات الحيوية من بيانات النص غير المنظمة. البريد الإلكتروني والدوريات والمذكرات والسجلات والتقارير هي جميعها أمثلة على مصادر بيانات النص التي تُستخدم في عمليات الشركات اليومية. قد تثبت بعض هذه الوثائق أنها حاسمة في الجهود التنظيمية لزيادة الكفاءة التشغيلية وتقليل التكاليف.
عندما نهدف إلى تنفيذ صيانة طارئة للتوربينات الرياحية، تقارير الفشل قد تحتوي على معلومات حيوية حول سلوك المكونات المختلفة. ولكن نظرًا لأن مصنعي التوربينات الرياحية المختلفين لديهم معايير مختلفة لجمع البيانات (أي أن تقارير الصيانة تأتي في تنسيقات ولغات مختلفة) ، يمكن أن يصبح تحديد العناصر البيانية ذات الصلة يدويًا باهظ التكلفة بالنسبة لمالك المحطة. يمكن لأدوات معالجة اللغة الطبيعية استخراج المفاهيم والسمات والأحداث ذات الصلة من المحتوى غير المنظم. ثم يمكن استخدام تحليل النص لتحديد العلاقات والأنماط في مصادر البيانات المختلفة. هذا يعطي أصحاب المحطات فرصة لتنفيذ الصيانة الوقائية بناءً على المقاييس الكمية المحددة في تقارير الفشل.
يمكن لنماذج معالجة اللغة الطبيعية تقديم واجهات بحث باللغة الطبيعية
على نحو مماثل ، يحتاج علماء الجيولوجيا العاملون في شركات النفط والغاز إلى مراجعة العديد من الوثائق المتعلقة بعمليات الحفر السابقة وسجلات الآبار والبيانات الزلزالية. نظرًا لأن هذه الوثائق تأتي أيضًا في تنسيقات متعددة وموزعة على العديد من المواقع (كلاً من المواقع المادية والرقمية) ، يبذرون الكثير من الوقت في البحث عن المعلومات في المكان الخطأ. يمكن أن تكون حلاً في مثل هذه الحالة واجهة بحث مدعومة بمعالجة اللغة الطبيعية ، والتي تسمح للمستخدمين بالبحث عن البيانات باللغة الطبيعية. ثم يمكن لنموذج معالجة اللغة الطبيعية ربط البيانات عبر مئات الوثائق وإرجاع مجموعة من الإجابات على الاستفسار. يمكن للموظفين بعد ذلك التحقق من الإخراج بناءً على معرفتهم الخبيرة ، وسي cải thiện النموذج.
然而 ، هناك أيضًا اعتبارات تقنية لتنفيذ مثل هذه النماذج. أحد الجوانب سيكون أن المصطلحات التقنية المحددة للصناعة يمكن أن ت混ك النماذج التقليدية التي لا تمتلك الفهم الدلالي المناسب. ثانيًا ، قد تتأثر أداء النماذج بحجم مجموعة البيانات المُدرَّبة. هذا هو عندما يمكن أن تثبت النماذج المُدرَّبة مسبقًا مثل BERT أنها مفيدة. يمكن للتمثيلات السياقية نمذجة معنى الكلمة المناسب وإزالة أي ارتباك يسببه المصطلحات التقنية المحددة للصناعة. من خلال استخدام النماذج المُدرَّبة مسبقًا ، يمكن تدريب الشبكة على مجموعات بيانات أصغر. هذا يوفر الوقت والطاقة والموارد التي كانت لازمة لتدريبها من الصفر.
ماذا عن عملك الخاص؟
هل يمكنك التفكير في مهام معالجة اللغة الطبيعية التي قد تساعدك على تقليل التكاليف وزيادة الكفاءة التشغيلية؟
فريق علوم البيانات في Blue Orange Digital سعيد بتweak BERT لمصلحتك أيضًا!










