نماذج ومنصات الذكاء الاصطناعي
ما هو NLP (معالجة اللغة الطبيعية)؟
معالجة اللغة الطبيعية (NLP) هي دراسة وتطبيق تقنيات وأدوات تمكن الحواسيب من معالجة وتحليل وتفسير والاستدلال عن اللغة البشرية. NLP هو مجال متعدد التخصصات ويجمع بين تقنيات متقدمة في مجالات مثل اللغويات وعلوم الحاسوب. يتم استخدام هذه التقنيات بالاشتراك مع الذكاء الاصطناعي لإنشاء محادثات ومرافقة رقمية مثل مساعد جوجل وأليكسا من أمازون.
دعونا ن dành بعض الوقت لاستكشاف العقلية وراء معالجة اللغة الطبيعية، وبعض التقنيات المستخدمة في NLP، وبعض الحالات الشائعة لاستخدام NLP.
لماذا تهتم معالجة اللغة الطبيعية (NLP)؟
من أجل تفسير اللغة البشرية، يجب تحويلها إلى شكل يمكن للحاسوب معالجته. ومع ذلك، هذا ليس بهذه البساطة، حيث لا يمكن تحويل البيانات النصية إلى أرقام فقط. من أجل استخراج المعنى من اللغة البشرية، يجب استخراج الأنماط من مئات أو آلاف الكلمات التي تتكون منها وثيقة نصية. هذا ليس بالأمر السهل. هناك قواعد صارمة يمكن تطبيقها على تفسير اللغة البشرية. على سبيل المثال، يمكن للكلمات نفسها أن تعني أشياء مختلفة اعتمادًا على السياق. اللغة البشرية معقدة وغالبًا ما تكون غامضة، ويمكن أن يقال البيان بصدق أو سخرية.
على الرغم من ذلك، هناك بعض الإرشادات العامة التي يمكن استخدامها عند تفسير الكلمات والرموز، مثل استخدام حرف “س” لتحديد أن العنصر هو جمع. يجب استخدام هذه الإرشادات العامة معًا لاستخراج المعنى من النص، ولإنشاء ميزات يمكن أن تفهمها خوارزمية التعلم الآلي.
معالجة اللغة الطبيعية تتضمن تطبيق خوارزميات متعددة القدرة على أخذ البيانات غير المنظمة وتحويلها إلى بيانات منظمّة. إذا تم تطبيق هذه الخوارزميات بطريقة خاطئة، فإن الحاسوب غالبًا ما يفشل في استخراج المعنى الصحيح من النص. هذا يمكن أن يظهر في ترجمة النص بين اللغات، حيث يتم فقدان المعنى الدقيق للجملة. بينما تحسنت الترجمة الآلية بشكل كبير خلال السنوات القليلة الماضية، لا تزال الأخطاء في الترجمة الآلية تحدث بشكل متكرر.
تقنيات معالجة اللغة الطبيعية (NLP)

صورة: Tamur عبر WikiMedia Commons، ترخيص المجال العام (https://commons.wikimedia.org/wiki/File:ParseTree.svg)
许多 من التقنيات المستخدمة في معالجة اللغة الطبيعية يمكن وضعها في واحدة من الفئتين: بنية الجملة أو دلالات اللغة. تقنيات بنية الجملة هي تلك التي تتعامل مع ترتيب الكلمات، بينما تقنيات دلالات اللغة هي التقنيات التي تتضمن معنى الكلمات.
تقنيات NLP بنية الجملة
أمثلة على بنية الجملة تشمل:
- الاختزال
- تقسيم الشكل
- تعليم جزء الكلام
- التحليل
- كسر الجملة
- الجذور
- تقسيم الكلمة
الاختزال يعني تقليص الاختلافات المختلفة لشكل الكلمة إلى شكل واحد. يأخذ الاختزال أشياء مثل الأزمنة والجمع ويبسطها، على سبيل المثال، “feet” قد يصبح “foot” و “stripes” قد يصبح “stripe”. هذا الشكل المبسط للكلمة يجعل من الأسهل للخوارزمية تفسير الكلمات في الوثيقة.
تقسيم الشكل هو عملية تقسيم الكلمات إلى مورفيمات أو الوحدات الأساسية للكلمة. هذه الوحدات هي أشياء مثل مورفيمات حرة (التي يمكن أن تقف بمفردها ككلمات) والبادئات واللاحقات.
تعليم جزء الكلام هو ببساطة عملية تحديد جزء الكلام لكل كلمة في وثيقة الإدخال.
التحليل يشير إلى تحليل جميع الكلمات في الجملة وتوضيحها مع علامات القواعد الرسمية أو القيام بالتحليل القواعدي لجميع الكلمات.
كسر الجملة، أو تقسيم حدود الجملة، يشير إلى تحديد مكان بداية ونهاية الجملة.
الجذور هو عملية خفض الكلمات إلى شكل الجذر للكلمة. على سبيل المثال، “connected” و “connection” و “connections” سوف يتم خفضها جميعًا إلى “connect”.
تقسيم الكلمة هو عملية تقسيم قطع كبيرة من النص إلى وحدات صغيرة، والتي يمكن أن تكون كلمات أو وحدات مشتقة/مختزلة.
تقنيات NLP دلالات اللغة
تقنيات دلالات اللغة NLP تشمل تقنيات مثل:
- تعرف الكيان المسمى
- توليد اللغة الطبيعية
- تمييز دلالة الكلمة
تعرف الكيان المسمى يتضمن وضع علامات على أجزاء معينة من النص التي يمكن وضعها في واحدة من الفئات المحددة مسبقًا. الفئات المحددة مسبقًا تشمل أشياء مثل التواريخ، المدن، الأماكن، الشركات، والأفراد.
توليد اللغة الطبيعية هو عملية استخدام قواعد البيانات لتحويل البيانات المنظمة إلى لغة طبيعية. على سبيل المثال، يمكن تلخيص الإحصاءات حول الطقس، مثل درجة الحرارة وسرعة الرياح، بلغة طبيعية.
تمييز دلالة الكلمة هو عملية إسناد المعنى إلى الكلمات في النص بناءً على السياق الذي تظهر فيه الكلمات.
نماذج التعلم العميق لمعالجة اللغة الطبيعية
الشبكات العصبية متعددة الطبقات العادية غير قادرة على التعامل مع تفسير البيانات التسلسلية، حيث يكون ترتيب المعلومات مهمًا. من أجل التعامل مع أهمية الترتيب في البيانات التسلسلية، يتم استخدام نوع من الشبكات العصبية التي تحافظ على المعلومات من الخطوات الزمنية السابقة في التدريب.
الشبكات العصبية المتكررة هي أنواع من الشبكات العصبية التي تكرر البيانات من الخطوات الزمنية السابقة، مع الأخذ بها في الاعتبار عند حساب أوزان الخطوة الزمنية الحالية. بشكل أساسي، الشبكات العصبية المتكررة لها ثلاثة معاملات تستخدم خلال تمرير التدريب الأمامي: مصفوفة dựa على الحالة الخفية السابقة، مصفوفة dựa على الإدخال الحالي، ومصفوفة بين الحالة الخفية والإخراج. نظرًا لأن الشبكات العصبية المتكررة يمكن أن تأخذ المعلومات من الخطوات الزمنية السابقة في الاعتبار، يمكنها استخراج الأنماط ذات الصلة من البيانات النصية من خلال الأخذ بالاعتبار الكلمات السابقة في الجملة عند تفسير معنى الكلمة.
نوع آخر من نماذج التعلم العميق المستخدمة لمعالجة البيانات النصية هو نماذج الذاكرة القصيرة الأمد (LSTM). نماذج LSTM مشابهة للشبكات العصبية المتكررة في الهيكل، ولكن بسبب بعض الاختلافات في هيكلها، فإنها تميل إلى الأداء بشكل أفضل من الشبكات العصبية المتكررة. أنها تتجنب مشكلة معينة غالبًا ما تحدث عند استخدام الشبكات العصبية المتكررة تسمى مشكلة التدرج المتفجر.
تعد هذه الشبكات العصبية العميقة قادرة على أن تكون إما باتجاه واحد أو ثنائي الاتجاه. الشبكات ثنائية الاتجاه قادرة على الأخذ ليس فقط بالكلمات التي تسبق الكلمة الحالية في الاعتبار، ولكن أيضًا الكلمات التي تليها. بينما يؤدي هذا إلى دقة أعلى، إلا أنه أكثر تكلفة حسابيًا.
حالات استخدام معالجة اللغة الطبيعية (NLP)

صورة: mohammed_hassan عبر Pixabay، ترخيص Pixabay (https://pixabay.com/illustrations/chatbot-chat-application-artificial-3589528/)
نظرًا لأن معالجة اللغة الطبيعية تتضمن تحليل و操縦 اللغة البشرية، فإن لها مجموعة واسعة من التطبيقات. التطبيقات المحتملة لمعالجة اللغة الطبيعية تشمل محادثات ومرافقة رقمية، وتحليل المشاعر، وتنظيم الوثائق، واختيار المواهب، والرعاية الصحية.
محادثات ومرافقة رقمية مثل أليكسا من أمازون ومساعد جوجل هي أمثلة على منصات التعرف على الصوت والتركيب التي تستخدم معالجة اللغة الطبيعية لتفسير والاستجابة للأوامر الصوتية. تساعد هذه المرافقة الرقمية الأشخاص في مجموعة واسعة من المهام، مما يسمح لهم بتحويل بعض مهامهم الإدراكية إلى جهاز آخر وتحرير بعض قوة دماغهم لمهام أكثر أهمية. بدلاً من البحث عن أفضل طريق إلى البنك في صباح مشغول، يمكننا فقط أن نطلب من مرافقنا الرقمية القيام بذلك.
تحليل المشاعر هو استخدام تقنيات معالجة اللغة الطبيعية لدراسة ردود أفعال الناس ومشاعرهم تجاه ظاهرة، كما يتم التعبير عنها من خلال استخدامهم للغة. يمكن أن توفر 捕获 مشاعر البيان، مثل تفسير ما إذا كان تقييم المنتج جيدًا أو سيئًا، للمؤسسات بمعلومات كبيرة حول كيفية استقبال منتجها.
تنظيم الوثائق النصية تلقائيًا هو تطبيق آخر لمعالجة اللغة الطبيعية. تستخدم شركات مثل جوجل وياهو خوارزميات معالجة اللغة الطبيعية لتصنيف وثائق البريد الإلكتروني، ووضعها في صناديق مناسبة مثل “اجتماعي” أو “ترويجي”. كما أنها تستخدم هذه التقنيات لتحديد البريد العشوائي ومنع وصوله إلى صندوق الوارد.
تم تطوير تقنيات معالجة اللغة الطبيعية لتحديد المرشحين المحتملين للوظائف، وايجادهم بناءً على المهارات ذات الصلة. كما يستخدم مديرو التوظيف تقنيات معالجة اللغة الطبيعية لمساعدتهم في فرز قائمة المتقدمين.
تستخدم تقنيات معالجة اللغة الطبيعية أيضًا لتحسين الرعاية الصحية. يمكن استخدام معالجة اللغة الطبيعية لتحسين الكشف عن الأمراض. يمكن تحليل السجلات الصحية واستخراج الأعراض بواسطة خوارزميات معالجة اللغة الطبيعية، والتي يمكن استخدامها بعد ذلك لاقتراح تشخيصات محتملة. واحد من الأمثلة على ذلك هو منصة Comprehend Medical من أمازون، التي تحلل السجلات الصحية وتستخرج الأمراض والمعالجات. تمدد تطبيقات معالجة اللغة الطبيعية في مجال الرعاية الصحية إلى الصحة النفسية. هناك تطبيقات مثل WoeBot، التي تتحدث مع المستخدمين من خلال مجموعة متنوعة من تقنيات إدارة القلق المستندة إلى العلاج السلوكي المعرفي.












