أساسيات الذكاء الاصطناعي
كيف تعمل تصنيف النص؟
تصنيف النص هو عملية تحليل تسلسلات النص وتعيينها بطابع، ووضعها في مجموعة بناءً على محتواها. يعتمد تصنيف النص تقريباً على أي مهمة ذكاء اصطناعي أو تعلم الآلة تتضمن معالجة اللغة الطبيعية. مع تصنيف النص، يمكن للبرنامج الحاسوبي تنفيذ مجموعة واسعة من المهام المختلفة مثل التعرف على البريد العشوائي وتحليل المشاعر ووظائف الدردشة. كيف يعمل تصنيف النص بالضبط؟ ما هي الطرق المختلفة لتنفيذ تصنيف النص؟ سنستكشف الإجابات على هذه الأسئلة أدناه.
تعريف تصنيف النص
من المهم أن ن dành بعض الوقت ون đảmن أننا نفهم ما هو تصنيف النص بشكل عام قبل الغوص في الطرق المختلفة لتنفيذ تصنيف النص. تصنيف النص هو واحد من تلك المصطلحات التي يتم تطبيقها على العديد من المهام والخوارزميات، لذا من المفيد أن ن đảmن أننا نفهم المفهوم الأساسي لتصنيف النص قبل المضي قدمًا في استكشاف الطرق المختلفة التي يمكن من خلالها تنفيذها.
يمكن اعتبار أي شيء يتضمن إنشاء فئات مختلفة للنص، وتصنيف عينات النص المختلفة على أنها فئات، تصنيفًا للنص. طالما أن النظام يقوم بتنفيذ هذه الخطوات الأساسية، يمكن اعتباره مصنفًا للنص، بغض النظر عن الطريقة المستخدمة لتصنيف النص وبغض النظر عن كيفية تطبيق مصنف النص في النهاية. يمكن اعتبار الكشف عن البريد العشوائي وتحليل المستندات حسب الموضوع أو العنوان والتعرف على مشاعر المراجعة لمنتج على أنها تصنيف للنص لأنها تتم من خلال أخذ النص كمدخل وإخراج علامة فئة للنص.
كيف يعمل تصنيف النص؟

صورة: Quinn Dombrowski via Flickr, CC BY SA 2.0 , (https://www.flickr.com/photos/quinnanya/4714794045)
يمكن وضع معظم طرق تصنيف النص في واحدة من ثلاث فئات مختلفة: طرق قاعدة أو طرق تعلم الآلة.
طرق التصنيف القائمة على القواعد
تعمل طرق تصنيف النص القائمة على القواعد من خلال استخدام قواعد لغة محددة صراحة. يستخدم النظام القواعد التي تم إنشاؤها بواسطة المهندس لتحديد الفئة التي ينتمي إليها نص معين، من خلال البحث عن أدلة في شكل عناصر نصية ذات صلة семантиًا. لكل قاعدة نمط يجب على النص مطابقته لتكون مصنفة في الفئة المقابلة.
لتوضيح أكثر، دعونا نقول إنك تريد تصميم مصنف نص يمكنه التمييز بين مواضيع محادثة شائعة، مثل الطقس أو الأفلام أو الطعام. من أجل تمكين مصنف النص من التعرف على مناقشة الطقس، قد ت告诉ه البحث عن كلمات متعلقة بالطقس في جسم عينات النص التي يتم تغذيتها. سيكون لديك قائمة بكلمات و عبارات و أنماط أخرى ذات صلة يمكن استخدامها لتمييز الموضوع. على سبيل المثال، قد ت告诉 المصنف البحث عن كلمات مثل “رياح” أو “مطر” أو “شمس” أو “ثلج” أو “سحاب”. يمكنك بعد ذلك أن ت告诉 المصنف مراقبة عدد المرات التي تظهر فيها هذه الكلمات في النص المدخل، وإذا كانت تظهر أكثر من كلمات متعلقة بالأفلام، فسيتم تصنيف النص على أنه ينتمي إلى فئة الطقس.
ميزة أنظمة القواعد هي أن مدخلاتها ومخرجاتها قابلة للتنبؤ بها وتفسيرها من قبل البشر، ويمكن تحسينها من خلال التدخل اليدوي للمهندس. ومع ذلك، فإن طرق التصنيف القائمة على القواعد أيضًا مرنة إلى حد ما، وغالبًا ما يصعب عليها تعميم النتائج لأنها يمكن أن تتبع فقط الأنماط المحددة مسبقًا التي تم برمجةها. على سبيل المثال، يمكن أن تشير كلمة “سحاب” إلى الرطوبة في السماء أو إلى سحاب رقمي حيث يتم تخزين البيانات. من الصعب على أنظمة القواعد التعامل مع هذه الدقة دون أن يقضي المهندسون وقتًا طويلًا في محاولة توقع وتعديل هذه الدقة.
أنظمة التعلم الآلي
كما ذكرنا أعلاه، أنظمة القواعد لديها قيود، لأن وظائفها وقواعدها يجب برمجةها مسبقًا. في المقابل، تعمل أنظمة التصنيف القائمة على التعلم الآلي من خلال تطبيق خوارزميات تحليل مجموعات البيانات للعثور على أنماط مرتبطة بفئة معينة.
تتم تغذية خوارزميات التعلم الآلي بعينات تم تصنيفها مسبقًا تم تحليلها للعثور على ميزات ذات صلة. هذه العينات المُصنفة مسبقًا هي بيانات التدريب.
يحلل مصنف التعلم الآلي بيانات التدريب ويتعلم الأنماط المرتبطة بالفئات المختلفة. بعد ذلك، يتم إزالة العلامات من العينات غير المرئية وتغذيتها إلى خوارزمية التصنيف، والتي تعين العينات علامات. يتم بعد ذلك مقارنة العلامات المخصصة بالعلامات الأصلية لمعرفة مدى دقة مصنف التعلم الآلي.
تعمل خوارزميات التعلم الآلي من خلال تحليل البيانات الرقمية. هذا يعني أن النص يجب تحويله إلى تنسيق رقمي لاستخدامه مع خوارزمية التعلم الآلي. هناك طرق مختلفة لتمثيل البيانات النصية كبيانات رقمية وخلق طرق التعلم الآلي حول هذه البيانات. سنغطي بعض الطرق المختلفة لتمثيل البيانات النصية أدناه.
حقيبة الكلمات
حقيبة الكلمات هي واحدة من أكثر الطرق شيوعًا لترميز وتمثيل البيانات النصية. يأتي مصطلح “حقيبة الكلمات” من حقيقة أنك تأخذ جميع الكلمات في المستندات وتضعها جميعًا في “حقيبة” واحدة، دون اهتمام بالترتيب أو القواعد، مع الاهتمام فقط بتكرار الكلمات في الحقيبة. هذا ينتج عنه مصفوفة طويلة، أو متجه، يحتوي على تمثيل واحد لجميع الكلمات في المستندات المدخلة. لذلك، إذا كان هناك 10000 كلمة فريدة في المستندات المدخلة، فإن متجهات الميزة ستكون 10000 كلمة طويلة. هذا هو كيفية حساب حجم حقيبة الكلمات / متجه الميزة.

صورة: gk_ via Machinelearning.co, (https://machinelearnings.co/text-classification-using-neural-networks-f5cd7b8765c6)
بعد تحديد حجم متجه الميزة، يتم تعيين كل مستند في قائمة المستندات إلى متجهه الخاص، ممتلئًا بأرقام تشير إلى عدد المرات التي تظهر فيها الكلمة في المستند الحالي. هذا يعني أنه إذا ظهرت كلمة “طعام” ثماني مرات في مستند نصي واحد، فإن متجه الميزة / مصفوفة الميزة المقابلة سيكون لديها ثمانية في الموضع المقابل.
بمعنى آخر، يتم وضع جميع الكلمات الفريدة في المستندات المدخلة في حقيبة واحدة، ثم يتم تعيين كل مستند حقيبة كلمات من نفس الحجم، والتي يتم ملؤها بعدد المرات التي تظهر فيها الكلمات المختلفة في المستند.
غالبًا ما تحتوي مجموعات البيانات النصية على عدد كبير من الكلمات الفريدة، ولكن معظمها لا يتم استخدامها بانتظام. لهذا السبب، يتم عادةً تقييد عدد الكلمات المستخدمة لإنشاء متجه الكلمات إلى قيمة محددة (N) ، ثم يصبح بعد متجه الميزة Nx1.
تكرار الترميز العكسي للوثائق (TF-IDF)
هناك طريقة أخرى لتمثيل المستند بناءً على الكلمات الموجودة فيه تسمى تكرار الترميز العكسي للوثائق (TF-IDF). يُنشئ نهج TF-IDF أيضًا متجهًا يُمثل المستند بناءً على الكلمات الموجودة فيه، ولكن على عكس حقيبة الكلمات، يتم وزن هذه الكلمات بأكثر من مجرد تكرارها. يُعتبر نهج TF-IDF أهمية الكلمات في المستندات، ويتحاول量 تقدير مدى صلة هذه الكلمة بموضوع المستند. بمعنى آخر، يتحليل TF-IDF الإشارات بدلاً من التكرار، ويتم استبدال عدد الكلمات في متجه الميزة بنتيجة TF-IDF يتم حسابها مع مراعاة مجموعة البيانات بأكملها.
يعمل نهج TF-IDF عن طريق حساب التكرار الأول، وهو عدد المرات التي تظهر فيها المصطلحات الفريدة في مستند معين. ومع ذلك، يُعتبر TF-IDF أيضًا الحد من تأثير الكلمات الشائعة جدًا مثل “ال” و “أو” و “و”، لأن هذه “الكلمات العشوائية” شائعة جدًا ولكنها لا تحمل معلومات كبيرة عن محتوى المستند. هذه الكلمات تحتاج إلى خصم، وهو ما يشير إليه جزء “تكرار الترميز العكسي للوثائق” من TF-IDF. يتم ذلك لأن الكلمات التي تظهر في عدد أكبر من المستندات تكون أقل فائدة في تمييزها عن المستندات الأخرى في قائمة جميع المستندات. الصيغة التي يستخدمها TF-IDF لحساب أهمية الكلمة مصممة للحفاظ على الكلمات الأكثر تكرارًا والأكثر غنى семантиًا.
يحتوي متجهات الميزة التي تم إنشاؤها بواسطة نهج TF-IDF على قيم مخفضة تصل إلى واحد، وتعيين كل كلمة قيمة موزونة حسب صيغة TF-IDF.
تضمين الكلمات
تضمين الكلمات هي طرق لتمثيل النص بحيث تتمتع الكلمات ذات المعاني المماثلة بتمثيلات رقمية مماثلة.
تعمل تضمين الكلمات من خلال “تحويل الكلمات إلى متجهات”، مما يعني أنها تمثل الكلمات كمتجهات ذات قيم حقيقية في فضاء متجه. المتجهات موجودة في شبكة أو مصفوفة، ولديها اتجاه وطول (أو حجم). عند تمثيل الكلمات كمتجهات، يتم تحويل الكلمات إلى متجهات تتكون من قيم حقيقية. كل كلمة يتم映وتها إلى متجه واحد، والكلمات التي لها معاني مماثلة لها متجهات مماثلة في الاتجاه والmagnitude. هذا النوع من الترميز يسمح بخوارزمية التعلم الآلي لتعلم علاقات معقدة بين الكلمات.
تُنشأ التضمينات التي تمثل كلمات مختلفة مع مراعاة كيفية استخدام الكلمات المذكورة. لأن الكلمات التي يتم استخدامها بنفس الطريقة سيكون لها متجهات مماثلة، فإن عملية إنشاء تضمين الكلمات تترجم تلقائيًا بعض المعاني التي تمتلكها الكلمات. على سبيل المثال، يُنشئ نهج حقيبة الكلمات تمثيلات هشة حيث يكون للكلمات المختلفة تمثيلات غير مماثلة حتى لو كانت تستخدم في سياقات متشابهة للغاية.
نتيجة لذلك، تُعد تضمين الكلمات أفضل في التقاط سياق الكلمات داخل الجملة.
هناك خوارزميات ونهج مختلفة لإنشاء تضمين الكلمات. بعض أكثر الطرق الشائعة والموثوقة لإنشاء تضمين الكلمات تشمل طبقات التضمين، و Word2Vec، و GloVe.
طبقات التضمين
إحدى الطرق المحتملة لاستخدام تضمين الكلمات جنبًا إلى جنب مع نظام التعلم الآلي / التعلم العميق هو استخدام طبقة تضمين. تُحول طبقات التضمين الكلمات إلى تضمينات يتم تغذيتها إلى نظام التعلم العميق. تُتعلم تضمين الكلمات أثناء تدريب الشبكة على مهمة معينة قائمة على النص.

في نهج تضمين الكلمات، تكون الكلمات المماثلة لها تمثيلات مماثلة وتكون أقرب إلى بعضها البعض منها إلى الكلمات غير المماثلة.
لاستخدام طبقات التضمين، يجب معالجة النص أولاً. يجب تحويل النص في المستند إلى ترميز ثنائي، ويجب تحديد حجم المتجه مسبقًا. ثم يتم تحويل النص الثنائي إلى متجهات كلمات ويتم تمرير المتجهات إلى نموذج التعلم الآلي.
Word2Vec
Word2Vec هو نهج شائع آخر لتحويل الكلمات إلى تضمينات. يستخدم Word2Vec طرقًا إحصائية لتحويل الكلمات إلى تضمينات وهو مُحسّن للاستخدام مع نماذج الشبكات العصبية. تم تطوير Word2Vec بواسطة باحثين في جوجل وهو واحد من أكثر طرق التضمين شيوعًا، لأنه يُنتج تضمينات مفيدة وغنية بانتظام. تُعتبر تمثيلات Word2Vec مفيدة لتحديد الاختلافات Семантиكية والصرفية في اللغة. هذا يعني أن تمثيلات Word2Vec تُلتقط العلاقات بين المفاهيم المماثلة، وقادرة على التمييز بين أن الملك يُشير إلى الملكية وأن الملك يُشير إلى الرجولة بينما الملكة تُشير إلى الأنوثة.
GloVe
GloVe، أو المتجه العالمي لتمثيل الكلمة، يُنشئ على خوارزميات التضمين المستخدمة بواسطة Word2Vec. يُجمع نهج GloVe بين جوانب خوارزميات Word2Vec و تقنيات تحليل التجزئة مثل تحليل الدلالة الكامنة. ميزة Word2Vec هي أنها يمكنها التقاط السياق، ولكن كتضحية، فهي لا تُقدم بشكل جيد الإحصاءات النصية العالمية. في المقابل، التمثيلات النصية التقليدية جيدة في تحديد الإحصاءات النصية العالمية، ولكنها لا تُستخدم في تحديد سياق الكلمات والعبارات. يُستفيد GloVe من أفضل نهجين، مما يخلق سياق الكلمة بناءً على الإحصاءات النصية العالمية.












