أساسيات الذكاء الاصطناعي

كيف يعمل تصنيف النص؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تصنيف النص يعيّن تسمية أو أكثر إلى مستند أو رسالة أو مقطع نصي. تشمل الأمثلة كشف البريد المزعج، توجيه النوايا، تحليل المشاعر، وضع وسوم الموضوعات، الإشراف وتحديد أولوية تذاكر الدعم.

المصنِّف الإنتاجي هو أكثر من مجرد نموذج. فهو يعتمد على تصنيف دقيق للتسميات، تعليقات تمثيلية، تقسيمات خالية من التسرب، قاعدة قرار مُعايرة، ومراقبة لتغيّر اللغة وانتشار الفئات.

النقاط الرئيسية

  • حدد التسميات والحالات الغامضة قبل اختيار البنية.
  • تظل الأساسيات البسيطة من نوع حقيبة الكلمات ذات قيمة؛ المحولات المدربة مسبقًا تضيف السياق والتعلم النقلي.
  • يمكن للدقة إخفاء ضعف الأداء على الفئات الأقل تمثيلاً، لذا استخدم مقاييس واعية بالفئات وتحليل الأخطاء.
  • المعايرة الاحتمالية، والامتناع، والمراجعة البشرية تحول الدرجات إلى قرارات أكثر أمانًا.
How Does Text Classification Work? diagram showing raw text, tokenize, represent, classify, calibrate, evaluate
تُحوِّل العتبات الدرجات إلى إجراءات؛ والامتناع والمراجعة يتعاملان مع عدم اليقين.

تحديد التصنيف وسياسة التعليق

المهمة ذات التسمية الواحدة تختار فئة واحدة متنافية. قد تُعيّن المهمة متعددة التسميات عدة وسوم مستقلة. تحتوي التصنيفات الهرمية على تسميات أصلية وفرعية. هذه مشاكل تعلم مختلفة وتتطلب مخرجات ومقاييس مختلفة.

يحتاج المعلّقون إلى تعريفات، أمثلة إيجابية وسلبية، قواعد لحالات نقص السياق، ومسار تصعيد. يمكن لإحصاءات الاتفاقية أن تكشف عن مهمة غير واضحة، لكن الاختلاف قد يمثل أيضًا غموضًا حقيقيًا يجب أن يحافظ عليه النظام.

تمثيل النص

تستخدم الأنابيب التقليدية عدّ الرموز، n‑grams وTF‑IDF مع مصنِّفات خطية أو آلات المتجهات الداعمة. فهي تُدَرِّب بسرعة، تُظهر المصطلحات المؤثرة، وتوفر أساسًا قويًا.

تُحوِّل الأنظمة العصبية الرموز إلى تمثيلات داخلية. تستخدم محولات مُدربة مسبقًا آلية الانتباه لإنتاج تمثيلات سياقية ويمكن تحسينها باستخدام أمثلة مُعلمة. يمكن للمصنِّفات الموجهة أو ذات الصفر‑لقطة تقليل الحاجة إلى تسمية أولية، لكن يجب تقييم صياغة التسميات، نسخة النموذج، والمعايرة على المجال الفعلي.

التدريب دون تسرب

يُقسم مجموعة البيانات إلى تدريب، تحقق، واختبار نهائي. يجب أن تبقى المستندات المتقاربة، الرسائل من نفس المحادثة أو القوالب من نفس المصدر في نفس التقسيم. بالنسبة للاستخدام الزمني، يُمثل التقسيم الزمني تمثيلًا أفضل للنشر.

يمكن معالجة عدم توازن الفئات عبر الوزن، إعادة العينة، اختيار العتبة أو إضافة بيانات. لا ينبغي أن تحل الأمثلة الاصطناعية محل مراجعة الأخطاء الحقيقية للفئات الأقل تمثيلاً وقد تُدخل تحيزات يتعلمها النموذج بسهولة.

المقاييس والقرارات المُعايرة

تُظهر مصفوفة الالتباس أي تسميات يتم الخلط بينها. الدقة (Precision) تقيس عدد الإيجابيات المتوقعة الصحيحة؛ الاستدعاء (Recall) يقيس عدد الإيجابيات الحقيقية التي تم العثور عليها. المتوسطات الماكرو تُوزن الفئات بالتساوي، بينما المتوسطات المايكرو تُوزن الأمثلة الفردية.

الدرجة الخامّة من softmax ليست بالضرورة احتمالًا موثوقًا. تُقارن المعايرة بين الثقة والصدق المُلاحَظ. يمكن للفرق وضع عتبات خاصة بالفئات، والامتناع عندما تكون الثقة منخفضة، وتوجيه الحالات الحساسة إلى مراجع.

النشر، الاستخدام متعدد اللغات والانجراف

يتغيّر النص مع المنتجات، الأحداث، العامية والسلوك العدائي. يجب أن تراقب المراقبة لغة الإدخال، الطول، الأنماط غير الموجودة في القاموس، معدلات الفئات، الثقة، والنتائج المتأخرة. يتطلب إعادة التدريب بيانات مُصدَّرة وإصدار مجموعة اختبار انحداري للأمثلة المهمة.

يجب اختبار الأداء متعدد اللغات لكل لغة ولهجة. قد يغيّر ترجمة كل شيء إلى لغة واحدة المشاعر أو الكيانات؛ وقد يظل المحول متعدد اللغات غير متوازن لأن التدريب المسبق والتسميات ليست ممثلة بالتساوي.

التمثيلات وعائلات المصنِّفات

يُحوِّل تصنيف النص مستندًا أو جملة أو تسلسل رموز إلى تسمية أو أكثر. حدِّد ما إذا كانت التسميات متنافية، متعددة، هرمية، مرتبة، أو مفتوحة. تُقسِّم الأنابيب التقليدية النص إلى رموز، تُنشئ حقيبة كلمات أو ميزات TF‑IDF، وتُدرّب الانحدار اللوجستي، نايف بايز، أو SVM خطي. تتعلم الأنظمة العصبية تمثيلات داخلية عبر الالتفاف، التكرار، أو المحولات. يمكن للنماذج اللغوية الموجهة تصنيف دون تدريب مخصص للمهمة، لكن قيود الإخراج، التكلفة، الانجراف، والأدلة لا تزال تحتاج إلى تقييم مقارنةً بالأساسيات.

يعتمد ما قبل المعالجة على التمثيل. قد يؤدي التحويل إلى أحرف صغيرة أو إزالة علامات الترقيم إلى إتلاف إشارات للأسماء، المشاعر، الشيفرات، أو اللغة؛ قد يدمج التجذير معاني مختلفة. تعمل مُجزئات المحولات على أجزاء الكلمات ولها حدود طول، لذا تُعد استراتيجية القطع مهمة. قد تتطلب المستندات الطويلة تجزئة وتجمّع. احفظ النص الأصلي وإصدار التحويل، وقسِّم حسب المؤلف، المحادثة، المصدر، أو الوقت لمنع القرب والأنماط المتكررة من عبور التدريب والاختبار.

التسميات، المقاييس، وتحليل الأخطاء

يجب أن يحدد دليل التعليق النطاق، الأمثلة، الحالات الغامضة، وخيار “غير معروف” أو “امتناع”. قسِّم الاتفاقية وحل الخلافات بدلاً من إخفائها بالتصويت الأغلبية. بالنسبة للفئات غير المتوازنة، لا تكفي الدقة؛ أبلغ عن الدقة، الاستدعاء، F1، الالتباس، المعايرة، وحجم العمل حسب العتبة لكل فئة. تتطلب المهام متعددة التسميات مقاييس مايكرو، ماكرو، وعلى مستوى التسميات. قيم اللغات، اللهجات، المجالات، طول الرسائل، والوقت. قد يبالغ الانقسام العشوائي في الجودة عندما ينزلق المفردات أو القوالب.

يجب أن يفصل تحليل الأخطاء بين فشل التمثيل، نقص السياق، غموض التسميات، المفردات النادرة، النفي، السخرية، والإشارات الزائفة. استخدم اختبارات مضادة للواقع تُغيّر الأسماء، علامات اللهجة، أو البيانات الوصفية غير ذات الصلة مع الحفاظ على المعنى. افحص الأخطاء ذات الثقة العالية والحالات المرفوضة. قد يتعلم النموذج أن قناة العميل أو التوقيع يتنبأ بالتسمية بدلًا من تفسير المحتوى. أزل التسرب وعدّل البيانات قبل زيادة سعة النموذج فقط.

تصميم الإنتاج

قدِّم مُجزئ ثابت ونموذج مع التحقق من المخطط، حدود الطول، التجميع، وخطة احتياطية للغات غير المدعومة أو الثقة المنخفضة. راقب توزيع الإدخال، معدلات التسميات، المعايرة، الكمون، والنتائج التي تمت مراجعتها. احمِ النص لأنه قد يحتوي على معلومات شخصية، سرية، أو تعليمات عدائية. بالنسبة للإشراف الآلي، الأهلية، أو التوجيه، قدِّم وسيلة استئناف وقسِّم الأخطاء المتفاوتة. طبّق إصدارات للتسميات والعتبات وفقًا لسياسة الأعمال. يظل تصنيف النص موثوقًا فقط ضمن نظام التسميات وتوزيع البيانات المحدد؛ لا تثبت التفسيرات السلسة للنموذج صحة التصنيف.

مثال عملي: تصنيف طلبات الدعم الواردة

تُعرّف فريق الدعم تسميات توجيه متنافية بالإضافة إلى علامات عاجلة، متعددة اللغات، وغير معروفة. يضع المعلّقون رسائل مُعّرفة مع إرشادات للقضايا المختلطة ويقيسون الاتفاقية. يُستخدم أساس TF‑IDF لوجستي، مشفر مُحسّن، ونموذج موجه على مجموعة اختبار زمنية موحدة. تُظهر تقارير التقييم دقة الفئة، الاستدعاء، الأخطاء السلبية العاجلة، المعايرة، صحة المخطط، الكمون، والتكلفة، مع تجميع القوالب المتقاربة لتجنب التسرب.

يتحقق المصنِّف المنشور من اللغة والطول، يمتنع عند الأدلة الضعيفة، ويسمح للوكيل بتصحيح التوجيه. تُعامل المطالبات والرسائل كغير موثوقة؛ ولا يُسمح بالوصول إلى الأدوات. تراقب المراقبة انتشار التسميات، الثقة، التصحيحات، زمن الاستجابة، والمواضيع الناشئة. تُحدَّث السياسة أو المنتج التصنيف وإعادة التدريب عبر المراجعة. يحسّن النظام وضعية الطابور، لكنه لا يستنتج مشاعر العميل أو استحقاقه بخلاف التسميات المُعتمدة.

دليل التنفيذ والاستعداد التشغيلي

يتطلب اتخاذ قرار إنتاجي أكثر من إظهار نجاح تجريبي. حدِّد المستخدمين المستهدفين، بيئة التشغيل، المدخلات، المخرجات، الاعتمادات، المالك، وعواقب كل فشل مهم. أنشئ أساسًا قابلاً لإعادة الإنتاج ومجموعة تقييم مُصدَّرة قبل الضبط. اختبر الحالات العادية، حدود الظروف، المدخلات المشوهة أو المفقودة، انزياح التوزيع، انقطاع الاعتماد، سوء الاستخدام، والمجموعات أو البيئات التي قد تُهمل. قسِّم جودة المهمة مع المعايرة أو عدم اليقين، الكمون، الإنتاجية، تكلفة الموارد، الوصولية، الخصوصية، والأمان. سجِّل كل تحويلة وعتبة حتى يتمكن مراجع مستقل من إعادة إنتاج النتيجة وتمييز الأدلة عن النموذج الجذاب.

قبل الإطلاق، عيّن سلطة للإصدار، الاستثناءات، التغييرات، الاسترجاع، والتقاعد. استخدم نشرًا متدرجًا، احفظ خطة احتياطية آمنة، وتحقق من المراقبة عبر إدخال أخطاء متعمد. يجب أن تكشف القياسات التشغيلية عن جودة الإدخال، سلوك المخرجات، نسخة النموذج أو القاعدة، صحة الاعتماد، تجاوزات البشر، والنتائج المؤكدة دون جمع بيانات حساسة غير ضرورية. حدِّد عتبات الإنذار وصاحب الاستجابة، ثم راجع الأدلة الواقعية بعد النشر بدلاً من افتراض استمرارية الأداء غير المتصل. أعد التقييم كلما تغيرت مصادر البيانات، المستخدمون، النماذج، البائعون، السياسات، الأجهزة، أو الأهداف. يحتاج النظام المُحافظ أيضًا إلى وثائق استعادة، تعلم من الحوادث، إجراءات حذف واحتفاظ، ونقطة واضحة لتعطيله أو استبداله.

الأسئلة المتكررة

هل تحليل المشاعر مهمة تصنيف نص؟

عادةً نعم، لكن المشاعر قد تكون متعددة التسميات، قائمة على الجوانب أو مستمرة بدلاً من تسمية واحدة إيجابية/محايدة/سلبية.

متى يجب على مصنِّف النص الامتناع؟

عندما تكون الثقة منخفضة، يكون النص خارج النطاق، يكون السياق المطلوب مفقودًا أو تتجاوز تكلفة الإجراء التلقائي الخاطئ تكلفة المراجعة.

المراجع الأساسية

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.