أساسيات الذكاء الاصطناعي
ما هي التجميع K-Means؟
التجميع K-Means هو خوارزمية تعلم غير مشرف، ومن بين جميع خوارزميات التعلم غير المشرف، قد يكون التجميع K-Means هو الأكثر استخدامًا، بفضل قوته وبساطته. كيف يعمل التجميع K-Means بالضبط؟
الجواب القصير هو أن التجميع K-Means يعمل عن طريق إنشاء نقطة مرجعية (مركز) لعدد محدد من الفئات، ثم تعيين نقاط البيانات إلى فئات التجميع بناءً على النقطة المرجعية الأقرب. بينما هذا هو تعريف سريع للتجميع K-Means، دعونا نأخذ بعض الوقت لنغوص أعمق في التجميع K-Means ونحصل على فهم أفضل لكيفية عمله.
تعريف التجميع
قبل أن ننظر إلى الخوارزميات الدقيقة المستخدمة في تنفيذ التجميع K-Means، دعونا نتخذ لحظة لتعريف التجميع بشكل عام.
المجموعات هي مجرد مجموعات من العناصر، والتجميع هو مجرد وضع العناصر في تلك المجموعات. في مجال علوم البيانات، خوارزميات التجميع تهدف إلى القيام بثلاثة أشياء:
- ضمان أن جميع نقاط البيانات في مجموعة واحدة تكون متشابهة قدر الإمكان.
- ضمان أن جميع نقاط البيانات في مجموعات مختلفة تكون متباينة قدر الإمكان.
خوارزميات التجميع تجمع العناصر معًا بناءً على بعض المقاييس من حيث التشابه. يتم ذلك عادةً عن طريق العثور على “المركز” للمجموعات المختلفة المحتملة في مجموعة البيانات، على الرغم من أنه لا يتم حصريًا. هناك العديد من خوارزميات التجميع المختلفة، ولكن هدف جميع خوارزميات التجميع هو نفسه، وهو تحديد المجموعات المتأصلة في مجموعة البيانات.
التجميع K-Means
التجميع K-Means هو واحد من أقدم وأكثر أنواع خوارزميات التجميع استخدامًا، ويعمل على أساس الكمية المتجهة. هناك نقطة في الفضاء يتم اختيارها كمنشأ، ثم يتم رسم متجهات من المنشأ إلى جميع نقاط البيانات في مجموعة البيانات.
بشكل عام، يمكن تقسيم التجميع K-Means إلى خمس خطوات مختلفة:
- وضع جميع الحالات في مجموعات فرعية، حيث يكون عدد المجموعات الفرعية مساويًا لـ K.
- العثور على نقطة الوسط/المركز للمجموعات الفرعية الجديدة.
- بناءً على هذه المراكز، تعيين كل نقطة إلى مجموعة معينة.
- حساب المسافات من كل نقطة إلى المراكز، وتركيب النقاط على المجموعات حيث تكون المسافة من المركز هي الأقل.
- بعد تركيب النقاط على المجموعات، العثور على مركز جديد للمجموعات.
تكرار الخطوات المذكورة أعلاه حتى انتهاء عملية التدريب.

في المرحلة الأولية، يتم وضع المراكز في مكان ما بين نقاط البيانات.
الصورة: Weston.pace via wikimedia commons, GNU Free Documentation License (https://commons.wikimedia.org/wiki/File:K_Means_Example_Step_1.svg)
بديل، بعد وضع المراكز، يمكننا تصور التجميع K-Means على أنه ينتقل بين مرحلتين مختلفتين: تعيين نقاط البيانات وتحديث المراكز.

في مرحلة تعيين نقاط البيانات، يتم تعيين كل نقطة إلى فئة تخص المركز الأقرب. يتم تحديد المركز الأقرب عادةً باستخدام المسافة الأوربية المربعة، على الرغم من أنه يمكن استخدام مقاييس المسافة الأخرى مثل المسافة المانهاطنية، الكوزين، وجاكارد، اعتمادًا على نوع البيانات التي يتم إدخالها في خوارزمية التجميع.

في مرحلة تحديث المراكز، يتم حساب المراكز عن طريق العثور على متوسط المسافة بين جميع نقاط البيانات الحالية في كل مجموعة.
كيفية اختيار القيمة الصحيحة لـ “K”
بالنظر إلى أن التجميع K-Means هو خوارزمية غير مشرف، وعدد الفئات غير معروف مسبقًا، كيف يمكنك اختيار عدد الفئات الصحيح / القيمة الصحيحة لـ K؟
أحد الطرق لاختيار القيمة الصحيحة لـ K هو تقنية تسمى “تقنية الكوع“. تتكون تقنية الكوع من تشغيل خوارزمية التجميع K-Means لمجموعة من قيم K المختلفة، واستخدام مقياس دقة، عادةً مجموع الأخطاء المربعة، لتحديد أي قيم K تعطي أفضل النتائج. يتم تحديد مجموع الأخطاء المربعة عن طريق حساب متوسط المسافة بين مركز كل مجموعة ونقاط البيانات في تلك المجموعة.
المصطلح “تقنية الكوع” يأتي من حقيقة أن عندما يتم رسم مجموع الأخطاء المربعة مع respecto إلى قيم K المختلفة، فإن الخط الناتج غالبًا ما يكون له شكل “كوع”، حيث ينخفض مجموع الأخطاء المربعة بسرعة للقيم الأولى من K، ثم ي مستوى بعد ذلك. في هذه الحالات، قيمة K الموجودة في الكوع هي أفضل قيمة لـ K، حيث يكون هناك عوائد متضائلة بسرعة بعد هذه القيمة.
التجميع K-Means الدفعي
随着 نمو مجموعات البيانات، ينمو وقت الحساب أيضًا. يمكن أن يستغرق التجميع K-Means الأساسي وقتًا طويلاً لإكماله عند تشغيله على مجموعات بيانات ضخمة، ونتيجة لذلك، تم إجراء تعديلات على التجميع K-Means لتمكين تقليل التكاليف المكانية والزمنية للخوارزمية.
التجميع K-Means الدفعي هو متغير من التجميع K-Means حيث يتم تقييد حجم مجموعة البيانات التي يتم النظر فيها. يعمل التجميع K-Means العادي على مجموعة البيانات بأكملها / الدفعة في نفس الوقت، بينما يقسم التجميع K-Means الدفعي مجموعة البيانات إلى مجموعات فرعية. يتم أخذ عينات الدفعات الدفعية بشكل عشوائي من مجموعة البيانات بأكملها، ويتم اختيار عينة جديدة عشوائية في كل تكرار جديد ويتم استخدامها لتحديث موقع المراكز.
في التجميع K-Means الدفعي، يتم تحديث المجموعات بتركيبة من قيم الدفعة الدفعية ومعدل التعلم. ينخفض معدل التعلم مع التكرارات، وهو العكس من عدد نقاط البيانات الموجودة في مجموعة معينة. تأثير تقليل معدل التعلم هو أن تأثير البيانات الجديدة يتم تقليله ويتحقق التقارب عندما لا توجد تغييرات في المجموعات بعد عدة تكرارات.
تشير نتائج الدراسات حول فعالية التجميع K-Means الدفعي إلى أنه يمكن أن يقلل بنجاح وقت الحساب مع تبادل طفيف في جودة المجموعة.
تطبيقات التجميع K-Means
يمكن استخدام التجميع K-Means بأمان في أي حالة يمكن فيها تقسيم نقاط البيانات إلى مجموعات أو فئات متميزة. إليك بعض الأمثلة على حالات استخدام شائعة للتجميع K-Means.
يمكن تطبيق التجميع K-Means على تصنيف الوثائق، ووضع الوثائق في مجموعات بناءً على سمات مثل الموضوعات، والوسوم، واستخدام الكلمات، والبيانات الوصفية والميزات الأخرى للوثائق. يمكن أيضًا استخدامه لتصنيف المستخدمين على أنهم روبوتات أو غير روبوتات بناءً على أنماط النشاط مثل المنشورات والتعليقات. يمكن استخدام التجميع K-Means أيضًا لوضع الأشخاص في مجموعات بناءً على مستويات القلق عند مراقبة صحتهم، بناءً على سمات مثل الأمراض المشتركة، والعمر، وتاريخ المريض، إلخ.
يمكن أيضًا استخدام التجميع K-Means لمهام أكثر مفتوحًا مثل إنشاء أنظمة التوصية. يمكن تجميع مستخدمي نظام مثل Netflix (NFLX ) معًا بناءً على أنماط المشاهدة وتوصيل المحتوى المماثل. يمكن استخدام التجميع K-Means لتحديد الشذوذ، و突出 الحالات المحتملة للغش أو العناصر المعيبة.












