أساسيات الذكاء الاصطناعي

ما هو KNN (الجيران الأقرب K)

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

K-nearest neighbors (KNN) يتنبأ بالنتيجة بناءً على أمثلة التدريب المعلَّمة الأقرب إلى نقطة الاستعلام. في التصنيف، يصوت الجيران على الفئة. في الانحدار، يتم أخذ متوسط قيم الأهداف الخاصة بهم أو دمجها بطريقة أخرى.

يُعد KNN طريقة قائمة على الحالات ولا تعمم؛ فالملاءمة عادةً ما تخزن أمثلة التدريب وفهرس البحث الاختياري. هذا لا يلغي الحاجة إلى تقسيمات التدريب، والتحقق، والاختبار. يُعد التقييم على بيانات غير مُستخدمة أساسيًا لاختيار k، مقياس المسافة، معالجة الخصائص، وقاعدة التصويت.

النقاط الرئيسية

  • يتنبأ KNN محليًا؛ لا يقوم أولًا بتقسيم مجموعة البيانات إلى مجموعات.
  • تحجيم الخصائص أمر حاسم لأن المسافة تحدد أي الأمثلة تُعد جيرانًا.
  • قيمة k الصغيرة قد تكون صاخبة، بينما القيمة الكبيرة قد تُزيل البنية المحلية.
  • الأبعاد العالية، الخصائص غير ذات الصلة، عدم توازن الفئات، والبحث البطيء قد يحدّ من الأداء.
K-nearest-neighbors comparison for one query point using k equals 1, k equals 5 with weighted voting, and an overly large k that crosses class boundaries
اختيار قيمة k يغيّر الحيّ المستخدم للتنبؤ المحلي ويسيطر على مقايضة الانحياز‑التباين.

كيف يعمل تصنيف KNN

  1. تمثيل الاستعلام وأمثلة التدريب في نفس فضاء الخصائص.
  2. حساب المسافة بين الاستعلام وأمثلة التدريب.
  3. اختيار أقرب k مثال.
  4. التنبؤ بالفئة الأغلبية أو استخدام تصويت مرجّح بالمسافة.

يعطي التصويت المرجّح للجيران الأقرب تأثيرًا أكبر. يجب تحديد قاعدة موثقة لحل التعادل، ويمكن أن تجعل الجيران المتساوين في المسافة والذين يحملون تسميات مختلفة النتائج تعتمد على الترتيب أو تفاصيل التنفيذ.

انحدار KNN

في الانحدار، عادةً ما يكون التنبؤ متوسط أهداف الجيران. يمكن أن يقلل الترجيح بالمسافة من تأثير الملاحظات البعيدة. قد يكون الوسيط أو التجميع المتين مفيدًا عندما تحتوي الأهداف المحلية على قيم شاذة.

مقاييس المسافة

المسافة الإقليدية شائعة للخصائص المتصلة، والمسافة المانهاتن تجمع الفروقات المطلقة، والمسافة الكوسينية تركز على الاتجاه بدلاً من المقدار. تُطبق مقاييس أخرى على البيانات الثنائية، الفئوية، الجغرافية، المتسلسلة، أو تمثيلات المتجه المتعلم.

وصف KNN بأنه “غير معلمي” يعني أنه لا يفترض شكلًا ثابتًا محدود الأبعاد للحد الفاصل. لكنه لا يزال يفترض أن التمثيل المختار والمقياس يجعل النقاط القريبة ذات صلة ببعضها.

لماذا يهم التحجيم

إذا كان نطاق خاصية واحدة من 0 إلى 1 وأخرى من 0 إلى 100 000، فإن المسافة الإقليدية العادية ستسيطر عليها الخاصية الثانية. يجب تطبيق التقييس أو التطبيع أو التحويلات المتخصصة على مجموعة التدريب ثم استخدامها على مجموعات التحقق، الاختبار، والإنتاج.

الخصائص غير ذات الصلة تشوّه أيضًا الأحياء. يمكن أن تساعد اختيار الخصائص، تقليل الأبعاد، أو التمثيلات المتعلمة، لكن كل اختيار يجب التحقق منه دون تسرب بيانات.

اختيار k

مع k = 1، قد يتبع النموذج الضوضاء والأمثلة ذات التسميات الخاطئة. كلما زاد k، تصبح التنبؤات أكثر سلاسة وأقل حساسية لنقطة واحدة. إذا أصبح k كبيرًا جدًا، قد تهيمن الفئات أو المناطق البعيدة ويصبح النموذج غير ملائم.

اختر k عبر التحقق المتقاطع على بيانات التدريب. في التصنيف الثنائي، يقلل k الفردي من حالات التعادل لكنه لا يزيلها تمامًا. أوزان الفئات، التقسيم الطبقي، اختيار العتبة، والقياسات المناسبة مهمة عندما تكون الفئات غير متوازنة.

لعنة الأبعاد العالية

في الفضاءات ذات الأبعاد العالية، قد تصبح المسافات أقل إخبارًا لأن الأمثلة متفرقة وتصبح المسافات الأقرب والأبعد متقاربة نسبيًا. قد يحتاج KNN إلى كميات هائلة من البيانات للحفاظ على أحياء محلية ذات معنى. هذه هي لعنة الأبعاد العالية.

تقليل الأبعاد أو التمثيلات المتخصصة للمهمة يمكن أن يساعد، لكن يجب التحقق من هندسة التمثيل بالنسبة لمفهوم التشابه المقصود.

أداء البحث

الاستعلام القسري يقارن النقطة الجديدة بكل مثال مخزن. تُسرّع أشجار KD وأشجار الكرة بعض عمليات البحث الدقيقة، رغم أن فوائدها تتلاشى في الأبعاد العالية. تُقايض فهارس الجيران الأقرب التقريبية قليلًا من الاستدعاء مقابل تحسين كبير في السرعة والذاكرة. هذه الفكرة تدعم أيضًا بحث التشابه المتجهي.

القوة والقيود

يُعد KNN بسيطًا، يدعم حدود قرار غير منتظمة، ويوفر تفسيرًا بديهيًا قائمًا على الأمثلة. لكنه قد يتطلب ذاكرة كبيرة، يكشف أمثلة التدريب الحساسة، يتنبأ ببطء، ويؤدي أداءً ضعيفًا عندما لا تكون المسافة ذات معنى. إنه خط أساس مفيد—ليس طريقة دقيقة بشكل افتراضي على معظم المشكلات.

المسافة، الأحياء، وسلوك المعاملات الفائقة

يخزن K-nearest neighbors أمثلة التدريب ويتنبأ من أقرب k تحت مسافة مختارة. يستخدم التصنيف تصويت الأغلبية أو التصويت المرجّح بالمسافة؛ يستخدم الانحدار متوسط أهداف الجيران. التحجيم أساسي لأن خاصية ذات نطاق عالي قد تهيمن على المسافة الإقليدية. قد تتطلب البيانات الفئوية، المتناثرة، المتسلسلة، أو الجغرافية مقاييس هامينغ، كوسين، تحرير، مسافة الدائرة الكبيرة، أو مقاييس متعلمة. المقياس هو افتراض نمذجة حول التشابه، ويجب التحقق منه مقابل المعنى الحقيقي للحالات القريبة.

القيمة الصغيرة لـ k تُنشئ حدودًا مرنة وعالية التباين وحساسية للضوضاء؛ القيمة الكبيرة تُسهل التنبؤات وقد تُمحى البنية الأقلية. k الفردي يخفف فقط بعض التعادلات الثنائية ولا يُعد قاعدة عامة. اختر k، والمسافة، والوزن، ومجموعة الخصائص، والمعالجة المسبقة داخل التحقق المتقاطع. قد تجعل عدم توازن الفئات تصويت الأغلبية المحلي يتجاهل النتائج النادرة، لذا راقب الاستدعاء لكل فئة وتكوين الحي. تميل المسافات في الأبعاد العالية إلى التركّز، وتُضعّف الخصائص غير ذات الصلة الأحياء؛ قد يساعد الاختيار، تقليل الأبعاد، أو التمثيلات المتعلمة.

الفهرسة، عدم اليقين، وتشغيل الإنتاج

الاستدلال الساذج يقارن الاستعلام بكل نقطة تدريب. تساعد أشجار KD وأشجار الكرة في الأبعاد المنخفضة المناسبة؛ تُقايض الفهارس التقريبية الدقة مقابل السرعة والقابلية للتوسع. قسّ استدعاء بحث الجيران منفصلًا عن جودة التنبؤ. تشمل الذاكرة الخصائص المخزنة، التسميات، وهياكل الفهرس. التحديثات بسيطة من حيث المفهوم لكنها قد تتطلب إعادة بناء الفهرس، الحفاظ على توافق الإصدارات، ونشر حذف السجلات. احمِ أمثلة التدريب الحساسة لأن إرجاع الجيران أو المسافات قد يكشف سجلات.

يمكن لـ KNN إظهار أمثلة تجعل التنبؤ قابلًا للفهم، لكن القرب لا يعني السبب أو العدالة. قدم المسافة، هامش التصويت، وقاعدة الامتناع عندما تكون الأحياء متفرقة أو متعارضة. راقب مسافة الاستعلام، تسميات الجيران، انحراف الخصائص، الكمون، والنتائج المؤكدة. حافظ على تزامن إصدارات المعالجة المسبقة والفهرس، واختبر النتائج الدقيقة مقابل التقريبية بعد أي تغيّر. يُعد KNN خط أساس محلي فعال وطريقة استرجاع عندما تكون المسافة ذات معنى؛ يواجه صعوبات عندما لا يمكن تمثيل التشابه بالخصائص المتاحة.

مثال عملي: KNN لاستبدال المنتجات

يمثل تاجر التجزئة المنتجات بخصائص رقمية موحدة، توافق فئوي، وتمثيل نصي متعلم، ثم يعرّف مسافة مرجّحة يراجعها مسؤولو البضائع. تُختار K والأوزان باستخدام إصدارات منتجات لاحقة، وليس عشوائيًا. يتحقق التقييم من استدعاء البدائل ذات الصلة، التوصيات غير المتوافقة، المسافة، تغطية الفئة، والنتائج للسلع النادرة. يُظهر خط الأساس القائم على الشعبية ما إذا كانت التشابه المحلي يضيف قيمة.

يُقارن فهرس تقريبي مع الجيران الدقيق من حيث الاستدعاء والكمون. الاستعلامات التي لا تجد عنصرًا متوافقًا قريبًا تُعيد لا اقتراح بدلاً من إجبار جيران. تُنقل حذف المنتجات وتصحيح الخصائص إلى الفهرس عبر تحديثات إصدارية. يراقب النظام توزيعات المسافة، النتائج الفارغة، التجاوزات، والنتائج التجارية دون الخلط بين المبيعات والتوافق الحقيقي. تُستثنى الشروط الحساسة للموردين من الشروحات، وتظل الأمثلة المسترجعة دليلًا على التشابه—not ادعاء أن المنتجات متكافئة.

دليل التنفيذ وجاهزية التشغيل

يتطلب قرار الإنتاج أكثر من إظهار ناجح. حدّد المستخدمين المستهدفين، بيئة التشغيل، المدخلات، المخرجات، الاعتمادات، المالك، وعواقب كل فشل مهم. أنشئ خط أساس قابل لإعادة الإنتاج ومجموعة تقييم إصداري قبل الضبط. اختبر الحالات العادية، حدود النطاق، المدخلات المشوهة أو المفقودة، تحوُّل التوزيع، انقطاع الاعتماد، الاستخدام الخاطئ، والمجموعات أو البيئات التي قد تكون غير مخدومة. قسّ جودة المهمة مع المعايرة أو عدم اليقين، الكمون، الإنتاجية، تكلفة الموارد، إمكانية الوصول، الخصوصية، والأمان. سجّل كل تحويل وعَتَب حتى يتمكن مراجع مستقل من إعادة النتيجة وتمييز الأدلة عن نموذج جذاب.

قبل الإطلاق، عيّن سلطة للإصدار، الاستثناءات، التغييرات، الاسترجاع، والتقاعد. استخدم نشرًا متدرجًا، احفظ نسخة احتياطية آمنة، وتأكد من مراقبة مع فشل متعمد. يجب أن تكشف قياسات التشغيل عن جودة المدخلات، سلوك المخرجات، نسخة النموذج أو القاعدة، صحة الاعتماد، التدخلات البشرية، والنتائج المؤكدة دون جمع بيانات حساسة غير ضرورية. حدّد عتبات التنبيه ومالك الاستجابة، ثم راجع الأدلة الواقعية بعد النشر بدلاً من افتراض استمرار الأداء غير المتصل. أعد التقييم كلما تغيرت مصادر البيانات، المستخدمون، النماذج، البائعون، السياسات، الأجهزة، أو الأهداف. يحتاج النظام المُحافظ أيضًا إلى وثائق استعادة، تعلم من الحوادث، إجراءات حذف واحتفاظ، ونقطة واضحة لتوقيفه أو استبداله.

الأسئلة المتكررة

هل لدى KNN مرحلة تدريب؟

لا يتطلب الكثير من ملاءمة المعاملات، لكنه لا يزال يمتلك عملية تطوير: يتم تعلم المعالجة المسبقة من بيانات التدريب، قد يُبنى فهرس، وتُختار k، المقياس، الأوزان، والخصائص باستخدام التحقق.

هل KNN هو نفسه K-means؟

لا. KNN هو أساسًا طريقة تنبؤ محلية خاضعة للإشراف. K-means هو خوارزمية تجميع غير خاضعة للإشراف يكون فيها K عدد مراكز المجموعات.

المراجع الأساسية

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.