Modely a platformy AI
Rychlý průvodce pochopením algoritmu KNN
S tím, jak byznysový svět agresivně přijímá Data Science, se stal jedním z nejžádanějších oborů. Vysvětlíme, co je algoritmus K-nearest neighbor a jak funguje.
Co je algoritmus KNN?
Algoritmus K-Nearest Neighbors (nebo KNN) je jedním z nejčastěji používaných učících se algoritmů díky své jednoduchosti. KNN nebo algoritmus K-nearest neighbor je algoritmus supervizovaného učení, který funguje na principu, že každý datový bod, který spadá blízko k sobě, patří do stejné třídy. Základní předpoklad zde je, že věci, které jsou blízko sebe, jsou si podobné. Mostly, algoritmus KNN se používá kvůli jeho snadné interpretaci a nízkému času výpočtu.
KNN se široce používá pro klasifikační a regresní problémy v strojovém učení. Některé příklady KNN jsou algoritmy používané e-commerce portály pro doporučení podobných produktů.
Pojďme si prohlédnout příklad:
Na daném obrázku máme dvě třídy dat. Třída A reprezentuje čtverce a třída B reprezentuje trojúhelníky.
Problém spočívá v přiřazení nového vstupního datového bodu do jedné z dvou tříd pomocí algoritmu KNN
Prvním krokem je definovat hodnotu ‘K’, která zastupuje počet nejbližších sousedů.

Pokud je hodnota “k” 6, bude hledat 6 nejbližších sousedů k tomuto datovému bodu, pokud je hodnota “k” 5, bude hledat 5 nejbližších sousedů k tomuto datovému bodu.
Pojďme si představit ‘K’ = 4, což znamená, že algoritmus bude zvažovat čtyři nejbližší sousedy, kteří jsou nejblíže k datovému bodu.
Nyní, při ‘K’ = 4, lze vidět jeden trojúhelník a dva čtverce jako nejbližší sousedy. Takže, nový datový bod na základě ‘K’ = 4 by byl přiřazen do třídy A.

Kde použít KNN?
KNN se používá v klasifikačních a regresních předpovědních problémech. Nicméně, když je aplikován pro průmyslové účely, většinou se používá v klasifikaci, protože se osvědčuje ve všech parametrech, které se vyhodnocují při stanovení použitelnosti techniky.
- Předpovědní síla
- Čas výpočtu
- Snadná interpretace výstupu
Jak se používá v každodenních problémech?
Navzdory své jednoduchosti, KNN funguje lépe než ostatní silní klasifikátoři a používá se na místech, jako je ekonomické předpovídání, komprese dat, rozpoznávání videa, rozpoznávání obrázků, rozpoznávání rukopisu a rozpoznávání řeči.
Některé hlavní použití algoritmu KNN
Algoritmus KNN se používá v bankovním systému pro předpověď, zda je osoba způsobilá k schválení úvěru nebo ne, předpovídající, zda má podobné rysy jako defaulter. KNN také pomáhá při výpočtu kreditních skórů jednotlivců srovnáním s osobami, které mají podobné rysy.
Společnosti, které používají KNN
Většina e-commerce a zábavních společností, jako je Amazon (AMZN ) nebo Netflix (NFLX ), používají KNN při doporučování produktů ke koupi nebo filmů/seriálů ke zhlédnutí.
Jak vlastně dělají tato doporučení? Tyto společnosti shromažďují data o chování uživatelů, jako jsou předchozí produkty, které jste na jejich webových stránkách koupili, nebo filmy, které jste sledovali, a aplikují KNN.
Společnosti budou vstupovat vaše dostupná zákaznická data a porovnávat je s jinými zákazníky, kteří koupili podobné produkty nebo sledovali podobné filmy.
Produkty a filmy budou pak doporučeny vám, v závislosti na tom, jak algoritmus klasifikuje tento datový bod.
Výhody a nevýhody KNN
Výhody KNN
- Rychlý výpočet
- Jednoduchý algoritmus – snadná interpretace
- Univerzální – použitelný pro klasifikaci a regresi
- Vysoká přesnost
- Žádné předpoklady o datech – není třeba dělat další předpoklady nebo budovat model.
Nevýhody KNN
- Přesnost závisí na kvalitě dat
- Předpověď se zpomaluje s velkými daty
- Není relevantní pro velké datové sady
- Potřebuje uložit všechna trénovací data, a proto vyžaduje vysokou paměť
- Může být výpočetně nákladný, protože ukládá všechna trénovací data
V tomto blogu jsme se pokusili vysvětlit algoritmus K-NN, který se široce používá pro klasifikaci. Diskutovali jsme o základním přístupu za KNN, jak funguje a jeho výhody a nevýhody.
Algoritmus KNN je jedním z nejjednodušších algoritmů a může poskytnout velmi agresivní výsledky. Algoritmy KNN lze použít jak pro klasifikační, tak pro regresní problémy.












