Yapay zeka temelleri
K-Means Kümeleme Nedir?
K-means kümeleme, bir denetimsiz öğrenme algoritmasıdır ve tüm denetimsiz öğrenme algoritmaları arasında, K-means kümeleme belki de en yaygın kullanılanıdır, gücüne ve basitliğine teşekkür eder. K-means kümeleme exactly nasıl çalışır?
Kısa cevap, K-means kümelemenin, istenen sayıda sınıf için bir referans noktası (merkez) oluşturarak ve sonra bu referans noktalarına göre veri noktalarını sınıf kümelere atanmasıdır. Bu, K-means kümeleme için hızlı bir tanımdır, ancak K-means kümeleme hakkında daha derin bir anlayış elde etmek için biraz zaman ayıralım.
Kümeleme Tanımı
K-means kümeleme algoritmalarını uygulamadan önce, kümelemenin genel olarak ne olduğunu tanımlayalım.
Kümeler, sadece öğelerin gruplarıdır ve kümeleme, bu öğeleri gruplara koymaktır. Veri biliminde, kümeleme algoritmaları iki şey yapmaya çalışır:
- Her bir kümedeki tüm veri noktalarının birbirine mümkün olduğunca benzer olmasını sağlar.
- Farklı kümedeki tüm veri noktalarının birbirine mümkün olduğunca farklı olmasını sağlar.
Kümeleme algoritmaları, bazı benzerlik ölçütüne göre öğeleri gruplar. Bu, genellikle farklı grupların “merkezini” bulmakla yapılır, ancak yalnızca bu yöntemle yapılmaz. Farklı kümeleme algoritmaları vardır, ancak tüm kümeleme algoritmalarının amacı aynıdır: verisetine ait grupları belirlemek.
K-Means Kümeleme
K-Means kümeleme, en eski ve en yaygın kullanılan kümeleme algoritmalarından biridir ve vektör kuantizasyonu temelinde çalışır. Uzayda bir origen olarak seçilen bir nokta vardır ve sonra bu origen’den verisetindeki tüm veri noktalarına vektörler çizilir.
Genel olarak, K-means kümeleme beş farklı adımda açıklanabilir:
- Örnekleri, K’ye eşit sayıda alt küme olarak yerleştirin.
- Yeni oluşturulan küme bölümlerinin merkez noktalarını bulun.
- Merkez noktalarına göre her bir noktayı belirli bir küme atan.
- Her bir noktadan merkez noktalarına olan uzaklıkları hesaplayın ve noktaları, merkez noktasına olan uzaklığı minimum olan kümelere atan.
- Noktalar kümelere atanmış olduğunda, kümelerin yeni merkez noktalarını bulun.
Yukarıdaki adımlar, eğitim süreci tamamlanana kadar tekrarlanır.

İlk aşamada, merkez noktaları veri noktaları arasında yerleştirilir.
Foto: Weston.pace via wikimedia commons, GNU Free Documentation License (https://commons.wikimedia.org/wiki/File:K_Means_Example_Step_1.svg)
Alternatif olarak, merkez noktaları yerleştirildikten sonra, K-means kümelemeyi veri noktalarını etiketleme ve merkez noktalarını güncelleme arasında gidip gelen iki farklı aşama olarak düşünebiliriz.

İkinci adımda, bir uzaklık ölçütü gibi Euclid uzaklığı kullanılır ve sonra noktalar, en yakın merkez noktasına atanır. Foto: Weston.pace via Wikimedia Commons, GNU Free Doc License (https://commons.wikimedia.org/wiki/File:K_Means_Example_Step_2.svg)
Veri noktası etiketleme aşamasında, her bir veri noktası en yakın merkez noktasına ait küme olarak etiketlenir. En yakın merkez noktası genellikle kare Euclid uzaklığı kullanılarak belirlenir, ancak diğer uzaklık ölçütleri gibi Manhattan uzaklığı, Cosine ve Jaccard uzaklığı da veri türüne bağlı olarak kullanılabilir.

Üçüncü adımda, merkez noktaları, tüm veri noktalarının ortalama uzaklığına göre güncellenir. Sonra, sınıflar yeniden atanır. Foto: Weston.pace via Wikiemedia Commons, CC SA 3.0 (https://commons.wikimedia.org/wiki/File:K_Means_Example_Step_3.svg)
Merkez noktalarının güncellenmesi aşamasında, merkez noktaları, kümedeki tüm veri noktalarının ortalama uzaklığına göre hesaplanır.
“K” Değerini Seçme
K-means kümeleme bir denetimsiz algoritmadır ve sınıf sayısı önceden bilinmediğinden, “K” değerini nasıl seçersiniz?
“K” değerini seçmek için kullanılan bir teknik, “dirsek tekniği” dir. Dirsek tekniği, farklı “K” değerleri için K-means kümeleme algoritmasını çalıştırarak ve sonra bir doğruluk ölçütü kullanarak, genellikle Kare Hata Toplamı, hangi “K” değerlerinin en iyi sonuçları verdiğini belirlemektir. Kare Hata Toplamı, bir kümenin merkez noktası ile kümedeki veri noktaları arasındaki ortalama uzaklık hesaplarak belirlenir.
“Dirsek tekniği” terimi, farklı “K” değerleri için Kare Hata Toplamını grafikleştirildiğinde, genellikle bir “dirsek” şekli oluşur, burada Kare Hata Toplamı ilk birkaç “K” değeri için hızla azalır, ancak sonra düzleşir. Bu durumda, “dirsek” noktasındaki “K” değeri, en iyi “K” değeridir, çünkü bu değerden sonra hızla azalan getiriler oluşur.
Mini-Toplu K-Means Kümeleme
Veri setleri büyüdükçe, hesaplanma zamanı da artar. Temel K-means kümeleme, büyük veri setleri üzerinde çalıştırıldığında uzun zaman alabilir ve bu nedenle, K-means kümelemenin hesaplanma zamanını ve uzay gereksinimlerini azaltmak için bazı değişiklikler yapılmıştır.
Mini-Toplu K-Means kümeleme, K-means kümelemenin bir varyantıdır ve bu varyantta, dikkate alınan veri setinin boyutu sınırlıdır. Normal K-means kümeleme, tüm veri setini bir defada işler, ancak Mini-Toplu K-Means kümeleme, veri setini alt kümelerine ayırır. Mini-toplu örnekler, tüm veri setinden rastgele seçilir ve her yeni iterasyon için yeni bir rastgele örnek seçilir ve merkez noktalarının konumunu güncellemek için kullanılır.
Mini-Toplu K-Means kümelemede, kümeler, mini-toplu değerlerin bir kombinasyonu ve bir öğrenme oranı ile güncellenir. Öğrenme oranı, iterasyonlar boyunca azalır ve bir kümede bulunan veri noktalarının sayısının tersidir. Öğrenme oranının azalmasının etkisi, yeni verilerin etkisi azaltılır ve kümeler değişmediğinde, birçok iterasyon之后, birleşir.
Mini-Toplu K-Means kümelemenin etkinliği üzerine yapılan çalışmalar, hesaplanma zamanını biraz küme kalitesi ile ticaret yaparak azaltabileceğini gösteriyor.
K-Means Kümelemenin Uygulamaları
K-means kümeleme, veri noktalarını ayrı gruplara/ayrı sınıflara ayırabileceğiniz her durumda güvenle kullanılabilir. İşte K-means kümelemenin bazı ortak kullanım örnekleri.
K-means kümeleme, belgeleri, konular, etiketler, kelime kullanımı, meta veriler ve diğer belge özelliklerine göre gruplandırarak belge sınıflandırma için kullanılabilir. Ayrıca, kullanıcıları bot mu yoksa bot değil mi olarak sınıflandırmak için, aktivite kalıpları gibi paylaşımlar ve yorumlar gibi özellikler temelinde kullanılabilir. K-means kümeleme, insanların sağlık durumlarını izlerken, komorbiditeler, yaş, hasta geçmişi gibi özelliklere göre gruplandırılması için de kullanılabilir.
K-means kümeleme, daha açık uçlu görevler gibi öneri sistemleri oluşturmak için de kullanılabilir. Bir sistemdeki kullanıcılar, izleme kalıplarına göre gruplandırılabilir ve benzer içerik önerilebilir. K-means kümeleme, anormallik tespiti görevleri için de kullanılabilir, potansiyel sahtekarlık veya hatalı öğeleri vurgulayabilir.












