K-ortalama Kümeleme
K-means Clustering Algorithm · Ayrıca şöyle bilinir: k-means clustering, Lloyd's algorithm, k-means partitioning, hard k-means
K-ortalama, bir veri setini K adet çakışmayan gruba ayıran klasik bir denetimsiz bölümlemeli kümeleme algoritmasıdır. Her gözlemi en yakın merkezine atayarak ve merkezleri atanan noktaların ortalaması olarak güncelleyerek yinelemeli bir şekilde çalışır. Makine öğrenimi ve veri analizinde en yaygın kullanılan keşif araçlarından biridir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+16 tane daha
Ne zaman kullanılır
K-ortalama, hızlı, ölçeklenebilir bölümlemeye ihtiyaç duyduğunuzda ve K'yi önceden belirtmekten veya dirsek veya siluet yöntemiyle aramaktan çekinmediğinizde, büyük, tamamen sayısal veri setlerinin keşifsel kümelenmesi için uygundur. Müşteri segmentasyonu, görüntü sıkıştırma, belge konu gruplaması ve denetimli öğrenme öncesi ön işleme için iyi çalışır. Kümeler küresel değilse, boyutları veya yoğunlukları çok farklıysa, öznitelikler kategorik veya sıralıysa (bunun yerine k-modları veya k-prototipleri kullanın), küme sayısı tamamen bilinmiyorsa ve farklı K deneyleri mümkün değilse veya veriler çok sayıda aykırı değer içeriyorsa (bunun yerine DBSCAN veya sağlam varyantlarını kullanın) kaçının.
Güçlü yönler & sınırlılıklar
- Hızlı ve ölçeklenebilir: Her yinelemede O(nKdi), orta K ve boyutlarla milyonlarca gözlem üzerinde pratiktir.
- Uygulaması basit, her büyük ML çerçevesinde yaygın olarak bulunur ve teknik olmayan kitlelere açıklaması kolaydır.
- Büyük, iyi ayrılmış, kabaca küresel ve benzer büyüklükteki kümelerde iyi çalışır.
- k-means++ başlatma, rastgele başlatmaya kıyasla başlangıç koşullarına duyarlılığı önemli ölçüde azaltır.
- Sabit bir rastgele tohum içinde deterministiktir, bu da sonuçların tekrarlanabilir olmasını sağlar.
- K'nin önceden belirtilmesini gerektirir; K'nin kötü seçilmesi anlamsız kümeler üretir.
- Küresel, benzer büyüklükteki kümeler varsayar; uzatılmış, düzensiz veya farklı ölçekli kümeler yanlış bölünür veya birleştirilir.
- Aykırı değerlere duyarlıdır: tek bir aşırı nokta, bir merkezi kümenin büyük kısmından uzağa çekebilir.
- Yalnızca sayısal sürekli özniteliklerle çalışır; kategorik veriler farklı bir algoritma (k-modları) gerektirir.
- Yerel bir minimuma yakınsar; k-means++ veya çoklu yeniden başlatmalar kullanılmadıkça, farklı rastgele tohumlarla yapılan çalıştırmalar arasında sonuçlar değişebilir.
SSS
Doğru küme sayısı K'yi nasıl seçerim?
K-ortalamayı bir dizi K değeri için çalıştırın, küme içi kareler toplamını K'ye karşı çizin ve azalma oranının keskin bir şekilde yavaşladığı bir 'dirsek' arayın. Bunu, her noktanın kendi kümesine komşu kümelere göre ne kadar benzer olduğunu ölçen siluet skorlarıyla destekleyin; daha yüksek ortalama siluet, daha iyi tanımlanmış kümeleri gösterir.
Her çalıştırmada neden farklı sonuçlar alıyorum?
K-ortalama, başlatmaya duyarlıdır ve WCSS'nin global minimumundan ziyade yerel bir minimumuna yakınsar. Tekrarlanabilirlik için k-means++ başlatmayı kullanın ve sabit bir rastgele tohum ayarlayın. Algoritmayı farklı tohumlarla birden çok kez çalıştırmak ve en düşük eylemsizliğe sahip çözümü saklamak iyi bir uygulamadır.
K-ortalama kategorik verilerle çalışır mı?
Hayır. K-ortalama, kategorik değişkenler için tanımlanmamış olan Öklid mesafesine ve merkez ortalamalarına dayanır. Tamamen kategorik veriler için k-modlarını; karışık sayısal ve kategorik veriler için k-prototiplerini kullanın.
DBSCAN veya GMM'yi k-ortalamaya ne zaman tercih etmeliyim?
Kümeler düzensiz şekillere sahip olduğunda veya K'yi belirtmeden otomatik aykırı değer tespitine ihtiyacınız olduğunda DBSCAN'ı kullanın. Daha yüksek hesaplama karmaşıklığı pahasına, yumuşak (olasılıksal) küme atamaları veya farklı boyut ve yönelimlerde kümeler istediğinizde Gauss Karışım Modellerini (GMM) kullanın.
Özniteliklerimi ölçeklendirmem gerekiyor mu?
Evet, neredeyse her zaman. K-ortalama Öklid mesafesini kullanır, bu nedenle geniş sayısal aralıklara sahip öznitelikler kümelemeye hakim olacaktır. Tüm öznitelikler zaten aynı ölçekte değilse, k-ortalamayı uygulamadan önce z-skor standardizasyonu veya min-max ölçeklendirme uygulayın.
Kaynaklar
- Lloyd, S. P. (1982). Least squares quantization in PCM. IEEE Transactions on Information Theory, 28(2), 129–137. DOI: 10.1109/TIT.1982.1056489 ↗
- MacQueen, J. B. (1967). Some methods for classification and analysis of multivariate observations. Proceedings of the 5th Berkeley Symposium on Mathematical Statistics and Probability, 1, 281–297. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). K-means Clustering Algorithm. ScholarGate. https://scholargate.app/tr/machine-learning/k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- Temel Bileşen AnaliziMakine öğrenmesi↔ karşılaştır
- t-SNEMakine öğrenmesi↔ karşılaştır