K-Means Kümeleme
K-Means Clustering (Lloyd–MacQueen Algorithm) · Ayrıca şöyle bilinir: K-Ortalamalar Kümeleme, k-ortalamalar kümeleme, k-means, centroid clustering
K-Means Kümeleme, 1967'de J. MacQueen'e dayanan, her gözlemi en yakın küme merkezine atayarak veriyi k kümeye bölen, merkeze dayalı bir bölümlemeli kümeleme algoritmasıdır. Pazarlama segmentasyonu, müşteri gruplama ve keşifsel analiz için yaygın olarak kullanılır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+6 tane daha
Ne zaman kullanılır
K-Means'i, gözlemleri önceden belirlenmiş sayıda gruba ayırmak istediğinizde ve en az yaklaşık 50 gözleminiz olduğunda, sürekli ve sayım tipi özelliklerin keşifsel analizi veya sınıflandırılması için kullanın. Kabaca küresel, benzer büyüklükte kümeler varsayar ve özelliklerin önceden standartlaştırılmasını gerektirir. Örnek küçük olduğunda (yaklaşık 50'nin altında) veya küresel küme varsayımı şüpheli olduğunda, hiyerarşik kümeleme daha güvenli, daha keşifsel bir alternatiftir.
Güçlü yönler & sınırlılıklar
- Basit, hızlı ve düşük matematiksel ek yük ile büyük veri kümelerine ölçeklenebilir.
- Segmentasyon çalışmaları için açık, yorumlanabilir küme atamaları ve merkezleri üretir.
- Dağılımlar üzerinde varsayım hafifliği: normal dağılımlı veri gerektirmez.
- İşletme, pazarlama ve keşifsel veri analizinde yaygın olarak kabul edilmiştir.
- Küme sayısı k, veriden keşfedilmek yerine önceden sabitlenmelidir.
- Küresel, karşılaştırılabilir büyüklükte kümeler varsayar ve düzensiz şekillerle mücadele eder.
- Sonuçlar standartlaştırmaya ve rastgele başlangıç merkezlerine bağlıdır.
- Küçük örneklerde (yaklaşık 50'nin altında) merkezler kararsızdır, farklı başlangıç noktalarından tutarsız sonuçlar verir.
SSS
Küme sayısı k'yı nasıl seçerim?
k, algoritmayı çalıştırmadan önce ayarlanmalıdır. Dirsek yöntemi (küme içi varyansı k'ya karşı çizme) ve siluet analizi, mantıklı bir değer seçmek ve doğrulamak için standart yollardır.
Verilerimi önce ölçeklendirmem gerekiyor mu?
Evet. K-Means mesafeye dayandığı için standartlaştırma zorunludur: olmadan, büyük bir aralığa sahip bir özellik küme atamalarına hakim olacak ve gruplamayı bozacaktır.
Her seferinde neden farklı kümeler elde ediyorum?
K-Means rastgele başlangıç merkezlerinden başlar, bu nedenle sonuçlar, özellikle merkezlerin kararsız olduğu küçük örneklerde değişebilir. Birden fazla başlatma çalıştırmak ve en iyisini tutmak veya hiyerarşik kümeleme gibi daha keşifsel bir yöntem kullanmak yardımcı olur.
Kümelemeden önce ve sonra neyi kontrol etmeliyim?
Önceden, verinin kümelenebilir olduğunu (örneğin en az yaklaşık 0.75'lik bir Hopkins istatistiği ile) doğrulayın ve k'yı dirsek yöntemi ve siluet analizi ile seçin. Sonrasında, siluet skorunu raporlayın, her kümenin profilini açıklayın ve kümeleri PCA veya t-SNE ile görselleştirin.
Kaynaklar
- MacQueen, J. (1967). Some Methods for Classification and Analysis of Multivariate Observations. Proceedings of the 5th Berkeley Symposium on Mathematical Statistics and Probability, 1, 281–297. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). K-Means Clustering (Lloyd–MacQueen Algorithm). ScholarGate. https://scholargate.app/tr/machine-learning/k-means-clustering
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- Doğrusal Diskriminant Analizi (LDAİstatistik↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır