Robust k-means
Robust k-means Clustering · Ayrıca şöyle bilinir: robust k-means clustering, trimmed k-means, outlier-resistant k-means, RKM
Robust k-means, klasik k-means kümelemesinin aykırı değerlerin etkisine direnmek üzere tasarlanmış bir çeşididir. Küme merkezlerini hesaplamadan önce en uç gözlemlerin belirli bir kesirini kırparak, veri gürültü, bulaşma veya ağır kuyruklu dağılımlar içerdiğinde bile standart k-means'in bozulduğu durumlarda kararlı ve anlamlı bölümlendirmeler üretir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Sürekli çok değişkenli verileri kümelemek istediğinizde ancak standart bir k-means çözümünü bozacak aykırı değerlerin, ölçüm hatalarının veya veri bulaşmasının varlığından şüphelendiğinizde Robust k-means kullanın. Özellikle kırpma kesrinin alan bilgisiyle tahmin edilebildiği durumlarda uygundur (örneğin, %10'a kadar hatalı kayıt beklenmesi). k'nin bilinmediği ve hassasiyet analizi planlanmadığı durumlarda kaçının — k ve alfa'nın ortak seçimi dikkat gerektirir. Kategorik veya karma türdeki veriler için uygun değildir, bunlar yerine k-modları veya k-prototipleri gerektirir. Çok yüksek boyutlu veriler için mesafe yoğunlaşması kırpma kriterini baltalayabilir.
Güçlü yönler & sınırlılıklar
- Kırpma kesri aracılığıyla aykırı değer etkisini açıkça kontrol eder, kümeleri bulaşma altında yorumlanabilir ve kararlı hale getirir.
- Anlamlı sağlamlık garantileri eklerken k-means'in basitliğini ve ölçeklenebilirliğini korur.
- Kırpılmış gözlemlerin kendileri otomatik bir aykırı değer tespiti yan ürünü olarak hizmet eder.
- Titiz istatistiksel teori ile iyi desteklenir, kanıtlanmış kırılma noktası özelliklerine sahiptir.
- k-means++ başlatma ve paralel yeniden başlatmalarla uyumludur, büyük veri kümelerinde hesaplamayı yönetilebilir tutar.
- İki ayar parametresi gerektirir — küme sayısı k ve kırpma kesri alfa — her ikisi de dikkatle seçilmelidir.
- Kabaca küresel, eşit büyüklükte kümeler varsayar; uzamış veya düzensiz küme şekilleri DBSCAN veya spektral yöntemleri destekler.
- Mesafe metriği seçimine duyarlıdır; Öklid mesafesi yüksek boyutlarda yanıltıcı olabilir.
- Kırpılmış gözlemler nihai küme üyeliğinden hariç tutulur, bu da bu noktalar bilimsel anlam taşıyorsa sorunlu olabilir.
SSS
Kırpma kesri alfa'yı nasıl seçerim?
Beklenen bulaşma oranı hakkındaki alan bilgisinden başlayın (örneğin, %5-10 hatalı kayıt). Ardından bir alfa değeri gridi üzerinde hassasiyet analizi yapın ve küme boyutlarının ve kırpılmış kümenin bileşiminin nasıl değiştiğini inceleyin. Bir dizi alfa değeri boyunca kararlı kümeler, çözümün gerçek olduğunu gösterir.
Robust k-means, k-medoids ile aynı mı?
Hayır. k-medoids (PAM), ortalama merkezi bir veri noktası (medoid) ile değiştirir, bu da farklı bir mekanizma aracılığıyla aykırı değer direncini sağlar. Robust k-means hala ortalamaları kullanır ancak bunları hesaplamadan önce aykırı gözlemleri hariç tutar. k-medoids, kategorik-yakın veriler için daha yorumlanabilirdir; Robust k-means, kırpma çerçevesi altında daha güçlü teorik garantilere sahiptir.
Robust k-means'i yalnızca aykırı değer tespiti için kullanabilir miyim?
Evet, kırpılmış kesri işaretlenmiş bir anomali kümesi olarak ele almak meşru bir uygulamadır. Ancak, özel anomali tespiti için Isolation Forest veya DBSCAN (gürültü noktalarını açıkça etiketleyen) gibi yöntemler daha uygun olabilir, çünkü k küme sayısı belirtmeyi gerektirmezler.
Robust k-means büyük veri kümelerine ölçeklenir mi?
Makul ölçüde iyi. Her iterasyon, mesafelerin hesaplanmasını ve sıralanmasını içerir, bu da iterasyon başına O(nk)'dir — ek bir sıralama ile standart k-means'in karmaşıklığıyla aynıdır. Çok büyük n için, literatürde Robust k-means'in mini-batch varyantları önerilmiştir.
Kümelerim çok farklı boyutlarda olursa ne olur?
Standart Robust k-means (standart k-means gibi), benzer boyutlarda kümeler üretme eğilimindedir. Kümelerinizin yoğunluk veya üyelik açısından büyük farklılıklar göstermesi bekleniyorsa, DBSCAN, Gaussian Mixture Models veya aynı kırpma paradigması içinde farklı küme şekillerine ve boyutlarına izin veren daha genel TCLUST çerçevesini düşünün.
Kaynaklar
- Garcia-Escudero, L. A., & Gordaliza, A. (1999). Robustness properties of k-means and trimmed k-means. Journal of the American Statistical Association, 94(447), 956–969. DOI: 10.2307/2670010 ↗
- Garcia-Escudero, L. A., Gordaliza, A., Matrán, C., & Mayo-Iscar, A. (2008). A general trimming approach to robust cluster analysis. Annals of Statistics, 36(3), 1324–1345. DOI: 10.1214/07-AOS515 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust k-means Clustering. ScholarGate. https://scholargate.app/tr/machine-learning/robust-k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- K-ortalama KümelemeMakine öğrenmesi↔ karşılaştır
- Spektral KümelemeMakine öğrenmesi↔ karşılaştır