Sağlam Hiyerarşik Kümeleme
Robust Hierarchical Clustering · Ayrıca şöyle bilinir: robust agglomerative clustering, outlier-resistant hierarchical clustering, robust linkage clustering, RHC
Sağlam hiyerarşik kümeleme, hassas mesafe ölçümlerini ve bağlantı kriterlerini aykırı değerlere dirençli alternatiflerle değiştirerek, veriler anormal gözlemler veya ağır kuyruklu dağılımlar içerse bile küme yapısını koruyarak klasik yığmacı veya ayırıcı hiyerarşik kümelemeyi genişletir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Çok değişkenli verileriniz, klasik hiyerarşik kümeleme sonuçlarını bozabilecek aykırı değerler, ölçüm hataları veya ağır kuyruklu varyasyonlar içerebileceğinde sağlam hiyerarşik kümeleme kullanın. Küme sayısı bilinmediğinde ve hem bir bölümleme hem de küme hiyerarşisinin görsel bir temsilini istediğiniz keşif analizleri için özellikle uygundur. Sürekli değişkenlerle iyi çalışır, ancak karışık veriler için sağlam mesafe ölçümleri mevcuttur. Veriler temiz ve Gauss ise KULLANMAYIN — klasik hiyerarşik kümeleme yeterli ve daha hızlıdır. n çok büyükse (birkaç binden fazla) kaçının, çünkü yığmacı algoritmalar bellek ve zaman açısından O(n^2)'dir; sağlam k-ortalamalar veya CLARA gibi bölümleme tabanlı yöntemler daha iyi ölçeklenir. Ayrıca önceden belirlenmiş bir küme yapısının onaylayıcı bir testi olarak uygun değildir — bunun için sağlam karışım modellemesi gibi modele dayalı bir yaklaşım kullanın.
Güçlü yönler & sınırlılıklar
- Küme sayısının önceden belirtilmesine gerek yoktur; kesim dendrogramdan sonradan seçilebilir.
- MCD veya benzeri tahmin edicilere dayalı sağlam mesafe ölçümleri, aykırı değerlerin ve kaldıraç noktalarının etkisini önemli ölçüde azaltır.
- Tam birleşme hiyerarşisini gösteren tam bir dendrogram üretir, küme sayısı ve iç içeliğinin yorumlanmasına yardımcı olur.
- Aykırı değerler, büyük yüksekliklerde geç birleşen tekiller olarak doğal olarak ortaya çıkar ve otomatik bir kontaminasyon tanısı sağlar.
- Farklı küme şekilleri için alana özgü bağlantı seçimiyle (ortalama, tam, Ward benzeri) uyumludur.
- Yığmacı algoritmaların O(n^2) zaman ve bellek karmaşıklığı vardır, bu da onları büyük veri kümeleri için pratik olmaktan çıkarır.
- MCD tabanlı sağlam mesafe tahmini, değişken sayısına göre yeterli örneklem boyutuna ihtiyaç duyar (n >> p).
- Birleşmeler geri alınamaz: erken bir hatalı birleşme geri alınamaz ve bu, dendrogram boyunca hataları yayabilir.
- Bağlantı kriterinin seçimi hala sonuçları etkiler ve evrensel olarak optimal bir seçim yoktur.
- Sağlam yöntemler, varsayımların aşırı ihlallerine karşı hassasiyeti azaltır ancak ortadan kaldırmaz.
SSS
Sağlam hiyerarşik kümeleme, klasik hiyerarşik kümelemeden nasıl farklıdır?
Klasik hiyerarşik kümeleme, aykırı değerlere oldukça duyarlı olan örnek ortalaması ve kovaryans matrisini kullanarak mesafeleri hesaplar. Sağlam hiyerarşik kümeleme, bunları aykırı değerlere dirençli tahminlerle — en yaygın olarak Minimum Kovaryans Determinant tahmin edicisi — değiştirir ve ayrıca sağlam bağlantı kriterleri kullanabilir, böylece az sayıda anormal gözlem tüm küme çözümünü bozamaz.
Hangi bağlantı yöntemi sağlam mesafelerle kullanılmalıdır?
Ortalama bağlantı (UPGMA) ve tam bağlantı, tek bağlantıdan daha yaygın olarak tercih edilir çünkü tek bağlantı, kümelerin birer birer gözlem ekleyerek uzadığı zincirleme eğilimindedir. Ward'ın kriteri de sağlam mesafelere uyarlanabilir. Aykırı değerler önemli bir endişe kaynağı olduğunda, kümeler arasındaki en uç mesafeleri göz ardı eden kırpılmış bağlantı varyantları ek koruma sağlar.
Sağlam hiyerarşik kümeleme karışık veri türlerini işleyebilir mi?
Uygun karışık veri için sağlam mesafe ölçümleri kullanılıyorsa işleyebilir — örneğin, Gower mesafesinin sağlam uzantıları. Ancak, en kolay bulunan uygulamaların çoğu sürekli değişkenlere odaklanır. Karışık veriler için, sağlam modele dayalı kümeleme veya sağlam gizli sınıf analizi daha prensipli alternatifler olabilir.
Ne kadar örneklem boyutuna ihtiyacım var?
MCD tabanlı sağlam mesafe tahmini, değişkenlerden önemli ölçüde daha fazla gözlem gerektirir (n >> p). Yaygın bir pratik kılavuz en az n >= 5p'dir. Eğer p, n'ye göre büyükse, önce boyut azaltmayı düşünün veya düzenlileştirilmiş sağlam kovaryans tahmin edicilerini kullanın.
Küme sayısını nasıl belirlerim?
Küme birleşme yüksekliğindeki büyük sıçramalar için dendrogramı inceleyin, bu doğal küme sınırlarını düşündürür. Bunu, sağlam mesafelere göre hesaplanan nicel kriterlerle tamamlayın: siluet katsayısı, boşluk istatistiği veya Calinski-Harabasz indeksi. Birden fazla kriter boyunca tutarlılık, seçilen çözümü güçlendirir.
Kaynaklar
- Kaufman, L. & Rousseeuw, P. J. (1990). Finding Groups in Data: An Introduction to Cluster Analysis. Wiley. ISBN: 978-0471878766
- Garcia-Escudero, L. A., Gordaliza, A., Matran, C. & Mayo-Iscar, A. (2010). A review of robust clustering methods. Advances in Data Analysis and Classification, 4(2–3), 89–109. DOI: 10.1007/s11634-010-0064-5 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust Hierarchical Clustering. ScholarGate. https://scholargate.app/tr/statistics/robust-hierarchical-clustering
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Küme Analiziİstatistik↔ karşılaştır
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- Karışım Modellemesiİstatistik↔ karşılaştır
- Çok Boyutlu Ölçekleme (ÇBÖ)İstatistik↔ karşılaştır
- Sağlam K-ortalama Kümelemeİstatistik↔ karşılaştır