Sağlam K-ortalama Kümeleme
Robust K-means Clustering · Ayrıca şöyle bilinir: trimmed k-means, TCLUST k-means, contamination-resistant k-means, outlier-robust clustering
Sağlam K-ortalama kümeleme, küme tahminlerini aykırı değerlerin veya kirlenmiş gözlemlerin neden olduğu bozulmalardan koruyan klasik k-ortalamanın bir uzantısıdır. Algoritma, küme merkezlerini güncellemeden önce en uç noktaların kullanıcı tarafından belirtilen bir kısmını budayarak, verilerde standart k-ortalamayı ciddi şekilde saptıracak atipik durumlar olsa bile kararlı, anlamlı bölümlendirmeler sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Sağlam K-ortalama'yı, aksi takdirde sürekli çok değişkenli verilerde orta düzeyde aykırı değer veya kirlenmiş kayıt beklediğinizde ve sabit sayıda grupla bölümsel bir kümeleme çözümü istediğinizde kullanın. Veriler standart k-ortalamanın küresel küme varsayımını karşılamadığında ancak ana sapma temel olarak küresel olmayan küme şekli yerine kirlilik olduğunda uygundur. Kirlilik oranı hakkındaki ön inancınıza uyması için α'yı seçin; 0.05 değeri mantıklı bir varsayılandır. Kirlilik yoğun olduğunda (α yaklaşık 0.25'in üzerinde) dikkatli bir doğrulama yapılmadan, küme sayısı k gerçekten bilinmediğinde ve kendisinin sağlam bir şekilde tahmin edilmesi gerektiğinde (bunun yerine TCLUST kullanın) veya kümelerin çok farklı yoğunluklara veya eliptik şekillere sahip olması beklendiğinde (bu durumda Gauss karışım modelleri veya sağlam karışımlar tercih edilebilir) kullanmayın.
Güçlü yönler & sınırlılıklar
- Aykırı değerlerin küme merkezlerini bozmasına, açık, kullanıcı kontrollü budama yoluyla direnir.
- Hesaplama açısından verimli — algoritma standart k-ortalamayla aynı yineleme yapısına sahiptir, bu da onu büyük veri kümelerine ölçeklenebilir kılar.
- Uygunluk sürecinin bir yan ürünü olarak şüpheli aykırı gözlemleri tanımlar, veri kalitesi incelemesine yardımcı olur.
- Doğrudan, yorumlanabilir bir anlama sahip tek bir ek parametre (α) ile basit, şeffaf sağlamlaştırma.
- Orijinal budanmış k-ortalama literatüründe tutarlılık ve bozulma noktası sonuçları ile teorik istatistiklere iyi bir şekilde dayanır.
- Tıpkı standart k-ortalamada olduğu gibi, küme sayısı k'nin önceden belirtilmesini gerektirir.
- Budama oranı α da analist tarafından seçilmelidir; yanlış bir değer gerçek aykırı değerleri maskeleyebilir veya meşru gözlemleri yanlış bir şekilde budayabilir.
- Standart k-ortalamanın küresel küme varsayımını miras alır; çok farklı boyutlara veya uzatılmış şekillere sahip kümeler iyi bir şekilde kurtarılamayabilir.
- Başlatmaya duyarlılığı azaltmak için birden fazla rastgele başlangıç gereklidir, bu da hesaplama süresini artırır.
SSS
Budama oranı α'yı nasıl seçerim?
Pratik bir başlangıç noktası α = 0.05'tir, bu %5'lik bir kirlilik varsayımını yansıtır. Algoritmayı birkaç farklı değerle (örn. 0.00, 0.05, 0.10, 0.15) çalıştırarak ve küme merkezlerinin ve atamaların önemli ölçüde değişip değişmediğini kontrol ederek duyarlılığı keşfedebilirsiniz. Bir dizi α değeri boyunca kararlı sonuçlar, çözümün budama seviyesi tarafından yapay olarak zorlanmadığını gösterir.
Budanmış gözlemler otomatik olarak silmem gereken aykırı değerler midir?
Hayır. Budanmış gözlemler, mevcut çözüme göre herhangi bir küme merkezinden en uzakta olanlardır. Gerçek aykırı değerler, veri hataları veya seçilen k tarafından yakalanamayan küçük kümelerin üyeleri olabilirler. Aşağı akış analizlerinden hariç tutmaya karar vermeden önce her zaman onları inceleyin.
Sağlam k-ortalama TCLUST'tan nasıl farklıdır?
Sağlam k-ortalama (budanmış k-ortalama) Öklid mesafesini kullanır ve küresel küme merkezlerini günceller, bu da onu standart k-ortalamanın doğrudan sağlam bir analoğu yapar. TCLUST, budama fikrini genelleştirerek her kümenin kendi saçılım matrisine sahip olmasına izin verir ve bu matrisler üzerinde özdeğer-oran kısıtlamaları uygular, bu da kümelerin şekil ve hacim olarak farklılık gösterdiği durumlarda uygun hale getirir. Sağlam k-ortalama daha basit ve daha hızlıdır; TCLUST daha esnektir ancak ek ayarlama parametrelerine sahiptir.
Hala birden fazla rastgele başlangıca ihtiyacım var mı?
Evet. Standart k-ortalamada olduğu gibi, sağlam k-ortalama da yerel optimumlara yakınsayabilir. Algoritmayı birçok rastgele başlatmadan (veya bir k-means++ tohumlama stratejisi kullanarak) çalıştırmak ve en düşük budanmış küme içi kareler toplamına sahip çalıştırmayı seçmek şiddetle tavsiye edilir.
Sağlam k-ortalama Öklid dışı verileri işleyebilir mi?
Standart algoritma Öklid mesafesini ve aritmetik ortalamaları kullanır; sürekli, yaklaşık olarak aralık ölçekli değişkenler için tasarlanmıştır. İkili, sıralı veya karma tipli veriler için mesafe metriği ve merkez güncelleme kuralının uyarlanması gerekir (örn. uygun bir farklılık ölçüsü ile k-medoidler kullanarak), bu da standart sağlam k-ortalama çerçevesinin ötesine geçer.
Kaynaklar
- Cuesta-Albertos, J. A., Gordaliza, A., & Matrán, C. (1997). Trimmed k-means: An attempt to robustify quantizers. The Annals of Statistics, 25(2), 553–576. DOI: 10.1214/aos/1031833664 ↗
- García-Escudero, L. A., Gordaliza, A., Matrán, C., & Mayo-Iscar, A. (2008). A general trimming approach to robust cluster analysis. The Annals of Statistics, 36(3), 1324–1345. DOI: 10.1214/07-AOS515 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust K-means Clustering. ScholarGate. https://scholargate.app/tr/statistics/robust-k-means-clustering
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Küme Analiziİstatistik↔ karşılaştır
- Karışım Modellemesiİstatistik↔ karşılaştır
- Sağlam Hiyerarşik Kümelemeİstatistik↔ karşılaştır
- Sağlam Karışım Modellemesiİstatistik↔ karşılaştır