Topluluk K-means
Ensemble K-means Clustering (Consensus Clustering) · Ayrıca şöyle bilinir: consensus K-means, K-means ensemble clustering, cluster ensemble with K-means, EKM
Topluluk K-means, K-means kümelemesini çeşitli başlangıçlar, rastgele tohumlar veya özellik alt kümeleri altında birçok kez çalıştırır, ardından elde edilen bölmeleri tek bir fikir birliği atamasına toplar. Bu yaklaşım, K-means'in iyi bilinen başlangıç hassasiyetini azaltır ve tek bir çalıştırmadan daha kararlı, tekrarlanabilir kümeler üretir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Tek bir K-means çalıştırması tekrarlanan analizlerde kararsız veya tekrarlanamayan sonuçlar verdiğinde, küme sayısı k hakkında belirsiz olduğunuzda veya tek bir K-means başlangıcının genellikle kaçırdığı karmaşık veya uzun kümeleri olan bir veri kümeniz olduğunda Topluluk K-means'i kullanın. Özellikle genomi, görüntü segmentasyonu ve tekrarlanabilirliğin önemli olduğu müşteri segmentasyonunda değerlidir. Alan odaklı küme doğrulaması için bir ikame olarak kullanmayın: kümeleri her zaman anlamsal olarak yorumlayın. Hesaplama bütçesi çok kısıtlıysa (B çalıştırması tek çalıştırma süresinin B katı maliyetlidir) veya boyut azaltma olmadan verinin boyutu çok yüksekse, ortak ilişki matrisi gürültülü hale geleceğinden kaçının.
Güçlü yönler & sınırlılıklar
- Tek bir K-means çalıştırmasından dramatik olarak daha kararlı ve tekrarlanabilir kümeler.
- Çalıştırmalar arasındaki etiket permütasyonuna karşı kayıtsız, eşleşme sorununu önler.
- Farklı k değerlerine sahip çalıştırmaları toplayabilir, küme sayısı seçimine örtük sağlamlık verir.
- Ortak ilişki matrisi, aşağı akış analizi için kullanışlı yumuşak bir benzerlik ölçüsü sağlar.
- Paralelleştirilebilir: B K-means çalıştırmasının her biri bağımsızdır ve eşzamanlı olarak çalıştırılabilir.
- Hesaplama maliyeti, topluluk üyelerinin sayısı B ile doğrusal olarak ölçeklenir.
- n-n'lik ortak ilişki matrisini depolamak ve işlemek, büyük n'ler için bellek yoğun.
- Son fikir birliği kümelemesi hala bir yöntem ve parametrelerinin (örneğin, küme sayısı) seçilmesini gerektirir.
- Temel kümeleyicilerle birleştirilmedikçe, K-means'in temel varsayımını (küresel, benzer boyutlu kümeler) çözmez.
SSS
Kaç topluluk üyesi B kullanmalıyım?
Yaygın bir varsayılan değer 50-100 çalıştırmadır. Ortak ilişki matrisi stabilize olana kadar B'yi artırın — yani, daha fazla çalıştırma eklendiğinde fikir birliği küme atamaları artık değişmez. 20'den az çalıştırma nadiren anlamlı kararlılık kazançları sağlar.
Küme sayısı k'yi nasıl seçerim?
Topluluğu bir dizi k değeri üzerinde çalıştırın ve fikir birliği kümülatif dağılım fonksiyonu (CDF) grafiklerini inceleyin. CDF'nin en ani değişimi (en yüksek delta) gösterdiği k, en belirgin kümelemeyi gösterir. Fikir birliği yaklaşımı, bu seçimi tek bir K-means çalıştırmasındaki dirsek yönteminden daha güvenilir hale getirmek için özel olarak tasarlanmıştır.
Topluluk K-means, K-means'in küresel küme varsayımını çözer mi?
Tam olarak değil. Topluluk üyelerinin tümü standart K-means'i Öklid mesafesiyle kullanırsa, toplama hala dışbükey, kabaca küresel kümeler için bir tercih miras alır. Dışbükey olmayan veya rastgele şekilli kümeler için, topluluk kümelemesini çekirdek K-means ile birleştirin veya DBSCAN ile bazı temel kümeleyicileri değiştirin.
Topluluk K-means ile K-means'i birçok kez çalıştırmak ve en iyisini seçmek arasındaki fark nedir?
En düşük atalet ile en iyi tek çalıştırmayı seçmek açgözlü deterministik bir seçimdir; diğer tüm çalıştırmalardaki bilgileri atar. Topluluk K-means, tüm çalıştırmaları bir ortak ilişki matrisine toplar, çalıştırmalar boyunca olasılıksal ortak oluşum yapısını yakalar, bu da herhangi bir tek kazanan bölümlemeden kesinlikle daha bilgilendiricidir.
Bu çok büyük veri kümeleri için uygun mu?
Ortak ilişki matrisi n-n'dir, bu nedenle bellek yaklaşık 50.000 noktanın ötesinde darboğaz haline gelir. Daha büyük veri kümeleri için, seyrek ortak ilişki yaklaşımları, mini-batch K-means'i temel kümeleyici olarak veya Monti ve ark.'nın fikir birliği kümeleme varyantı gibi alt örnekleme stratejileri kullanın.
Kaynaklar
- Strehl, A. & Ghosh, J. (2002). Cluster ensembles — a knowledge reuse framework for combining multiple partitions. Journal of Machine Learning Research, 3, 583–617. link ↗
- Monti, S., Tamayo, P., Mesirov, J. & Golub, T. (2003). Consensus clustering: a resampling-based method for class discovery and visualization of gene expression microarray data. Machine Learning, 52, 91–118. DOI: 10.1023/A:1023949509487 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Ensemble K-means Clustering (Consensus Clustering). ScholarGate. https://scholargate.app/tr/machine-learning/ensemble-k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Topluluk Gauss Karışım ModeliMakine öğrenmesi↔ karşılaştır
- K-ortalama KümelemeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli K-ortalamalarMakine öğrenmesi↔ karşılaştır