Sağlam HDBSCAN
Robust Hierarchical Density-Based Spatial Clustering of Applications with Noise · Ayrıca şöyle bilinir: HDBSCAN*, Robust HDBSCAN*, robust hierarchical density clustering, robust single-linkage HDBSCAN
Sağlam HDBSCAN (HDBSCAN*), orijinal HDBSCAN algoritmasını, gürültüyü, aykırı değerleri ve farklı yoğunluklardaki kümeleri daha güvenilir bir şekilde işleyen sağlam bir tek-bağlantılı çerçeve ile genişletir. Campello ve ark. (2015) tarafından tanıtılan bu algoritma, herhangi bir yoğunluk tabanlı hiyerarşiyi, küme sayısını önceden belirtme gereği olmaksızın, gürültü noktalarını açıkça modelleyerek kararlı bir düz kümelemeye dönüştürür.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Verilerinizde farklı şekil, boyut ve yoğunlukta kümeler olduğunda; gürültü veya aykırı değerler beklediğinizde; veya verilerdeki küme sayısını önceden bilmediğinizde Sağlam HDBSCAN'ı kullanın. Yüksek boyutlu sürekli veriler, coğrafi nokta bulutları, metin gömüleri ve biyolojik veri kümelerinde mükemmeldir. Her çalıştırmada tamamen tekrarlanabilir deterministik kümeler istediğinizde (MST oluşturma benzersiz olmayabilir), veriler tamamen kategorik olduğunda veya yorumlanabilirlik basit merkez tabanlı özetler gerektirdiğinde bundan kaçının — k-means veya Gauss Karışım Modelleri orada daha iyi seçeneklerdir.
Güçlü yönler & sınırlılıklar
- Küme sayısının belirtilmesini gerektirmeden keyfi şekil ve değişen yoğunlukta kümeler keşfeder.
- Her noktayı bir kümeye zorlamak yerine gürültüyü ve aykırı değerleri açıkça etiketler.
- Sağlam tek-bağlantılı adım, standart tek-bağlantılı hiyerarşik kümelemeyi etkileyen zincirleme etkisini ve yerel gürültü yapaylıklarını bastırır.
- Tek bir düz bölümün ötesinde birden fazla granülerlikte keşfedilebilen zengin bir yoğunlaştırılmış hiyerarşi üretir.
- Yaklaşık en yakın komşu arka uçlarıyla makul ölçüde iyi ölçeklenir ve yüksek boyutlu gömme alanlarında çalışır.
- Sonuçlar, alan bilgisi veya dikkatli ayarlama gerektiren minimum küme boyutu hiperparametresine bağlıdır.
- Yüksek boyutlu ham özellik alanları en yakın komşu tahminlerini bozabilir; genellikle önceden boyut azaltma (örneğin, UMAP) gereklidir.
- Kütle fazlalığı yoluyla küme çıkarma her zaman sezgisel değildir ve yoğunluk sınırlarına yakın kümeleri beklenmedik şekilde bölebilir veya birleştirebilir.
- MST oluşturmadaki deterministik olmama, aynı veriler üzerinde çalıştırmalar arasında hafif farklı kümelemelere yol açabilir.
SSS
Ayarlanması gereken en önemli hiperparametre nedir?
Minimum küme boyutu (min_cluster_size), algoritmanın tutacağı en küçük anlamlı kümeyi kontrol eder. Çok düşük ayarlamak gürültü noktalarının mikro kümeler oluşturmasına neden olur; çok yüksek ayarlamak ise gerçekten farklı grupları birleştirir. Alan bilgisi veya göreceli geçerlilik indeksleri (örneğin, DBCV) tarafından yönlendirilen bir ızgara araması önerilir.
Sağlam HDBSCAN, düz HDBSCAN'dan nasıl farklıdır?
Sağlam (HDBSCAN*) sürümü, önceki geçici düz kümeleme adımını değiştiren, kütle fazlalığı kararlılık puanlaması ile teorik olarak temellendirilmiş yoğunlaştırılmış ağaç çıkarma işlemini kullanır. Ayrıca gürültü noktası atamasını biçimlendirir ve orijinal 2013 sürümünün yapmadığı şekilde, alttaki yoğunluk seviye kümesi kümeleriyle tutarlılığı garanti eder.
Kategorik veya karma verilerde kullanabilir miyim?
Sağlam HDBSCAN, metrik (genellikle Öklid) uzaylar için tasarlanmıştır. Tamamen kategorik veriler için uygun bir mesafe metriği (örneğin, Gower mesafesi veya Hamming) gerekir. Karma türdeki veriler dikkatli ön işleme gerektirir; k-prototipler veya FAMD tabanlı kümeleme gibi özel yöntemler daha uygun olabilir.
Büyük veri kümelerine ölçeklenir mi?
Saf HDBSCAN, kesin en yakın komşular için O(n² log n) olarak ölçeklenir. Pratikte, yaklaşık en yakın komşu indekslerini (örneğin, FAISS, PyNNDescent) kullanmak bunu neredeyse lineere indirir, bu da hdbscan veya scikit-learn-extra kütüphaneleriyle on binlerce ila milyonlarca noktanın kümelenmesini mümkün kılar.
Kümeleme kalitesini nasıl değerlendirmeliyim?
Gerçek etiketlerin mevcut olmadığı durumlarda, özellikle yoğunluk tabanlı yöntemler için tasarlanmış ve gürültü ağırlıklı veya kötü ayrılmış kümeleri cezalandıran Yoğunluk Tabanlı Kümeleme Doğrulama (DBCV) indeksini kullanın. Siluet puanları da yaygın olarak raporlanır ancak dışbükey kümeler varsayar, bu nedenle bunları ek olarak kabul edin.
Kaynaklar
- Campello, R.J.G.B., Moulavi, D., Zimek, A. & Sander, J. (2015). Hierarchical Density Estimates for Data Clustering, Visualization, and Outlier Detection. ACM Transactions on Knowledge Discovery from Data, 10(1), 5. DOI: 10.1145/2733381 ↗
- McInnes, L., Healy, J. & Astels, S. (2017). hdbscan: Hierarchical density based clustering. Journal of Open Source Software, 2(11), 205. DOI: 10.21105/joss.00205 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust Hierarchical Density-Based Spatial Clustering of Applications with Noise. ScholarGate. https://scholargate.app/tr/machine-learning/robust-hdbscan
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- HDBSCANMakine öğrenmesi↔ karşılaştır
- K-ortalama KümelemeMakine öğrenmesi↔ karşılaştır
- Spektral KümelemeMakine öğrenmesi↔ karşılaştır