HDBSCAN
Hierarchical Density-Based Spatial Clustering of Applications with Noise · Ayrıca şöyle bilinir: HDBSCAN, Hierarchical DBSCAN, hierarchical density-based clustering, HDBSCAN*
HDBSCAN (Hierarchical Density-Based Spatial Clustering of Applications with Noise), Campello, Moulavi ve Sander tarafından 2013 yılında tanıtılan yoğunluk tabanlı bir kümeleme algoritmasıdır. DBSCAN'ı, tüm yoğunluk ölçeklerinde yoğunluk tabanlı küme hiyerarşileri oluşturup ardından kararlı düz bir bölümleme çıkararak genişletir, bu da onu küme yoğunluklarının bölgeler arasında önemli ölçüde değiştiği veri kümeleri için sağlam hale getirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+1 tane daha
Ne zaman kullanılır
HDBSCAN, veri kümelerinde değişen yoğunluklara sahip kümelerin beklendiği, küme sayısının bilinmediği, gürültü ve aykırı değer tespitinin önemli olduğu veya DBSCAN'ın epsilon hiperparametresine duyarlılığının sorunlara yol açtığı durumlarda uygundur. Yalnızca minimum küme boyutu parametresini ve isteğe bağlı olarak k komşuluk boyutunu gerektirir. Yöntem, küme şekli konusunda varsayımsızdır ve uzamsal koordinatlar, gömmeler (örneğin UMAP projeksiyonları) ve diğer sürekli özellik uzaylarında iyi çalışır. Beklenen her küme başına en az 15-20 noktalık bir veri kümesi önerilir; algoritma, on binlerce noktaya verimli bir şekilde ve daha büyük veri kümelerine yaklaşık en yakın komşu varyantlarıyla ölçeklenir.
Güçlü yönler & sınırlılıklar
- Küresel bir epsilon parametresi gerektirmeden keyfi şekil ve değişen yoğunlukta kümeler keşfeder.
- Belirsiz noktalar için yumuşak bir gürültü etiketi üretir, yan ürün olarak aykırı değer tespitini sağlar.
- DBSCAN'dan önemli ölçüde daha kolay ayarlanabilen yalnızca bir sezgisel parametre — minimum küme boyutu — gerektirir.
- Yoğunlaştırılmış küme ağacı, hiyerarşik küme yapısının zengin, yorumlanabilir bir görünümünü sağlar.
- Yumuşak küme üyelik olasılıkları, kararlılık puanlarından çıkarılabilir ve sabit etiketin yanında olasılıksal bir atama verir.
- Performans, mesafe yoğunlaşmasının en yakın komşu mesafelerinin anlamını azalttığı çok yüksek boyutlu uzaylarda (boyutluluk laneti) düşebilir; kümelemeden önce boyutluluk azaltma önerilir.
- Minimum küme boyutu parametresi sonuçları önemli ölçüde etkiler; çok küçük bir değer birçok küçük küme üretir ve çok büyük bir değer farklı grupları birleştirir.
- Hesaplama maliyeti, verimli uygulamalarla yaklaşık olarak O(n log n) olarak ölçeklenir, ancak çok büyük veri kümeleri için k-means'ten daha yavaş kalır.
- Algoritma, MST adımındaki eşitlik bozma gerektiğinde doğası gereği deterministik değildir, bu nedenle kesin tekrarlanabilirlik sabit bir rastgele tohum gerektirir.
SSS
HDBSCAN'ın DBSCAN'a göre temel avantajı nedir?
DBSCAN, her küme için aynı olması gereken tek bir küresel yoğunluk eşiği (epsilon) gerektirir. Kümeler yoğunluk açısından farklılık gösterdiğinde — gerçek verilerde yaygın bir durum — tek bir epsilon aynı anda iyi çalışmaz. HDBSCAN, tam yoğunluk hiyerarşisini keşfederek ve kümeleri yoğunluk ölçekleri boyunca kalıcılıklarına göre seçerek bu gereksinimi ortadan kaldırır ve değişen yerel yoğunluklara otomatik olarak uyum sağlar.
Minimum küme boyutunu nasıl seçerim?
Minimum küme boyutu, gürültüden ziyade gerçek bir küme olarak kabul edilecek en küçük grubu kontrol eder. 5 değeri yaygın bir başlangıç noktasıdır; verideki en küçük anlamlı gruba ilişkin alan bilgisine göre ayarlanmalıdır. Daha büyük değerler daha az, daha kaba kümeler ve daha fazla gürültü noktası üretir; daha küçük değerler daha ince taneciklik ve daha az gürültü bastırma üretir.
Küme üyelik olasılıkları ne anlama geliyor?
Her noktaya, atanan kümesine ne kadar güvendiğini yansıtan 0 ile 1 arasında bir olasılık atanır. 1 olasılığı, noktanın hiyerarşi boyunca kararlı bir kümenin derinliklerinde olduğu anlamına gelir; 0'a yakın bir olasılık, kenarlarda olduğu ve yalnızca marjinal olarak atandığı anlamına gelir. Düşük olasılıklara sahip noktalar sınır durumlarıdır ve daha yakından incelenmeyi gerektirebilir.
HDBSCAN çok büyük veri kümeleri için uygun mu?
Verimli bir uygulama ile (örneğin Python hdbscan kütüphanesi), algoritma yaklaşık olarak O(n log n) sürede çalışır ve pratikte yüz binlerce noktayı işler. Milyonlarca veri kümesi için, yaklaşık en yakın komşu yapıları (örneğin k-d ağaçları veya top ağaçlarına dayalı olanlar) çekirdek mesafesi hesaplamasını hızlandırmak için kullanılabilir, ancak bu bazı yaklaşımlar pahasına gerçekleşir.
Kaynaklar
- Campello, R. J. G. B., Moulavi, D., & Sander, J. (2013). Density-Based Clustering Based on Hierarchical Density Estimates. In J. Pei et al. (Eds.), Advances in Knowledge Discovery and Data Mining. PAKDD 2013. Lecture Notes in Computer Science, vol. 7819 (pp. 160–172). Springer, Berlin, Heidelberg. DOI: 10.1007/978-3-642-37456-2_14 ↗
- Campello, R. J. G. B., Moulavi, D., Zimek, A., & Sander, J. (2015). Hierarchical Density Estimates for Data Clustering, Visualization, and Outlier Detection. ACM Transactions on Knowledge Discovery from Data, 10(1), Article 5. DOI: 10.1145/2733381 ↗
- McInnes, L., Healy, J., & Astels, S. (2017). hdbscan: Hierarchical density based clustering. Journal of Open Source Software, 2(11), 205. DOI: 10.21105/joss.00205 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Hierarchical Density-Based Spatial Clustering of Applications with Noise. ScholarGate. https://scholargate.app/tr/machine-learning/hdbscan
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- OPTICSMakine öğrenmesi↔ karşılaştır
- Spektral KümelemeMakine öğrenmesi↔ karşılaştır