Online HDBSCAN
Online Hierarchical Density-Based Spatial Clustering of Applications with Noise · Ayrıca şöyle bilinir: incremental HDBSCAN, streaming HDBSCAN, online hierarchical density clustering, dynamic HDBSCAN
Online HDBSCAN, HDBSCAN hiyerarşik yoğunluk tabanlı kümeleme algoritmasını, akış verilerini veya sıralı olarak gelen verileri artımlı olarak işlemek üzere genişletir. Her yeni gözlemle tam hiyerarşiyi sıfırdan yeniden oluşturmak yerine, tam veri kümesi yeniden işlenmeden sürekli yoğunluk tabanlı kümeleme sağlayan karşılıklı erişilebilirlik grafiğini, minimum kapsayan ağacı, yoğunlaştırılmış küme ağacını ve kararlılık tabanlı küme çıkarma işlemlerini korur ve yerel olarak günceller.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Hesaplama açısından fizibilite dışı tam yeniden işleme maliyeti olmadan, sürekli veya yüksek frekanslı verilerin artımlı olarak geldiği durumlarda Online HDBSCAN'ı kullanın. Küme sayısı bilinmeyen, heterojen küme yoğunluklarına sahip ve anlamlı gürültü içeren - toplu HDBSCAN'ı k-means veya DBSCAN'a tercih edilebilir kılan özellikler - ancak veri hacmi veya geliş hızı toplu yeniden eğitime engel olan uygulamalar için uygundur. Tam veri kümesinin belleğe rahatça sığdığı ve toplu HDBSCAN'ın gecikme endişeleri olmadan periyodik olarak yeniden çalıştırılabildiği durumlarda bundan kaçının - toplu sürüm, yaklaşım ek yükü olmadan kesin kararlılık tabanlı çözümler üretir. Ayrıca, kavram kaymasının (dağılım kayması) ciddi olduğu ve birikmiş geçmiş noktaların mevcut küme yapısını yanıltıcı olduğu durumlarda bundan kaçının; bu durumda pencereli veya unutma mekanizmalı bir varyant gereklidir.
Güçlü yönler & sınırlılıklar
- HDBSCAN'ın temel avantajlarını - keyfi küme şekli, değişen yoğunluk, gürültü etiketlemesi - akış ortamında korur.
- Yalnızca MST, yoğunlaştırılmış ağaç ve kararlılık puanlarının etkilenen kısımlarını güncelleyerek tam yeniden işlemeyi önler.
- Bellek ayak izi, tutulan nokta sayısıyla doğrusal olarak büyür ancak kayan bir pencere veya mikro-küme özetlemesi ile sınırlandırılabilir.
- Yeni veri geldikçe sürekli olarak küme üyelik olasılıkları ve gürültü etiketleri üretir.
- Küme sayısını önceden belirtmeye gerek yoktur; minimum küme boyutu ana parametre olarak kalır.
- Artımlı MST ve yoğunlaştırılmış ağaç onarımı, toplu HDBSCAN'ı aşan uygulama karmaşıklığı ekler.
- Önceki noktaların çekirdek mesafeleri, komşuluk yapıları yeni gelenlerle önemli ölçüde kaydığında bayatlayabilir ve yaklaşım hatası oluşturabilir.
- Unutma veya pencereleme mekanizması olmadan, eski noktalar süresiz olarak birikir ve uzun süreli akışlarda yöntemin yüksek maliyetle toplu HDBSCAN'a eşdeğer hale gelmesine neden olur.
- Artımlı yaklaşımın kalitesi üzerindeki teorik garantiler, iyi incelenmiş çevrimiçi topluluk yöntemlerine kıyasla sınırlıdır.
SSS
Online HDBSCAN, toplu HDBSCAN'dan nasıl farklıdır?
Toplu HDBSCAN, tüm veriden tam karşılıklı erişilebilirlik grafiğini, minimum kapsayan ağacı ve yoğunlaştırılmış küme ağacını bir kerede oluşturur. Online HDBSCAN, bu yapıları artımlı olarak korur, yeni bir nokta geldiğinde yalnızca etkilenen kısımları günceller. Sonuç, birikmiş veriler üzerinde toplu HDBSCAN'ın üreteceği şeyi, hesaplama maliyetinin çok küçük bir kısmında yaklaştırır.
Online HDBSCAN'da kavram kaymasını nasıl ele almalıyım?
Temel biçimindeki Online HDBSCAN, tüm geçmiş noktaları biriktirir, bu da dağılım kaydığında eski yapının mevcut kümeleri domine etmesine neden olabilir. Kaymayı ele almak için, kayan bir pencere (eski noktaları atarak) veya mikro-küme özetlemesi kullanın, böylece son veriler uzak geçmişe göre daha ağır ağırlıklandırılır.
Akış bağlamında ne kadar minimum küme boyutu kullanmalıyım?
Toplu HDBSCAN için alan bilgisine dayalı seçimle başlayın. Küme sayısını ve gürültü oranını zamanla izleyin: gürültü sürekli artarsa veya küçük kümeler çoğalırsa, minimum küme boyutunu artırmayı düşünün. İç akış küme kalitesi indeksleri (akışlar için uyarlanmış DBCV ölçümü gibi) aracılığıyla otomatik ayarlama, parametre güncellemelerine rehberlik edebilir.
Online HDBSCAN standart kütüphanelerde mevcut mu?
Artımlı ve akış halindeki yoğunluk tabanlı kümeleme bileşenleri River kütüphanesinde (Python) mevcuttur ve akış verileri için hiyerarşik yoğunluk tabanlı yöntemleri destekler. hdbscan Python kütüphanesi toplu varyanta odaklanır; tam çevrimiçi HDBSCAN, mevcut bileşenlerin üzerine kurulu özel artımlı MST güncelleme mantığı gerektirebilir.
Online DBSCAN'ı Online HDBSCAN'a ne zaman tercih etmeliyim?
Kümeleriniz kabaca üniform yoğunluğa sahipse ve epsilon yarıçapı ile min-örnekler eşiğini önceden belirlemeye razıysanız, Online DBSCAN daha basit ve daha hızlıdır. Yoğunluklar kümeler arasında değişiyorsa, küme sayısı bilinmiyorsa veya kararlılık tabanlı gürültü etiketlemesi ve küme üyelik olasılıklarına ihtiyacınız varsa Online HDBSCAN tercih edilir.
Kaynaklar
- Hassani, M., Seidl, T. (2017). Using internal evaluation measures to validate the quality of diverse stream clustering algorithms. Vietnam Journal of Computer Science, 4(3), 171–183. DOI: 10.1007/s40595-016-0086-9 ↗
- Campello, R. J. G. B., Moulavi, D., Zimek, A., & Sander, J. (2015). Hierarchical Density Estimates for Data Clustering, Visualization, and Outlier Detection. ACM Transactions on Knowledge Discovery from Data, 10(1), Article 5. DOI: 10.1145/2733381 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Online Hierarchical Density-Based Spatial Clustering of Applications with Noise. ScholarGate. https://scholargate.app/tr/machine-learning/online-hdbscan
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Ensemble HDBSCANMakine öğrenmesi↔ karşılaştır
- HDBSCANMakine öğrenmesi↔ karşılaştır
- Çevrimiçi ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Sağlam HDBSCANMakine öğrenmesi↔ karşılaştır
- Spektral KümelemeMakine öğrenmesi↔ karşılaştır