Online DBSCAN
Online Density-Based Spatial Clustering of Applications with Noise · Ayrıca şöyle bilinir: Incremental DBSCAN, Streaming DBSCAN, Online density-based clustering, iDBSCAN
Online DBSCAN, yoğunluk tabanlı kümeleme algoritmasının klasik halini, tüm veri kümesini sıfırdan yeniden kümelemeye gerek kalmadan sürekli gelen veri noktalarını işlemek üzere genişletir. Her yeni gözlem, yerel komşuluk sorguları aracılığıyla mevcut küme yapısına entegre edilir, bu da onu artımlı olarak büyüyen akış verisi ve veri ambarı senaryoları için pratik hale getirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Veri sürekli veya toplu olarak geldiğinde ve tam yeniden kümeleme masraflı olacağında Online DBSCAN'ı kullanın: sensör akışları, ağ saldırı günlükleri, gerçek zamanlı işlem izleme veya zamanla büyüyen büyük veri ambarları. Küme şekillerinin düzensiz olduğu ve küme sayısının önceden bilinmediği düşük ila orta boyutlu sürekli veriler için uygundur. Yüksek boyutlu verilerde (boyutsallık laneti epsilon-komşuluk anlamını bozar), altta yatan yoğunluk yapısı zamanla önemli ölçüde değişirse (kavram kayması pencereli veya uyarlanabilir varyantlar gerektirir) veya her nokta için katı gecikme kısıtlamalarıyla hemen etiketler gerekiyorsa uygun değildir.
Güçlü yönler & sınırlılıklar
- Masraflı tam yeniden kümelemeyi önler: yeni noktalar geldiğinde yalnızca yerel olarak etkilenen bölgeler güncellenir.
- DBSCAN'ın keyfi şekilli kümeleri bulma ve aykırı değerleri doğal olarak gürültü olarak etiketleme yeteneğini miras alır.
- Küme sayısını önceden belirtmeyi gerektirmez.
- Verinin artımlı olarak büyüdüğü gerçek zamanlı ve veri ambarı işlem hatları için uygundur.
- Veri kümesi yoğunlaştıkça gürültü noktaları dinamik olarak yeniden sınıflandırılır, zamanla küme kalitesini iyileştirir.
- Akış başlamadan önce seçilmesi gereken ve temsili bir tohum veri kümesi olmadan ayarlaması zor olabilen epsilon ve MinPts hiperparametrelerine duyarlıdır.
- Epsilon-komşuluk kavramının ayırt edici gücünü kaybetmesi nedeniyle yüksek boyutlu uzaylarda performans düşer.
- Yeni bir köprü noktası tarafından tetiklenen küme birleştirmeleri, birçok küme bağlandığında maliyetli olabilecek zincirleme güncellemeler tetikleyebilir.
- Standart çevrimiçi DBSCAN, kavram kaymasını veya veri silmeyi ele almaz; evrilen dağılımlar için pencereli veya bozunma ağırlıklı varyantlar gereklidir.
SSS
Bir akış için epsilon ve MinPts'i nasıl seçerim?
Makul parametreleri bulmak için temsili bir tohum örneği üzerinde toplu DBSCAN çalıştırın, ardından akış için bunları sabitleyin. Alternatif olarak, epsilon için dirsek noktasını belirlemek üzere tohum verileri üzerinde bir k-mesafe grafiği kullanın. Akış dağılımı önemli ölçüde kayarsa yeniden ayarlamaya hazır olun.
Yeni bir nokta iki önceki ayrı kümeyi birleştirdiğinde ne olur?
Her iki kümenin de tüm sınır noktaları yeniden incelenir ve birleştirilmiş küme kimliği altında yeniden etiketlenir. Büyük veri kümelerinde bu maliyetli olabilir, bu nedenle uygulamalar genellikle yayılma kapsamını sınırlamak için küme başına sınır noktası kümelerini izler.
Online DBSCAN, DenStream ile aynı mı?
Hayır. DenStream (Cao ve diğerleri, 2006), kavram kaymasını ele almak için mikro-kümeler ve eski noktalara uygulanan bir solma ağırlığı kullanan ilgili ancak farklı bir algoritmadır. Online DBSCAN, bozunma mekanizması olmadan tam küme yapısını artımlı olarak günceller.
Online DBSCAN modelinden nokta silebilir miyim?
Standart Online DBSCAN yalnızca eklemeleri destekler. Silmeleri desteklemek, hangi küme üyeliklerinin her noktaya bağlı olduğunu izlemeyi ve nokta kaldırıldığında bu atamaları tersine çevirmeyi gerektirir, bu da önemli ölçüde daha karmaşıktır ve aktif bir araştırma problemidir.
Online DBSCAN çok büyük akışlara ölçeklenir mi?
İyi bir uzamsal dizin (R-ağacı, top ağacı) ile düşük boyutlarda makul ölçüde ölçeklenir. Yüksek boyutlarda veya çok yüksek verimli akışlarda, DenStream veya CluStream gibi mikro-küme tabanlı yöntemler, bazı kümeleme doğruluğu pahasına genellikle daha iyi verim sunar.
Kaynaklar
- Ester, M., Kriegel, H.-P., Sander, J., Wimmer, M., & Xu, X. (1998). Incremental Clustering for Mining in a Data Warehousing Environment. In Proceedings of the 24th International Conference on Very Large Data Bases (VLDB), pp. 323–333. link ↗
- Cao, F., Ester, M., Qian, W., & Zhou, A. (2006). Density-Based Clustering over an Evolving Data Stream with Noise. In Proceedings of the 2006 SIAM International Conference on Data Mining (SDM), pp. 328–339. DOI: 10.1137/1.9781611972764.29 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Online Density-Based Spatial Clustering of Applications with Noise. ScholarGate. https://scholargate.app/tr/machine-learning/online-dbscan
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- HDBSCANMakine öğrenmesi↔ karşılaştır
- Çevrimiçi Gauss Karışım ModeliMakine öğrenmesi↔ karşılaştır
- Çevrimiçi K-ortalamalarMakine öğrenmesi↔ karşılaştır
- Çevrimiçi ÖğrenmeMakine öğrenmesi↔ karşılaştır