Öz-denetimli DBSCAN
Self-supervised Representation Learning with DBSCAN Clustering · Ayrıca şöyle bilinir: SSL-DBSCAN, self-supervised density clustering, contrastive DBSCAN, representation-based DBSCAN
Öz-denetimli DBSCAN, önce etiketlenmemiş verilerden kompakt, anlamsal olarak anlamlı gömme (embedding) üretmek üzere ön-görev (pretext task) üzerinde — örneğin zıt öğrenme veya maskelenmiş yeniden yapılandırma gibi — bir sinirsel kodlayıcıyı eğiten ve ardından herhangi bir sınıf etiketi gerektirmeden keyfi şekilli kümeleri keşfetmek için sonuçta elde edilen gömme uzayında DBSCAN uygulayan iki aşamalı denetimsiz bir boru hattıdır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketlenmemiş büyük hacimli yüksek boyutlu verileriniz (görüntüler, metin, sensör sinyalleri) olduğunda ve herhangi bir manuel ek açıklama olmadan bilinmeyen sayıda ve şekilde doğal gruplamalar keşfetmeniz gerektiğinde Öz-denetimli DBSCAN'ı kullanın. Anormallikleri açıkça gürültü olarak işaretlerken kompakt yoğun kümeleri bulmada üstündür, bu da onu yüz kümeleme, belge konu keşfi ve denetimsiz anomali tespiti için uygun hale getirir. Etiketlenmiş verileriniz olduğunda (denetimli veya yarı denetimli yöntemler ondan daha iyi performans gösterecektir), gömme uzayınız düşük boyutluysa ve ham özellikler zaten anlamlıysa, sabit önceden belirlenmiş bir küme sayısına ihtiyacınız olduğunda (k-means veya GMM kullanın) veya kümeleme mekanizmasının yorumlanabilirliğinin paydaşlar için gerekli olduğu durumlarda kullanmayın.
Güçlü yönler & sınırlılıklar
- Küme sayısını önceden belirtmeden keyfi şekil ve değişen yoğunlukta kümeler keşfeder.
- Öz-denetimli ön-eğitim adımı, zengin anlamsal temsiller çıkarır, bu da kümeyi görüntüler veya metinler üzerindeki ham özellikli DBSCAN'dan çok daha anlamlı hale getirir.
- Gürültü ve aykırı noktaları açıkça tanımlar, yan ürün olarak yerleşik anomali tespiti sağlar.
- Herhangi bir aşamada etiketlenmiş veri gerektirmez, bu da onu ek açıklamanın pahalı veya mevcut olmadığı alanlara uygulanabilir kılar.
- Ön-eğitimli kodlayıcılar, küçük bir etiketli küme mevcut olursa daha sonra ince ayarlanabilir, bu da yarı denetimli öğrenmeye sorunsuz bir geçiş sağlar.
- Parametre hassasiyeti: epsilon ve min_samples gömme uzayında dikkatlice ayarlanmalıdır; yanlış değerler tüm noktaları tek bir kümeye çökertebilir veya doğal grupları birçok küçük parçaya ayırabilir.
- Ön-eğitim maliyeti: büyük kodlayıcıların öz-denetimli eğitimi hesaplama açısından pahalıdır ve kullanışlı temsillerle yakınsaması için önemli miktarda etiketlenmemiş veri gerektirir.
- Gerçek etiketler olmadan küme kalitesini değerlendirmek zordur; kümeler yoğunluk açısından büyük ölçüde farklılık gösterdiğinde içsel metrikler yanıltıcı olabilir.
- DBSCAN, kümelerin yoğunlukları büyük ölçüde değiştiğinde zorlanır; bu durumda HDBSCAN daha sağlam bir alternatiftir.
- Boru hattı karmaşıktır — hatalar ön-eğitim veya kümeleme aşamasında gizlenebilir ve arızaları teşhis etmek her iki bileşeni de incelemeyi gerektirir.
SSS
Neden ham özellikler üzerinde doğrudan DBSCAN çalıştırmak yerine öz-denetimli ön-eğitim kullanmalı?
Yüksek boyutlu uzaylarda, Öklid uzaklıkları neredeyse tekdüze hale gelir ve ayırt edici gücünü kaybeder — boyutsallık laneti olarak adlandırılan bir olgu. Öz-denetimli ön-eğitim, veriyi anlamsal olarak benzer girdilerin birbirine yakın olduğu düşük boyutlu bir uzaya sıkıştırır, bu da DBSCAN'ın çalışması için anlamlı bir geometri sağlar.
Gerçek etiketler olmadan epsilon nasıl seçilir?
Her nokta için, k-ıncı en yakın komşusuna olan uzaklığı hesaplayın (yaygın seçim: k = min_samples). Bu uzaklıkları sıralayın ve çizin. Sonuç eğrinin dirseği, epsilon için iyi bir başlangıç değeridir. Ardından, küçük bir epsilon değerleri ızgarası boyunca siluet puanlarını ve gürültü oranını inceleyin.
DBSCAN çok fazla noktayı gürültü olarak işaretlerse ne olur?
Epsilonu artırın veya min_samples'ı azaltın. Önce k-uzaklık grafiğini yeniden inceleyin — seçilen epsilon dirseğin altında olabilir. Ayrıca, gömme uzayının ön-eğitim hedefiyle aynı uzaklık metriğini (Öklid'e karşı kosinüs) kullandığını doğrulayın.
Burada DBSCAN yerine HDBSCAN daha iyi bir seçim midir?
Genellikle evet: HDBSCAN parametre açısından daha hafiftir (yalnızca min_cluster_size gerektirir) ve değişken yoğunluklu kümeleri daha sağlam bir şekilde ele alır. Gömme uzayınızdaki kümeler yoğunluk veya kompaktlık açısından önemli ölçüde farklılık gösterdiğinde önerilen yükseltmedir.
Küme atamalarını ince ayar için sözde etiketler olarak kullanabilir miyim?
Evet — bu yaygın bir takip adımıdır. Yüksek güvenilirlikli küme üyelikleri (sınır noktalarından uzaktaki çekirdek noktalar), küme kalitesi stabilize olana kadar denetimli veya öz-denetimli bir şekilde kodlayıcıyı ince ayarlamak için sözde etiketler olarak kullanılır.
Kaynaklar
- Ester, M., Kriegel, H.-P., Sander, J., & Xu, X. (1996). A density-based algorithm for discovering clusters in large spatial databases with noise. In Proceedings of the 2nd International Conference on Knowledge Discovery and Data Mining (KDD-96), pp. 226–231. AAAI Press. link ↗
- Zhan, X., Liu, Z., Luo, P., Tang, X., & Loy, C. C. (2018). Rethinking deep neural network training for face recognition: A geometric approach. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2045–2054. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Representation Learning with DBSCAN Clustering. ScholarGate. https://scholargate.app/tr/machine-learning/self-supervised-dbscan
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- HDBSCANMakine öğrenmesi↔ karşılaştır
- K-ortalama KümelemeMakine öğrenmesi↔ karşılaştır
- Öz-denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli DBSCANMakine öğrenmesi↔ karşılaştır