Açıklanabilir HDBSCAN
Explainable Hierarchical Density-Based Spatial Clustering of Applications with Noise · Ayrıca şöyle bilinir: XAI-HDBSCAN, Interpretable HDBSCAN, Explainable Hierarchical DBSCAN, HDBSCAN with XAI
Açıklanabilir HDBSCAN, hiyerarşik yoğunluk tabanlı kümeleme algoritması HDBSCAN'i, küme üyeliğini ve ayrımını hangi girdi özelliklerinin yönlendirdiğini ortaya çıkarmak için SHAP başta olmak üzere, sonradan açıklanabilirlik yöntemleriyle birleştirir. HDBSCAN'in değişen şekil ve yoğunluktaki kümeleri bulma yeteneğini korurken, ilkeli ve denetlenebilir bir açıklama katmanı ekler.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Düzensiz şekilli veya değişen yoğunluktaki kümelere sahip veriler üzerinde yoğunluk tabanlı kümelemeye ihtiyacınız olduğunda VE küme üyeliğini paydaşlara, düzenleyicilere veya inceleyicilere açıklamanız gerektiğinde Açıklanabilir HDBSCAN kullanın. Hem keşif hem de yorumlanabilirliğin önemli olduğu yüksek boyutlu tablo verileri üzerindeki keşif çalışmalarında özellikle uygundur. Kümelerin küresel olduğu bilindiğinde ve k-means yeterli olduğunda; veri kümesi çok küçük olduğunda (yaklaşık 100'den az nokta), yoğunluk tahmininin güvenilmez olduğu durumlarda; veya SHAP hesaplaması önemli bir ek yük getirdiğinden, gerçek zamanlı kararlar almanız gerektiğinde bundan kaçının.
Güçlü yönler & sınırlılıklar
- Küme sayısının önceden belirtilmesini gerektirmeden, rastgele şekilli ve değişen yoğunluktaki kümeleri bulur.
- Gürültü/aykırı değer noktalarını bir kümeye zorlamak yerine doğal olarak tanımlar ve etiketler.
- SHAP tabanlı açıklamalar modelden bağımsızdır ve arzu edilen özellikleri (verimlilik, simetri, kukla, eklenebilirlik) karşılar.
- Yoğunlaştırılmış küme ağacı, SHAP uygulanmadan önce bile hiyerarşik yapının içsel bir görsel özetini sağlar.
- SHAP'tan elde edilen özellik-önem sıralamaları, alan uzmanlarına küme ayrımlarının bilimsel olarak anlamlı olup olmadığını doğrulamaları için rehberlik edebilir.
- SHAP atfı, sonradan yapılan bir yaklaşımdır; KernelSHAP, büyük veri kümeleri için hesaplama açısından pahalıdır.
- Küme atamaları türevlenebilir değildir, bu da belirsiz bir şekilde atanmış sınır noktaları için SHAP vekil uydurmasını kesin olmaktan çıkarır.
- HDBSCAN'in hiperparametreleri (min_cluster_size, min_samples) ayar gerektirir ve sonuçları güçlü bir şekilde etkileyebilir, bu da tekrarlanabilirliği zorlaştırır.
- Gürültü olarak etiketlenmiş noktalar, her noktanın atanmasını gerektiren sonraki kullanım durumlarını engelleyebilecek kararlı bir küme atfı almaz.
SSS
HDBSCAN küme sayısını belirtmeyi gerektirir mi?
Hayır. k-means'in aksine, HDBSCAN küme sayısını verinin yoğunluk yapısından çıkarır. Hedef küme sayısı yerine min_cluster_size (anlamlı kabul ettiğiniz en küçük grup) ayarlarsınız.
HDBSCAN ile hangi SHAP açıklayıcısını kullanmalıyım?
HDBSCAN türevlenebilir bir model üretmediği için, genellikle KernelSHAP veya bir vekil sınıflandırıcı (örn. küme etiketlerine uydurulmuş bir rastgele orman) kullanılır. Vekil bir ağaç tabanlı model ise TreeExplainer uygulanabilir ve KernelSHAP'tan çok daha hızlıdır.
Açıklamada gürültü noktalarını nasıl ele alırım?
Gürültü noktaları (etiket -1) tanım gereği belirsizdir; SHAP değerleri hiçbir kararlı kümeye yakınlığı yansıtmaz. Bunları ayrı ayrı ele almak, kümelenmiş gözlemlerle karıştırmak yerine aykırı durumlarına en çok hangi özelliklerin katkıda bulunduğunu raporlamak iyi bir uygulamadır.
Kümelerimin gerçek olduğunu ve yapay olmadığını nasıl doğrularım?
Önyüklemeli kararlılık analizi (örn. HDBSCAN'in yerleşik küme kalıcılık puanları) kullanın, siluet veya DBCV puanlarını hesaplayın ve SHAP tarafından tanımlanan yönlendirici özelliklerin alan bilgisiyle uyumlu olup olmadığını kontrol edin. Kümeleri ayrı tutulmuş veya bağımsız olarak toplanmış bir örneklem üzerinde çoğaltmak en güçlü doğrulamayı sağlar.
Açıklanabilir HDBSCAN, metin gömüleri gibi yüksek boyutlu verilerle kullanılabilir mi?
Evet, ancak çok yüksek boyutlu uzaylarda kümelemeden önce boyut indirgeme (örn. UMAP) şiddetle tavsiye edilir, çünkü bu tür uzaylarda mesafe metrikleri anlamını yitirir. SHAP daha sonra küme atamalarına bir vekil uydurularak orijinal özelliklere uygulanır.
Kaynaklar
- McInnes, L., Healy, J., & Astels, S. (2017). hdbscan: Hierarchical density based clustering. Journal of Open Source Software, 2(11), 205. DOI: 10.21105/joss.00205 ↗
- Lundberg, S. M., & Lee, S.-I. (2017). A unified approach to interpreting model predictions. Advances in Neural Information Processing Systems, 30, 4765–4774. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Explainable Hierarchical Density-Based Spatial Clustering of Applications with Noise. ScholarGate. https://scholargate.app/tr/machine-learning/explainable-hdbscan
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Açıklanabilir DBSCANMakine öğrenmesi↔ karşılaştır
- Açıklanabilir Gauss Karışım ModeliMakine öğrenmesi↔ karşılaştır
- Açıklanabilir İzolasyon OrmanıMakine öğrenmesi↔ karşılaştır
- Açıklanabilir K-OrtalamalarMakine öğrenmesi↔ karşılaştır
- Açıklanabilir Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- HDBSCANMakine öğrenmesi↔ karşılaştır