Açıklanabilir K-Ortalamalar
Explainable K-Means Clustering · Ayrıca şöyle bilinir: ExKMC, interpretable k-means, decision-tree k-means, explainable clustering
Açıklanabilir K-Ortalamalar, standart K-Ortalamalar kümelemesine yönelik, küme atamalarını küçük bir eksen-paralel karar ağacıyla değiştiren veya yaklaştıran bir son-sonrası ve model-içi yorumlanabilirlik yaklaşımıdır. Ağacın her yaprağı bir kümeye karşılık gelir ve her veri noktası, bireysel özellikler üzerindeki basit bir eşik kuralı dizisini izleyerek bir kümeye atanır; bu da küme üyeliğini tamamen şeffaf ve insan tarafından okunabilir hale getirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Amacın, üyelik kurallarının teknik olmayan paydaşlara iletilmesi gereken yorumlanabilir gruplara veri segmentasyonu olduğu durumlarda Açıklanabilir K-Ortalamalar kullanın — örneğin, basit iş kurallarıyla tanımlanan müşteri segmentleri veya klinik eşiklerle tanımlanan hasta alt grupları. Sürekli özelliklere ve orta düzeyde k (2–10) değerine sahip tablo verileri için uygundur. Küme sayısı büyükse (k > 20), gerçek küme şekilleri oldukça küresel değilse (DBSCAN veya GMM tercih edilir) veya kümeleme kalitesini en üst düzeye çıkarmak şeffaflıktan daha önemliyse bundan kaçının.
Güçlü yönler & sınırlılıklar
- Küme üyeliği, alan uzmanları ve teknik olmayan kitleler tarafından hemen anlaşılabilen basit eğer-o zaman eşik kurallarıyla açıklanır.
- Yaklaşım garantileri mevcuttur: standart K-Ortalamalara kıyasla ne kadar kümeleme kalitesi kaybettiğine dair teorik sınırlar literatürde belirlenmiştir.
- Mevcut kümeleme boru hatlarıyla bütünleşmesi için herhangi bir K-Ortalamalar çözümüne son-sonrası bir adım olarak uygulanır, onları değiştirmeden.
- Karar ağacı yapısı, çıkarım zamanında hızlı atamaya olanak tanır — merkez mesafe hesaplaması gerekmez.
- Açıklanabilir otomatik kararlar gerektiren denetim ve düzenleyici gereksinimleri destekler.
- Eksen-paralel bölmeler, eğik veya eğri K-Ortalamalar sınırlarını mükemmel bir şekilde yakalayamaz, bu nedenle kümeleme kalitesinden her zaman bir miktar fedakarlık edilir.
- Yaklaşım maliyeti boşluğu k ve veri kümesi karmaşıklığı ile artar — büyük k değerleri ya derin ya da doğru olmayan ağaçlar üretir.
- Açgözlü ağaç oluşturma sezgisel yöntemi, küresel olarak en uygun açıklanabilir bölümü garanti etmez.
- Gerçek kümeler uzun, örtüşen veya dışbükey olmayan olduğunda performans düşer.
SSS
Açıklanabilir K-Ortalamalar, K-Ortalamalar etiketleri üzerinde çalıştırılan bir karar ağacından nasıl farklıdır?
K-Ortalamalar etiketleri üzerinde sonradan uydurulan bir karar ağacı, sınıflandırma doğruluğunu (doğru etiket tahmini) en aza indirir ve kümeleme maliyetini en aza indirmeyebilir. Açıklanabilir K-Ortalamalar, ağacın indüklediği bölüm altındaki küme içi kareler toplamını doğrudan en aza indirir ve genel bir sınıflandırıcının sağlamadığı yaklaşım garantileri üretir.
Yöntemin yorumlanabilir kalmasını sağlamak için kaç küme (k) çok fazladır?
Uygulamada, ağaç sezgisel okunabilirliğini kaybedecek kadar derin büyüdüğü için k = 8–10'un ötesinde yorumlanabilirlik bozulmaya başlar. Teorik garantiler hala geçerlidir, ancak sonucu iletmek zorlaşır. Büyük k değerleri için bunun yerine hiyerarşik yaklaşımları veya konu modellerini düşünün.
Yöntem K-Ortalamaları yeniden çalıştırmayı gerektirir mi, yoksa mevcut herhangi bir kümeleme üzerinde çalışabilir mi?
Açıklanabilir K-Ortalamalar, K-Ortalamalar merkezlerini referans hedef olarak kullanır. Mevcut herhangi bir K-Ortalamalar çözümü üzerinde sonradan çalışabilir — K-Ortalamaları yeniden çalıştırmanız gerekmez. Ancak, yaklaşım maliyetini hesaplamak için merkezler gereklidir.
Tipik bir yaklaşım maliyeti oranı nedir ve ne kadar kalite kaybı kabul edilebilir?
Ampirik çalışmalar, gerçek veri kümelerinde 1.1–2.0 arasında yaklaşım oranları bildirmektedir, bu da ağaç tabanlı kümelemenin K-Ortalamalar optimumundan 10–100% daha pahalı olduğu anlamına gelir. Bunun kabul edilebilir olup olmadığı uygulamaya bağlıdır; şeffaflığın zorunlu olduğu alanlarda, 2 kat maliyet artışı bile genellikle haklı çıkarılır.
Açıklanabilir K-Ortalamalar kategorik özelliklerle başa çıkabilir mi?
Yöntem, K-Ortalamalar Öklid mesafelerini kullandığı için sürekli özellikler için tasarlanmıştır. Kategorik özellikler önce sayısal olarak kodlanmalı (örneğin, sıralı kodlama veya ikili göstergeler) ve kodlanmış değerler üzerindeki sonuç eşik kuralları dikkatlice yorumlanmalıdır.
Kaynaklar
- Dasgupta, S., Frost, N., Moshkovitz, M., & Rashtchian, C. (2020). Explainability of k-Means Clustering. Proceedings of the 37th International Conference on Machine Learning (ICML), PMLR 119. link ↗
- Moshkovitz, M., Dasgupta, S., Rashtchian, C., & Frost, N. (2020). Explainable k-Means and k-Medians Clustering. Proceedings of the 37th International Conference on Machine Learning (ICML), PMLR 119. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Explainable K-Means Clustering. ScholarGate. https://scholargate.app/tr/machine-learning/explainable-k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Karar AğacıMakine öğrenmesi↔ karşılaştır
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- K-Means KümelemeMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır