Yarı denetimli K-ortalamalar
Semi-supervised K-means Clustering · Ayrıca şöyle bilinir: constrained K-means, seeded K-means, partially supervised K-means, SS-K-means
Yarı denetimli K-ortalamalar, küme oluşumunu yönlendirmek için kısmi denetim — ya etiketlenmiş tohum noktalarının küçük bir kümesi ya da çift bazında zorunlu bağlantı ve bağlantı olmama kısıtlamaları — dahil ederek standart K-ortalamalar kümelemesini genişletir. Denetimsiz kümeleme ve tam denetimli sınıflandırma arasında bir köprü kurarak, etiketlerin az olduğu ancak tam olarak elde edilmesinin maliyetli olduğu durumlarda daha anlamlı kümeler sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Verilerin çoğunlukla etiketlenmemiş olduğu ancak az sayıda etiket veya çift bazında kısıtlamanın düşük maliyetle elde edilebildiği ve standart K-ortalamaların alan beklentileriyle eşleşmeyen kümeler ürettiği durumlarda yarı denetimli K-ortalamaları kullanın. Metin, müşteri segmentasyonu, görüntü gruplama ve uzman bilgisinin sınırlı tedarik edildiği biyomedikal görevler için uygundur. (a) Hiçbir türde denetim mevcut değilse — düz K-ortalamalar yeterlidir; (b) verileriniz dışbükey olmayan veya oldukça düzensiz küme şekillerine sahipse — DBSCAN gibi yoğunluk tabanlı yöntemler denetimden bağımsız olarak daha iyi performans gösterecektir; (c) kısıtlamalar gürültülü veya çelişkiliyse, çünkü uygulanamaz kısıtlama kümeleri yakınsamayı engelleyebilir; veya (d) tam denetimli bir sınıflandırıcı için yeterli etiketli veriniz varsa, bu daha güçlü garantiler sağlayacaktır.
Güçlü yönler & sınırlılıklar
- Küme kalitesini önemli ölçüde iyileştirmek için yalnızca az miktarda denetim — birkaç tohum etiketi veya çift bazında kısıtlama — gerektirir.
- Tohumlu başlatma rastgele değil, bilgilendirici olduğu için standart K-ortalamalardan daha hızlı ve daha tekrarlanabilir yakınsama.
- Esnek denetim biçimi: sınıf düzeyinde tohumlar, zorunlu bağlantı kısıtlamaları, bağlantı olmama kısıtlamaları veya herhangi bir kombinasyonla çalışır.
- Yorumlanabilir küme yapısı: küme atama kuralı mesafeye dayalı kalır ve uzman olmayanlara açıklanması kolaydır.
- Standart K-ortalamalara benzer şekilde büyük veri kümelerine ölçeklenir, bu da onu gerçek dünya veri hacimleri için pratik hale getirir.
- K-ortalamaların dışbükey, kabaca küresel kümeler varsayımını miras alır; uzun veya düzensiz şekilli gruplarda düşük performans gösterir.
- Küme sayısı K hala önceden seçilmelidir ve veriden veya kısıtlamalardan çıkarılmaz.
- Uygulanamaz veya çelişkili kısıtlamalar (örneğin, A B ile zorunlu bağlantılı ve B A ile bağlantı olmama) kısıtlamalar dikkatlice kürlenmedikçe algoritmanın başarısız olmasına neden olur.
- Tohumlar temsilci değilse veya kısıtlamalar gürültülüyse küme kalitesi bozulur, potansiyel olarak denetimsiz K-ortalamalardan daha kötü performans gösterir.
- Özelliklerin ölçeğine duyarlıdır: standardizasyon olmadan, yüksek varyanslı boyutlar mesafe hesaplamalarına hakim olur.
SSS
Ne kadar etiketli noktaya veya kısıtlamaya ihtiyacım var?
Veri kümesinin çok küçük bir kesri — genellikle %1-5'i — denetimsiz K-ortalamalara göre önemli iyileştirmeler sağlayabilir. Fayda genellikle tam denetim elde edilmeden çok önce plato yapar, bu da yarı denetimli K-ortalamaları tam olarak düşük etiket rejiminde çekici kılar.
Kısıtlamalarım çelişkiliyse ne olur?
Uygulanamaz kısıtlamalara sahip kısıtlı K-ortalamalar yakınsamayı başaramayabilir veya bazı kısıtlamaları sessizce göz ardı edebilir. Çalıştırmadan önce, hiçbir zorunlu bağlantı zincirinin geçişli olarak bir bağlantı olmama kısıtlamasını ihlal etmediğini kontrol edin. Kısıtlamalar gürültülü olabileceğinden, kısıtlamaları sert kurallar yerine yumuşak tercihler olarak ele alan olasılıksal gevşetmeleri düşünün.
Doğru K'yı nasıl seçerim?
Siluet katsayısı, küme içi kareler toplamı üzerindeki dirsek sezgisi ve boşluk istatistiği burada geçerlidir. Tohum sınıflarınız varsa, K en az tohum sınıflarının sayısı kadar olmalıdır, ancak veriler ek gizli kümeler içerebilir — tohum sayısının üzerindeki K değerlerini deneyin ve hem nicel hem de nitel olarak değerlendirin.
Tohumlu K-ortalamalar, kısıtlı K-ortalamalardan daha mı iyi?
Farklı bilgi türlerini kodlarlar. Tohumlu K-ortalamalar, her sınıf için birkaç tam etiketli örneğiniz olduğunda iyi çalışır. Kısıtlı K-ortalamalar, mutlak küme etiketlerini bilmeden benzer veya farklı nokta çiftlerini belirleyebildiğinizde tercih edilir — örneğin kullanıcı geri bildiriminden veya bilinen farklılık kurallarından. Uygulamada, denetim doğru olduğunda her iki varyant da denetimsiz K-ortalamalara göre önemli ölçüde iyileşir.
Bunu metin veya yüksek boyutlu verilerle kullanabilir miyim?
Evet, ancak kümelemeden önce boyut azaltma (örneğin, PCA, UMAP veya metin için SVD ile TF-IDF) şiddetle tavsiye edilir. Çok yüksek boyutlarda, Öklid mesafesi yoğunlaşır ve tüm noktalar eşit uzaklıkta görünür, bu da denetimden bağımsız olarak temel mesafe tabanlı atama adımını baltalar.
Kaynaklar
- Wagstaff, K., Cardie, C., Rogers, S., & Schroedl, S. (2001). Constrained K-means Clustering with Background Knowledge. In Proceedings of the 18th International Conference on Machine Learning (ICML 2001), pp. 577–584. link ↗
- Basu, S., Banerjee, A., & Mooney, R. J. (2002). Semi-supervised Clustering by Seeding. In Proceedings of the 19th International Conference on Machine Learning (ICML 2002), pp. 27–34. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised K-means Clustering. ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Aktif ÖğrenmeMakine öğrenmesi↔ karşılaştır
- K-ortalama KümelemeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Spektral KümelemeMakine öğrenmesi↔ karşılaştır