Düzenlileştirilmiş K-Ortalamalar Kümelemesi
Regularized K-Means Clustering · Ayrıca şöyle bilinir: sparse k-means, penalized k-means, regularized clustering, constrained k-means
Düzenlileştirilmiş k-ortalamalar, standart k-ortalamaları, amaç fonksiyonuna bir ceza terimi — en yaygın olarak bir L1 (lasso tipi) veya L2 kısıtlaması — ekleyerek genişletir. Bu, dejeneratif küme çözümlerini caydırır ve Witten ve Tibshirani (2010) tarafından tanıtılan seyrek (sparse) varyantta, küme ayrımını sağlayan özellikleri eş zamanlı olarak seçer, bu da onu birçok özelliğin ilgisiz olduğu yüksek boyutlu ortamlarda özellikle değerli kılar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Özelliklerinizin çoğunun ilgisiz gürültü olduğundan şüphelendiğinizde, özellikle özellik sayısı gözlemlere göre büyük olduğunda (örneğin, genomik, metin, sensör dizileri) düzenlileştirilmiş k-ortalamaları kullanın. Ayrıca, kümeleme ile entegre edilmiş otomatik bir özellik seçimi adımı istediğinizde, iki aşamalı bir işlem hattı yerine uygundur. Tüm özelliklerin bilgilendirici ve eşit ölçekli olduğu bilindiğinde kullanmayın; bu durumda standart k-ortalamalar daha basittir ve eşit derecede etkilidir. Kümeler küresel olmadığında veya çok farklı yoğunluklara sahip olduğunda kaçının; yoğunluk tabanlı yöntemler (DBSCAN, HDBSCAN) veya karışım modelleri geometriye daha iyi uyacaktır. Hem K (küme sayısı) hem de lambda (düzenlileştirme gücü) seçilmesini gerektirir, bu nedenle bir doğrulama stratejisi esastır.
Güçlü yönler & sınırlılıklar
- Yerleşik özellik seçimi gerçekleştirir, hangi değişkenlerin küme yapısını gerçekten yönlendirdiğini belirler.
- Standart k-ortalamalar mesafelerini bozan ilgisiz veya gürültülü özelliklerin etkisini azaltır.
- Yüksek boyutlu verilerde daha seyrek, daha yorumlanabilir küme merkezleri üretir.
- Özellikle genomik, metin madenciliği ve p >> n olan diğer ortamlarda etkilidir.
- Seyrek k-ortalamalar çerçevesi, ilkeli, istatistiksel olarak motive edilmiş bir düzenlileştirme kriteri sağlar.
- K-ortalamaların varsayımlarını miras alır: kümelerin kabaca küresel ve benzer boyutta olduğu varsayılır.
- İki ayarlama parametresi (K ve lambda) gerektirir, model seçiminin karmaşıklığını artırır.
- Alternatif ağırlık güncelleme adımı nedeniyle standart k-ortalamalardan hesaplama açısından daha ağırdır.
- L1 düzenlileştirmesi sıfırda türevlenemez, bu da optimizasyonu sayısal hassasiyete duyarlı hale getirir.
- Özellik ağırlıkları tüm kümeler genelinde küreseldir, bu nedenle bir küme için ilgisiz ancak başka bir küme için ilgili bir özellik yanlışlıkla bastırılabilir.
SSS
Düzenlileştirme parametresi lambda'yı nasıl seçerim?
Witten ve Tibshirani, bir permütasyon tabanlı boşluk istatistiği önerir: küme yapısını yok etmek için verileri her özellik içinde permüte edin, permüte edilmiş veriler üzerinde düzenlileştirilmiş k-ortalamaları uydurun ve gözlemlenen ve permüte edilmiş amaç değerleri arasındaki boşluğu en üst düzeye çıkaran lambda'yı seçin. Bir siluet veya Calinski-Harabasz puanları üzerinde çapraz doğrulama pratik bir alternatiftir.
Düzenlileştirilmiş k-ortalamalar küresel optimumu bulmayı garanti eder mi?
Hayır. Standart k-ortalamalar gibi, alternatif optimizasyon yerel bir minimuma yakınsar. Farklı başlangıçlarla birden fazla yeniden başlatma önerilir ve k-means++ başlatma, başlangıç koşullarına duyarlılığı azaltır.
Düzenlileştirilmiş k-ortalamalar ile seyrek k-ortalamalar arasındaki fark nedir?
Seyrek k-ortalamalar (Witten & Tibshirani, 2010), özellik ağırlıklarını tam olarak sıfıra indirmek için bir L1 cezası kullanan, düzenlileştirilmiş k-ortalamaların en belirgin örneğidir. Diğer düzenlileştirilmiş varyantlar L2 cezaları (ağırlıkları sıfıra indirir ancak sıfırlamaz), elastik net kombinasyonları veya gruplandırılmış özellikler için yapısal cezalar kullanır.
Düzenlileştirilmiş k-ortalamaları çalıştırmadan önce özellikleri standartlaştırmalı mıyım?
Evet. Standardizasyon olmadan, yüksek varyanslı özellikler küme içi kareler toplamına hakim olur, bu da cezanın gerçekten bilgilendirici özellikleri seçme yeteneğini baltalar. Uydurmadan önce sıfır ortalama ve birim varyansa standartlaştırma şiddetle tavsiye edilir.
DBSCAN veya Gaussian karışım modelini düzenlileştirilmiş k-ortalamalar yerine ne zaman tercih etmeliyim?
Kümeler küresel olmadığında, yoğunlukta değiştiğinde veya gürültülü noktaların bir kümeye zorlanmak yerine işaretlenmesi gerektiğinde DBSCAN veya HDBSCAN'ı seçin. Olasılıksal küme üyeliği ve yumuşak atamalar istediğinizde bir Gaussian karışım modeli seçin. Düzenlileştirilmiş k-ortalamalar, bölümlendirilmiş kümeleme ile birlikte yerleşik özellik seçimine özel olarak ihtiyaç duyduğunuzda en iyisidir.
Kaynaklar
- Witten, D. M., & Tibshirani, R. (2010). A framework for feature selection in clustering. Journal of the American Statistical Association, 105(490), 713–726. DOI: 10.1198/jasa.2010.tm09415 ↗
- K-means clustering. Wikipedia. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Regularized K-Means Clustering. ScholarGate. https://scholargate.app/tr/machine-learning/regularized-k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- K-ortalama KümelemeMakine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Gauss Karışım ModeliMakine öğrenmesi↔ karşılaştır