Küme Analizi
Cluster Analysis · Ayrıca şöyle bilinir: clustering, unsupervised classification, data clustering, numerical taxonomy
Küme analizi, nesneler veya gözlemler kümesini, ölçülen özelliklere dayanarak, grup üyeliği hakkında önceden bilgi sahibi olmadan, içsel olarak homojen, karşılıklı olarak farklı gruplara — kümelere — bölen, denetimsiz çok değişkenli teknikler ailesidir. Pazar segmentasyonu, biyoenformatik, psikoloji ve sosyal bilimlerde verilerdeki doğal gruplanmaları ortaya çıkarmak için yaygın olarak kullanılır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+5 tane daha
Ne zaman kullanılır
Önceden tanımlanmış bir sonuç değişkeni olmadan verilerdeki doğal grupları keşfetmek — örneğin pazar segmentlerini, hasta alt gruplarını, türleri veya yanıtlayıcı profillerini belirlemek — hedeflendiğinde küme analizini kullanın. Ön koşullar: gözlemler değiştirilebilir olmalı (anlamlı bir zaman sırası olmamalı) ve değişkenler tutarlı bir şekilde ölçülmelidir. Ölçek etkilerini eşitlemek için sürekli değişkenleri standartlaştırın. Grupların zaten bilindiği ve hedefin sınıflandırma olduğu (diskriminant analizi kullanın) veya mesafelerin boyut azaltma olmadan anlamlı olması için verilerin çok seyrek veya yüksek boyutlu olduğu durumlarda küme analizinden kaçının. Kararlı sonuçlar için öngörülen her küme başına en az 20 ila 30 gözlem gereklidir ve anlamlı sonuçlar çıkarmadan önce küme çözümünü her zaman yeni veriler üzerinde veya bir bölme-örnek yaklaşımıyla doğrulayın.
Güçlü yönler & sınırlılıklar
- Tamamen veriye dayalı ve denetimsiz — teorik olarak yönlendirilmiş bir gruplama dayatmadan yapıyı ortaya çıkarır.
- Uygun uzaklık ölçüleriyle çeşitli veri türlerine (sürekli, sıralı, ikili, karışık) uygulanabilir.
- Hiyerarşik yöntemler, sabit bir küme sayısına bağlı kalmadan, dendrogram aracılığıyla iç içe geçmiş yapının tam bir resmini sunar.
- Ölçeklenebilir: k-ortalamalar ve ilgili algoritmalar büyük veri kümelerini verimli bir şekilde işler.
- Faktör analizi ve PCA'ya tamamlayıcı — faktör puanları veya azaltılmış boyutlar üzerinde kümeleme yapabilir.
- Küme sayısı analist tarafından seçilmelidir; k'yı belirlemek için evrensel olarak kabul edilmiş bir yöntem yoktur.
- Sonuçlar, uzaklık ölçüsü, bağlantı kriteri ve iteratif algoritmalar için başlangıç değerlerinin seçimine büyük ölçüde bağlıdır.
- Tüm yöntemler rastgele verilerde bile kümeler bulacaktır — doğrulama esastır.
- Ayık gözlemlere duyarlıdır, bu da sağlam olmayan uygulamalarda merkezleri ve bağlantıyı bozabilir.
- Kümeler sert bölmelerdir; küme sınırlarında bulunan gözlemler, üyelik belirsiz olsa bile bir gruba zorlanır.
SSS
Kaç küme kullanacağımı nasıl belirlerim?
Kesin tek bir kural yoktur. Yaygın yaklaşımlar arasında dirsek yöntemi (küme içi kareler toplamını k'ya karşı çizip belirgin bir bükülme arama), siluet genişliği (daha yüksek ortalama siluet daha iyi ayrılmış kümeleri gösterir) ve Calinski-Harabasz indeksi bulunur. Hiyerarşik çözümler için, birleştirme uzaklıklarındaki büyük sıçramalar için dendrogramı ve yığma çizelgesini inceleyin. Seçilen küme sayısının anlamsal olarak mantıklı olduğunu her zaman doğrulayın.
Hiyerarşik kümeleme ile k-ortalamalar kümeleme arasındaki fark nedir?
Hiyerarşik kümeleme, gözlemleri art arda birleştirerek (yığmacı) veya bölerek (bölücü) iç içe geçmiş grupların bir ağacını oluşturur; analist ağacı nereden keseceğine karar verir. K-ortalamalar, küme sayısını k önceden belirlemeyi ve ardından her gözlemi en yakın merkeze iteratif olarak atamayı gerektirir. Hiyerarşik yöntemler, tüm gruplama aralığını keşfetmek ve küçük örneklemler için daha iyidir; k-ortalamalar, k yaklaşık olarak bilindiğinde büyük veri kümeleri için daha verimlidir.
Kümelemeden önce değişkenlerimi standartlaştırmalı mıyım?
Evet, değişkenler farklı ölçeklerde ölçülmüşse. Standartlaştırma olmadan, daha büyük sayısal aralıklara sahip değişkenler Öklid uzaklıklarında baskın olacak ve küçük ölçekli değişkenler gruplamaya çok az katkıda bulunacaktır. Z-skoru standartlaştırması (ortalamayı çıkar, standart sapmaya böl) varsayılan değerdir; orijinal ölçek anlamlıysa [0, 1] aralığına standartlaştırma bir alternatiftir.
Küme analizi kategorik değişkenleri işleyebilir mi?
Standart Öklid uzaklığı kategorik değişkenler için uygun değildir. Karışık veri türleri için Gower'ın uzaklığını veya ikili veriler için Jaccard / basit eşleşme katsayılarını kullanın. Alternatif olarak, kategorik değişkenleri kukla kodlara dönüştürün, ancak bu tür kümeleri dikkatli bir şekilde yorumlayın. Gizli sınıf analizi, özellikle kategorik göstergeler için tasarlanmış modele dayalı bir alternatiftir.
Bir küme çözümünü nasıl doğrularım?
İç doğrulama, siluet genişliği gibi indeksleri kullanarak küme içi uyumu ve küme dışı ayrılığı karşılaştırır. Dış doğrulama, kümelerin anlamlı dış kriterlerle (örneğin, bir tutma örneğindeki bilinen grup üyeliği) örtüşüp örtüşmediğini kontrol eder. Kararlılık, analizi bootstrap alt örnekleri veya verinin rastgele bölmeleri üzerinde tekrarlayarak ve gözlemlerin ne kadar tutarlı bir şekilde birlikte atandığını ölçerek değerlendirilir.
Kaynaklar
- Everitt, B. S., Landau, S., Leese, M. & Stahl, D. (2011). Cluster Analysis (5th ed.). Wiley. ISBN: 978-0470749913
- Hair, J. F., Black, W. C., Babin, B. J. & Anderson, R. E. (2019). Multivariate Data Analysis (8th ed.). Cengage Learning. ISBN: 978-1473756540
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Cluster Analysis. ScholarGate. https://scholargate.app/tr/statistics/cluster-analysis
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Diskriminant Analiziİstatistik↔ karşılaştır
- Keşfedici Faktör Analizi (KFA)İstatistik↔ karşılaştır
- Gizli Sınıf Analizi (LCA)İstatistik↔ karşılaştır
- Karışım Modellemesiİstatistik↔ karşılaştır
- Çok Boyutlu Ölçekleme (ÇBÖ)İstatistik↔ karşılaştır