Bayes Hiyerarşik Kümeleme (BHC)
Bayesian Hierarchical Clustering · Ayrıca şöyle bilinir: BHC, probabilistic hierarchical clustering, Bayesian agglomerative clustering
Bayes hiyerarşik kümeleme, her adımda Bayes model karşılaştırması kullanarak iç içe geçmiş küme birleştirmelerinden oluşan bir ağaç yapısı oluşturan olasılıksal bir yığma algoritmasıdır. Geometrik bir bağlantı kriterini en aza indirmek yerine, her aday birleştirmede iki kümedeki verilerin tek bir birleşik model tarafından mı yoksa iki ayrı model tarafından mı daha iyi açıklandığını değerlendirir ve bu da istatistiksel olarak temellendirilmiş bir dendrogram üretir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Bays hiyerarşik kümelemeyi, geometrik bir hiyerarşinin ötesinde belirsizlik ölçümüyle birlikte temellendirilmiş, modele dayalı bir dendrograma ihtiyaç duyduğunuzda kullanın. Orta büyüklükteki veri kümeleri (genellikle hesaplama maliyeti engelleyici hale gelmeden önce birkaç bin gözlem), eşlenik bir olabilirlik fonksiyonunun doğal olduğu alanlar — örneğin Gauss sürekli verileri veya Multinomial sayım verileri — ve dendrogramı kesmek için keyfi eşik seçimleri olmadan nesnel bir durdurma kuralı istediğiniz durumlar için uygundur. Çok büyük veri kümelerinde (n > 10.000) standart hiyerarşik kümelemenin yerine doğrudan kullanmayın, çünkü O(n^2) ila O(n^3) karmaşıklığı onu yavaşlatır; bu ayarlarda yaklaşık veya ölçeklenebilir varyantları tercih edin. Ayrıca, verilerin herhangi bir eşlenik parametrik aileye uymadığı veya ağaç yapısının kendisinin bilimsel olarak anlamlı olmadığı durumlarda daha az uygundur.
Güçlü yönler & sınırlılıklar
- Keyfi bağlantı sezgilerini, Bayes model karşılaştırmasına dayanan istatistiksel olarak temellendirilmiş birleştirme kararlarıyla değiştirir.
- Her ağaç düğümünde bir sonsal birleştirme olasılığı üretir ve bu da küme sayısını seçmek için nesnel bir kriter sağlar.
- Küme yapısındaki belirsizliği açıkça ele alır ve tek bir kesin bölümün yanlış kesinliğini önler.
- Eşlenik önseler, kapalı formda marjinal olabilirlik değerleri sağlar ve Gauss ve Multinomial veriler için kesin hesaplamayı mümkün kılar.
- Sonuçta ortaya çıkan dendrogram, iç içe geçmiş grup üyeliğinin olasılıksal bir modeli olarak yorumlanabilir.
- Hesaplama karmaşıklığı, örneklem boyutunun karesi ile küpü arasında değişir ve bu da yaklaşık yöntemler olmadan orta büyüklükteki veri kümelerine uygulanabilirliği sınırlar.
- Parametrik bir olabilirlik ve eşlenik önsel belirleme gerektirir; üretici modelin yanlış belirtilmesi kümeleme kalitesini düşürür.
- Açgözlü birleştirme stratejisi, küresel olarak en uygun ağacı garanti etmez, bu nedenle nihai dendrogram maksimum sonsal ağaçtan farklı olabilir.
- Alfa yoğunluk parametresi ayarlanmalı veya tahmin edilmelidir; seçimi önsel küme sayısını etkiler ve kalibre edilmesi zor olabilir.
SSS
Bayes hiyerarşik kümeleme, standart hiyerarşik kümelemeden nasıl farklıdır?
Standart hiyerarşik kümeleme, olasılıksal bir yorumu olmayan geometrik bir uzaklık veya bağlantı kriterine dayanarak kümeleri birleştirir. BHC, bu kriteri bir Bayes model karşılaştırmasıyla değiştirir: her adımda, iki aday kümenin tek bir model yerine iki ayrı model tarafından üretildiği sonsal olasılığı hesaplar ve bu olasılığı en yüksek olan çifti birleştirir.
BHC dendrogramından küme sayısını nasıl seçerim?
Dendrogramdaki her iç düğüm bir birleştirme olasılığı r_k değerini taşır. Doğal bir kural, ağacı r_k değeri 0.5'in altına düşen en derin düğümde kesmektir, bu da birleştirmenin sahte olma olasılığının daha yüksek olduğu anlamına gelir. Bu, klasik hiyerarşik yöntemlerde bulunmayan nesnel, veriye dayalı bir durdurma kriteri sağlar.
Hangi olabilirlik ve önseli kullanmalıyım?
Sürekli veriler için, kovaryans üzerinde ters-Wishart önseli (ve ortalama üzerinde Normal önsel) ile bir Gauss olabilirlik fonksiyonu standarttır ve kapalı formda marjinal olabilirlik sağlar. Sayım veya kategorik veriler için, Dirichlet-Multinomial modeli doğal eşlenik seçenektir. Temel gereksinim, önselin olabilirlik fonksiyonuna eşlenik olmasıdır, böylece marjinal integral çözülebilir olur.
BHC büyük veri kümeleri için uygun mudur?
Temel algoritma n'nin karesi ile küpü arasında değişir ve birkaç bin gözlemin ötesinde yavaşlar. Daha büyük veri kümeleri için uygulayıcılar, yerel ağaçlar oluşturup sonra bunları birleştiren rastgele projeksiyon başlatma, alt örnekleme veya böl-fethet BHC varyantları gibi yaklaşımlar kullanır.
BHC, Dirichlet süreci karışım modelleriyle nasıl ilişkilidir?
BHC, ağaç bölümleri üzerinde bir Dirichlet süreci önseli kullanır, bu nedenle DP karışımlarıyla aynı nonparametrik önsel ailesini paylaşır. Ancak, DP karışımları düz (değiştirilebilir) bir bölüm sonsalı üretirken, BHC iç içe geçmiş bölümlerden oluşan bir ağaç üretir. İki yöntem farklı soruları yanıtlar: DP karışımları kaç küme olduğunu ve hangi gözlemlerin her birine ait olduğunu sorar; BHC ayrıca kümelerin hiyerarşik olarak nasıl ilişkili olduğunu sorar.
Kaynaklar
- Heller, K. A. & Ghahramani, Z. (2005). Bayesian hierarchical clustering. In Proceedings of the 22nd International Conference on Machine Learning (ICML 2005), pp. 297–304. ACM. DOI: 10.1145/1102351.1102389 ↗
- Murtagh, F. & Legendre, P. (2014). Ward's hierarchical agglomerative clustering method: which algorithms implement Ward's criterion? Journal of Classification, 31(3), 274–295. DOI: 10.1007/s00357-014-9161-z ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Bayesian Hierarchical Clustering. ScholarGate. https://scholargate.app/tr/statistics/bayesian-hierarchical-clustering
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Bayesçi Kümeleme Analiziİstatistik↔ karşılaştır
- Bayesci Gizli Sınıf Analizi (BLCA)İstatistik↔ karşılaştır
- Bayes Karışım Modellemesiİstatistik↔ karşılaştır
- Küme Analiziİstatistik↔ karşılaştır
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- Karışım Modellemesiİstatistik↔ karşılaştır