Yarı denetimli Gauss Karışım Modeli
Semi-supervised Gaussian Mixture Model (SS-GMM) · Ayrıca şöyle bilinir: SS-GMM, semi-supervised GMM, partially labeled Gaussian mixture model, generative semi-supervised classifier
Yarı denetimli Gauss Karışım Modeli (SS-GMM), Etkinleştirme-Maksimizasyon algoritmasını kullanarak hem etiketli hem de etiketsiz verilere bir Gauss karışımı uyduran üretken olasılıksal bir sınıflandırıcıdır. Etiketli noktalar bileşen atamalarını kısıtlarken, etiketsiz noktalar yoğunluk tahminlerini iyileştirir ve bu da sınırlı sayıda etiket olduğunda etkili öğrenmeyi sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli örneklerin az olduğu ancak etiketsiz verilerin bol olduğu ve altta yatan sınıf koşullu dağılımların yaklaşık olarak Gauss olduğu veya dönüşüm yoluyla bu hale getirilebildiği durumlarda SS-GMM kullanın. Düşük ila orta dereceli boyutlu sürekli özellik uzayları için uygundur (boyut azaltma olmadan yaklaşık 20-50 özelliğe kadar). Özellikler yüksek derecede Gauss-dışı veya kategorik olduğunda, sınıf sayısı etiketli örneklere göre büyük olduğunda, küme yapısı sınıf sınırlarıyla uyumlu olmadığında (küme varsayımı ihlal edildiğinde) veya yarı denetimli SVM veya etiket yayılımı gibi ayrımcı bir model veri geometrisine daha iyi uyduğunda bundan kaçının.
Güçlü yönler & sınırlılıklar
- Etiketlerin pahalı veya nadir olduğu durumlarda parametre tahminini iyileştirmek için etiketsiz verilerden yararlanır.
- İyi anlaşılmış EM yakınsama garantilerine sahip, matematiksel olarak şeffaf üretken bir model sunar.
- Doğrudan çok sınıflı problemler için, bir-karşı-hepsi ayrımı olmadan doğal olarak başa çıkar.
- Sınıf içi çok modlu dağılımları yakalamak için her sınıf için birden fazla Gauss ile genişletilebilir.
- Gauss varsayımının güçlü bir şekilde ihlal edildiği durumlarda model uyumu bozulur — doğrusal olmayan dönüşümler veya çekirdek yöntemleri gerekebilir.
- EM yerel bir optimuma yakınsar; sonuçlar başlatmaya duyarlıdır ve birden fazla yeniden başlatma gereklidir.
- Yüksek boyutlu veriler (boyutluluk laneti), düzenlileştirme veya boyut azaltma olmadan kovaryans tahminini güvenilmez hale getirir.
- Küme varsayımı geçerli olmadığında (kümeler sınıf sınırlarıyla uyumlu olmadığında) etiketsiz veriler yardımcı olmak yerine zarar verebilir.
- Düzenlileştirme veya boyut azaltma olmadan çok büyük etiketsiz veri kümelerine kötü ölçeklenir.
- İlk yakınsayan çözümü kabul ederek tek bir EM başlatması çalıştırmak — her zaman birden fazla yeniden başlatma kullanın.
SSS
Denetimsiz bir GMM, sınıf etiketleri hakkında hiçbir bilgi olmadan küme yapısını bulur ve etiket değiştirme sorunundan muzdariptir — küme indeksleri anlamsal bir anlam taşımaz. SS-GMM, her E-adımı sırasında etiketli noktaları doğru bileşenlerine sabitler, küme kimliğini sınıf semantiğine bağlar ve etiketsiz noktaların yoğunluk tahminlerini iyileştirmesine izin verir.
Etiketsiz veriler doğruluğumu neden olumsuz etkiliyor olabilir?
Bu, 'küme varsayımı ihlali' sorunudur: eğer sınıf sınırları doğal yoğunluk kümeleriyle uyumlu değilse, etiketsiz veriler modeli yanlış yöne yönlendirir. Tanısal adımlar arasında veriyi 2B'de görselleştirmek (PCA/t-SNE), etiketli noktalara olan ağırlığı lambda artırmak veya yarı denetimli SVM gibi ayrımcı bir yarı denetimli yönteme geçmek yer alır.
Sınıf başına kaç Gauss bileşeni kullanmalıyım?
Sınıf başına bir bileşenle başlayın. Eğer bir sınıfın açıkça çok modlu bir yapısı varsa (örneğin, iki alt popülasyon), o sınıf için iki veya daha fazla bileşene izin verin. Aşırı uyum olmadan model sıralarını karşılaştırmak için etiketli alt küme üzerinde BIC veya tutulan olabilirlik kullanın.
Tam, çapraz veya bağlı kovaryans matrisleri kullanmalı mıyım?
Tam kovaryans en esnek olanıdır ancak bileşen başına çok sayıda örnek gerektirir. Çapraz kovaryans (özelliklerin bağımsız olduğu varsayılır), orta ila yüksek boyutlarda en güvenli varsayılan değerdir. Bağlı kovaryans (tüm bileşenler tek bir matrisi paylaşır) parametreleri daha da azaltır ve sınıfların benzer yayılıma sahip olduğu durumlarda uygundur.
Etiketli ve etiketsiz katkılar için bir ağırlık var mı?
Evet. Yaygın bir uzantı, genellikle çok daha fazla sayıda etiketsiz noktayı telafi etmek için etiketli log-olabilirliği lambda > 1 faktörüyle çarpar. Bunun olmadan, etiketsiz çoğunluk parametre güncellemelerinde baskın olabilir ve denetim sinyalini ortadan kaldırabilir.
Etiketli ve etiketsiz özellik matrislerinizi MethodMind'a yükleyin, sınıf sayısını ve kovaryans türünü belirtin ve kod yazmadan sınıf arka olasılıklarını, bileşen parametrelerini ve bir yakınsama izini elde etmek için SS-GMM'yi çalıştırın.
Kaynaklar
- Chapelle, O., Scholkopf, B., & Zien, A. (Eds.). (2006). Semi-Supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
- Nigam, K., McCallum, A. K., Thrun, S., & Mitchell, T. (2000). Text classification from labeled and unlabeled documents using EM. Machine Learning, 39(2-3), 103-134. DOI: 10.1023/A:1007692713085 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Gaussian Mixture Model (SS-GMM). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-gaussian-mixture-model
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Varyasyonel Otomatik KodlayıcıDerin öğrenme↔ karşılaştır