Yarı denetimli Naive Bayes
Semi-supervised Naive Bayes (EM-augmented Generative Classifier) · Ayrıca şöyle bilinir: SSL Naive Bayes, EM-Naive Bayes, semi-supervised generative classifier, Nigam et al. text classifier
Yarı denetimli Naive Bayes, klasik Naive Bayes üretici modelini, küçük bir etiketli veri kümesinin yanı sıra büyük miktarda etiketsiz veriden yararlanacak şekilde genişletir. Beklenti-Maksimizasyon (Expectation-Maximization) kullanarak, etiketsiz örnekler için yumuşak sınıf atamalarını iteratif olarak çıkarır ve sınıf ve özellik parametrelerini yeniden tahmin eder, böylece etiketli örneklerin az olduğu durumlarda önemli ölçüde daha iyi sınıflandırıcılar elde eder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli örneklerin on ila yüzlerce arasında olduğu ancak aynı dağılımdan büyük miktarda etiketsiz verinin mevcut olduğu durumlar için idealdir — metin sınıflandırma, spam filtreleme ve biyomedikal belge kategorizasyonunda yaygın bir durumdur. Özellikler, sınıf verildiğinde koşullu olarak bağımsız olmalıdır (veya yaklaşık olarak öyle), bu da kelime çantası ve sayım tabanlı temsilleri doğal bir uyum haline getirir. Etiketsiz veriler etiketli kümeden farklı bir dağılımdan geldiğinde (kovaryant kayma) kaçının, çünkü EM güncellemeleri yardımcı olmak yerine zarar verebilir; bu durumlarda lambda ağırlıklandırma parametresi ayarlanmalıdır. Koşullu bağımsızlık varsayımının ciddi şekilde ihlal edildiği ve etiket kıtlığından bağımsız olarak ayrımcı bir modelin şiddetle tercih edileceği durumlardan da kaçının.
Güçlü yönler & sınırlılıklar
- Aksi takdirde atılacak olan etiketsiz verileri verimli bir şekilde kullanır, genellikle gereken etiketli veri miktarını önemli ölçüde azaltır.
- Hesaplama açısından hızlı: her EM iterasyonu veri boyutuna göre doğrusaldır, bu da onu büyük metin derlemleri için uygun hale getirir.
- İyi anlaşılmış yakınsama garantilerine sahip (olasılığın yerel bir optimaline) ilkeli olasılıksal çerçeve.
- Aşağı akış sıralama ve eşikleme sağlayan kalibre edilmiş arka olasılıklar üretir.
- Uygulaması ve genişletmesi kolaydır — lambda ağırlıklandırması, etiketsiz verilerin etkisini kontrol etmek için pratik bir ayar sağlar.
- Naive Bayes'in koşullu bağımsızlık varsayımını miras alır; ilişkili özellikler parametre tahminlerini bozar.
- EM, başlatmaya bağlı olarak yerel bir optimal değere yakınsar; birden fazla rastgele yeniden başlatma gerekebilir.
- Farklı bir dağılımdan gelen etiketsiz veriler, dikkatlice ağırlıklandırılmadıkça doğruluğu bozabilir (olumsuz transfer).
- Küçük özellik kümelerinde güçlü özellik korelasyonlarıyla ayrımcı yarı denetimli yöntemlerden (örn. transductive SVM, etiket yayılımı) daha az rekabetçidir.
SSS
İyi bir başlangıç modeli elde etmek için ne kadar etiketli örneğe ihtiyacım var?
Metin ve çok sayıda özellik için sınıflar başına 10-50 kadar yeterli olabilir, Laplace düzeltmesi uygulandığı sürece. Daha fazla etiketli örnek her zaman yardımcı olur, ancak yarı denetimli yaklaşım özellikle birkaç yüzden az etiketli örnek olduğunda parlar.
Lambda parametresi nedir ve nasıl ayarlanır?
Lambda, M-adımında etiketsiz örneklerin etiketlilere göre ne kadar ağırlık aldığını kontrol eder (lambda=1 onları eşit kabul eder; lambda=0 onları yok sayar). Etiketli küme üzerinde çapraz doğrulama yoluyla ayarlayın, {0.1, 0.3, 0.5, 1.0} değerleriyle başlayın. Dağılım uyumsuzluğundan şüphelendiğinizde lambda'yı azaltın.
EM her zaman yalnızca etiketli Naive Bayes'ten daha iyi mi olur?
Hayır. Etiketsiz veriler farklı bir dağılımdan geliyorsa, EM parametreleri yanlış yöne kaydırabilir ve hatayı artırabilir. Yarı denetimli modeli dağıtmadan önce her zaman yalnızca etiketli temel çizgiye karşı kıyaslayın.
Bu, Naive Bayes ile kendi kendine eğitimden nasıl farklıdır?
Kendi kendine eğitim, bir güven eşiğinin üzerindeki etiketsiz örneklere sabit etiketler atar, ardından yeniden eğitir. EM aracılığıyla yarı denetimli Naive Bayes, her iterasyonda tüm etiketsiz örneklere yumuşak kesirli etiketler atar, bu istatistiksel olarak daha ilkeli olup, kendi kendine eğitimde oluşabilen güvenli hataların zincirleme reaksiyonunu önler.
Bu, metin dışı tablo verileri için uygun mu?
Evet. Sürekli özellikler için, her sınıf için multinomial olasılığı Gauss (veya diğer parametrik) olasılıklarıyla değiştirin. EM döngüsü yapısı aynıdır; yalnızca M-adımı parametre formülleri değişir.
Kaynaklar
- Nigam, K., McCallum, A. K., Thrun, S., & Mitchell, T. (2000). Text Classification from Labeled and Unlabeled Documents using EM. Machine Learning, 39(2–3), 103–134. DOI: 10.1023/A:1007692713085 ↗
- Chapelle, O., Scholkopf, B., & Zien, A. (Eds.). (2006). Semi-Supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Naive Bayes (EM-augmented Generative Classifier). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-naive-bayes
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Lojistik RegresyonAraştırma istatistiği↔ karşılaştır
- Naive BayesMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli Destek Vektör MakinesiMakine öğrenmesi↔ karşılaştır