Öz-denetimli Naive Bayes
Self-supervised Naive Bayes (EM-augmented Generative Classifier) · Ayrıca şöyle bilinir: Self-training Naive Bayes, EM Naive Bayes, Expectation-Maximization Naive Bayes, Pseudo-label Naive Bayes
Öz-denetimli Naive Bayes, klasik Naive Bayes sınıflandırıcısını, Beklenti-Maksimizasyon döngüsü aracılığıyla iteratif olarak yumuşak sözde etiketler atayarak büyük etiketlenmemiş veri havuzlarından yararlanacak şekilde genişletir. Başlangıçta Nigam ve ark. (2000) tarafından metin sınıflandırması için gösterilen bu yaklaşım, etiketli örnekler az olduğunda ancak etiketlenmemiş veriler bol olduğunda doğruluğu önemli ölçüde artırabilir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketlenmiş verilerin sınırlı olduğu (düzinelerce ila yüzlerce örnek) ancak etiketlenmemiş verilerin bol olduğu durumlarda öz-denetimli Naive Bayes'i seçin — metin sınıflandırması, spam filtreleme, belge kategorizasyonu ve klinik NLP'de annotasyonun pahalı olduğu yaygın bir senaryo. Özellikle veriler çoklu dağılımı (kelime sayıları, olay sıklıkları) takip ettiğinde ve Naive Bayes bağımsızlık varsayımı makul bir yaklaşımsa etkili olur. Etiketlenmiş verilerin zaten yeterli olduğu (sınıf başına yüzlerce iyi dengelenmiş örnek), özelliklerin güçlü bir şekilde ilişkili olduğu (bağımsızlık varsayımını ihlal eden), etiketlenmemiş veri dağılımının etiketlenmiş kümeden önemli ölçüde farklı olduğu veya yorumlanabilirliğin tam denetimli, denetlenebilir bir model gerektirdiği durumlarda bundan kaçının.
Güçlü yönler & sınırlılıklar
- Bol miktarda etiketlenmemiş veriyi verimli bir şekilde kullanır, etiketlenmiş örnekler az olduğunda genellikle doğruluğu önemli ölçüde artırır.
- Hesaplama açısından ucuz: Naive Bayes için EM M-adımı, çok büyük etiketlenmemiş veri kümelerine ölçeklenen tek bir kapalı form geçişidir.
- Olasılıksal çıktılar, yalnızca sert etiketler değil, kalibre edilmiş sınıf olasılıkları sağlar.
- Etiketlenmemiş veri ağırlığı hiperparametresi, denetimsiz sinyalin modeli ne kadar etkilediği üzerinde ince ayar kontrolü sağlar.
- Metin kelime torbası temsilleri gibi yüksek boyutlu ayrık özellik uzaylarına iyi uyum sağlar.
- Herhangi bir standart Naive Bayes kütüphanesinin üzerine uygulaması basittir.
- Bağımsızlık varsayımının ağır bir şekilde ihlal edilmesi durumunda performans düşer, bu da Naive Bayes ailesinin bilinen bir zayıflığıdır.
- İlk denetimli model zayıfsa, EM döngüsü erken hataları büyütebilen kötü bir yerel optimuma yakınsayabilir.
- Yaklaşım, etiketlenmemiş verilerin etiketlenmiş verilerle aynı dağılımdan çekildiği varsayımını yapar; kovaryat kayması performansı olumsuz etkileyebilir.
- Ayrıştırma veya Gauss Naive Bayes uyarlamaları olmadan sürekli özellikler için yerel olarak çalışmaz.
- Etiketlenmemiş veri ağırlığı ayarlanmalıdır; çok yüksek ayarlamak, modelin etiketlenmemiş havuzdaki gürültü tarafından domine edilmesine neden olur.
SSS
Başlamak için kaç adet etiketlenmiş örneğe ihtiyaç vardır?
Yaklaşımın metin ortamlarında sınıf başına yalnızca 10-20 etiketlenmiş örnekle bile işe yaradığı gösterildi, ancak sınıf başına 50 veya daha fazlası genellikle daha iyi bir başlangıç ve daha kararlı bir EM yakınsaması sağlar.
Etiketlenmemiş veri ağırlığı nedir ve nasıl ayarlanmalıdır?
Ağırlık (genellikle lambda ile gösterilir), etiketlenmemiş örneklerin etiketlenmiş örneklere göre katkısını ölçekler. Nigam ve ark., etiketlenmiş küme üzerinde çapraz doğrulama yoluyla ayarlanan 0.1 ile 1.0 arasındaki değerleri önerir; 1.0 ağırlığı, etiketlenmiş ve etiketlenmemiş verileri eşit şekilde ele alır.
Bu, yarı denetimli Naive Bayes'ten nasıl farklıdır?
Ayrım büyük ölçüde terminolojiktir. Öz-denetimli Naive Bayes, denetim sinyalinin (sözde etiketler) insan annotasyonu olmadan modelin kendisi tarafından üretildiğini vurgularken, yarı denetimli Naive Bayes daha geniş kategoridir. Pratikte her ikisi de etiketlenmemiş verilerle EM ile artırılmış Naive Bayes'i ifade eder.
EM her zaman denetimli Naive Bayes'ten daha iyi performans gösterir mi?
Her zaman değil. Bağımsızlık varsayımı kötü bir şekilde ihlal edilirse, etiketlenmemiş havuz gürültü getirirse veya veri dağılımları farklıysa, EM zarar verebilir. Dağıtmadan önce ayrılmış etiketlenmiş bir test kümesiyle değerlendirin.
Bu sürekli özelliklere uygulanabilir mi?
Evet, temel model olarak Gauss Naive Bayes kullanılarak. EM yapısı aynıdır; yalnızca olasılık fonksiyonu çoklu dağılımdan Gauss'a değişir. Sürekli özelliklerin ayrıştırılması, çoklu dağılım formülasyonunu koruyan bir alternatiftir.
Kaynaklar
- Nigam, K., McCallum, A. K., Thrun, S., & Mitchell, T. (2000). Text classification from labeled and unlabeled documents using EM. Machine Learning, 39(2-3), 103–134. DOI: 10.1023/A:1007692713085 ↗
- Chapelle, O., Scholkopf, B., & Zien, A. (Eds.) (2006). Semi-supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Naive Bayes (EM-augmented Generative Classifier). ScholarGate. https://scholargate.app/tr/machine-learning/self-supervised-naive-bayes
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Naive BayesMakine öğrenmesi↔ karşılaştır
- Öz-denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Öz-denetimli Lojistik RegresyonMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli Naive BayesMakine öğrenmesi↔ karşılaştır