Yarı denetimli Lojistik Regresyon
Semi-supervised Logistic Regression (Self-training and EM-based variants) · Ayrıca şöyle bilinir: SSL logistic regression, semi-supervised LR, EM logistic regression, self-training logistic classifier
Yarı denetimli lojistik regresyon, eğitim sırasında etiketlenmemiş verileri dahil ederek standart lojistik sınıflandırıcıyı genişletir. Öz-eğitim, beklendik-maksimizasyon veya etiket-yayılma sarmalayıcılarını kullanarak, etiketlenmemiş örneklere iteratif olarak yumuşak etiketler atar ve model parametrelerini iyileştirir, bu da etiketli verilerin tüm veri kümesine oranla kıt olduğu durumlarda genellemeyi iyileştirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli örneklerin az olduğu — tipik olarak etiketli kesrin toplam mevcut verinin %20'sinin altında olduğu — ancak aynı dağılımdan büyük bir etiketlenmemiş veri havuzunun bulunduğu ve etiketlemenin pahalı olduğu durumlarda yarı denetimli lojistik regresyonu seçin. Metin sınıflandırma, klinik sonuç tahmini ve kısmen gözlemlenen sonuçların olduğu anket araştırmaları için uygundur. Etiketlenmemiş veriler etiketli kümeden farklı bir dağılımdan geliyorsa (kovaryant kayması), etiketler rastgele değilse ve eksiklik bilgilendirici ise veya etiketli küme zaten standart bir lojistik regresyonun iyi performans gösterdiği kadar büyükse kullanmayın — bu durumlarda, sözde-etiket gürültüsü faydadan çok zarar verir.
Güçlü yönler & sınırlılıklar
- Ek etiketleme maliyeti olmadan bir lojistik sınıflandırıcıyı iyileştirmek için büyük etiketlenmemiş veri havuzlarından yararlanır.
- Lojistik regresyon katsayılarının ve oran oranlarının yorumlanabilirliğini korur.
- Öz-eğitim sarmalayıcısı modelden bağımsızdır ve mevcut herhangi bir lojistik regresyon işlem hattına eklenmesi kolaydır.
- EM varyantı, biçimsel bir yakınsama garantisi ile ilkeli bir olasılıksal çerçeve sunar.
- Düzenlileştirme (L1/L2), sözde-etiketli verilerde aşırı uyumu kontrol etmek için doğrudan birleştirilebilir.
- İlk etiketli veriler çok az veya temsilci değilse, erken sözde-etiketler gürültülüdür ve hatalar iterasyonlar boyunca birikir.
- Etiketlenmemiş verilerin etiketli verilerle aynı dağılımdan çekildiği varsayılır — birçok gerçek dünya toplama senaryosunda ihlal edilir.
- Denetimli tabanın üzerine çıkacak yerel bir optimuma yakınsama garanti edilmez.
- Öz-eğitimdeki güven eşikleri ayarlanmalıdır ve sınıf dengesizliği ile öngörülemeyen şekillerde etkileşime girer.
- Etkin eğitim kümesi algoritmik olarak oluşturulmuş etiketleri içerdiğinden, katsayıların yorumlanması zorlaşır.
SSS
Yarı denetimli lojistik regresyon standart lojistik regresyondan nasıl farklıdır?
Standart lojistik regresyon yalnızca etiketli örnekleri kullanır. Yarı denetimli varyant, etiketlenmemiş verilere iteratif olarak geçici etiketler atar ve bunları yeniden eğitime dahil eder, böylece karar sınırı hem doğrulanmış etiketler hem de daha büyük etiketlenmemiş veri kümesinin yapısı tarafından şekillendirilir.
Öz-eğitim için hangi güven eşiğini kullanmalıyım?
İkili sınıflandırma için yaygın başlangıç noktaları 0.85–0.95'tir. Doğru eşik sınıf dengesine ve etiket kalitesine bağlıdır. Etiketli doğrulama kümesinde ayarlayın ve belirsiz sözde-etiketlerin selini önlemek için her iterasyonda eklenen etiketlenmemiş örneklerin oranını izleyin.
Katsayıları oran oranları olarak yorumlayabilir miyim?
Evet, ancak dikkatli olun. Tahmin edilen katsayılar log-oran yorumunu korur, ancak sözde-etiketli veriler gerçek gözlemler olarak ele alındığı için güven aralıkları hafife alınır. Anlamlılık hakkındaki çıkarımlar yalnızca gerçek etiketli bölüme dayanmalıdır.
Etiketlenmemiş verilerim farklı bir zaman diliminden veya kaynaktan gelirse ne olur?
Etiketli ve etiketlenmemiş kümeler arasındaki dağılım kayması ana hata modlarından biridir. Etiketlenmemiş veriler farklı bir popülasyondan veya dönemden geliyorsa, sözde-etiketler sistematik hataları pekiştirebilir. Devam etmeden önce kovaryant kaymasını kontrol edin.
Hazır bir uygulaması var mı?
Evet. scikit-learn'in SelfTrainingClassifier'ı, öz-eğitim için LogisticRegression dahil olmak üzere herhangi bir olasılıksal sınıflandırıcıyı sarmalar. EM varyantı, manuel uygulama veya SKSSL veya LASSL gibi özel SSL kütüphaneleri gerektirir.
Kaynaklar
- Nigam, K., McCallum, A., Thrun, S., & Mitchell, T. (2000). Text classification from labeled and unlabeled documents using EM. Machine Learning, 39, 103–134. DOI: 10.1023/a:1007692713085 ↗
- Chapelle, O., Scholkopf, B., & Zien, A. (Eds.) (2006). Semi-supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Logistic Regression (Self-training and EM-based variants). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-logistic-regression
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Lojistik Regresyon (YZ)Makine öğrenmesi↔ karşılaştır
- Öz-denetimli Lojistik RegresyonMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli Naive BayesMakine öğrenmesi↔ karşılaştır