Yarı denetimli Torbalama (Semi-supervised Bagging)
Semi-supervised Bagging (Bootstrap Aggregating with Unlabeled Data) · Ayrıca şöyle bilinir: SS-Bagging, semi-supervised bootstrap aggregating, self-training bagging, bagging with pseudo-labels
Yarı denetimli Torbalama, etiketli eğitim örneklerinin kıt olduğu ancak büyük miktarda etiketsiz verinin mevcut olduğu ortamlara klasik torbalama topluluğunu (bagging ensemble) genişletir. Etiketli veriler üzerinde eğitilen temel öğreniciler, etiketsiz örneklere sözde etiketler (pseudo-labels) atar; genişletilmiş veri kümesi daha sonra tek başına sınırlı etiketli küme üzerinde eğitilen herhangi bir tekil modelden daha doğru ve daha kararlı olan topluluğun toplu oyunu (aggregated vote) büyütmek için kullanılır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli verilerin pahalı veya kıt olduğu - örneğin uzman incelemesi gerektiren etiketlemeler - ancak büyük miktarda etiketsiz gözlem mevcut olduğunda Yarı denetimli Torbalama'yı kullanın. Yarı denetimli öğrenmenin uygulanabilir olduğu tablo veya özellik vektörü verileri üzerinde hem sınıflandırma hem de regresyon için uygundur. Etiketli küme temel öğreniciyi iyi eğitecek kadar büyükse (sade torbalama yeterlidir), etiketsiz veriler etiketli verilerden farklı bir dağılımdan geliyorsa (dağılım uyumsuzluğu ana varsayımı ihlal eder) veya sözde etiket kalitesi sürekli düşükse (güven filtrelemesi çoğu etiketsiz noktayı reddedecek ve çok az fayda sağlayacaktır) kullanmayın.
Güçlü yönler & sınırlılıklar
- Ek etiketleme maliyeti olmadan doğruluğu artırmak için bol miktarda etiketsiz veriden yararlanır.
- Torbalamanın varyans azaltma özelliğini miras alır: çeşitli bootstrap örneklemleri, gürültülü sözde etiketlere aşırı uyum sağlamayı önler.
- Modelden bağımsız çerçeve - herhangi bir türevlenebilir veya türevlenemez temel öğrenici takılabilir.
- Güven eşiği filtrelemesi, düşük kaliteli sözde etiketlerin yayılmasını önlemek için yerleşik bir koruma sağlar.
- Doğal olarak paralelleştirilebilir: her temel öğrenici bağımsız olarak eğitilir, büyük veri kümelerine ölçeklenir.
- Etiketli ve etiketsiz verilerin aynı temel dağılımı paylaştığını varsayar; dağılım uyumsuzluğu performansı düşürür.
- Sözde etiket hataları, güven eşikleri çok düşük ayarlanırsa iterasyonlar boyunca birikebilir.
- Hiperparametre hassasiyeti: güven eşiği, temel öğrenici sayısı ve sözde etiketleme turu sayısı etkileşime girer ve ayarlanması gerekir.
- Birçok akademik kitle için yorumlanabilirliği sınırlayan, açık özellik önemi veya katsayı çıktıları sağlamaz.
SSS
Yarı denetimli Torbalama, sade kendi kendine eğitimden nasıl farklıdır?
Sade kendi kendine eğitim, sözde etiketleme ve yeniden eğitme işlemini yinelemeli olarak gerçekleştirmek için tek bir model kullanır. Yarı denetimli Torbalama, bootstrap örneklemleri üzerinde eğitilmiş bir model topluluğu kullanır, bu nedenle sözde etiket kalitesi, tek bir modelin güveni yerine topluluk anlaşmasıyla değerlendirilir, bu da hata yayılımını azaltır.
Güven eşiğini nasıl ayarlamalıyım?
Yaygın bir başlangıç noktası, topluluk son olasılığının sınıflandırma için 0.8-0.9'u aştığı sözde etiketleri kabul etmektir. Etiketli küme üzerinde çapraz doğrulama ile ayarlayın; eşiği geçen etiketsiz nokta sayısı çok azsa, biraz düşürün - ancak doğrulukta düşüş olup olmadığını izleyin.
Kaç temel öğrenici gereklidir?
Standart torbalama için geçerli olan aynı kılavuz geçerlidir: 100 ile başlayın ve ayrılmış bir etiketli doğrulama kümesindeki performans stabilize olana kadar artırın. Daha fazla öğrenici varyansı azaltır ancak hesaplama maliyetini artırır.
Bunu sinir ağları ile temel öğreniciler olarak kullanabilir miyim?
Evet, ancak pratikte karar ağaçları veya sığ modeller daha yaygındır çünkü her bootstrap örneği üzerinde hızlı bir şekilde yeniden eğitilirler. Hesaplama gücü izin verirse sinir ağları temel öğreniciler olarak hizmet edebilir, ancak derin yarı denetimli öğrenme için sözde etiket eğitimi veya ortalama-öğretmen (mean-teacher) gibi yöntemler daha tipiktir.
Ya etiketsiz kümem etiketli kümemden çok daha büyükse?
Bu tipik olarak faydalı bir senaryodur. Bootstrap örneklemlerini gürültülü sözde etiketlerle doldurmaktan kaçınmak için agresif güven filtrelemesi uygulayın ve etiketli örneklerin yeniden örnekleme sırasında daha fazla ağırlıklandırılmasını düşünün.
Kaynaklar
- Bennett, K. P., & Demiriz, A. (1999). Semi-supervised support vector machines. Advances in Neural Information Processing Systems, 11. MIT Press. link ↗
- Li, M., & Zhou, Z.-H. (2005). SETRED: Self-training with editing. In Proceedings of the 9th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD), LNAI 3518, pp. 611–621. Springer. DOI: 10.1007/11430919_71 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Bagging (Bootstrap Aggregating with Unlabeled Data). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-bagging
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır