Yarı denetimli Boosting
Semi-supervised Boosting (Boosting with Unlabeled Data) · Ayrıca şöyle bilinir: SemiBoost, SSL boosting, boosting with unlabeled data, semi-supervised ensemble boosting
Yarı denetimli Boosting, klasik boosting algoritmalarını — AdaBoost gibi — hem etiketli hem de etiketsiz verilerden yararlanacak şekilde genişleten bir topluluk öğrenme paradigmasıdır. Etiketli verilerin kıt olduğu durumlarda, etiketsiz örnekler üzerindeki bir benzerlik yapısı aracılığıyla etiket bilgisini yayarak, yalnızca denetimli boosting'den daha güçlü sınıflandırıcılar eğitir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Yarı denetimli Boosting, etiketli verilerin kıt ve elde edilmesi pahalı olduğu ancak daha büyük bir etiketsiz veri havuzunun hazır bulunduğu durumlarda uygundur — tıbbi görüntü annotasyonu, metin kategorizasyonu ve sensör tabanlı izleme yaygındır. Küme veya manifold varsayımının makul bir şekilde geçerli olduğu (benzer girdiler etiketleri paylaşır) ikili veya çok sınıflı sınıflandırma görevleri için en uygunudur. Etiketsiz veriler test dağılımını temsil etmiyorsa, küme varsayımı makul değilse (örneğin, temelde farklı süreçlerden gelen veriler) veya etiketli küme zaten bir denetimli güçlendiriciyi doyuracak kadar büyükse — bu durumda, düz gradyan boosting çok daha az karmaşıklıkla performansını eşleştirecek veya aşacaktır — bundan kaçının.
Güçlü yönler & sınırlılıklar
- Etiketli kümenin tek başına desteklediğinin ötesinde doğruluğu artırmak için bol miktarda etiketsiz veriden yararlanır.
- AdaBoost gibi boosting çerçevelerinin güçlü ampirik performansını ve esnekliğini miras alır.
- Grafik tabanlı benzerlik yapısı, etiket yayılımını yorumlanabilir ve ayarlanabilir hale getirir.
- Örnek ağırlıklarını kabul eden herhangi bir temel öğrenici ile çalışır, çerçeveyi modüler tutar.
- Belge deneylerinde belgelenen düşük etiket oranlı rejimlerde saf denetimli boosting'den tutarlı bir şekilde daha iyi performans gösterir.
- Etiketsiz veriler etiketli verilerle aynı dağılımdan gelmiyorsa (veri kümesi kayması) performans keskin bir şekilde düşer.
- Sözde etiket gürültüsü, ilk tahminler zayıf olduğunda hata amplifikasyonu ile sonuçlanan boosting turları boyunca birikebilir.
- Benzerlik grafiği oluşturma, hassas olan ve doğrulama gerektiren çekirdek bant genişliği veya komşu sayısı seçimi gerektirir.
- Grafik oluşturma ve her turda sözde etiket yeniden hesaplama nedeniyle hesaplama maliyeti, denetimli boosting'den önemli ölçüde daha yüksektir.
SSS
Yarı denetimli boosting, düz AdaBoost'tan ne zaman daha iyi performans gösterir?
En güvenilir şekilde, etiketli küme çok küçük olduğunda — tipik olarak sınıf başına birkaç yüz örneğin altında — ve etiketsiz veriler bol ve aynı dağılımdan alındığında. Büyük etiketli kümelerle, fark kapanır ve standart denetimli boosting daha basittir ve daha hızlıdır.
Benzerlik grafiğini nasıl oluşturmalıyım?
Etiketli küme üzerinde çapraz doğrulama ile ayarlanmış bant genişliğine sahip bir radyal tabanlı fonksiyon (RBF) çekirdeği en yaygın seçenektir. k-en yakın komşu grafikleri daha basit bir alternatiftir. Anahtar kriter, grafiğin aynı sınıfa ait örnekleri bağlaması ve farklı sınıf kümelerini mümkün olduğunca temiz bir şekilde ayırması gerektiğidir.
Hangi temel öğrenici en iyi şekilde çalışır?
Klasik AdaBoost ile tutarlı olarak karar kütükleri (derinlik-1 ağaçları) standart seçimdir. Karar sınırı karmaşık olduğunda sığ ağaçlar (derinlik 2–4) doğruluğu artırabilir ancak gürültülü sözde etiketlere aşırı güvenme riskini artırır.
Kaç boosting turu gereklidir?
100–200 tur ile başlayın ve etiketli doğrulama hatasını izleyin. Tamamen denetimli boosting'in aksine, çok fazla tur eklemek sözde etiket gürültüsünü artırabilir, bu nedenle küçük bir etiketli doğrulama kümesinde erken durdurma şiddetle tavsiye edilir.
Sınıf dengesizliği bir endişe midir?
Evet. Etiketli havuz sınıf dengesiz olduğunda, ilk tahminler yanlıdır ve sözde etiketler bu yanlılığı etiketsiz kümeye yayacaktır. Bunu azaltmak için eğitimden önce etiketli sınıfları yeniden ağırlıklandırın veya azınlık sınıfını aşırı örnekleyin.
Kaynaklar
- Mallapragada, P. K., Jin, R., Jain, A. K., & Liu, Y. (2009). SemiBoost: Boosting for Semi-supervised Learning. IEEE Transactions on Pattern Analysis and Machine Intelligence, 31(11), 2000–2014. DOI: 10.1109/TPAMI.2008.235 ↗
- Bennett, K. P., & Demiriz, A. (1999). Semi-supervised Support Vector Machines. Advances in Neural Information Processing Systems (NIPS), 11, 368–374. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Boosting (Boosting with Unlabeled Data). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-boosting
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- AdaBoostMakine öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır