Yarı denetimli XGBoost
Semi-supervised Extreme Gradient Boosting · Ayrıca şöyle bilinir: SS-XGBoost, semi-supervised gradient boosting, pseudo-label XGBoost, label-propagation XGBoost
Yarı denetimli XGBoost, XGBoost gradyan artırma çerçevesini, yalnızca eğitim örneklerinin bir kısmının etiket taşıdığı ayarlara genişletir. Etiketsiz verilere iteratif olarak sözde etiketler üreterek ve genişletilmiş küme üzerinde yeniden eğiterek, yöntem etiketsiz gözlemlerden sinyal çıkarır, etiketli verilerin kıt olduğu durumlarda genelleştirmeyi iyileştirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli örneklerin güvenilir bir denetimli model için gerekenden az olduğu ancak aynı özellik uzayına sahip önemli miktarda etiketsiz örneğin mevcut olduğu durumlarda yarı denetimli XGBoost kullanın — tıbbi bilişim, dolandırıcılık tespiti ve endüstriyel kalite kontrolünde yaygındır. Yapılandırılmış özelliklere, heterojen türlere ve orta düzeyde boyutluluğa sahip tablo verileri için uygundur. Etiketli verilerin zaten bol olduğu ve sözde etiketlemenin ek yükünün doğruluk kazançları olmadan karmaşıklık kattığı, etiketli ve etiketsiz dağılımların önemli ölçüde farklılaştığı (kovaryant kayma) veya ilk denetimli modelin güvenilir sözde etiketler üretemeyecek kadar zayıf olduğu (kabaca 50 örneğin altında çok küçük etiketli küme) durumlarda bundan kaçının.
Güçlü yönler & sınırlılıklar
- Ek annotasyon çabası gerektirmeden genelleştirmeyi iyileştirmek için etiketsiz verilerden yararlanır.
- Tablo verilerinde XGBoost'un güçlü performansını miras alır: karışık özellik türlerini, eksik değerleri ve doğrusal olmayan etkileşimleri yerel olarak işler.
- Güven eşiği filtrelemesi, sözde etiket gürültüsünü kontrol eder, bu da yaklaşımı naif kendi kendine eğitime göre daha sağlam hale getirir.
- Tak ve çalıştır: herhangi bir XGBoost hedefi ve hiperparametre yapılandırmasıyla uyumludur; sözde etiketleme mevcut işlem hatlarını sarabilir.
- İteratif iyileştirme, model geliştikçe sözde etiketlerin kalitesini giderek artırır.
- İlk etiketli küme güvenilir sözde etiketler üretmek için çok küçükse performans keskin bir şekilde düşer — hatalar yinelemeler boyunca birikir.
- Etiketli ve etiketsiz veriler arasındaki kovaryant kayma, sözde etiketlerin gerçek etiketsiz dağılımı yerine etiketli dağılımı yansıtmasına neden olabilir.
- Eşik seçimi sezgiseldir; kötü seçilmiş bir güven kesme değeri ya çok fazla gürültülü etiket kabul eder ya da faydalı etiketsiz örnekleri reddeder.
- Yorumlanabilirlik sınırlı kalır — yarı denetimli sarmalayıcı, XGBoost'un zaten opak topluluğunun üzerine bir karmaşıklık katmanı ekler.
SSS
Başlamak için kaç etiketli örneğe ihtiyaç var?
Kesin bir minimum yoktur, ancak kabaca 50'den az etiketli örnek genellikle faydalı olamayacak kadar gürültülü sözde etiketler üretir. Yarı denetimli eğitimden elde edilen performans artışları, etiketli örnek sayısı yüzlerle ifade edilirken etiketsiz örnek sayısı binlerle veya daha fazla olduğunda en belirgin hale gelir.
Güven eşiği nasıl ayarlanmalıdır?
İkili sınıflandırma için yaygın bir varsayılan, sözde etiketleri yalnızca tahmin edilen olasılık 0.85–0.90'ı aştığında kabul etmektir. Eşik, etiketli bir tutulan doğrulama kümesi üzerinde ayarlanmalıdır: sözde etiket doğruluğu düşükse sıkılaştırın, çok az etiketsiz nokta dahil ediliyorsa gevşetin.
Yarı denetimli XGBoost her zaman denetimli XGBoost'tan daha iyi performans gösterir mi?
Her zaman değil. Etiketli küme zaten temsili ve büyük olduğunda, yarı denetimli uzantı anlamlı doğruluk kazançları olmadan karmaşıklık katar. Ayrıca, etiketsiz dağılım etiketli olana göre kaymış olduğunda da yetersiz performans gösterir.
Bu, transductive XGBoost veya etiket yayılımı ile aynı mı?
İlgili ancak farklıdır. Sözde etiketli yarı denetimli XGBoost, yeni test noktalarına uygulanabilir bir eğitimli model üreten endüktif bir yöntemdir. Etiket yayılımı, yalnızca görülen etiketsiz kümeye etiketler atayan ve yeni verilere bu kadar doğrudan genelleme yapmayan bir graf tabanlı yöntemdir.
Yinelemeler boyunca hata birikimini nasıl önleyebilirim?
Yalnızca yüksek güvenli sözde etiketleri kabul edin, bunları gerçek etiketlerin altında ağırlıklandırın, yineleme sayısını sınırlayın ve her turdan sonra tutulan etiketli küme doğruluğunu izleyin — doğruluk eğrisi düzleştiğinde veya düşmeye başladığında durun.
Kaynaklar
- Chen, T. & Guestrin, C. (2016). XGBoost: A Scalable Tree Boosting System. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 785–794. DOI: 10.1145/2939672.2939785 ↗
- Chapelle, O., Scholkopf, B. & Zien, A. (Eds.) (2006). Semi-Supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Extreme Gradient Boosting. ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-xgboost
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır