Yarı denetimli İstifleme Topluluğu (Semi-supervised Stacking Ensemble)
Semi-supervised Stacking Ensemble (Self-trained Stacked Generalization) · Ayrıca şöyle bilinir: SSL stacking, semi-supervised stacked generalization, self-trained stacking, semi-supervised meta-learning ensemble
Yarı denetimli İstifleme Topluluğu, klasik yığılmış genelleştirme çerçevesini, yalnızca eğitim örneklerinin bir kesrinin etiket taşıdığı ayarlar için genişletir. Temel öğreniciler önce etiketli veriler üzerinde eğitilir, ardından etiketlenmemiş örneklere sahte etiketler atamak için kullanılır; genişletilmiş veri kümesi, iki katmanlı bir topluluk oluşturan ve hem etiketli hem de etiketlenmemiş yapıyı kullanan daha güçlü temel modelleri eğitir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketleme maliyetli olduğu tıbbi görüntüleme, NLP veya uzaktan algılama gibi yaygın bir ayarda, küçük etiketli bir veri kümesi ve büyük bir etiketlenmemiş örnek havuzu ile bir sınıflandırma veya regresyon göreviniz olduğunda yarı denetimli istiflemeyi kullanın. Özellikle etiketlenmemiş veriler etiketli verilerle aynı dağılımdan alındığında ve en az 3–5 çeşitli temel öğrenici ailesi mevcut olduğunda etkilidir. Etiketlenmemiş havuz küçükse (standart istiflemeye göre fayda sağlamıyorsa), etiketli küme zaten yeterince büyükse ve yarı denetimli kazanımlar marjinalse veya etiketli ve etiketlenmemiş örnekler arasındaki dağılım kayması şüpheliyse, sahte etiket hataları yinelemeler boyunca birleşeceği için bundan kaçının.
Güçlü yönler & sınırlılıklar
- Ek açıklama maliyeti olmadan büyük etiketlenmemiş veri havuzlarından yararlanır, genellikle yalnızca denetimli istiflemeye göre doğruluğu önemli ölçüde iyileştirir.
- Klasik istiflemenin tüm faydalarını miras alır: temel öğreniciler arasındaki çeşitlilik, varyansı ve yanlılığı aynı anda azaltır.
- Esnek: herhangi bir denetimli öğrenici, temel model veya meta-öğrenici olarak hizmet edebilir, bu da çerçeveyi geniş çapta uygulanabilir hale getirir.
- Güven eşiği, her yinelemede tanıtılan sahte etiketlerin kalitesini kontrol etmek için ilkeli bir mekanizma sağlar.
- İyi ölçeklenir — etiketlenmemiş veri ucuzdur, bu nedenle yöntemin değerliliği, etiketlenmemiş örneklerin etiketli örneklere oranının artmasıyla artar.
- Sahte etiket hataları yinelemeler boyunca birikir; ilk temel modeller zayıfsa, hatalı sahte etiketler performansı iyileştirmek yerine düşürebilir.
- Hiperparametre yüzeyi geniştir: yineleme sayısı, güven eşiği, kat sayısı ve temel öğrenici çeşitliliği hepsi etkileşim halindedir.
- Hesaplama açısından pahalıdır: birden fazla temel öğrenici üzerinde k-katlı yeniden eğitim, birkaç yineleme boyunca tekrarlanır, bu nedenle çalışma süresi hızla artar.
- Etiketlenmemiş dağılımın etiketli dağılımla yakından eşleşmesini gerektirir; kovaryant kayması, sahte etiketleme varsayımını geçersiz kılar.
- Yorumlanabilirlik düşüktür — iki istiflenmiş katman artı yinelemeli sahte etiketleme, herhangi bir bireysel tahminin nasıl oluşturulduğunu izlemeyi zorlaştırır.
SSS
Sahte etiketleme için güven eşiğini nasıl seçerim?
Sınıflandırma için yaygın bir başlangıç noktası 0.9 veya daha yüksektir, bu da yalnızca önde gelen sınıf olasılığının %90'ı aştığı örneklerin bir sahte etiket alması anlamına gelir. Temel modeller geliştikçe sonraki yinelemelerde eşik gevşetilebilir. Çok fazla gürültü getiren eşik değerlerini yakalamak için her zaman doğrulama doğruluğunu yinelemeler boyunca izleyin.
Hangi temel öğrenicileri kullanmalıyım?
Çeşitlilik ana ilkedir. Tipik bir kombinasyon, gradyan artırılmış ağaçları (örneğin, XGBoost), radyal çekirdekli bir SVM ve bir sinir ağını eşleştirir. Yanlılık-varyans profilleri ve yakaladıkları özellik ilişkileri açısından farklılık gösteren modelleri birleştirmek, ikinci katman için en bilgilendirici meta-özellikleri sağlar.
Bu standart istiflemeden nasıl farklıdır?
Standart istifleme, baştan sona yalnızca etiketli verileri kullanır. Yarı denetimli istifleme, yüksek güvenli etiketlenmemiş örneklerle etkili eğitim kümesini yinelemeli olarak genişleten bir sahte etiketleme döngüsü ekler, bu nedenle etiketli verilerin kıt ve etiketlenmemiş verilerin bol olduğu durumlarda en faydalıdır.
Regresyonu sınıflandırma kadar iyi idare edebilir mi?
Evet. Regresyon için, güven eşiği, artık tabanlı bir kritere göre değiştirilir — örneğin, tahmin edilen değeri temel modeller arasında kararlı (düşük varyanslı) olan sahte etiketli örnekleri dahil etmek. Ardından meta-öğrenici, sınıf olasılıkları yerine sürekli çıktıları birleştirir.
Etiket yayılma hataları riski nedir?
İlk temel modeller doğru değilse, kendinden emin tahminleri hala yanlış olabilir ve bu hatalar sonraki yinelemelerde pekiştirilir. Yüksek bir başlangıç güven eşiği kullanmak, yinelemeler boyunca tutulmuş etiketli bir doğrulama kümesini izlemek ve doğrulama performansı iyileşmeyi bıraktığında durmak, ana savunmalardır.
Kaynaklar
- Wolpert, D. H. (1992). Stacked generalization. Neural Networks, 5(2), 241–259. DOI: 10.1016/S0893-6080(05)80023-1 ↗
- Chapelle, O., Schölkopf, B., & Zien, A. (Eds.). (2006). Semi-Supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Stacking Ensemble (Self-trained Stacked Generalization). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-stacking-ensemble
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Bagging EnsembleTopluluk öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Yığma (Stacking)Makine öğrenmesi↔ karşılaştır