Yarı denetimli CatBoost
Semi-supervised CatBoost (Gradient Boosting with Partially Labeled Data) · Ayrıca şöyle bilinir: SSL CatBoost, semi-supervised gradient boosting with CatBoost, CatBoost with unlabeled data, pseudo-label CatBoost
Yarı denetimli CatBoost, yalnızca eğitim örneklerinin bir kısmının etiket taşıdığı ayarlara CatBoost'un sıralı gradyan artırma çerçevesini uygular; etiketlenmemiş verileri, yalnızca etiketli verilerin sağlayabileceğinden daha iyi model doğruluğu elde etmek için sözde etiketleme veya tutarlılık tabanlı stratejiler aracılığıyla kullanır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli tabular verinin mevcut etiketlenmemiş verilere kıyasla kıt olduğu, özellikle etiketleme maliyetinin yüksek olduğu ve etiketlenmemiş örneklerin etiketli olanlarla aynı dağılımı paylaştığı durumlarda yarı denetimli CatBoost'u kullanın. Kategorik özelliklerin çoğunu içeren veri kümeleri için çok uygundur, çünkü CatBoost bunları manuel kodlama olmadan yerel olarak işler. Etiketlenmemiş veriler etiketlenmiş verilerden farklı bir dağılımdan geldiğinde (kovaryans kayması), etiketlenmiş küme kendi başına kabul edilebilir performansa ulaşmak için zaten yeterince büyük olduğunda veya model kararlarının katı yorumlanabilirliği gerektiğinde ve sözde etiket yayılımı denetlenemediğinde kullanmayın.
Güçlü yönler & sınırlılıklar
- Etiketli örnek gereksinimini azaltmak için etiketlenmemiş verilerden yararlanır; bu, etiketlemenin pahalı olduğu durumlarda değerlidir.
- CatBoost'un yerel kategorik özellik işleme özelliği, manuel tek-sıcak kodlama veya sıralı kodlama ihtiyacını ortadan kaldırır.
- Sıralı artırma, küçük veri kümelerinde hedef sızıntisini azaltır ve CatBoost'u etiketli havuz sınırlı olsa bile sağlam hale getirir.
- Sözde etiketleme prensipte modele bağlı değildir, bu nedenle CatBoost'un artımlı artırma arayüzü ile doğal olarak bütünleşir.
- Sözde etiketlerdeki güven eşiği, etiketlenmemiş verilerden gelen gürültüyü kontrol etmek için bir kaldıraç sağlar.
- Kusurlu bir ilk model tarafından üretilen sözde etiketler, birden çok yinelemede birikip performansı düşürebilecek gürültü ekler.
- Performans, etiketli ve etiketlenmemiş verilerin aynı temel dağılımı paylaştığı varsayımına güçlü bir şekilde bağlıdır.
- Güven eşiği ayarlama ve tur seçimi, CatBoost'un kendi kapsamlı hiperparametre setinin üzerine ek hiperparametreler ekler.
- Değerlendirme daha zordur: sözde etiketlere aşırı güvenilirse, etiketli katlamadaki standart çapraz doğrulama genelleştirmeyi hafife alabilir.
- CatBoost kütüphanesinde kullanıma hazır, üretim düzeyinde bir yarı denetimli mod bulunmamaktadır; uygulayıcılar sözde etiketleme işlem hatlarını manuel olarak uygulamalıdır.
SSS
CatBoost, yarı denetimli öğrenmeyi yerel olarak destekliyor mu?
Hayır. Standart CatBoost kütüphanesi, her eğitim örneği için etiketli hedefler gerektirir. Yarı denetimli kullanım, standart CatBoost eğitim API'sini saran harici sözde etiketleme işlem hatları aracılığıyla elde edilir.
Sözde etiketleme için hangi güven eşiğini kullanmalıyım?
İkili sınıflandırma için yaygın bir başlangıç noktası 0.9'dur, ancak en uygun değer ilk modelin ne kadar iyi kalibre edildiğine bağlıdır. Başlangıçta yalnızca yüksek güvenli sözde etiketleri kabul ederek muhafazakar olmak ve model iterasyonlar boyunca geliştikçe eşiği gevşetmek daha iyidir.
Gürültülü sözde etiketlerden kaynaklanan hata yayılmasını nasıl önlerim?
Sert etiketler yerine yumuşak sözde etiketler (tahmin edilen olasılıklar) kullanın, iterasyon sayısını sınırlayın, güven filtrelemesi uygulayın ve asla sözde etiket almayan ayrılmış bir etiketli küme üzerinde değerlendirme yapın.
Yarı denetimli CatBoost, ek karmaşıklığına değdiği durumlar nelerdir?
Etiketli küme zaten büyükse (makul sınıf dengesiyle birkaç bin örnek), etiketlenmemiş verilerden elde edilen kazançlar genellikle küçüktür ve ek işlem hattı karmaşıklığı haklı çıkarılamaz. Standart denetimli CatBoost, temel karşılaştırma olmalıdır.
Bu, kendi kendine denetimli CatBoost'tan nasıl farklıdır?
Kendi kendine denetimli öğrenme, herhangi bir gerçek etiketine dayanmadan verinin yapısının kendisinden (örneğin, maskelenmiş özellik tahmini) kendi denetleyici sinyalini üretir. Yarı denetimli CatBoost hala etiketlenmiş bir alt kümeye dayanır ve etiketleri etiketlenmemiş örneklere yaymak için bu alt küme üzerinde eğitilmiş modeli kullanır.
Kaynaklar
- Prokhorenkova, L., Gusev, G., Vorobev, A., Dorogush, A. V., & Gulin, A. (2018). CatBoost: unbiased boosting with categorical features. In Advances in Neural Information Processing Systems (NeurIPS), 31. link ↗
- Chapelle, O., Scholkopf, B., & Zien, A. (Eds.). (2006). Semi-Supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised CatBoost (Gradient Boosting with Partially Labeled Data). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-catboost
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- CatBoostMakine öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Yarı denetimli Gradyan Artırma (Semi-supervised Gradient Boosting)Makine öğrenmesi↔ karşılaştır
- Yarı Denetimli Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Yarı denetimli XGBoostMakine öğrenmesi↔ karşılaştır