Öz-denetimli LightGBM
Self-supervised Learning with LightGBM (Gradient Boosting with Self-supervised Pretraining) · Ayrıca şöyle bilinir: SSL-LightGBM, self-supervised gradient boosting, pretraining LightGBM, pseudo-label LightGBM
Öz-denetimli LightGBM, öz-denetimli öğrenme paradigmasını LightGBM gradyan artırma çerçevesiyle birleştirerek büyük hacimli etiketlenmemiş tablosal verilerden yararlanır. Maskelenmiş özellik tahmini veya zıt bozulma gibi bir öz-denetimli ön-görev, daha sonra bir LightGBM modelini eğitmek veya ince ayar yapmak için kullanılan zengin özellik temsilleri veya sözde etiketler üretir, bu da etiket kıtlığı olan durumlarda performansı önemli ölçüde iyileştirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketlenmemiş tablosal verilerin büyük bir havuzuna ve yalnızca küçük veya pahalı etiketli bir alt kümesine sahip olduğunuzda, standart denetimli LightGBM'nin yetersiz kaldığı durumlarda Öz-denetimli LightGBM'yi kullanın. Etiketlemenin maliyetli olduğu — örneğin klinik kayıtlar, dolandırıcılık tespiti veya endüstriyel sensör verileri — ve gradyan artırmanın yalnızca etiketli verilerde sinirsel yöntemlerden daha iyi performans gösterdiği görevler için uygundur. Etiketlerin bol olduğu durumlarda (standart LightGBM yeterlidir), etiketlenmemiş veri dağılımı etiketli kümeden önemli ölçüde farklıysa veya öz-denetimli işlem hattının ek karmaşıklığı mevcut mühendislik kaynakları tarafından haklı çıkarılamıyorsa kullanmayın.
Güçlü yönler & sınırlılıklar
- Düşük etiketli rejimlerde LightGBM performansını iyileştirmek için etiketlenmemiş verilerden etkili bir şekilde yararlanır.
- LightGBM'nin tüm avantajlarını korur: hızlı eğitim, kategorik özelliklerin yerel olarak işlenmesi, yüksek tablosal doğruluk.
- Öz-denetimli ön-görevler, anlamlı endüktif önyargıları kodlamak için alana özgü olarak tasarlanabilir.
- Sözde etiket yinelemeli iyileştirmesi, etiketlenmemiş verilerden giderek daha fazla bilgi kurtarabilir.
- Standart LightGBM hiperparametre ayarlaması ve çapraz doğrulama iş akışlarıyla uyumludur.
- İşlem hattı karmaşıklığı, ön-görevin tasarımı ve doğrulanmasını gerektiren, düz LightGBM'den önemli ölçüde daha yüksektir.
- Sözde etiket kalitesi, başlangıçtaki etiketli küme çok küçük veya temsilci değilse bozulur, bu da onay önyargısı riskini taşır.
- Ön-görev tasarımı veri kümesine bağlıdır; kötü seçilmiş bir görev, bilgisiz temsiller üretebilir.
- Ön-eğitim aşaması nedeniyle hesaplama maliyeti, denetimli LightGBM'ye kıyasla önemli ölçüde artar.
SSS
Tablosal veriler için ön-görev nedir?
Bir ön-görev, insan etiketleri olmadan bir denetim sinyali oluşturur. Tablolar için yaygın örnekler arasında özellik değerlerinin bir alt kümesini maskelemek ve modelin maskelenmiş değerleri tahmin etmesini sağlamak (maskelenmiş dil modellemesine benzer) veya satırları gürültüyle bozmak ve modelin hangi özelliklerin bozulduğunu belirlemesini sağlamak yer alır.
Öz-denetimli LightGBM, yarı-denetimli LightGBM'den nasıl farklıdır?
Yarı-denetimli LightGBM tipik olarak başlangıçtaki denetimli bir modelden yinelemeli sözde etiketlemeyi genişletir. Öz-denetimli LightGBM, herhangi bir denetimli eğitimden önce tüm etiketlenmemiş veriler üzerinde ayrı bir ön-görev ön-eğitim aşaması ekleyerek daha zengin özellik temsilleri veya daha güçlü başlangıç sözde etiketleri üretir.
Sözde etiketler için bir güven eşiği gerekli midir?
Bir eşik şiddetle tavsiye edilir. Filtreleme olmadan, düşük güvenli sözde etiketler, LightGBM'nin performansını düşürebilecek gürültülü denetim getirir. Yaygın bir yaklaşım, yinelemeli öz-eğitim için tahmin edilen olasılığın 0.9'u (veya çapraz doğrulanmış bir eşiği) aştığı sözde etiketleri tutmaktır.
Etiketlenmemiş veriler bol ancak etiketli veriler sıfır olduğunda bu yaklaşımı kullanabilir miyim?
Doğrudan değil, çünkü LightGBM'nin sonraki denetimli adım için en azından bazı gerçek etiketler üzerinde eğitilmesi gerekir. Ancak, ön-görev tamamen denetimsiz olarak çalıştırılabilir; hatta az sayıda etiketli örnek bile öğrenilen temsiller kullanılarak modeli ince ayar yapmak için kullanılabilir.
Hangi değerlendirme stratejisini kullanmalıyım?
Yalnızca gerçek etiketli örnekler içeren, asla sözde etiketler içermeyen ayrılmış bir test kümesi üzerinde değerlendirin. Hiperparametreleri seçmek için gerçek etiketli veriler üzerinde katmanlı k-katlı çapraz doğrulama kullanın ve şişirilmiş tahminlerden kaçınmak için ayrılmış küme üzerindeki metrikleri bildirin.
Kaynaklar
- Ke, G., Meng, Q., Finley, T., Wang, T., Chen, W., Ma, W., Ye, Q., & Liu, T.-Y. (2017). LightGBM: A Highly Efficient Gradient Boosting Decision Tree. Advances in Neural Information Processing Systems, 30. link ↗
- Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Self-Supervised Learning. Proceedings of the 37th International Conference on Machine Learning (ICML). link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Learning with LightGBM (Gradient Boosting with Self-supervised Pretraining). ScholarGate. https://scholargate.app/tr/machine-learning/self-supervised-lightgbm
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- LightGBMMakine öğrenmesi↔ karşılaştır
- Öz-denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli LightGBMMakine öğrenmesi↔ karşılaştır
- Transfer LearningMakine öğrenmesi↔ karşılaştır