Sağlam LightGBM
Robust LightGBM (Light Gradient Boosting Machine with Robust Loss Functions) · Ayrıca şöyle bilinir: Robust LGBM, LightGBM with Huber loss, outlier-resistant gradient boosting, robust gradient boosted trees
Sağlam LightGBM, Microsoft'un oldukça verimli LightGBM motorunu aykırı değerlere dayanıklı kayıp fonksiyonlarıyla — en yaygın olarak Huber, kantil veya ortalama mutlak hata — birleştiren bir gradyan artırma çerçevesidir, böylece tahminler aşırı veya hatalı gözlemlerden haksız yere bozulmaz. LightGBM'in hızını ve yaprak bazlı ağaç büyümesini korurken, hedef değişkendeki ağır kuyruklu gürültüye karşı direnç sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Hedef değişkenin sürekli (veya bir sayım) olduğu ve veri kümesinin sıradan karesel hata tabanlı modelleri şişirecek aykırı değerler, ölçüm hataları veya ağır kuyruklu gürültü içermesi muhtemel olduğu durumlarda Sağlam LightGBM kullanın — örneğin finansal getiri tahmini, sensör verileri, sigorta hasar tutarları veya küçük bir aşırı değer kesrinin modellemeyi bozduğu herhangi bir alanda. Kantil tahmini gerektiğinde de uygundur. Her durumda doğrudan bir yedek olarak kullanmayın: hedef gerçekten Gauss ve temiz ise, standart LightGBM yeterli ve ayarlanması daha basittir. Çok sınıflı sınıflandırma görevi için kaçının — orada, odak kaybı veya sınıf ağırlıklı çapraz entropi daha uygundur.
Güçlü yönler & sınırlılıklar
- Veri temizleme veya winsorizasyon gerektirmeden hedef değişkendeki aykırı değerlere karşı dirençlidir.
- LightGBM'in hız avantajını miras alır — histogram tabanlı bölmeler ve yaprak bazlı büyüme, milyonlarca satırda pratik olmasını sağlar.
- Kantil kaybı varyantı, tahmin aralıklarını ve risk farkındalığı olan tahminleri doğrudan destekler.
- Tutulmuş bir doğrulama kümesinde erken durdurmayı destekler, aşırı uyumu otomatik olarak sınırlar.
- Karışık özellik türleriyle (sürekli, kategorik) iyi çalışır ve eksik değerleri yerel olarak işler.
- Sağlam kayıp fonksiyonları, ek bir hiperparametre (örneğin, Huber delta) ayarlanmasını gerektirir, bu da model seçme sürecine karmaşıklık katar.
- Yaprak bazlı büyüme, max_depth veya num_leaves dikkatlice kısıtlanmazsa küçük veri kümelerinde aşırı uyuma neden olabilir.
- Kantil LightGBM, tek bir kantil için bir model üretir; aralık tahmini birden fazla modelin eğitilmesini gerektirir.
- Yorumlanabilirlik, doğrusal modellere kıyasla sınırlıdır; özellik ataması için SHAP sonradan analiz gereklidir.
- Gerçek ilişki aslında doğrusal olduğunda, doğrusal bir sağlam regresyona (örneğin, Huber regresyonu) göre ayarlanması daha yavaştır.
SSS
Huber delta parametresini nasıl seçerim?
Pratik bir yaklaşım, önleyici bir karesel hata modelinden elde edilen artıkların dağılımını incelemek ve deltasını mutlak artıkların %80-90'lık dilimine yakın ayarlamaktır. Küçük bir delta değerleri ızgarası üzerinde çapraz doğrulama yapın ve doğrulama MAE'si veya alanınıza özgü metriğe göre seçin.
Kantil kaybını Huber kaybına ne zaman tercih etmeliyim?
Hedef dağılımın belirli bir yüzdelik dilimini — örneğin muhafazakar planlama için %90'lık dilimi — tahmin etmek istediğinizde veya iki kantil modeli eğiterek tahmin aralıkları oluşturmak istediğinizde kantil kaybını seçin. Sadece ortalamadan daha fazla aykırı değerlere dayanıklı tek bir nokta tahmini istediğinizde Huber kaybını kullanın.
Sağlam LightGBM, yalnızca hedef değişkendeki değil, özelliklerdeki (öngörücülerdeki) aykırı değerleri de işler mi?
Hayır. Sağlam kayıp yalnızca hedef değişkendeki büyük hatalara karşı koruma sağlar. Aşırı öngörücü değerler hala bölme kararlarını bozabilir. Ağır çarpık özellikleri ayrı ayrı winsorize edin veya kırpın veya LightGBM'in yerel kategorik işleme ve kutu bazlı bölmelerini kullanın, bu da bir miktar örtük sağlamlık sağlar.
Aykırı değerler olduğunda Sağlam LightGBM her zaman standart LightGBM'den daha mı iyidir?
Otomatik olarak değil. Aykırı değerler gerçek sinyal taşıyorsa (örneğin, tahmin etmeniz gereken meşru aşırı olaylar), sağlam bir kayıp bunların etkisini bastıracak ve bu durumlar için daha kötü tahminler üretebilir. Her iki hedefi de tutulmuş bir küme üzerinde, uygulamanız için önemli olan metriği kullanarak değerlendirin.
Hangi değerlendirme metriklerini raporlamalıyım?
İncelemecilerin aykırı değerlerin etkisini görebilmeleri için hem RMSE hem de MAE'yi raporlayın. Bir kantil hedefi kullanıldıysa, seçilen kantildeki pinball (kantil) kaybını da raporlayın. Regresyon görevleri için, sağlam kaybın aşırı gözlemlerin etkisini azalttığını doğrulamak için bir artık grafiği ekleyin.
Kaynaklar
- Ke, G., Meng, Q., Finley, T., Wang, T., Chen, W., Ma, W., Ye, Q., & Liu, T.-Y. (2017). LightGBM: A Highly Efficient Gradient Boosting Decision Tree. Advances in Neural Information Processing Systems, 30, 3146–3154. link ↗
- Friedman, J. H. (2001). Greedy Function Approximation: A Gradient Boosting Machine. The Annals of Statistics, 29(5), 1189–1232. DOI: 10.1214/aos/1013203451 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust LightGBM (Light Gradient Boosting Machine with Robust Loss Functions). ScholarGate. https://scholargate.app/tr/machine-learning/robust-lightgbm
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- CatBoostMakine öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Huber Regresyonuİstatistik↔ karşılaştır
- LightGBMMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır