Düzenlileştirilmiş CatBoost
Regularized CatBoost (Categorical Boosting with Explicit Regularization) · Ayrıca şöyle bilinir: CatBoost with regularization, regularized categorical boosting, CatBoost L2 regularization, penalized CatBoost
Düzenlileştirilmiş CatBoost, CatBoost'un sıralı gradyan yükseltme çerçevesinin üzerine açık düzenlileştirme kontrolleri — L2 yaprak düzenlileştirmesi, ağaç derinliği kısıtlamaları, küçültme oranı ve model boyutu cezaları — uygulayarak, CatBoost'un kategorik özellikleri doğal olarak ele alışını ve tablo veri kümelerinde düşük tahmin gecikmesini korurken aşırı uyumu azaltır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Sayısal ve kategorik özelliklerin bir karışımına sahip tablo verileriniz olduğunda ve kontrollü aşırı uyum ile en son teknoloji tahmin doğruluğu istediğinizde Düzenlileştirilmiş CatBoost'u kullanın — özellikle orta büyüklükteki veri kümelerinde (yaklaşık 200 ila 500.000 satır) düzenlileştirilmemiş yükseltmenin aşırı uyum sağlayacağı durumlarda. Birçok özelliğin yüksek kardinaliteli kategorik olduğu durumlarda özellikle güçlüdür, çünkü CatBoost bunları manuel ön işleme gerektirmeden kodlar. Tam model yorumlanabilirliğinin zorunlu olduğu, veri hacminin çok küçük olduğu (yaklaşık 100 satırın altında) veya basit bir doğrusal modelin zaten iyi uyum sağladığı durumlarda kaçının — bu durumlarda ek karmaşıklık haksızdır. Ayrıca, düzenlileştirilmiş bir doğrusal modelin veya sığ bir ağacın yeterli olabileceği tamamen sayısal düşük boyutlu problemler için de gereksizdir.
Güçlü yönler & sınırlılıklar
- Manuel kodlama veya ön işleme boru hatları olmadan kategorik özelliklerin doğal olarak ele alınması.
- Sıralı yükseltme ve simetrik ağaçlar, herhangi bir ceza uygulanmadan önce aşırı uyumu yapısal olarak azaltır.
- Zengin yerleşik düzenlileştirme parametreleri (L2, derinlik, örnekleme, random-strength) ince taneli kontrol sağlar.
- Simetrik ağaç yapısı sayesinde hızlı çıkarım, gerçek zamanlı sunum için uygundur.
- Nispeten az hiperparametre ayarı ile rekabetçi kutudan çıktığı gibi performans.
- Doğrulama katmanı ile erken durdurma, optimal ağaç sayısının seçimini otomatikleştirir.
- Eğitim, özellikle GPU hızlandırması olmayan büyük veri kümelerinde LightGBM'den daha yavaş olabilir.
- Model bir kara kutu olarak kalır; düzenlileştirme katsayı yorumlanabilirliğini geri kazandırmaz.
- Sıralı yükseltme, eğitim zamanında rastgele bir permütasyon gerektirir, bu da tam tekrarlanabilirliği rastgele tohumun sabitlenmesine bağlı kılar.
- Hiperparametre alanı geniştir; kötü seçilmiş düzenlileştirme gücü, aşırı uyum kadar kolayca düşük uyuma da neden olabilir.
- Derin öğrenme alternatiflerine kıyasla yapılandırılmamış veriler (metin, görüntüler) için sınırlı fayda.
SSS
Düzenlileştirilmiş CatBoost, düz CatBoost'tan nasıl farklıdır?
Düz CatBoost, sıralı yükseltme ve simetrik ağaçlar aracılığıyla yapısal düzenlileştirmeyi zaten içerir. Düzenlileştirilmiş CatBoost, ek ceza ve karmaşıklık kontrolleri uygulamak için l2-leaf-reg, derinlik, min-data-in-leaf, subsample ve öğrenme oranı gibi parametreleri açıkça ayarlar; bu, yapısal düzenlileştirmenin tek başına yetersiz olduğu küçük veya gürültülü veri kümelerinde en çok önem taşır.
Hangi düzenlileştirme parametresi en çok önemlidir?
l2-leaf-reg (yaprak ağırlıklarında L2 cezası) ve öğrenme oranı (erken durdurma ile birleştirilmiş eta) en büyük etkiye sahiptir. Derinlik ve min-data-in-leaf ikincil kontrollerdir. Yaygın bir başlangıç noktası, çapraz doğrulama ile ayarlanan 1-10 aralığında l2-leaf-reg, 0.05-0.1 civarında eta ve 4-6 derinliktir.
CatBoost'a geçirmeden önce kategorik değişkenleri hala kodlamam gerekiyor mu?
Hayır. CatBoost, ham kategorik sütunları doğrudan kabul eder — sütun indekslerini veya adlarını cat_features parametresi aracılığıyla geçirin. Manuel one-hot veya etiket kodlaması gereksizdir ve CatBoost'un sıralı hedef istatistikleri kodlamasını göz ardı ederek performansı olumsuz etkileyebilir.
Açık düzenlileştirme parametreleri olmadan aşırı uyumu nasıl önleyebilirim?
Ayrı bir doğrulama seti ile erken durdurma kullanın. eval_metric, early_stopping_rounds (örn. 50) ayarlayın ve eğitim döngüsünün otomatik olarak durmasını sağlayın. Bu, aşırı uyuma karşı en etkili tek korumadır ve diğer düzenlileştirme ayarlarından bağımsız olarak her zaman kullanılmalıdır.
Düzenlileştirilmiş CatBoost için GPU eğitimi kullanmaya değer mi?
Evet, büyük veri kümeleri için (yüz binlerce satır veya daha fazla). CatBoost'un GPU uygulaması simetrik ağaç eğitimini destekler ve 10x-50x hızlanma sağlar, bu da ızgara veya rastgele arama yoluyla hiperparametre aramasını pratik hale getirir. Küçük veri kümeleri için CPU eğitimi genellikle yeterince hızlıdır.
Kaynaklar
- Prokhorenkova, L., Gusev, G., Vorobev, A., Dorogush, A. V., & Gulin, A. (2018). CatBoost: unbiased boosting with categorical features. Advances in Neural Information Processing Systems, 31. link ↗
- Dorogush, A. V., Ershov, V., & Gulin, A. (2018). CatBoost: gradient boosting with categorical features support. arXiv preprint arXiv:1810.11363. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Regularized CatBoost (Categorical Boosting with Explicit Regularization). ScholarGate. https://scholargate.app/tr/machine-learning/regularized-catboost
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- CatBoostMakine öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Regülerize Gradyan YükseltmeMakine öğrenmesi↔ karşılaştır
- Regularized LightGBMMakine öğrenmesi↔ karşılaştır