CatBoost
CatBoost (Categorical Boosting) · Ayrıca şöyle bilinir: CatBoost (Categorical Boosting), categorical boosting, ordered boosting, kategorik gradyan artırma
CatBoost, Prokhorenkova ve çalışma arkadaşlarının 2018'de Yandex bünyesinde tanıttığı, kategorik değişkenleri yerel olarak işleyen ve etiket sızıntısını önlemek için sıralı hedef kodlamayı kullanan bir gradyan artırma (gradient boosting) algoritmasıdır. Her yinelemede veri sırasını permüte ederek ağaçlardan oluşan toplamsal bir topluluk (ensemble) oluşturan bu yöntem, kategori ağırlıklı verilerde genellikle XGBoost ve LightGBM'den üstündür.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Kategorik özelliklerin hakim olduğu tablo verileri üzerinde sınıflandırma ve tahmin için güçlü bir uyum sağlar; en az yaklaşık 100 gözlem gerektirir. Normal dağılımlı veri gerektirmez ve sürekli, kategorik, ikili ve sıralı özellikleri kabul eder, kesitsel ve panel tarzı yapılar üzerinde çalışır. Derinlik (6-10), öğrenme oranı (0.01-0.1) ve yineleme sayısı (500-2000) gibi hiperparametre ayarı önerilir. Yaklaşık 100 gözlemin altında, lojistik regresyon veya tek bir karar ağacı gibi daha basit modeller daha güvenlidir.
Güçlü yönler & sınırlılıklar
- cat_features aracılığıyla kategorik özelliklerin yerel olarak işlenmesi — tek-sıfır kodlaması gerekmez.
- Sıralı hedef kodlama, sıradan hedef kodlamayı yanlı hale getiren etiket sızıntisini önler.
- Sıralı artırma, aşırı uyumu azaltarak her yinelemede veriyi permüte eder.
- Simetrik ağaçlar, LightGBM ile rekabetçi hızlı tahmin ve yerel GPU desteği sağlar.
- Kategori ağırlıklı verilerde genellikle XGBoost ve LightGBM'den daha iyi performans gösterir.
- Küçük örneklemlerde (yaklaşık 100'ün altındaki n) sıralı artırma bile aşırı uyum sağlar ve erken durdurma etkisiz hale gelir.
- Hiperparametre ayarı (derinlik, öğrenme oranı, yinelemeler) yeterli doğrulama verisi gerektirir, bu da küçük örneklemlerde eksiktir.
- Artırılmış ağaç topluluğu olarak yorumlanacak açık katsayılar sunmaz.
- Kategorik özelliği az veya hiç olmayan verilerde avantajı azalır.
SSS
Kategorik değişkenleri tek-sıfır kodlamam gerekir mi?
Hayır. CatBoost, bunları cat_features olarak işaretlediğinizde kategorik değişkenleri yerel olarak işler, her kategoriyi anında sayısal bir hedef istatistiğine dönüştürür, bu nedenle manuel tek-sıfır kodlaması gereksizdir.
Sıralı artırma (ordered boosting) nedir?
Her yinelemede CatBoost veri sırasını permüte eder ve bir satırın hedef kodlamasını ve gradyanını yalnızca kendisinden önceki gözlemlerden hesaplar. Bu, sıradan hedef kodlamanın etiket sızıntisini önler ve aşırı uyumu azaltır.
CatBoost, XGBoost ve LightGBM ile nasıl karşılaştırılır?
CatBoost, yerel kategorik işlemesi sayesinde kategori ağırlıklı verilerde genellikle üstündür, simetrik ağaçları ve GPU desteği ise hız açısından rekabetçi kalır. Az sayıda kategorik özelliğe sahip verilerde avantajı azalır.
Ne kadar örneklem büyüklüğü ve ayarlama gerektirir?
En az yaklaşık 100 gözlem kullanın; bunun altında sıralı artırma bile aşırı uyum sağlar ve erken durdurma etkisizdir. Derinlik (6-10), öğrenme oranı (0.01-0.1) ve yineleme sayısı (500-2000) gibi parametreleri bir doğrulama kümesiyle ayarlayın.
Kaynaklar
- Prokhorenkova, L., Gusev, G., Vorobev, A., Dorogush, A.V. & Gulin, A. (2018). CatBoost: Unbiased Boosting with Categorical Features. In NeurIPS 2018. DOI: 10.48550/arXiv.1706.09516 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). CatBoost (Categorical Boosting). ScholarGate. https://scholargate.app/tr/machine-learning/catboost
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- AdaBoostMakine öğrenmesi↔ karşılaştır
- Karar AğacıMakine öğrenmesi↔ karşılaştır
- Lojistik RegresyonAraştırma istatistiği↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır