Regularized Random Forest
Regularized Random Forest (RRF) · Ayrıca şöyle bilinir: RRF, Guided Regularized Random Forest, GRRF, regularized tree ensemble
Deng ve Runger tarafından 2012'de tanıtılan Regularized Random Forest (RRF), standart Random Forest'ı, toplulukta zaten kullanılmayan özelliklerde bölünmeleri caydıran bir ceza ekleyerek genişletir. Bu yerleşik düzenlileştirme, daha seyrek, daha az gereksiz özellik alt kümeleri üretir ve bu da modeli, özellik seçiminin en az tahmin doğruluğu kadar önemli olduğu durumlarda özellikle değerli kılar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Hem yüksek tahmin doğruluğu hem de kompakt, yorumlanabilir bir özellik alt kümesi gerektiğinde Regularized Random Forest'ı kullanın — örneğin, binomlu özelliklerin örnek boyutunu aştığı yüksek boyutlu biyobelirteç keşfi, genomik veya herhangi bir alanda. Özellikle standart Random Forest'ın kararsız veya şişirilmiş önem sıralamaları ürettiği durumlarda çok uygundur. Tüm özelliklerin bilgilendirici olduğu bilindiğinde ve herhangi bir seçim istenmediğinde, veri kümesi çok küçük olduğunda (yaklaşık 50 gözlemin altında) ve çapraz doğrulama performansı gerektiğinde veya açık katsayılarla tam model şeffaflığı gerektiğinde (bunun yerine düzenlileştirilmiş lojistik veya doğrusal regresyon kullanın) RRF'yi kullanmayın. Lambda'yı dikkatlice ayarlayın: çok küçük bir değer, gerçekten faydalı özellikleri agresif bir şekilde hariç tutar.
Güçlü yönler & sınırlılıklar
- Tek geçişte özellik seçimi ve tahmin gerçekleştirir, ayrı bir değişken seçimi adımına olan ihtiyacı ortadan kaldırır.
- Standart Random Forest'tan daha seyrek, daha kararlı özellik önemi sıralamaları üretir — özellikle yüksek boyutlu verilerde.
- Bagging ve ağaç çeşitliliği yoluyla aşırı uyumaya dirençli, Random Forest'ın sağlamlığını ve doğruluğunu miras alır.
- Dağılım varsayımları olmadan karışık özellik türlerini (sürekli, kategorik, ikili) ve doğrusal olmayan etkileşimleri işler.
- Yönlendirilmiş varyant (GRRF), alan bilgisinin öncelikli önem puanı olarak enjekte edilmesine izin vererek, seçimi teorik olarak anlamlı özelliklere doğru yönlendirir.
- Ayarlanması dikkatle gereken bir veya iki hiperparametre (lambda ve GRRF'de önem ağırlığı) ekler, genellikle çapraz doğrulama yoluyla.
- Ağaçlar arasında küresel olarak paylaşılan özellik kullanım belleğinin güncellenmesi gerektiğinden, standart Random Forest'tan hesaplama açısından daha pahalıdır.
- Küçük veri kümelerinde (n ~50'nin altında) hem düzenlileştirme hem de ağaç dışı hata tahmini güvenilmez hale gelir.
- Hala bir kara kutu topluluğudur; bireysel özellik etkileri için açık katsayılar veya güven aralıkları sağlamaz.
- Çok küçük lambda değerleri, yüksek varyanslı dejeneratif bir orman üreterek tek bir baskın özelliği aşırı seçebilir.
SSS
Lambda parametresi neyi kontrol eder?
Lambda (0 ile 1 arasında), ormanda henüz görünmeyen özellikleri cezalandırır. 1 değeri standart Random Forest davranışını verir. Daha küçük değerler daha güçlü seyreklik uygular ve ormanı zaten seçilmiş özellikleri yeniden kullanmaya zorlar. Yaklaşık 0.5–0.8 civarındaki bir değer, çapraz doğrulama ile ayarlanan yaygın bir başlangıç aralığıdır.
RRF, sonradan özellik seçimi yapılan standart Random Forest'tan nasıl farklıdır?
Standart Random Forest, önem puanlarını sıralayarak uydurmadan sonra özellikleri seçer, ardından en iyi özellikler üzerinde bir model yeniden eğitir — kararsız olabilen iki aşamalı bir süreç. RRF, seçimi bölünme kriterine entegre eder, böylece özellik kümesi ve model birlikte optimize edilir, bu da tipik olarak daha kararlı ve daha az karmaşık sonuçlar verir.
Neden düz RRF yerine Yönlendirilmiş varyantı (GRRF) kullanmalıyım?
Önceden bilgilendirici olma olasılığı yüksek olan özelliklere işaret eden ön bilgiye — örneğin, yayınlanmış literatür veya alan uzmanlığı — sahip olduğunuzda GRRF'yi kullanın. GRRF, düzenlileştirmeyi yanlı hale getirmek için öncelikli önem puanları sağlamanıza olanak tanır, böylece teorik olarak motive edilmiş özellikler seçim sırasında tercih edilir.
RRF, regresyon için olduğu kadar sınıflandırma için de çalışır mı?
Evet. Düzenlileştirilmiş kazanç kriteri, regresyon görevleri için varyans azaltma dahil olmak üzere herhangi bir safsızlık ölçüsüne uygulanır. Toplama adımı, çoğunluk oyu yerine ağaç tahminlerinin ortalamasını kullanır.
Ağaç dışı hata RRF'de hala geçerli mi?
Ağaç dışı hata mevcuttur ancak lambda çok küçük olduğunda iyimser bir yanlılığa sahip olabilir, çünkü agresif düzenlileştirme özellik seçimini eğitim ağaçlarına aşırı uyarlayabilir. Genelleştirmeyi doğrulamak için OOB hatasına ek olarak tutulmuş bir test kümesi üzerinde çapraz doğrulama önerilir.
Kaynaklar
- Deng, H., & Runger, G. (2012). Feature selection via regularized trees. Proceedings of the 2012 International Joint Conference on Neural Networks (IJCNN), IEEE, pp. 1–8. DOI: 10.1109/IJCNN.2012.6252640 ↗
- Deng, H., & Runger, G. (2013). Gene selection with guided regularized random forest. Pattern Recognition, 46(12), 3483–3489. DOI: 10.1016/j.patcog.2013.05.018 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Regularized Random Forest (RRF). ScholarGate. https://scholargate.app/tr/machine-learning/regularized-random-forest
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Karar AğacıMakine öğrenmesi↔ karşılaştır
- Ekstra AğaçlarMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Karar AğacıMakine öğrenmesi↔ karşılaştır
- Regülerize Gradyan YükseltmeMakine öğrenmesi↔ karşılaştır