Aktif Öğrenme Gradyan Artırma
Active Learning with Gradient Boosting (Query-by-Committee / Uncertainty Sampling with Gradient Boosted Trees) · Ayrıca şöyle bilinir: AL-GBM, gradient boosting active learner, active gradient boosting, active learning with boosted trees
Aktif Öğrenme Gradyan Artırma, gradyan artırılmış ağaçların güçlü tahmin doğruluğunu, insan etiketlemesi için en bilgilendirici etiketsiz örnekleri seçen bir aktif öğrenme döngüsüyle birleştirir. Yalnızca modelin en çok emin olmadığı örnekleri sorgulayarak, yöntem pasif denetimli öğrenmeye göre çok daha az etiketlenmiş örnekle yüksek doğruluk elde eder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketleme pahalı veya zaman alıcı olduğunda ve gradyan artırma aksi takdirde tercih edilen model olduğunda, büyük bir etiketsiz tabular veri havuzuna sahip olduğunuzda aktif öğrenme gradyan artırmayı kullanın. Özellikle nadir sınıfların pasif olarak örneklenmesinin zor olduğu dengesiz veri kümeleri için etkilidir. Etiketleme ucuz olduğunda (tüm etiketlerle pasif öğrenme daha basittir), etiketsiz havuz sorgulamaya değecek kadar küçük olmadığında, tamamen şeffaf bir model (katsayılar veya kurallar) gerektirdiğinizde veya her sorgudan sonra gerçek zamanlı yeniden eğitimin mümkün olmadığı durumlarda bundan kaçının.
Güçlü yönler & sınırlılıklar
- Pasif denetimli öğrenmeye göre önemli ölçüde daha az etiketlenmiş örnekle rekabetçi doğruluk elde eder.
- Tabular verilerde gradyan artırmanın güçlü performansını miras alır, doğrusal olmayan etkileşimleri ve karma özellik türlerini işler.
- Esnek: herhangi bir sorgulama stratejisiyle (belirsizlik, marj, entropi, komite tarafından sorgulama) uyumludur.
- Tıp veya hukuk gibi uzman etiketlemesi yoğun alanlar için pratik hale getirerek etiketleme maliyetini sistematik olarak azaltır.
- İteratif dağıtımı destekler: daha fazla etiket toplandıkça model sürekli iyileşir.
- Her sorgu turundan sonra gradyan artırmayı sıfırdan yeniden eğitmek, büyük veri kümeleri için hesaplama açısından pahalıdır.
- Sorgulama stratejileri, başlangıç tohumu temsilci değilse, örnekleme yanlılığına maruz kalabilir ve temsilci olmayan bir etiketli kümeye yakınsayabilir.
- Gradyan artırma olasılıklarının kalibrasyonu, güvenilir belirsizlik tahminleri sağlamak için ek bir adıma (örneğin, Platt ölçeklendirme) ihtiyaç duyabilir.
- Performans, sorgulama stratejisinin seçimine duyarlıdır; hiçbir tek strateji tüm görevlerde baskın değildir.
- İnsan döngüsünde etiketleme iş akışı için altyapı gerektirir, bu da mühendislik ek yükü getirir.
SSS
Gradyan artırma ile hangi sorgulama stratejisi en iyi şekilde çalışır?
Entropi örneklemesi ve marj örneklemesi en yaygın seçeneklerdir ve pratikte iyi çalışırlar. Bir gradyan artırma modelleri topluluğu kullanarak komite tarafından sorgulama daha sağlam olabilir ancak eğitim maliyetini artırır. En iyi strateji veri kümesine bağlıdır; bir pilot örneklem üzerinde iki veya üç stratejiyi karşılaştırmaya değer.
Gradyan artırma olasılıklarını kalibre etmem gerekir mi?
Evet, özellikle entropi veya güvenliğe dayalı sorgulama stratejileri kullanılıyorsa. Gradyan artırma aşırı güvenli olasılıklar üretebilir. Sorgulamadan önce daha iyi kalibre edilmiş belirsizlik tahminleri elde etmek için her eğitim turundan sonra Platt ölçeklendirme veya izotonik regresyon uygulayın.
Her turda kaç örnek etiketlemeliyim?
1 ila birkaç düzine arası toplu iş boyutları tipiktir. Daha büyük toplu işler hesaplama açısından daha verimlidir ancak tek nokta sorgulamadan daha az örnek verimli olabilir. Başlangıç etiketli kümenizin yaklaşık %1-5'ine orantılı bir toplu iş boyutuyla başlayın ve etiketleme verimine göre ayarlayın.
Aktif öğrenme döngüsünü ne zaman durdurmalıyım?
Doğrulama performansı birkaç ardışık turda durağanlaştığında, etiketleme bütçesi tükendiğinde veya kalan etiketsiz havuz üzerindeki modelin belirsizliği, havuzun büyük ölçüde bilgilendirici olmadığını gösteren bir eşiğin altına düştüğünde durdurun.
scikit-learn'ün gradyan artırması yerine XGBoost veya LightGBM kullanabilir miyim?
Evet — XGBoost ve LightGBM daha hızlı ve genellikle daha doğrudur; pratikte tercih edilen uygulamalardır. Sorgulama stratejisi için ham log-oran puanları yerine predict_proba'yı (veya eşdeğerini) kalibrasyonla kullandığınızdan emin olun.
Kaynaklar
- Settles, B. (2010). Active Learning Literature Survey. Computer Sciences Technical Report 1648, University of Wisconsin–Madison. link ↗
- Friedman, J. H. (2001). Greedy Function Approximation: A Gradient Boosting Machine. Annals of Statistics, 29(5), 1189–1232. DOI: 10.1214/aos/1013203451 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Active Learning with Gradient Boosting (Query-by-Committee / Uncertainty Sampling with Gradient Boosted Trees). ScholarGate. https://scholargate.app/tr/machine-learning/active-learning-gradient-boosting
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Aktif ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır