Yarı Denetimli Rastgele Orman
Semi-supervised Random Forest (SSL-RF) · Ayrıca şöyle bilinir: SSL-RF, semi-supervised forest, label-propagation random forest, self-training random forest
Yarı Denetimli Rastgele Orman (SSL-RF), hem etiketli hem de etiketsiz eğitim örneklerini kullanarak klasik Rastgele Orman'ı genişletir. Veri etiketleme pahalı veya zaman alıcı olduğunda, SSL-RF, ormanın kendisi aracılığıyla etiketsiz gözlemlere geçici sözde etiketler atar, ardından zenginleştirilmiş veri kümesi üzerinde yeniden eğitim yapar ve ek insan etiketlemesi gerektirmeden doğruluğu aşamalı olarak iyileştirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Bol miktarda etiketsiz veriniz olduğunda ancak etiketleme maliyetli, az veya zaman alıcı olduğunda Yarı Denetimli Rastgele Orman kullanın — tıbbi görüntüleme, uzaktan algılama, metin sınıflandırması ve biyolojik verilerde yaygındır. En azından mütevazı bir etiketli alt kümeye (toplam verinin yaklaşık %5-20'si) sahip tablo, görüntüden türetilmiş özellik ve karma tip veri kümeleri için uygundur. Neredeyse hiç güvenilir etiket olmadığında (ilk orman faydalı sözde etiketler üretemeyecek kadar zayıf olacaktır), sınıf sınırları oldukça pürüzsüz olmadığında veya tamamen denetimli bir modelin yalnızca etiketli kümeniz üzerinde zaten tatmin edici performans gösterdiği durumlarda kaçının.
Güçlü yönler & sınırlılıklar
- Yalnızca etiketli verilerin başarabileceğinin ötesinde doğruluğu artırmak için ucuz etiketsiz verilerden yararlanır.
- Tüm Rastgele Orman avantajlarını miras alır: sağlamlık, yerleşik özellik önemi ve torbalama yoluyla aşırı uyuma karşı direnç.
- Esnek güven eşiği, etiketsiz verilerin ne kadar agresif bir şekilde dahil edildiğini kontrol etmenizi sağlar.
- Karma özellik türlerini, doğrusal olmayan ilişkileri ve yüksek boyutlu girdiyi dağılımsal varsayımlar olmaksızın doğal olarak işler.
- Etiketli kısımdan elde edilen torba dışı tahminler, küçük etiketli kümelerde bile bir doğrulama sinyali sağlar.
- Minimal algoritmik değişikliklerle hem sınıflandırma hem de regresyon görevlerine uygulanabilir.
- Sözde etiketlerin kalitesi, ilk denetimli ormana bağlıdır; zayıf bir başlangıç modeli, hataları sonraki tüm yinelemeler boyunca yayar.
- Güven eşiği seçimi önemsiz değildir ve nihai performansı önemli ölçüde etkileyebilir.
- Hesaplama maliyeti, etiketsiz örneklerin sayısı ve yinelemelerle, özellikle büyük ormanlar için artar.
- Etiketsiz veri dağılımı, etiketli veriden farklıysa (kovaryat kayması), sözde etiketler sistematik olarak yanlı olabilir.
- Yakınsama garanti edilmez; yinelemeli kendi kendine eğitim, dikkatli durdurma kriterleri olmadan erken yanlış sınıflandırmaları güçlendirebilir.
SSS
Başlamak için ne kadar etiketli veriye ihtiyacım var?
Kesin bir minimum yoktur, ancak ilk denetimli orman, faydalı sözde etiketler üretebilecek kadar güçlü olmalıdır. Pratikte, toplam örneklerin en az %5-10'unun etiketlenmesi — veya birkaç yüz etiketli gözlem — güvenilir başlangıç tahminleri vermeye eğilimlidir. Çok az etiketle, bunun yerine ortak eğitim veya grafik tabanlı yöntemleri düşünün.
Sözde etiketleme için güven eşiğini nasıl seçerim?
Etiketli küme üzerinde bir eşik değerleri ızgarası (örneğin, 0.60 ila 0.95) boyunca çapraz doğrulama yapın ve ayrı tutulan performansı maksimize eden değeri seçin. Daha yüksek bir eşik gürültüyü azaltır ancak kullanılan etiketsiz veri miktarını da azaltır; 0.80 civarında muhafazakar bir başlangıç yaygın bir uygulamadır.
SSL-RF sınıf dengesizliğini yönetebilir mi?
Evet, ancak etiketli kümedeki sınıf dengesizliği sözde etiketlere yayılır. İlk eğitim adımından önce etiketli havuzda sınıf ağırlıklı bölme kriterleri kullanın veya azınlık sınıfını aşırı örnekleyin. Genel doğruluk yerine sınıf başına kesinlik ve geri çağırmayı izleyin.
SSL-RF, rastgele orman temel öğrenicisi ile kendi kendine eğitim ile aynı mıdır?
Kendi kendine eğitim daha geniş algoritmik şemadır; SSL-RF bunun bir gerçekleşmesidir. SSL-RF uygulamaları, naif yinelemeli kendi kendine eğitimin ötesine geçerek manifold düzenlileştirilmiş bölme kriterlerini veya grafik tabanlı yapıyı da içerebilir.
SSL-RF yerine gradyan yükseltmeyi ne zaman tercih etmeliyim?
Tüm verileriniz etiketliyse, gradyan yükseltme genellikle daha yüksek doğruluk sağlar ve tercih edilmelidir. SSL-RF'yi özellikle etiketli kısım küçük olduğunda ve kullanılabilecek geniş bir etiketsiz veri havuzu mevcut olduğunda kullanın.
Kaynaklar
- Leistner, C., Saffari, A., Santner, J., & Bischof, H. (2009). Semi-supervised random forests. In Proceedings of the IEEE 12th International Conference on Computer Vision (ICCV), pp. 506–513. IEEE. DOI: 10.1109/ICCV.2009.5459198 ↗
- Zhu, X. (2005). Semi-supervised learning literature survey. Computer Sciences Technical Report 1530, University of Wisconsin-Madison. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Random Forest (SSL-RF). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-random-forest
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır