Öz-denetimli Rastgele Orman
Self-supervised Random Forest (SSL-RF) · Ayrıca şöyle bilinir: SSL-RF, self-supervised RF, self-supervised ensemble forest, unsupervised random forest with self-labeling
Öz-denetimli Rastgele Orman (SSL-RF), etiketli örneklerin az olduğu ortamlara klasik rastgele ormanı genişletir. Orman, önce kendi kendine denetlenen bir ön görevden — veri dönüşümlerini veya maskelenmiş özellikleri tahmin etmek gibi — türetilen otomatik olarak oluşturulmuş sözde etiketler kullanılarak eğitilir ve ardından mevcut gerçek etiketler üzerinde iyileştirilir, bu da öz-denetimli öğrenmenin etiket verimliliğini topluluk ağaçlarının sağlamlığıyla birleştirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli örneklerin problem karmaşıklığına göre az olduğu — tıbbi görüntüleme, sensör verileri veya ek açıklamaların maliyetli olduğu bilimsel veri kümeleri gibi yaygın bir durum — durumlarda Öz-denetimli Rastgele Orman'ı kullanın. Etiketsiz verilerin aynı dağılımdan bol olduğu ve ağaç topluluklarının yorumlanabilirliği ve sağlamlık garantilerinin korunması gerektiği durumlarda güçlü bir seçenektir. Tamamen etiketlenmiş makul büyüklükte bir veri kümesi mevcut olduğunda (standart bir rastgele orman daha basit ve eşit derecede iyi olacaktır) veya ön görevin veri modallitesi için anlamlı bir şekilde tanımlanamadığı durumlarda (örneğin, özellik mühendisliği olmayan yapılandırılmamış serbest metin) bundan kaçının.
Güçlü yönler & sınırlılıklar
- Etiketlenmemiş büyük veri havuzlarından etkili bir şekilde yararlanır, etiketli veri gereksinimini önemli ölçüde azaltır.
- Standart rastgele ormanların sağlamlığını, aşırı uyuma direncini ve yerleşik özellik önemini miras alır.
- Normalite varsayımı yok; karışık özellik türlerini, doğrusal olmayan etkileşimleri ve gürültülü girdileri işler.
- Tekrarlayan sözde etiket yayılımı, orman güven kazandıkça performansı giderek artırabilir.
- Modüler tasarım: ön görev, orman mimarisini değiştirmeden alana uyacak şekilde değiştirilebilir.
- Performans, seçilen ön görevin kalitesine ve ilgililiğine büyük ölçüde bağlıdır; kötü tasarlanmış bir görev yanıltıcı sözde etiketler üretebilir.
- Tekrarlayan sözde etiketleme döngüsü, denetimli rastgele ormanlara kıyasla hesaplama ek yükü ve ek hiperparametreler ekler.
- Teorik garantiler, tam denetimli ormanlara göre daha zayıftır; yakınsama ve hata sınırlarının belirlenmesi daha zordur.
- Etiketsiz veri dağılımı, etiketli test kümesinden farklıysa, öz-denetimli ön eğitim sistematik bir yanlılık getirebilir.
SSS
Öz-denetimli Rastgele Orman, standart bir yarı denetimli ormandan nasıl farklıdır?
Klasik bir yarı denetimli orman, etiket yayılımı veya manifold düzenlemesi yoluyla etiketli ve etiketsiz verileri ortaklaşa kullanır. Öz-denetimli RF, öncelikle etiketsiz veriler üzerinde bir ön görev tanımlayarak ilk sözde etiketleri oluşturarak daha ileri gider, böylece ön eğitim aşamasında sıfır gerçek etiketle çalışabilir, bu da onu tamamen denetimsiz sıcak başlangıç senaryolarında uygulanabilir kılar.
Tablo verileri için en iyi ön görevler hangileridir?
Tablo verileri için yaygın ön görevler arasında maskelenmiş veya bozulmuş özellik değerlerini tahmin etmek (BERT tarzı maskelemeye benzer), iki satırın aynı kümeden olup olmadığını sınıflandırmak veya satırları bir vekil istatistiğe göre sıralamak yer alır. Anahtar nokta, görevin ilgilenilen hedef yapı ile ilişkili olmasıdır.
Standart bir rastgele ormandan daha fazla hiperparametre ayarı gerektirir mi?
Evet. Standart orman hiperparametrelerine (ağaç sayısı, maksimum özellikler, maksimum derinlik) ek olarak, ön görevi, öz-eğitim yinelemelerinin sayısını ve sözde etiketleri kabul etmek için güven eşiğini seçmeli ve yapılandırmalısınız. Küçük etiketli havuzdan çekilen bir doğrulama kümesi şarttır.
Ne zaman derin bir öz-denetimli modeli SSL-RF'ye tercih etmeliyim?
Derin modeller (örneğin, karşılaştırmalı sinir ağları), ham görüntüler veya ses gibi yapılandırılmamış verilerde, öğrenilmiş özellik hiyerarşilerinin kritik olduğu yerlerde SSL-RF'den daha iyi performans gösterme eğilimindedir. SSL-RF, ağaç topluluklarının tam denetimli durumda zaten sinir ağlarına eşit veya daha iyi performans gösterdiği tablo veya hafifçe işlenmiş özellik kümelerinde tercih edilir.
SSL-RF sınıf dengesizliğini ele alabilir mi?
Evet, standart rastgele ormanlarla aynı mekanizmalar aracılığıyla — sınıf ağırlıklandırma, azınlık sınıfının aşırı örneklenmesi veya sözde etiket seçimi sırasında güven eşiğinin ayarlanması. Ancak, tekrarlayan öz-eğitim aşaması, aşırı güvenli sözde etiketler sistematik olarak çoğunluk sınıfını tercih ederse dengesizliği artırabilir.
Kaynaklar
- Lefortier, D., Chitta, K., & Agrawal, P. (2022). Self-supervised random forests. arXiv:2204.01430. link ↗
- Criminisi, A., Shotton, J., & Konukoglu, E. (2012). Decision forests: A unified framework for classification, regression, density estimation, manifold learning and semi-supervised learning. Foundations and Trends in Computer Graphics and Vision, 7(2–3), 81–227. DOI: 10.1561/0600000035 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Random Forest (SSL-RF). ScholarGate. https://scholargate.app/tr/machine-learning/self-supervised-random-forest
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Karar AğacıMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Öz-denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır