Yarı Denetimli Karar Ağacı
Semi-supervised Decision Tree Learning · Ayrıca şöyle bilinir: SSDT, semi-supervised tree induction, self-training decision tree, label-propagation tree
Yarı Denetimli Karar Ağacı, etiketli eğitim setinin yanı sıra etiketsiz gözlemleri de kullanmak üzere CART veya C4.5 gibi standart karar ağacı çıkarımını genişletir. Algoritma, etiketsiz verilere yinelemeli olarak geçici etiketler atayarak ve bunları büyüme veya bölme sürecine dahil ederek, yalnızca etiketli alt küme üzerinde eğitilmiş tamamen denetimli bir ağaçtan daha iyi doğruluk elde edebilir; bu durum özellikle etiketlemenin pahalı veya zaman alıcı olduğu durumlarda değerlidir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Yarı denetimli karar ağaçları, etiketli verilerin az ve elde edilmesinin pahalı olduğu ancak geniş bir etiketsiz gözlem havuzunun mevcut olduğu durumlarda uygundur — tıbbi görüntüleme anotasyonu, metin sınıflandırması ve sensör tabanlı izlemede yaygındır. Özellikle genel özellik dağılımının etiketsiz havuz tarafından iyi yakalandığı ve insan tarafından yorumlanabilir bir modelin (bir ağaç) gerektiği durumlarda faydalıdırlar. Etiketli örnek o kadar küçükse ki başlangıç ağacı son derece güvenilmezse, etiketsiz veriler test dağılımını temsil etmiyorsa veya sözde etiketleme sürecinin sistematik hataları (onay yanlılığı) yayması bekleniyorsa bu yöntemden kaçınılmalıdır. Bu durumlarda, temiz etiketli veriler üzerinde tamamen denetimli yöntemler veya etiket yayılımı veya birlikte eğitim gibi alternatif yarı denetimli yaklaşımlar daha güvenli olabilir.
Güçlü yönler & sınırlılıklar
- Etiketli örnekler az olduğunda doğruluğu artırmak için etiketsiz verileri kullanır, böylece açıklama maliyetini azaltır.
- Karar ağaçlarının yorumlanabilirliğini korur: ortaya çıkan model, insan tarafından okunabilir bir eğer-o zaman kuralları setidir.
- Ön işleme normalizasyonuna gerek kalmadan karma özellik türlerini — sürekli, kategorik, ikili — doğal olarak işler.
- Yinelemeli kendi kendine eğitim, mevcut herhangi bir ağaç öğrenicinin üzerine kolayca uygulanabilir.
- Doğrusal yarı denetimli modellerin gözden kaçırdığı doğrusal olmayan sınırları ve özellik etkileşimlerini yakalayabilir.
- Güvenilmez bir başlangıç ağacından kaynaklanan sözde etiket hataları yinelemeler boyunca büyüyebilir ve tamamen denetimli bir temel çizgiye göre performansı düşürebilir.
- Yöntem, etiketsiz verilerin etiketli verilerle aynı temel dağılımı paylaştığını varsayar; dağılım kayması bu varsayımı bozar.
- Ağaçlar giderek büyüyen etkili veri setleri üzerinde yeniden eğitildikçe hesaplama maliyeti her yinelemede artar.
- Sözde etiket dahil etme için güven eşiğini seçmek dikkatli ayarlama ve çapraz doğrulama gerektirir.
SSS
Yarı denetimli bir karar ağacı, normal bir kendi kendine eğitim sınıflandırıcısından nasıl farklıdır?
Temel prensip — etiketsiz veriler üzerindeki tahminleri eğitimi artırmak için kullanmak — aynıdır. Ağaca özgü yaklaşımları ayıran şey, yalnızca etiketli seti yinelemeli olarak genişletmek yerine, bölme kriterinin kendisini etiketsiz dağılım bilgisini dahil edecek şekilde değiştirme seçeneğidir.
Başlamak için kaç etiketli örneğe ihtiyacım var?
Evrensel bir minimum yoktur, ancak başlangıçtaki denetimli ağacın faydalı sözde etiketler üretecek kadar güvenilir olması gerekir. Pratikte, sınıf başına en az 20-50 etiketli örnek genellikle önerilir; daha azıyla, hata yayılımı riski yüksektir ve etiket yayılımı gibi alternatif yaklaşımlar daha iyi çalışabilir.
Tüm etiketsiz verileri mi kullanmalıyım yoksa bir alt küme mi seçmeliyim?
Yalnızca yüksek güvenli sözde etiketleri seçmek — örneğin yaprak olasılığının 0.85 gibi bir eşiği aştığı durumlar — genellikle tüm etiketsiz noktaları kullanmaktan daha iyi performans gösterir, özellikle başlangıç ağacı kusurlu olduğunda.
Bu, standart çapraz doğrulamayı değiştirir mi?
Hayır. Sözde etiketler modelin kendisinden türetildiği için, örnek içi metrikler iyimserdir. Değerlendirme, ayrılmış bir etiketli test seti veya kesinlikle etiketli bölüme uygulanan k-kat çapraz doğrulama kullanmalıdır.
Bunu topluluk yöntemleriyle birleştirebilir miyim?
Evet. Yarı denetimli rastgele ormanlar ve birlikte orman yaklaşımları, fikri topluluklara genişletir, bu da sözde etiket hatalarının varyansını azaltabilir ve tipik olarak tek bir yarı denetimli ağaçtan daha iyi performans gösterir.
Kaynaklar
- Levin, E. & Shapiro, E. (2000). Learning Decision Trees from Semi-labeled Examples. Proceedings of the ICML Workshop on Attribute-Value and Relational Learning. link ↗
- Zhu, X. & Goldberg, A. B. (2009). Introduction to Semi-Supervised Learning. Morgan & Claypool Publishers. ISBN: 978-1-598-29548-9
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Decision Tree Learning. ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-decision-tree
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Karar AğacıMakine öğrenmesi↔ karşılaştır
- Gradyan ArtırmaMakine öğrenmesi↔ karşılaştır
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır