Sağlam İzolasyon Ormanı
Robust Isolation Forest (Anomaly Detection with Robustness to Noise and Contamination) · Ayrıca şöyle bilinir: Robust iForest, noise-robust isolation forest, contamination-robust isolation forest, robust anomaly isolation
Sağlam İzolasyon Ormanı, klasik İzolasyon Ormanı aykırı değer tespit edicisini, veri kirliliğine, maskeleme etkilerine ve yanlı rastgele bölünmelere duyarlılığı azaltan stratejilerle genişletir. İyileştirilmiş alt örnekleme, şüpheli bölgelerin yeniden ağırlıklandırılması veya yanlılık düzeltilmiş bölünme gibi sağlamlık mekanizmalarını dahil ederek, eğitim verisinin kendisi önemli bir oranda aykırı değer içerdiğinde veya belirli özellik dağılımları standart iForest'in güvenilmez yol uzunlukları üretmesine neden olduğunda daha güvenilir aykırı değer puanları elde eder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Eğitim verisinin önemli bir oranda aykırı değer içerdiğinden şüpheleniyorsanız (yaklaşık %10'un üzerinde), özelliklerin eksen hizalı bölünmelerin geometrik olarak yanlı olmasına neden olan düzensiz dağılımlara sahip olduğu durumlarda veya standart İzolasyon Ormanı'nın özellik sınırları yakınındaki bilinen aykırı değerleri sürekli olarak yanlış sıraladığı gözlemlendiğinde Sağlam İzolasyon Ormanı'nı kullanın. Aykırı değerlerin kümelenebileceği yüksek boyutlu tablo verileri için uygundur. Standart iForest zaten iyi çalışıyorsa, tak-çalıştır bir yedek olarak kullanmayın — ek karmaşıklık gereksizdir. Ağaç tabanlı herhangi bir yaklaşımın kararsız olduğu çok küçük veri kümeleri (yaklaşık 100 gözlemin altında) için veya tam etiketli bir veri kümesinin denetimli aykırı değer tespiti için daha iyi bir seçenek olduğu durumlarda bundan kaçının.
Güçlü yönler & sınırlılıklar
- Aykırı değer kümelerinin standart iForest'in aykırı değer puanlarını hafife almasına neden olduğu maskeleme etkilerini azaltır.
- Özellikle çarpık veya çok modlu dağılımlara sahip özellikler için eksen hizalı bölünmelerden kaynaklanan geometrik yanlılığa karşı iyileştirilmiş sağlamlık.
- Standart İzolasyon Ormanı'nın doğrusal zaman karmaşıklığını ve düşük bellek ayak izini miras alır.
- Temiz, aykırı değer içermeyen bir eğitim kümesi gerektirmez — sağlam varyantlar daha yüksek kirlilik oranlarını tolere eder.
- Aykırı değer puanları, dağılımsal varsayımlar olmaksızın göreceli yol uzunluğu mesafeleri olarak yorumlanabilirliğini korur.
- Sağlamlık mekanizmaları, dikkatli ayar gerektiren hiperparametreler (örn. kirlilik tahmini, budama oranı) ekler.
- Aykırı değer puanları sağlar ancak olasılıksal belirsizlik aralıkları sunmaz; eşik belirleme için sonradan kalibrasyon gerekir.
- Tüm denetimsiz aykırı değer tespit ediciler gibi, performansın zemin gerçeği aykırı değer etiketleri olmadan titizlikle değerlendirilmesi zordur.
- Sağlamlık iyileştirmelerine rağmen, normal verilere göre yoğun olan aykırı değerleri kümelemek yöntemi hala karıştırabilir.
SSS
Sağlam İzolasyon Ormanı, standart İzolasyon Ormanı'ndan nasıl farklıdır?
Standart İzolasyon Ormanı, eksen hizalı bölünmelerden kaynaklanan geometrik yanlılığa duyarlıdır ve bir araya kümelenen aykırı değerleri kaçırabilir. Sağlam varyantlar, iyileştirilmiş bölünme yönleri, kirlilik farkındalığı alt örneklemesi veya budanmış puanlama yoluyla bu zayıflıkları giderir, bu da eğitim verisi gürültülü veya kirlenmiş olduğunda daha güvenilir olmalarını sağlar.
Kirlilik parametresini nasıl ayarlarım?
Beklenen aykırı değer oranı hakkında alan bilginiz varsa, onu doğrudan kullanın. Aksi takdirde, puan dağılımını inceleyerek doğrulayın ve etiketlenmiş örnekler varsa, kabul edilebilir hassasiyet ve geri çağırma elde eden bir eşik bulmak için bunları kullanın. Sağlam varyantlar genellikle standart iForest'ten küçük kirlilik yanlış belirtilerine daha az duyarlıdır.
Sağlam İzolasyon Ormanı yüksek boyutlu veriler için uygun mudur?
Evet. Standart iForest gibi, yüksek boyutlara iyi ölçeklenir. Sağlam bir varyant olan Genişletilmiş İzolasyon Ormanı, standart iForest'in yalnızca eksen hizalı bölünmeler nedeniyle yüksek boyutlarda sergilediği yanlılığı özellikle ele alır.
Ne zaman denetimli bir aykırı değer tespit ediciyi tercih etmeliyim?
Anlamlı bir oranda aykırı değer için güvenilir etiketleriniz olduğunda, etiketlenmiş küme üzerinde eğitilmiş Rastgele Orman veya gradyan artırma gibi denetimli yöntemler, denetimsiz tespit edicilerden neredeyse her zaman daha iyi performans gösterecektir. Etiketlerin bulunmadığı veya son derece seyrek olduğu durumlarda Sağlam İzolasyon Ormanı'nı kullanın.
Ne kadar örneklem büyüklüğü gereklidir?
Ağaç başına standart alt örnekleme boyutu 256 gözlemdir, ancak ağaç topluluğunun kararlı puanlar üretebilmesi için tüm veri kümesi önemli ölçüde daha büyük olmalıdır — en az birkaç yüz satır. Çok küçük veri kümeleri, sağlamlık geliştirmelerinden bağımsız olarak oldukça değişken sıralamalar üretir.
Kaynaklar
- Liu, F. T., Ting, K. M., & Zhou, Z.-H. (2008). Isolation Forest. In Proceedings of the IEEE International Conference on Data Mining (ICDM), pp. 413–422. IEEE. DOI: 10.1109/ICDM.2008.17 ↗
- Hariri, S., Kind, M. C., & Brunner, R. J. (2019). Extended Isolation Forest. IEEE Transactions on Knowledge and Data Engineering, 33(4), 1479–1489. DOI: 10.1109/TKDE.2019.2947676 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust Isolation Forest (Anomaly Detection with Robustness to Noise and Contamination). ScholarGate. https://scholargate.app/tr/machine-learning/robust-isolation-forest
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Otokodlayıcı Anomali TespitiMakine öğrenmesi↔ karşılaştır
- Isolation ForestMakine öğrenmesi↔ karşılaştır
- Tek Sınıf SVMMakine öğrenmesi↔ karşılaştır
- Sağlam Otomatik Kodlayıcı Aykırı Değer TespitiMakine öğrenmesi↔ karşılaştır
- Dayanıklı Tek Sınıf Destek Vektör MakinesiMakine öğrenmesi↔ karşılaştır