Toplu İzolasyon Ormanı
Ensemble Isolation Forest (Meta-Ensemble Anomaly Detection) · Ayrıca şöyle bilinir: EIF ensemble, multi-isolation-forest, isolation forest ensemble, ensemble anomaly detection with isolation trees
Toplu İzolasyon Ormanı, daha kararlı, sağlam bir aykırı değer sıralaması üretmek için birden çok İzolasyon Ormanı modelini - her biri farklı rastgele tohumlar, alt örnekleme oranları veya kirlilik parametreleri ile - eğitir ve aykırı değer puanlarını birleştirir. Birkaç bağımsız izolasyon ormanından ortalama alarak veya toplayarak, yöntem tek bir ormanda bulunan varyansı azaltır ve karmaşık veya yüksek boyutlu verilerde daha güvenilir aykırı değer tespiti sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Aykırı değer tespiti kararlılığının önemli olduğu ve tek bir İzolasyon Ormanı'nın çalıştırmalar veya katlar arasında tutarsız sonuçlar ürettiği durumlarda Toplu İzolasyon Ormanı'nı kullanın. Yüksek boyutlu sayısal veriler için, aykırı değer dağılımı hakkında hiçbir varsayım yapmadan, orta ila büyük veri kümeleri (yüzlerce ila milyonlarca gözlem) ve yanlış pozitif maliyetlerinin yüksek olduğu ve aykırı değer sıralamasının sağlamlığının kritik olduğu ayarlar - örneğin dolandırıcılık tespiti, ağ saldırısı tespiti veya endüstriyel kalite kontrolü gibi - için uygundur. Verilerin çok düşük boyutlu olduğu (yaklaşık 3 özellikten az) durumlarda kaçının, çünkü izolasyon tabanlı yöntemler bu rejimde daha basit istatistikler üzerindeki avantajlarını kaybeder. Ayrıca, hesaplama bütçesinin ciddi şekilde sınırlı olduğu durumlarda kaçının, çünkü birkaç orman eğitmek çalışma süresini ve bellek maliyetini çarpar.
Güçlü yönler & sınırlılıklar
- Tek bir İzolasyon Ormanı'na göre daha kararlı ve tekrarlanabilir aykırı değer puanları, özellikle sınır gözlemlerinde.
- Belirli bir aykırı değer dağılımı varsaymadan yüksek boyutlu ve büyük hacimli veri kümelerine ölçeklenir.
- Normallik veya doğrusallık varsayımı yok; karışık sürekli özellikleri iyi işler.
- Kolayca paralelleştirilebilir: her bileşen ormanı bağımsız olarak eğitilir.
- Toplu toplama doğal bir belirsizlik sinyali sağlar - ormanlar arasındaki geniş puan yayılımı belirsiz gözlemleri işaretler.
- Tek bir İzolasyon Ormanı'na göre artırılmış hesaplama ve bellek maliyeti; birden çok orman hiperparametrelerini ayarlamak karmaşıklık katar.
- Hala çok düşük boyutlu verilerde temel İzolasyon Ormanı'nın zayıflığını paylaşır, burada rastgele ikiye bölme basit istatistiklerden daha etkili değildir.
- Aykırı değer puanları kalibre edilmiş olasılıklar değildir, bu da alan bilgisi veya etiketli bir doğrulama seti olmadan eşik seçimini önemsiz hale getirir.
- Kategorik özellikler kullanmadan önce kodlama gerektirir; yöntem sayısal veriler için tasarlanmıştır.
SSS
Toplulukta kaç tane izolasyon ormanı dahil etmeliyim?
Uygulamada, farklı rastgele tohumlara sahip beş ila yirmi orman, önemli varyans azalması sağlar. Yirmiden sonra marjinal kazanç azalırken çalışma süresi doğrusal olarak artar, bu nedenle makul bir durma noktası bulmak için bir doğrulama setinde karşılaştırma yapın.
Bu, tek bir İzolasyon Ormanı'ndan nasıl farklıdır?
Standart bir İzolasyon Ormanı zaten tek bir rastgele tohumu ve tek bir hiperparametre seti paylaşan izolasyon ağaçlarının bir topluluğudur. Toplu İzolasyon Ormanı, birden çok böyle modeli değişen tohumlar veya ayarlar ile çalıştırır ve puanlarını toplar, temel yöntemin üzerine bir katman daha varyans azaltma ekler.
Kirlilik parametresini nasıl seçerim?
Etiketli aykırı değerleriniz varsa, kirliliği ayrılmış bir doğrulama setinde ayarlayın. Etiketler olmadan, alan bilgisini (örneğin, beklenen dolandırıcılık oranı) kullanın veya parametreyi bir hassasiyet kontrolü olarak ele alın ve bir eşiğe karar vermeden önce en üst sıralardaki gözlemleri manuel olarak inceleyin.
Topluluk etiketli veri gerektirir mi?
Hayır. Standart İzolasyon Ormanı gibi, topluluk tamamen denetimsizdir ve eğitim sırasında aykırı değer etiketleri gerektirmez. Etiketler yalnızca nihai eşiği değerlendirmek veya kalibre etmek için kullanışlıdır.
Bunu Neden Tek Sınıflı SVM veya Otomatik Kodlayıcı Tabanlı Tespitten Üstün Görmeliyim?
Toplu İzolasyon Ormanı, genellikle Tek Sınıflı SVM'den daha hızlı eğitilir ve büyük veri kümelerine daha iyi ölçeklenir, bu da destek vektörlerinin sayısında karesel maliyete sahiptir. Otomatik kodlayıcılar mimari kararlar ve daha fazla hiperparametre ayarlaması gerektirir. Hız ve kararlılığın önemli olduğu ve verilerin görüntü veya metin yerine sayısal tablo olduğu durumlarda topluluğu tercih edin.
Kaynaklar
- Liu, F. T., Ting, K. M., & Zhou, Z.-H. (2008). Isolation Forest. In Proceedings of the 8th IEEE International Conference on Data Mining (ICDM 2008), pp. 413–422. IEEE. DOI: 10.1109/ICDM.2008.17 ↗
- Isolation Forest. Wikipedia. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Ensemble Isolation Forest (Meta-Ensemble Anomaly Detection). ScholarGate. https://scholargate.app/tr/machine-learning/ensemble-isolation-forest
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Otokodlayıcı Anomali TespitiMakine öğrenmesi↔ karşılaştır
- Isolation ForestMakine öğrenmesi↔ karşılaştır
- Tek Sınıf SVMMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Oy Birliği TopluluğuMakine öğrenmesi↔ karşılaştır