Öz-denetimli İzolasyon Ormanı
Self-supervised Isolation Forest (SSL-augmented Anomaly Detection) · Ayrıca şöyle bilinir: SSL Isolation Forest, self-supervised iForest, semi-supervised isolation forest, contrastive isolation forest
Öz-denetimli İzolasyon Ormanı, klasik İzolasyon Ormanı aykırı değer tespitini bir öz-denetimli ön eğitim aşamasıyla zenginleştirir. Etiketler olmadan, döndürme, maskelenmiş özellikler veya zıtlık çiftleri gibi bir ön görev çözülerek daha zengin bir özellik temsili öğrenilir; bu temsil daha sonra izolasyon ağaçları oluşturulurken kullanılır ve karmaşık, yüksek boyutlu tablo verilerinde daha keskin aykırı değer puanları elde edilir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Ham özellikler ilişkili, gereksiz veya etkileşim terimleri gerektiren aykırı değerleri ortaya çıkarmak için yetersiz kaldığında, yüksek boyutlu veya yapılandırılmış tablo verilerinde aykırı değer tespitiyle karşılaştığınızda Öz-denetimli İzolasyon Ormanı'nı kullanın. Özellikle etiketlerin tamamen bulunmadığı ancak anlamlı bir ön görev eğitmek için yeterli etiketsiz normal verinin mevcut olduğu durumlarda değerlidir. Veri kümesi küçükse (birkaç yüz örnekten az), ham özellikler aykırı değerleri zaten temiz bir şekilde ayırıyorsa veya açık özellik katkılarıyla tam yorumlanabilir bir model gerekiyorsa kullanmayın; bu durumlarda, düz İzolasyon Ormanı veya iyi seçilmiş bir çekirdeğe sahip tek sınıflı bir SVM daha uygundur.
Güçlü yönler & sınırlılıklar
- Herhangi bir aykırı değer etiketi olmadan anlamsal olarak daha zengin temsiller öğrenir, karmaşık yüksek boyutlu verilerde tespiti iyileştirir.
- İzolasyon Ormanı'nın doğrusal zaman karmaşıklığını ve alt örnekleme verimliliğini miras alır, eğitimi ölçeklenebilir tutar.
- Ön görev, bilgilendirici olmayan varyansı attığı için ilgisiz veya gereksiz ham özelliklere karşı sağlamdır.
- Esnektir: ön görev, alan yapısına göre uyarlanabilir (örneğin, alanla ilgili özelliklerin maskelenmesi).
- Şüpheli gözlemlerin eşik değerinden bağımsız sıralanmasını sağlayan sürekli bir aykırı değer puanı üretir.
- Bir sinirsel ön eğitim aşaması ekler, uygulama karmaşıklığını artırır ve daha fazla hiperparametre kararı gerektirir.
- Performans, ön görevin seçimine duyarlıdır — kötü tasarlanmış bir görev, faydadan çok zarar verebilir.
- Öz-denetimli aşamanın anlamlı temsiller öğrenmesi için yeterli hacimde etiketsiz veri gerektirir.
- Düz İzolasyon Ormanı'ndan daha az yorumlanabilirdir çünkü aykırı değer puanları öğrenilen özellik uzayında tanımlanır.
SSS
Bu, düz İzolasyon Ormanı'ndan nasıl farklıdır?
Düz İzolasyon Ormanı, ağaçları doğrudan ham özellik uzayında oluşturur. Öz-denetimli varyant, verinin normal yapısının daha iyi bir temsilini üretmek için önce bir ön görev üzerinde bir kodlayıcı eğitir, ardından bu temsil uzayında izolasyon ağaçları oluşturur. Sonuç, ham özelliklerin ilişkili veya gürültülü olduğu karmaşık veri kümelerinde tipik olarak daha yüksek AUROC'dir.
Hangi ön görevler yaygın olarak kullanılır?
Tablo verileri için popüler seçimler arasında maskelenmiş özellik yeniden yapılandırması (tutulan sütunları tahmin etme), döndürme veya permütasyon tahmini (bir satıra hangi permütasyonun uygulandığını belirleme) ve zıtlık öğrenimi (aynı satırın artırılmış görünümlerini birbirine çekme, farklı satırları birbirinden itme) yer alır. En iyi seçim, alanın özellik yapısına bağlıdır.
Ne kadar veriye ihtiyaç var?
Öz-denetimli ön eğitim aşaması, faydalı bir temsil öğrenmek için en az birkaç yüz örnekten, ideal olarak birkaç binden fayda sağlar. Çok küçük veri kümelerinde, ön görev aşırı uyum sağlar ve öğrenilen özellikler ham olanlardan daha iyi olmayabilir — bu rejimde, düz İzolasyon Ormanı genellikle daha güvenlidir.
Herhangi bir etiketli veri gerekli mi?
Eğitim için etiket gerekmez. Küçük bir etiketli doğrulama kümesi mevcutsa, yalnızca bulaşma eşiğini ayarlamak ve en iyi ön görevi seçmek için kullanılabilir, ancak çekirdek model tamamen gözetimsiz eğitilir.
Modeli nasıl değerlendiririm?
Tutulmuş etiketli bir test kümesi üzerinde hesaplanan AUROC ve AUROC-PR (kesinlik-geri çağırma) kullanın. Aykırı değer sınıfları nadir olduğundan, AUROC-PR genellikle AUROC-ROC'den daha bilgilendiricidir. Öz-denetimli aşamanın değer kattığını doğrulamak için düz bir İzolasyon Ormanı taban çizgisine karşı karşılaştırın.
Kaynaklar
- Liu, F. T., Ting, K. M., & Zhou, Z.-H. (2008). Isolation Forest. In Proceedings of the 8th IEEE International Conference on Data Mining (ICDM), pp. 413–422. DOI: 10.1109/ICDM.2008.17 ↗
- Isolation Forest. Wikipedia. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Isolation Forest (SSL-augmented Anomaly Detection). ScholarGate. https://scholargate.app/tr/machine-learning/self-supervised-isolation-forest
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Otomatik kodlayıcıDerin öğrenme↔ karşılaştır
- Isolation ForestMakine öğrenmesi↔ karşılaştır
- Yerel Aykırı Değer Faktörü (LOF)Makine öğrenmesi↔ karşılaştır
- Tek Sınıf SVMMakine öğrenmesi↔ karşılaştır