Yerel Aykırı Değer Faktörü (LOF)
Local Outlier Factor (LOF): Density-Based Anomaly Detection · Ayrıca şöyle bilinir: LOF, local outlier factor, density-based outlier detection, local density deviation
Yerel Aykırı Değer Faktörü (LOF), Breunig, Kriegel, Ng ve Sander tarafından 2000 yılında tanıtılan, yoğunluk tabanlı, denetimsiz bir anomali tespit algoritmasıdır. Her veri noktasına, o noktanın yerel komşuluğuna göre ne kadar izole olduğunu niceliksel olarak belirten sürekli bir aykırı değer skoru atar. Bu sayede, uzayın başka yerlerindeki yoğun kümelere karışarak küresel yöntemlerin gözden kaçırdığı anomalilerin tespitini mümkün kılar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
LOF, anomalilerin değişen yoğunluktaki kümelerde ortaya çıkmasının beklendiği ve küresel bir uzaklık eşiğinin ya seyrek bölgelerde gizlenmiş aykırı değerleri kaçıracağı ya da meşru olarak seyrek ama tutarlı kümelerdeki noktaları yanlışlıkla işaretleyeceği durumlarda uygundur. Anlamlı bir uzaklık metriğine sahip herhangi bir sürekli özellik uzayında çalışır ve etiketlenmiş anomali örnekleri gerektirmez (tamamen denetimsizdir). Dolandırıcılık tespiti, ağa sızma tespiti, üretim kalite kontrolü ve tıbbi anomali taraması gibi uygulamalar için uygundur. Temel varsayımlar, iç değerlerin makul ölçüde tutarlı yerel komşuluklar oluşturması ve anlamlı ikili uzaklıkların hesaplanabilmesidir. LOF, n en az onlarca ila yüzlerce olduğunda en iyi performansı gösterir; çok yüksek boyutlu veriler için (boyutluluk laneti) uzaklıklar daha az ayırt edici hale gelir ve boyut indirgeme veya özellik seçimi önce tavsiye edilir.
Güçlü yönler & sınırlılıklar
- Küresel yöntemlerin başarısız olduğu, değişen yoğunluktaki kümelere sahip veri kümelerinde yerel aykırı değerleri tespit eder.
- Kesin ikili bir etiket yerine sürekli, yorumlanabilir bir skor üreterek esnek eşik seçimine olanak tanır.
- Tamamen denetimsizdir: etiketlenmiş anomali verisi gerekmez.
- Öklid dışı uzaklıklar dahil olmak üzere, hesaplanabilir bir uzaklık metriğine sahip herhangi bir özellik uzayına uygulanabilir.
- Uzaklıklar standartlaştırılmış veriler üzerinde hesaplandığında, bireysel özelliklerin ölçeğine karşı sağlamdır.
- Naif uygulamadaki karesel zaman karmaşıklığı, yaklaşık en yakın komşu indekslemesi olmadan büyük veri kümelerinde yavaş çalışmasına neden olur.
- k seçimine duyarlıdır: çok küçük bir k gürültülü skorlar üretirken; çok büyük bir k yerel yapıyı bulanıklaştırır.
- Boyutluluk laneti nedeniyle çok yüksek boyutlu uzaylarda performans düşer.
- Yeniden hesaplama yapılmadan akış veya çevrimiçi verilere doğal olarak ölçeklenmez.
- Eğitim setine erişim olmadan yeni noktaları doğrudan puanlamak için uygulanabilecek bir model sağlamaz.
SSS
k'nin doğru değerini nasıl seçerim?
Evrensel olarak optimal bir k yoktur. Yaygın uygulama, bir dizi değeri — genellikle 5 ila 50 arası — değerlendirmek ve skor dağılımının ve işaretlenen aykırı değerlerin nasıl değiştiğini incelemektir. k değerleri arasındaki bir duyarlılık analizi, tespit edilen anomalilerin seçime karşı sağlam olduğuna dair güven verir. Minimum beklenen küme boyutu hakkındaki alan bilgisi de alt sınırı yönlendirebilir.
LOF skoru 1 ile 3 arasında ne anlama gelir?
1'e yakın bir skor, noktanın komşularıyla yaklaşık olarak aynı yerel yoğunluğa sahip olduğu ve bir iç değer olarak kabul edildiği anlamına gelir. 1'den önemli ölçüde büyük bir skor — veri kümesine bağlı olarak genellikle 1.5 veya 2'nin üzeri olarak yorumlanır — noktanın komşuluğunun, komşularının komşuluklarından çok daha seyrek olduğunu gösterir. Evrensel bir kesme noktası yoktur; eşik, belirli veri kümesi için LOF skorlarının dağılımı incelenerek seçilmelidir.
LOF, yeniden eğitim yapmadan yeni, görülmemiş noktaları puanlayabilir mi?
LOF, transdüktif bir yöntemdir: herhangi bir yeni nokta için komşulukları ve yoğunlukları hesaplamak için eğitim setinin mevcut olmasını gerektirir. Yeni gözlemleri puanlamak için eğitim seti saklanmalı ve her yeni nokta, depolanmış eğitim noktalarına karşı k-komşuluğunu yeniden hesaplamak üzere eklenmelidir. Bazı uygulamalar bu işlevselliği sunar, ancak bu, kompakt bir puanlama fonksiyonu öğrenen parametrik modellerden temelden farklıdır.
LOF, anomali tespiti için Isolation Forest ile nasıl karşılaştırılır?
LOF, yerel komşuluklara dayalı yoğunluk tahmini kullanır ve anomalilerin heterojen bir uzayın yerel olarak seyrek bölgelerinde kümelendiği durumlarda daha güçlüdür. Isolation Forest, rastgele bölümleme kullanır ve genellikle daha hızlı ve büyük veri kümelerine daha ölçeklenebilirdir. Yüksek boyutlu veya çok büyük veri kümeleri için genellikle Isolation Forest tercih edilir; yoğunluk varyasyonu olan orta boyutlu veriler için LOF sıklıkla daha ince ayrımcılık sunar.
Kaynaklar
- Breunig, M. M., Kriegel, H.-P., Ng, R. T., & Sander, J. (2000). LOF: Identifying density-based local outliers. Proceedings of the 2000 ACM SIGMOD International Conference on Management of Data, 93–104. DOI: 10.1145/335191.335388 ↗
- Aggarwal, C. C. (2017). Outlier Analysis (2nd ed., Ch. 4). Springer. ISBN: 978-3-319-47577-6
- Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning (2nd ed., Ch. 14). Springer. ISBN: 978-0-387-84857-0
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Local Outlier Factor (LOF): Density-Based Anomaly Detection. ScholarGate. https://scholargate.app/tr/machine-learning/local-outlier-factor
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Otomatik kodlayıcıDerin öğrenme↔ karşılaştır
- Isolation ForestMakine öğrenmesi↔ karşılaştır
- Tek Sınıf SVMMakine öğrenmesi↔ karşılaştır