OPTICS
OPTICS: Ordering Points To Identify the Clustering Structure · Ayrıca şöyle bilinir: OPTICS, Ordering Points To Identify the Clustering Structure, density-based clustering with reachability plot, generalized DBSCAN
OPTICS (Ordering Points To Identify the Clustering Structure), Ankerst, Breunig, Kriegel ve Sander tarafından 1999 yılında tanıtılan, yoğunluk tabanlı bir kümeleme algoritmasıdır. DBSCAN'i genelleştirerek, bir veri setinin tüm yoğunluk tabanlı küme yapısını kodlayan bir sıralama ile noktaları işler ve sabit bir global yoğunluk eşiği gerektirmek yerine, erişilebilirlik grafiği aracılığıyla değişen yoğunluklardaki kümelerin tespit edilmesini sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
OPTICS'i, veri setinin tek bir global epsilon'un (DBSCAN'deki gibi) aynı anda yakalayamayacağı, değişen yerel yoğunluklara sahip kümeler içerdiği durumlarda veya belirli bir küme çıkarma eşiğine karar vermeden önce yoğunluk hiyerarşisini görsel olarak incelemek istediğinizde kullanın. Küme şekillerinin rastgele olduğu ve gürültünün bulunduğu uzamsal, coğrafi veya yüksek boyutlu nokta bulutu verileri için uygundur. OPTICS, anlamlı kümelerin çevreleyen alandan daha yoğun olduğunu, anlamlı bir mesafe metriğinin var olduğunu ve minPts'nin alan bilgisine göre ayarlanabileceğini varsayar (genellikle düşük boyutlu veriler için 5-20, yüksek boyutlu veriler için daha yüksek). Tüm kümelerin tek tip yoğunluğa sahip olduğu bilindiğinde (standart DBSCAN daha basittir), veri seti çok büyük olduğunda ve verimli bir indeks yapısı olmadan hesaplama maliyeti çok yüksek olduğunda veya veriler tamamen kategorik olup tutarlı bir mesafe metriği olmadığında önerilmez.
Güçlü yönler & sınırlılıklar
- DBSCAN'in ana sınırlamasını aşarak, keyfi olarak değişen yoğunluktaki kümeleri tek geçişte işler.
- Kullanıcının küme sayısını önceden belirtmesini gerektirmez.
- Gürültü noktalarını kümelere zorlamak yerine otomatik olarak tanımlar ve etiketler.
- Erişilebilirlik grafiği, tüm küme hiyerarşisinin yorumlanabilir görsel bir özetini sunar.
- Küme çıkarma, algoritmayı yeniden çalıştırmadan, sonradan birden çok ayrıntı düzeyinde gerçekleştirilebilir.
- Erişilebilirlik grafiği ve xi-steep çıkarma yönteminin doğru yorumlanması kolay olmayabilir; xi ve minPts seçimi sonuçları güçlü bir şekilde etkiler.
- Hesaplama karmaşıklığı, uzamsal bir indeks (örn. k-d ağacı veya top ağacı) ile O(n log n) iken, indeks olmadan O(n²) olup, çok büyük veri setlerinde yavaş çalışmasına neden olur.
- Yüksek boyutlu uzaylarda, mesafelerin yoğunlaşması yoğunluk tahminini güvenilmez hale getirdiğinden, boyutluluk laneti nedeniyle performans düşer.
- Algoritma hala iki hiperparametre (epsilon ve minPts) gerektirir ve epsilon ikincil bir rol oynasa da, yanlış seçimler erişilebilirlik grafiğini etkileyebilir.
SSS
OPTICS, DBSCAN'den nasıl farklıdır?
DBSCAN, verileri sabit bir global epsilon ve minPts kullanarak bölümlere ayırır, bu da aynı anda yalnızca bir yoğunluk seviyesindeki kümeleri bulabileceği anlamına gelir. OPTICS, verileri yoğunluk sıralı bir dizide işler ve erişilebilirlik mesafelerini kaydeder, böylece tüm epsilon değerleri için DBSCAN sonucunu eşzamanlı olarak hesaplar. Bir son işleme adımı daha sonra herhangi bir seçilen yoğunluk eşiğinde — veya xi parametresi kullanılarak tüm seviyelerde otomatik olarak — kümeleri çıkarır.
minPts ve epsilon için hangi değerleri seçmeliyim?
Yaygın bir kural, minPts'yi en az verinin boyutluluğu artı bir olarak veya boyut sayısının 2 katı olarak belirler; 5 ila 20 arasındaki değerler düşük boyutlu veriler için iyi sonuç verir. Epsilon için, çok küçük olmadığı sürece erişilebilirlik grafiği epsilon'a nispeten duyarsız olduğundan, komşuları erken dışlamaması için büyük, izin verici bir değer (örn. maksimum çiftler arası mesafe) ayarlayın. Epsilon'u doğrudan ayarlamak yerine erişilebilirlik grafiğini inceleyin ve xi'yi veya çıkarma eşiğini ayarlayın.
Erişilebilirlik grafiğinden somut kümeleri nasıl çıkarırım?
İki ana yaklaşım mevcuttur. Daha basit olanı, erişilebilirlik grafiğine yatay bir epsilon' eşiği uygular: erişilebilirlik mesafesi epsilon'un altında olan noktalar bir kümeye aittir ve bu epsilon' ile DBSCAN çalıştırmakla aynı sonucu verir. Daha otomatik olan xi-steep yaklaşımı, erişilebilirlik mesafesindeki en az xi'lik göreceli düşüşleri ve yükselişleri tespit ederek vadileri tanımlar; xi'yi seçmeyi gerektirir (genellikle 0.01-0.1) ancak mutlak bir mesafe eşiği belirtmekten kaçınır.
OPTICS yüksek boyutlu veriler için uygun mudur?
Dikkatli olmak kaydıyla. Yüksek boyutlarda, boyutluluk laneti tüm çiftler arası mesafelerin yoğunlaşmasına neden olur, bu da yoğunluk farklılıklarını tespit etmeyi zorlaştırır. Boyut azaltma (PCA, UMAP) veya OPTICS'i uygulamadan önce alana özgü mesafe metriklerinin kullanılması bunu hafifletebilir. Benzer prensiplere dayanan HDBSCAN, orta derecede yüksek boyutlu ayarlarda genellikle daha sağlamdır.
Kaynaklar
- Ankerst, M., Breunig, M. M., Kriegel, H.-P., & Sander, J. (1999). OPTICS: Ordering points to identify the clustering structure. ACM SIGMOD Record, 28(2), 49–60. DOI: 10.1145/304181.304187 ↗
- Ester, M., Kriegel, H.-P., Sander, J., & Xu, X. (1996). A density-based algorithm for discovering clusters in large spatial databases with noise. Proceedings of the 2nd International Conference on Knowledge Discovery and Data Mining (KDD-96), 226–231. link ↗
- Aggarwal, C. C., & Reddy, C. K. (Eds.) (2013). Data Clustering: Algorithms and Applications (Ch. 4). CRC Press. ISBN: 978-1-4665-5821-2
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). OPTICS: Ordering Points To Identify the Clustering Structure. ScholarGate. https://scholargate.app/tr/machine-learning/optics
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- HDBSCANMakine öğrenmesi↔ karşılaştır
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır