Çevrimiçi K-ortalamalar
Online K-means Clustering (Sequential / Streaming K-means) · Ayrıca şöyle bilinir: sequential k-means, streaming k-means, incremental k-means, online clustering
Çevrimiçi K-ortalamalar, tüm veri kümesini bellekte saklamadan, küme merkezlerini tek tek veya küçük yığınlar halinde güncelleyen klasik K-ortalamalar algoritmasının bir akış varyantıdır. Özellikle toplu yeniden hesaplamanın çok yavaş veya pratik olmayacağı büyük ölçekli, gerçek zamanlı veya sürekli gelen veriler için uygundur.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Veri kümesi belleğe sığamayacak kadar büyük olduğunda, veriler bir akış olarak geldiğinde ve kümelerin sürekli güncellenmesi gerektiğinde veya aşağı akış gerçek zamanlı uygulamalar için hızlı yaklaşık kümeleme gerektiğinde Çevrimiçi K-ortalamaları kullanın. Ayrıca, toplu K-ortalamalara ölçeklenebilir bir alternatif olarak çok büyük statik veri kümeleri için pratik bir seçenektir. K küme sayısı bilinmiyorsa ve dirsek veya siluet analizi mümkün değilse; kümeler küresel değilse veya çok farklı yoğunluklara sahipse (DBSCAN veya GMM tercih edilir); veya küçük, statik bir veri kümesi üzerinde yüksek kümeleme hassasiyeti gerekiyorsa (toplu K-ortalamalar daha güvenilir bir şekilde yakınsar) kullanmayın.
Güçlü yönler & sınırlılıklar
- Veriyi tek geçişte işler, bu da mevcut RAM'i aşan veri kümeleri için uygulanabilir hale getirir.
- Akış verilerine veya sürekli güncellenen verilere tam yeniden hesaplama yapmadan doğal olarak uyum sağlar.
- Güncelleme başına hesaplama açısından hafiftir: nokta başına O(K·d), burada d özellik boyutudur.
- Mini-yığın varyantı (Sculley 2010), toplu K-ortalamalar ile neredeyse aynı kümeleme kalitesinde daha fazla hızlanma sağlar.
- Kolayca paralelleştirilebilir: mini-yığınlar işçiler arasında eşzamanlı olarak işlenebilir.
- K'nın seçimine duyarlıdır; küme sayısının önceden belirtilmesini gerektirir.
- Küresel, kabaca eşit boyutlu kümeler varsayar; uzatılmış veya yoğunluğu değişen küme şekillerinde kötü performans gösterir.
- Merkez tahminleri, yeterli veri görülmeden önce akışın başlarında gürültülü olabilir.
- Özellik ölçeğine göre değişmezdir — kümelemeden önce özellikler standartlaştırılmalıdır.
- Sonuçlar rastgele başlatmaya bağlıdır; K-ortalamalar++ başlatması şiddetle tavsiye edilir.
SSS
Çevrimiçi K-ortalamalar, Mini-Yığın K-ortalamalar'dan nasıl farklıdır?
Çevrimiçi K-ortalamalar tek seferde bir noktayı işler; Mini-Yığın K-ortalamalar (Sculley 2010) küçük rastgele yığınları işler ve yakınsama hızını artıran biraz değiştirilmiş bir merkez güncelleme kuralı kullanır. Her ikisi de akış varyantlarıdır; Mini-Yığın, modern donanımda daha iyi vektörleştirmesi nedeniyle pratikte daha yaygın olarak kullanılır.
Akış ortamında K'yı nasıl seçerim?
Önce temsili bir veri alt örneği üzerinde toplu veya Mini-Yığın K-ortalamaları çalıştırın, K'yı belirlemek için dirsek veya siluet analizi kullanın. Ardından K'yı sabitleyin ve Çevrimiçi K-ortalamaları, bu başlatılmış merkezlerle tam akış üzerinde dağıtın.
Çevrimiçi K-ortalamalar, toplu K-ortalamalar ile aynı çözüme yakınsar mı?
Asimptotik olarak evet, durağan veriler ve azalan bir öğrenme oranı verildiğinde. Pratikte, erken gürültü ve yerel minimumlar biraz farklı çözümlere yol açabilir, bu nedenle birden fazla yeniden başlatma (K-ortalamalar++ başlatması ile) ve son bir değerlendirme adımı önerilir.
Veri dağılımı zamanla değişirse (kavram kayması) ne olur?
Standart Çevrimiçi K-ortalamalar kavram kaymasını işlemez; eski gözlemler merkezleri kalıcı olarak etkiler. Kaymayla başa çıkmak için, eski noktaların ağırlığını azaltan pencereli veya azalan ağırlıklı bir varyant kullanın veya periyodik olarak merkezleri son verilere göre yeniden başlatın.
Özelliklerimi ölçeklendirmeli miyim?
Evet. Çevrimiçi K-ortalamalar, yüksek varyanslı özelliklerin hakim olduğu Öklid mesafesini kullanır. Kümelemeden önce standart ölçeklendirme (sıfır ortalama, birim varyans) veya min-maks ölçeklendirme uygulayın, tüm verileri depolamaktan kaçınmak için ölçekleyiciyi yalnızca temsili bir alt örneğe uydurun.
Kaynaklar
- MacQueen, J. (1967). Some methods for classification and analysis of multivariate observations. In Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, Vol. 1, pp. 281–297. University of California Press. link ↗
- Sculley, D. (2010). Web-scale k-means clustering. In Proceedings of the 19th International Conference on World Wide Web (WWW 2010), pp. 1177–1178. ACM. DOI: 10.1145/1772690.1772862 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Online K-means Clustering (Sequential / Streaming K-means). ScholarGate. https://scholargate.app/tr/machine-learning/online-k-means
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Hiyerarşik KümelemeMakine öğrenmesi↔ karşılaştır
- K-Means KümelemeMakine öğrenmesi↔ karşılaştır
- Öz-düzenleyen harita (Kohonen Haritası)Makine öğrenmesi↔ karşılaştır