Topluluk K-En Yakın Komşu (Ensemble K-Nearest Neighbors)
Ensemble K-Nearest Neighbors (Aggregated KNN) · Ayrıca şöyle bilinir: Ensemble KNN, KNN ensemble, aggregated k-nearest neighbors, combined KNN
Topluluk K-En Yakın Komşu (Ensemble K-NN), her biri farklı bir k değeri, uzaklık metriği, özellik alt kümesi veya veri önyüklemesi (bootstrap) ile eğitilmiş birden çok K-NN modelini birleştirir ve tahminlerini çoğunluk oyu (sınıflandırma) veya ortalama alma (regresyon) yoluyla toplar. Bu yaklaşım, tek bir K-NN modelinde bulunan yüksek varyansı azaltır ve tablo verileri üzerinde daha kararlı, doğru tahminler üretir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Standart bir K-NN kabul edilebilir ancak kararsız sonuçlar verdiğinde ve temel algoritmayı değiştirmeden varyans azaltımı istediğinizde Topluluk K-NN'yi kullanın. Uzaklık yapısının anlamlı olduğu ve özellik ölçeklendirmenin uygulandığı küçük ila orta ölçekli tablo veri kümeleri için uygundur. Optimal k'nın belirsiz olduğu durumlarda özellikle yararlıdır: topluluk örtük olarak birden çok k değeri üzerinden ortalama alır. Veri kümesi çok büyük olduğunda (K-NN çıkarımı sorgu başına O(n) olarak ölçeklenir ve M üyenin çalıştırılması bu maliyeti çarpar); bunun yerine yaklaşık-en-yakın komşu yöntemlerini veya ağaç tabanlı toplulukları tercih edin. Ayrıca, zaten parametrik olmayan bir modelin üzerine bir katman daha eklediği için bireysel tahminlerin yorumlanabilirliği gerektiğinde kaçının.
Güçlü yönler & sınırlılıklar
- Tek bir K-NN'nin yüksek varyansını, temel algoritmayı değiştirmeden azaltır.
- Dağılımsal varsayım yok — duyarlı bir uzaklık metriği olan herhangi bir özellik uzayında çalışır.
- Çok sınıflı sınıflandırmayı ve regresyonu modifikasyon olmadan doğal olarak ele alır.
- k seçimine karşı dayanıklıdır: farklı k değerleri üzerinden ortalama alma, bu hiperparametreye duyarlılığı yumuşatır.
- Kolayca paralelleştirilebilir: her K-NN üyesi bağımsız olarak tahmin yapar.
- Çıkarım maliyeti, veri kümesi boyutunun topluluk üye sayısıyla çarpılmasıyla ölçeklenir, bu da büyük verilerde yavaş olmasına neden olur.
- Yüksek boyutlu verilerde performans düşer (boyutsallık laneti) — ağaç tabanlı topluluklardan daha şiddetli.
- Bellek yoğundur: tüm eğitim verileri her üye için saklanmalıdır.
- Veri kümesi küçük olduğunda veya özellikler zaten iyi ölçeklenmiş olduğunda, iyi ayarlanmış tek bir K-NN'ye göre kazançlar mütevazı olabilir.
SSS
Kaç tane K-NN üyesi dahil etmem gerektiğini nasıl seçmeliyim?
k (örneğin 3, 5, 7, 9, 11 gibi bir aralığı kapsayan) veya uzaklık metriği açısından farklılık gösteren 5-15 üye ile başlayın. Kazançlar genellikle hızla platoya ulaşır; 20-30'dan fazla üye nadiren performansı artırır ve çıkarım maliyetini doğrusal olarak artırır.
Topluluk K-NN, tablo verilerinde Rastgele Orman'dan (Random Forest) daha iyi performans gösterir mi?
Çoğu kıyaslamada, Rastgele Orman ve gradyan artırma (gradient boosting), tablo verilerinde Topluluk K-NN'den daha iyi performans gösterir, özellikle n > 1000 olduğunda veya özellik boyutları yüksek olduğunda. Topluluk K-NN, küçük, temiz ve belirgin bir uzaklık yapısına sahip veri kümelerinde en rekabetçidir.
Kategorik özelliklerle nasıl başa çıkarım?
K-NN sayısal bir uzaklık gerektirir. İkili veya sıralı kategorileri sayısal olarak kodlayın ve karma türdeki veriler için Hamming uzaklığı veya Gower uzaklığı kullanın. Herhangi bir uzaklık hesaplamadan önce tüm özelliklerin karşılaştırılabilir aralıklara ölçeklendirildiğinden emin olun.
Uzaklığa göre ağırlıklı oylama kullanabilir miyim?
Evet — uzaklık ağırlıklı K-NN (her komşunun oyu uzaklığının tersiyle ağırlıklandırılır) topluluklara doğal olarak genişler. Her üye kendi uzaklık ağırlıklı oyunu uygular ve topluluk bu ağırlıklı tahminleri toplar.
K-NN'nin açık bir eğitim aşaması olmasa da çapraz doğrulama gerekli midir?
Evet. K-NN parametreleri uydurmasa da, k, metrik ve topluluk boyutu seçimi, tutulmuş veriler üzerinde doğrulanması gereken hiperparametrelerdir. Bunları seçmek ve dürüst genelleme performansını raporlamak için k-katlı çapraz doğrulama kullanın.
Kaynaklar
- Domeniconi, C., & Yan, B. (2004). Nearest neighbor ensemble. In Proceedings of the 17th International Conference on Pattern Recognition (ICPR), Vol. 1, pp. 228–231. IEEE. DOI: 10.1109/ICPR.2004.1334065 ↗
- Zhou, Z.-H. (2012). Ensemble Methods: Foundations and Algorithms. Chapman and Hall/CRC. ISBN: 978-1-4398-3003-1
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Ensemble K-Nearest Neighbors (Aggregated KNN). ScholarGate. https://scholargate.app/tr/machine-learning/ensemble-k-nearest-neighbors
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Bagging (Önyükleme Toplama)Makine öğrenmesi↔ karşılaştır
- Topluluk Karar AğacıMakine öğrenmesi↔ karşılaştır
- Topluluk Destek Vektör MakinesiMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Oy Birliği TopluluğuMakine öğrenmesi↔ karşılaştır