Düzenlileştirilmiş k-En Yakın Komşu
Regularized k-Nearest Neighbors (Kernel-Weighted kNN) · Ayrıca şöyle bilinir: regularized kNN, kernel-weighted kNN, distance-regularized nearest neighbors, kNN with regularization
Düzenlileştirilmiş k-En Yakın Komşu (kNN), çekirdek tabanlı uzaklık ağırlıklandırması veya bant genişliği kontrolü gibi düzenlileştirme mekanizmalarını içerecek şekilde klasik en yakın komşu algoritmasını genişletir. Bu mekanizmalar tahminleri yumuşatır, k seçimine duyarlılığı azaltır ve varyansı düşürür. Sonuç, tablo verileri üzerindeki sınıflandırma ve regresyon görevleri için daha kararlı ve daha iyi kalibre edilmiş bir örnek tabanlı öğrenicidir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Karmaşık yerel yapıyı küresel bir fonksiyonel form varsaymadan yakalayabilen esnek, parametrik olmayan bir sınıflandırıcı veya regresöre ihtiyaç duyduğunuzda ve örneklem boyutu orta düzeyde olduğunda (yaklaşık 100–10.000 gözlem) komşuluğun iyi doldurulmuş olması durumunda düzenlileştirilmiş kNN'yi kullanın. Uygun ölçeklendirmeden sonra sürekli veya karışık türdeki özelliklerle iyi çalışır. Çok yüksek boyutlu verilerde (boyutsallık laneti, yaklaşık 20–30 özellikten sonra uzaklıkları anlamsız hale getirir), çok büyük veri kümelerinde (tahmin maliyeti eğitim kümesi boyutuna göre ölçeklenir) veya açık katsayılara sahip şeffaf bir parametrik modelin gerektiği durumlarda kullanmayın.
Güçlü yönler & sınırlılıklar
- Parametrik olmayan ve varsayımları hafif: veriler üzerinde dağılımsal gereksinimleri yoktur.
- Çekirdek ağırlıklandırması tahminleri yumuşatır ve k'nin tam seçimine duyarlılığı azaltır.
- Yerel veri yoğunluğuna ve doğrusal olmayan karar sınırlarına doğal olarak uyum sağlar.
- Uygulaması basittir ve alternatif uzaklık metrikleri veya öğrenilmiş metriklerle genişletilebilir.
- Bant genişliği ve k, prensipli düzenlileştirme için çapraz doğrulama yoluyla ortaklaşa ayarlanabilir.
- Tahmin maliyeti, hızlandırma yapıları olmadan sorgu başına O(n)'dir, bu da onu büyük veri kümelerinde yavaşlatır.
- Boyutsallık lanetinden ciddi şekilde muzdariptir: yüksek boyutlu özellik uzaylarında uzaklıklar tekdüze olarak büyük ve anlamsız hale gelir.
- Dikkatli özellik ölçeklendirmesi gerektirir; sonuçlar seçilen uzaklık metriğine oldukça duyarlıdır.
- Açık model katsayıları veya özellik önemleri üretilmez, bu da yorumlanabilirliği sınırlar.
- Bellek yoğun: tam eğitim kümesinin çıkarım zamanında saklanması gerekir.
SSS
Standart kNN ile düzenlileştirilmiş kNN arasındaki fark nedir?
Standart kNN, mesafeden bağımsız olarak tüm k komşularına eşit ağırlık verir. Düzenlileştirilmiş kNN, bant genişliği parametresi h ile kontrol edilen bir çekirdek ağırlıklandırma fonksiyonu uygular, böylece daha yakın komşular daha fazla katkıda bulunur. Bu, tahminleri yumuşatır ve k'nin tam değerine duyarlılığı azaltır.
k ve bant genişliği h'yi nasıl seçerim?
Her ikisi de çapraz doğrulama yoluyla ortaklaşa seçilmesi gereken düzenlileştirme hiperparametresidir. Daha büyük k ve daha büyük h, daha yumuşak, daha düşük varyanslı tahminler üretir; daha küçük değerler daha yerel olarak uyarlanabilir ancak daha yüksek varyanslı tahminler üretir. k-katlı çapraz doğrulama ile (k, h) çiftleri üzerinde grid search standart yaklaşımdır.
Düzenlileştirilmiş kNN kategorik özelliklerle çalışır mı?
Gower uzaklığı gibi kategorik özellikleri işleyen bir uzaklık metriği gerektirir. Alternatif olarak, kategorik değişkenleri sayısal olarak kodlayın (örneğin, hedef kodlama) ve uygun ölçeklendirme ile dahil edin. Uygun bir metrik olmadan, uzaklıklar anlamlı benzerliği yansıtmaz.
Düzenlileştirilmiş kNN'yi neden düzenlileştirilmiş bir parametrik modele tercih etmeliyim?
Veri üreten ilişkinin yüksek derecede doğrusal olmayan ve yerel olarak yapılandırılmış olduğu durumlarda, düzenlileştirilmiş kNN, özellik mühendisliği gerektirmeden parametrik modellerden daha iyi performans gösterebilir. Ancak, açık katsayılar, hızlı tahmin veya yüksek boyutlu verilerin işlenmesi gerekiyorsa, düzenlileştirilmiş lojistik veya doğrusal regresyon daha uygundur.
Kaç tane eğitim gözlemine ihtiyacım var?
Pratik bir alt sınır yaklaşık 100 gözlemdir ve performans yaklaşık 10.000'e kadar önemli ölçüde iyileşir. 100'ün altında, komşuluk yetersiz doldurulur ve çapraz doğrulama tahminleri güvenilmez hale gelir. Yaklaşık 50.000 gözlemin üzerinde, tahmin maliyetini kontrol etmek için yaklaşık en yakın komşu yapılarını (örneğin, KD-ağaçları, top ağaçları) düşünün.
Kaynaklar
- Cover, T. & Hart, P. (1967). Nearest neighbor pattern classification. IEEE Transactions on Information Theory, 13(1), 21–27. DOI: 10.1109/TIT.1967.1053964 ↗
- Hastie, T., Tibshirani, R. & Friedman, J. (2009). The Elements of Statistical Learning (2nd ed., Ch. 13). Springer. ISBN: 978-0-387-84858-7
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Regularized k-Nearest Neighbors (Kernel-Weighted kNN). ScholarGate. https://scholargate.app/tr/machine-learning/regularized-k-nearest-neighbors
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gauss SüreciMakine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Gauss SüreciMakine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Lojistik RegresyonMakine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Destek Vektör MakinesiMakine öğrenmesi↔ karşılaştır