Lojistik Regresyon (YZ)
Logistic Regression (Machine Learning Classification Model) · Ayrıca şöyle bilinir: logit model, logit regression, binomial logistic regression, maximum entropy classifier
Lojistik regresyon, ikili (veya çok terimli) bir sonucun log-olasılıklarını öngörücülere doğrusal bir fonksiyon olarak modelleyen temel bir olasılıksal sınıflandırıcıdır. D. R. Cox tarafından 1958'de tanıtılan bu yöntem, istatistik ve makine öğrenmesi alanlarında en yaygın kullanılan ve yorumlanabilir sınıflandırma yöntemlerinden biri olmaya devam etmektedir; kalibre edilmiş olasılık çıktıları ve net katsayı yorumlaması nedeniyle değerlidir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+2 tane daha
Ne zaman kullanılır
Sonuç ikili veya kategorik olduğunda, örneklem büyüklüğü en az orta düzeyde olduğunda (bir kural olarak öngörücü başına en az 10 olay), ve yorumlanabilir katsayılar veya kalibre edilmiş olasılıklar gerektiğinde lojistik regresyonu kullanın. Sosyal bilimler, tıp ve epidemiyoloji alanlarında varsayılan temel sınıflandırıcıdır ve daha karmaşık modellerden önce denenmelidir. Karar sınırı güçlü bir şekilde doğrusal olmayan olduğunda, birçok etkileşim terimi gerektiğinde veya karmaşık tablo verilerinde tahmin doğruluğu yorumlanabilirlikten daha önemli olduğunda kaçının — bu durumlarda ağaç tabanlı topluluklar veya SVM'ler tipik olarak daha iyi performans gösterir.
Güçlü yönler & sınırlılıklar
- Sadece etiketler değil, sıralama ve karar eşikleme için doğrudan kullanılabilen kalibre edilmiş sınıf olasılıkları üretir.
- Katsayılar, klinik, sosyal bilimler ve politika araştırmalarında beklenen standartları karşılayan log-olasılık oranları olarak yorumlanabilir.
- Büyük veri kümelerinde bile hesaplama açısından hızlı ve bellek açısından verimlidir.
- Düzenlileştirilmiş varyantlar (Ridge, Lasso, Elastic Net) yüksek boyutlu özellikleri ele alır ve otomatik özellik seçimi yapar.
- Ayrımcı analize göre varsayım açısından hafiftir: öngörücülerin çok değişkenli normalliğini gerektirmez.
- Sağlam ve iyi anlaşılmış; karmaşık modellerin karşılaştırılması gereken güçlü, güvenilir bir temel oluşturur.
- Özellikler ile sonucun log-olasılığı arasında doğrusal bir ilişki olduğunu varsayar; doğrusal olmayan desenler manuel özellik mühendisliği veya doğrusal olmayan bir model gerektirir.
- Öngörücüler arasındaki çoklu doğrusallığa duyarlıdır: ilişkili özellikler katsayı standart hatalarını şişirir ve tahminleri dengesizleştirir.
- Öngörücü başına makul sayıda olay gerektirir (kural olarak: en az 10); seyrek sonuç sınıfları yakınsama sorunlarına ve aşırı uyuma neden olur.
- Birçok etkileşim içeren karmaşık tablo verilerinde topluluk yöntemlerinden (rastgele orman, gradyan artırma) daha düşük performans gösterebilir.
SSS
Lojistik regresyonu rastgele ormana ne zaman tercih etmeliyim?
Kalibre edilmiş olasılıklara, yorumlanabilir katsayılara ihtiyaç duyduğunuzda veya klinik denemeler veya politika değerlendirmeleri gibi açık olasılık oranları gerektiren raporlama standartlarını karşılamanız gerektiğinde. Rastgele orman tipik olarak daha yüksek tahmin doğruluğu elde eder ancak doğrudan katsayı yorumlaması sağlamaz.
Kaç gözleme ihtiyacım var?
Yaygın olarak atıfta bulunulan bir kural, öngörücü değişken başına en az 10 olaydır (pozitif sonuçlar). Daha az olay olduğunda, parametre tahminleri kararsızlaşır ve güven aralıkları güvenilmez hale gelir. Düzenlileştirme veya cezalandırılmış olabilirlik, kullanılabilir aralığı bir miktar genişletebilir.
Özelliklerimi standartlaştırmalı mıyım?
Tahmin için özelliklerin standartlaştırılması gerekli değildir, ancak katsayı büyüklüklerini öngörücüler arasında karşılaştırırken veya düzenlileştirme (L1 veya L2) kullanırken önemlidir, çünkü cezalar tüm katsayıları aynı ölçekte ele alır.
İkili ve çok terimli lojistik regresyon arasındaki fark nedir?
İkili lojistik regresyon, sigmoid fonksiyonunu kullanarak iki sınıflı bir sonucu modeller. Çok terimli (softmax) lojistik regresyon, bunu üç veya daha fazla sırasız sınıf için genelleştirir ve her sınıf için bir referans sınıfa göre bir katsayı seti tahmin eder.
Sınıf dengesizliğiyle nasıl başa çıkarım?
Kayıp fonksiyonunu yeniden ağırlıklandırmak için scikit-learn'de class_weight='balanced' ayarlayın veya azınlık sınıfını aşırı örnekleyin (SMOTE). Doğruluk yerine her zaman AUC-ROC ve hassasiyet-geri çağırma eğrileri ile değerlendirin ve sınıflandırma eşiğini bir doğrulama kümesinde ayarlayın.
Kaynaklar
- Cox, D. R. (1958). The regression analysis of binary sequences. Journal of the Royal Statistical Society, Series B, 20(2), 215–242. DOI: 10.1111/j.2517-6161.1958.tb00292.x ↗
- James, G., Witten, D., Hastie, T. & Tibshirani, R. (2013). An Introduction to Statistical Learning (Ch. 4). Springer. ISBN: 978-1-4614-7138-7
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Logistic Regression (Machine Learning Classification Model). ScholarGate. https://scholargate.app/tr/machine-learning/logistic-regression-ml
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Karar AğacıMakine öğrenmesi↔ karşılaştır
- Doğrusal Regresyon (ML)Makine öğrenmesi↔ karşılaştır
- Naive BayesMakine öğrenmesi↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Lojistik RegresyonMakine öğrenmesi↔ karşılaştır