Çoklu Derecelendirici Uyumuna Yönelik Fleiss Kappa Katsayısı
Fleiss' Kappa for Multiple Rater Agreement · Ayrıca şöyle bilinir: multi-rater kappa, Fleiss kappa, Fleiss' Kappa (Çoklu Değerlendirici Uyumu)
Fleiss Kappa katsayısı, öğeleri karşılıklı olarak dışlayıcı nominal kategorilere ayıran üç veya daha fazla derecelendirici arasındaki uyum derecesini ölçmek için kullanılan parametrik olmayan bir istatistiktir. Joseph L. Fleiss tarafından 1971 yılında Cohen Kappa katsayısının ikiden fazla derecelendiriciye genelleştirilmesi olarak tanıtılan bu katsayı, gözlemlenen uyumu yalnızca şans eseri beklenen uyum düzeyine göre düzeltir ve bu da onu tıbbi teşhis çalışmaları, içerik analizi ve çoklu kodlayıcı araştırmalarında standart bir güvenilirlik endeksi haline getirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Fleiss Kappa katsayısını, üç veya daha fazla bağımsız derecelendiricinin her birinin sabit bir nominal (sırasız) kategori kümesi kullanarak aynı öğe kümesini değerlendirdiği ve temel sorunun derecelendirici uyumunun şansı aşıp aşmadığı olduğu durumlarda kullanın. Temel varsayımlar şunlardır: (1) her öğeye atanan derecelendirici sayısı öğeler arasında sabittir, (2) kategoriler sabittir ve karşılıklı olarak dışlayıcıdır ve (3) derecelendirmeler bağımsızdır. İstatistik yalnızca nominal kategoriler için tasarlanmıştır; sıralı kategoriler için, daha büyük uyumsuzlukları daha ağır cezalandıran ağırlıklı bir varyant tercih edilir. Yalnızca iki derecelendirici olduğunda, Cohen Kappa katsayısı uygun seçimdir.
Güçlü yönler & sınırlılıklar
- Cohen Kappa katsayısını herhangi bir sayıda derecelendiriciye genişletir ve aynı derecelendiricilerin her öğeyi değerlendirmesini gerektirmez, bu da onu büyük açıklama projeleri için oldukça pratik hale getirir.
- Basit yüzde uyumunun aksine, şans eseri uyumu düzeltir ve daha dürüst bir güvenilirlik tahmini sağlar.
- Yaygın olarak rapor edilen kıyaslama kuralları (Landis ve Koch, 1977), sonuçların disiplinler arası yorumlanabilirliğini sağlar.
- Verilerin normal dağılmasını gerektirmez, bu da onu herhangi bir kategorik sınıflandırma görevi için uygun hale getirir.
- Yalnızca nominal (sırasız) kategoriler için geçerlidir; sıralı derecelendirmeler için ağırlıklı bir Fleiss Kappa katsayısı gereklidir.
- κ değeri kategorilerin yaygınlığına duyarlıdır; bir kategori baskın olduğunda, beklenen uyum yüksek olur ve derecelendiriciler sıklıkla hemfikir olsa bile κ paradoksal olarak düşük olabilir.
- Öğe başına sabit sayıda derecelendirici varsayar; değişken sayıda derecelendirici Krippendorff Alpha gibi alternatif yaklaşımlar gerektirir.
- Büyük örneklem normal yaklaşımı z-testinin temelini oluşturur; yaklaşık 20'den az öğe olduğunda p-değeri güvenilir olmayabilir.
SSS
Fleiss Kappa katsayısı ile Cohen Kappa katsayısı arasındaki fark nedir?
Cohen Kappa katsayısı (1960), aynı öğeleri değerlendiren tam olarak iki derecelendirici için tasarlanmıştır. Fleiss Kappa katsayısı (1971), istatistiği üç veya daha fazla derecelendiriciye genelleştirir ve ayrıca, öğe başına derecelendirici sayısı sabit olduğu sürece, farklı derecelendirici alt kümelerinin farklı öğeleri değerlendirmesine izin verir. Yalnızca iki derecelendiriciniz varsa Cohen Kappa katsayısını kullanın; üç veya daha fazla derecelendiriciyle Fleiss Kappa katsayısını kullanın.
κ değerini nasıl yorumlarım?
Landis ve Koch (1977) en çok alıntı yapılan ölçütleri önermiştir: 0.20'nin altı = zayıf, 0.21–0.40 = orta, 0.41–0.60 = iyi, 0.61–0.80 = önemli, 0.80'in üzeri = neredeyse mükemmel. Bunlar yasalar değil, geleneklerdir. Klinik teşhis gibi yüksek riskli alanlarda, birçok uygulayıcı bir derecelendirme şemasının yeterince güvenilir kabul edilmesi için κ ≥ 0.80 olmasını gerektirir.
Fleiss Kappa katsayısı sıralı kategorileri işleyebilir mi?
Standart formül tüm uyumsuzlukları eşit şekilde ele alır ve bu nedenle yalnızca nominal (sırasız) kategoriler için uygundur. Sıralı derecelendirmeler için — bir adım farkla anlaşmazlığın üç adım farkla anlaşmazlıktan daha az ciddi olduğu durumlarda — daha büyük uyumsuzlukları daha ağır cezalandıran ağırlıklı bir Fleiss Kappa katsayısı sürümü kullanılmalıdır.
Önerilen minimum örneklem büyüklüğü nedir?
Genel bir kural olarak, analiz, kararlı tahminler ve güvenilir bir büyük örneklem z-testi elde etmek için en az 20 öğe (denek veya vaka) gerektirir. Çok az öğe olduğunda, standart hata için asimptotik normal yaklaşım bozulur ve bootstrap güven aralıkları tavsiye edilir.
Kaynaklar
- Fleiss, J.L. (1971). Measuring Nominal Scale Agreement Among Many Raters. Psychological Bulletin, 76(5), 378–382. DOI: 10.1037/h0031619 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Fleiss' Kappa for Multiple Rater Agreement. ScholarGate. https://scholargate.app/tr/statistics/fleiss-kappa
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Cohen Kappa Katsayısıİstatistik↔ karşılaştır
- İstatistiksel Güvenilirlik AnaliziGüvenilirlik↔ karşılaştır