Değerlendiriciler Arası Güvenilirlik (Cohen Kappa ve ICC)
Interrater Reliability (Cohen's κ and ICC) · Ayrıca şöyle bilinir: inter-rater reliability, interrater agreement, rater agreement, Değerlendiriciler Arası Güvenilirlik (Cohen's κ, ICC), Cohen's kappa and ICC
Değerlendiriciler arası güvenilirlik, iki veya daha fazla bağımsız değerlendiricinin aynı bireyleri veya ürünleri değerlendirirken ne derecede tutarlı puanlar ürettiğini ölçer. Bu yöntem ailesi, kategorik yargılar için 1960 yılında tanıtılan Cohen Kappa'yı ve sürekli derecelendirmeler için Sınıf İçi Korelasyon Katsayısı'nı (ICC) kapsar; birlikte davranışsal, sağlık ve eğitim araştırmalarında karşılaşılan çoğu ölçüm senaryosunu ele alırlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Değerlendiriciler arası güvenilirlik yöntemleri, iki veya daha fazla değerlendiricinin aynı birimleri bağımsız olarak puanladığı ve derecelendirmelerin tekrarlanabilir olduğunu göstermeniz gerektiği her durumda uygundur. Cohen Kappa, sonuç kategorik veya sıralı olduğunda (tanılar, şiddet dereceleri, içerik analizindeki nitel kodlar) kullanılır. ICC, derecelendirmeler sürekli veya ince derecelendirilmiş olduğunda (fiziksel ölçümler, ölçek puanları, Likert tipi ölçeklerde gözlemci derecelendirmeleri) kullanılır. Kararlı bir tahmin için yaklaşık olarak en az 20 denek gereklidir, ancak ICC için güç analizleri genellikle 30 veya daha fazlasını önerir. Tasarım, bağımsız derecelendirmeyi sağlamalıdır: değerlendiriciler birbirleriyle konuşmamalı, birbirlerinin puanlarına bakmamalı veya taşıma etkilerine neden olan sabit bir sırayla derecelendirme yapmamalıdır.
Güçlü yönler & sınırlılıklar
- İnsan tarafından üretilen puanlara dayanan herhangi bir çalışmada geçerli çıkarım için bir ön koşul olan ölçümün tekrarlanabilirliğini doğrudan ele alır.
- Kappa, şans anlaşmasını düzeltir, bu da ham yüzde anlaşmasından daha muhafazakar ve dürüst bir indeks sağlar.
- ICC, değerlendirici-denek tasarımlarının tam varyans yapısını modeller, tutarlılığı (kovaryasyon) mutlak anlaşmadan (sistematik yanlılık) ayırır, böylece araştırmacılar kendi esas sorularına uygun indeksi seçebilirler.
- Her iki istatistik de klinik, eğitim ve davranışsal araştırma topluluklarında yaygın olarak rapor edilir ve anlaşılır.
- Kappa, kategorilerin yaygınlığına duyarlıdır: bir kategori çok yaygın veya çok nadir olduğunda, marjinal toplamlar ulaşılabilir maksimum kappa'yı sınırlar, bu da farklı temel oranlara sahip çalışmalar arasında karşılaştırmaları yanıltıcı hale getirir.
- ICC, doğru varyans-bileşen modelinin (rastgele ve karma, tutarlılık ve mutlak anlaşma) belirtilmesini gerektirir; yanlış bir model seçimi, araştırma sorusuyla eşleşmeyen bir istatistik üretir.
- Her iki istatistik de örneklemdeki anlaşmayı tanımlar; hangi değerlendiricinin daha doğru olduğunu veya anlaşmazlıkların neden ortaya çıktığını teşhis etmezler.
SSS
Yüzde anlaşması yerine ne zaman kappa kullanmalıyım?
Şansı göz ardı etmek için özel bir nedeniniz olmadıkça her zaman. Yüzde anlaşması, bir kategori baskın olduğunda yanıltıcı derecede yüksek olabilir: vakaların %90'ı A kategorisindeyse, her şeye rastgele A atayan iki değerlendirici, hiçbir beceriye sahip olmasalar bile zamanın %81'inde aynı fikirde olacaktır. Kappa bunu düzeltir ve şansın tahmin ettiğinin üzerindeki anlaşma oranını verir.
Hangi ICC modelini seçmeliyim?
Seçim tasarımınıza bağlıdır. Değerlendiricileriniz daha büyük bir potansiyel değerlendirici havuzundan rastgele bir örneklem ise ve sonuçların diğer değerlendiricilere genellenmesini istiyorsanız, iki yönlü rastgele etkiler modelini kullanın. Uygulamada her zaman aynı sabit değerlendiriciler kullanılacaksa, iki yönlü karma etkiler modelini kullanın. Daha sonra tutarlılık (sabit bir değerlendirici ofseti önemli olmadığında kabul edilebilir) ve mutlak anlaşma (değerlendiriciler arasındaki sistematik farklılıklar kararları etkileyecekse gereklidir) arasında karar verin.
Kaç değerlendiriciye ve deneğe ihtiyacım var?
Kararlı bir ICC tahmini için yaygın bir öneri en az 30 denek ve en az iki değerlendiricidir, ancak daha fazla değerlendirici ve denek hassasiyeti artırır. ICC için yayınlanmış güç analizi yöntemleri (örn. Bonett 2002), hedeflenen güven aralığı genişliği için örneklem büyüklüğü planlamasına rehberlik edebilir.
Aynı çalışmada ICC ve kappa'yı birleştirebilir miyim?
Evet ve bazen uygundur. Enstrümanınız hem sürekli alt ölçek puanlarına hem de kategorik genel sınıflandırmalara sahipse, sürekli puanlar için ICC'yi ve kategorik sınıflandırmalar için kappa'yı (veya ağırlıklı kappa'yı) rapor edin. Her istatistiği güven aralığı ve kullanılan model veya ağırlıklandırma şeması ile birlikte rapor edin.
Kaynaklar
- Cohen, J. (1960). A Coefficient of Agreement for Nominal Scales. Educational and Psychological Measurement, 20(1), 37–46. DOI: 10.1177/001316446002000104 ↗
- Koo, T.K. & Li, M.Y. (2016). A Guideline of Selecting and Reporting Intraclass Correlation Coefficients for Reliability Research. Journal of Chiropractic Medicine, 15(2), 155–163. DOI: 10.1016/j.jcm.2016.02.012 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Interrater Reliability (Cohen's κ and ICC). ScholarGate. https://scholargate.app/tr/psychometrics/interrater-reliability
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Bland-Altman Yöntem Karşılaştırma Analiziİstatistik↔ karşılaştır
- Cohen Kappa Katsayısıİstatistik↔ karşılaştır
- Cronbach'ın Alfa Katsayısı (Güvenilirlik Analizi)İstatistik↔ karşılaştır
- Çoklu Derecelendirici Uyumuna Yönelik Fleiss Kappa Katsayısıİstatistik↔ karşılaştır
- Genelleştirilebilirlik Kuramı (G-Kuramı)Psikometri↔ karşılaştır
- Sınıf İçi Korelasyon Katsayısı (ICC)İstatistik↔ karşılaştır