Sağlam Yeniden Test Güvenilirliği
Robust Test-Retest Reliability · Ayrıca şöyle bilinir: robust temporal stability, outlier-resistant retest reliability, robust repeatability coefficient, robust intraclass correlation
Sağlam yeniden test güvenilirliği, bir ölçümün aynı bireyleri iki farklı zamanda ne kadar tutarlı bir şekilde sıraladığını veya puanladığını ölçerken, tahmini aykırı değerlerden ve normal olmayan puan dağılımlarından kaynaklanan bozulmalara karşı korur. Klasik Pearson tabanlı korelasyon ve standart ICC formüllerini konum, ölçek ve ilişki için sağlam tahmin edicilerle değiştirir veya bunlara ek olur.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Aynı ölçümü aynı gruba iki kez uyguladığınızda ve aykırı değerlerden, ağır kuyruklardan veya çarpık değişim puanı dağılımlarından şüpheleniyorsanız veya bunlara karşı korunmak istiyorsanız sağlam yeniden test güvenilirliğini kullanın. Özellikle aşırı puanların veri hatalarından ziyade özsel olarak yaygın olduğu klinik veya topluluk örneklemleri, tavan veya taban etkileri olan kısa ölçekler veya doğası gereği değişken fizyolojik ölçümler için uygundur. Örneklem büyükse (n > 200), puanlar açıkça normal ise ve aykırı değerler önceki veri temizleme kurallarıyla elenmişse daha az gereklidir. Alanınızdaki araştırma geleneği karşılaştırılabilirlik için standart bir Pearson veya ICC katsayısı gerektiriyorsa, bunu klasik güvenilirlik yerine kullanmayın; bu durumda her ikisini de raporlayın.
Güçlü yönler & sınırlılıklar
- Az sayıda aşırı veya hatalı puandan kaynaklanan güvenilirlik tahmininin şişirilmesinden veya azaltılmasından korur.
- Klinik ve uygulamalı psikometrik örneklemlerde yaygın olan normal olmayan, çarpık veya ağır kuyruklu puan dağılımları için uygundur.
- Bootstrap güven aralıkları, istatistiğin örnekleme dağılımına ilişkin parametrik varsayımlardan kaçınır.
- Hata dağılımı normal olmadığında bile, aykırı değer etkisinin azaltılmasından sonra zamansal tutarsızlık nedeniyle tek bir puanın gerçek puandan ne kadar farklı olabileceğini gösteren, orijinal ölçekte yorumlanabilir bir SEM verir.
- Hassasiyet analizi ile birleştirilebilir: sağlam ve klasik tahminlerin karşılaştırılması, aykırı değerlerin belirli bir veri kümesi için ne kadar önemli olduğunu ortaya koyar.
- Gerçekten normal dağılmış puanlar olduğunda, kırpma veya ağırlıklandırma bilginin atılmasına neden olduğu için Pearson tabanlı ICC'den biraz daha az istatistiksel olarak verimlidir.
- Tek bir evrensel olarak kabul edilmiş standart olmaması, yüzde-bükme, Winsorize edilmiş, M-tahmin edici tabanlı gibi birden fazla sağlam tahmin edicinin bulunması, çalışmalar arası karşılaştırmaları zorlaştırabilir.
- Daha geniş bootstrap aralıkları nedeniyle, küçük n'de klasik yöntemlerle aynı hassasiyeti elde etmek için daha büyük örneklemler gerektirir.
- Standart ICC'den uygulamalı hakemler tarafından daha az bilinir, bu nedenle raporlama ek gerekçelendirme ve geleneksel tahminle karşılaştırma içermelidir.
SSS
Sağlam yeniden test güvenilirliği, standart ICC'den tamamen farklı bir prosedür müdür?
Hayır. Tasarım ve kavramsal amaç — aynı kişilerin iki farklı zamanda ne kadar tutarlı puan aldığını ölçmek — aynıdır. Fark, tahmin edicidedir: sağlam yöntemler, güvenilirlik katsayısını hesaplamadan önce ortalamaları ve standart sapmaları aykırı değerlere dayanıklı karşılıklarıyla değiştirir. Elde edilen indeksin yorumlanması aynıdır.
Hangi sağlam tahminciyi seçmeliyim?
Yüzde-bükme korelasyonu ve Winsorize edilmiş korelasyon en çok alıntılananlardır. ICC türü tahminler için, Wilcox tarafından açıklanan kırpılmış ortalamalara dayalı yöntemler makul bir varsayılan değerdir. Seçiminizi ve kırpma kesrini veya bükme sabitini tahminle birlikte raporlayın, böylece okuyucular hassasiyeti değerlendirebilir.
Ne kadar örneklem büyüklüğü gereklidir?
Sağlam prosedürler, kırpma veya ağırlıklandırma etkili örneklem boyutunu azalttığı için, eşdeğer hassasiyeti elde etmek için genellikle klasik yöntemlerden biraz daha büyük örneklemler gerektirir. Minimum 50 katılımcı yaygın bir kaba tabandır; bootstrap güven aralıkları n = 100 veya daha fazla civarında daha kararlı hale gelir.
Her zaman sağlam tahmini klasik ICC'ye tercih etmeli miyim?
Zorunlu değil. Puan dağılımı normale yakınsa ve önemli aykırı değerler beklenmiyorsa, klasik ICC verimli ve yorumlanabilir. Sağlam tahminler, aykırı değerlerin özsel gerekçelerle olası olduğu durumlarda en değerlidir. Her ikisini de raporlamak, okuyucuların aşırı vakaların etkisini değerlendirmesine olanak tanır.
Yüksek bir sağlam yeniden test güvenilirliği katsayısı, ölçümün daha uzun süreler boyunca kararlı olduğunu kanıtlar mı?
Hayır. Katsayı, çalışmada kullanılan belirli aralığa bağlıdır. Daha uzun bir ufukta zamansal kararlılık, uygun bir aralıkla ayrı bir çalışmada değerlendirilmelidir. Bir haftalık yüksek bir katsayı, altı aylık kararlılık anlamına gelmez.
Kaynaklar
- Wilcox, R. R. (2012). Introduction to Robust Estimation and Hypothesis Testing (3rd ed.). Academic Press. ISBN: 978-0123869838
- Test-retest reliability. Wikipedia. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Robust Test-Retest Reliability. ScholarGate. https://scholargate.app/tr/psychometrics/robust-test-retest-reliability
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Doğrulayıcı faktör analizi (DFA)Psikometri↔ karşılaştır
- Cronbach'ın Alfa Katsayısı (Güvenilirlik Analizi)İstatistik↔ karşılaştır
- Değerlendiriciler Arası Güvenilirlik (Cohen Kappa ve ICC)Psikometri↔ karşılaştır