Test-Tekrar Güvenilirliği
Test-Retest Reliability · Ayrıca şöyle bilinir: stability reliability, temporal stability, repeatability coefficient, TRT reliability
Test-tekrar güvenilirliği, aynı katılımcılardan iki ayrı zamanda elde edilen puanların korelasyonu yoluyla bir ölçümün zamansal tutarlılığını nicelleştirir. Psikometrik doğrulamanın temel taşıdır ve altta yatan yapıda bir değişiklik olmadığında bir ölçeğin veya aracın kararlı puanlar üretip üretmediğini doğrudan gösterir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+9 tane daha
Ne zaman kullanılır
Psikometrik bir doğrulama çalışmasının parçası olarak, özellikle teorik olarak seçilen aralık boyunca kararlı olan yapılar (örneğin, kişilik özellikleri, kronik semptomlar, bilişsel yetenek) için bir ölçeğin veya ölçümün zamansal kararlılığını göstermeniz gerektiğinde test-tekrar güvenilirliğini kullanın. Dahili tutarlılığın tahmin edilemediği performans tabanlı veya gözlemci tarafından derecelendirilen ölçümler için birincil güvenilirlik kanıtıdır. Hızla değişen durumları (örneğin, ruh hali, ağrı yoğunluğu) ölçen araçlar için tek güvenilirlik kanıtı olarak test-tekrar kullanmayın ve teorik veya pratik olarak uygun bir tekrar test aralığının gerekçelendirilemediği durumlarda kullanmayın. Ayrıca, uygulamalar arasındaki katılımcı kaybı önemliyse, seçici düşüş korelasyon tahminini bozduğu için uygun değildir.
Güçlü yönler & sınırlılıklar
- Kararlı yapılar için en pratik olarak ilgili güvenilirlik biçimi olan zamansal kararlılığı doğrudan yakalar.
- Birden fazla paralel öğe gerektirmeden herhangi bir ölçüm formatına — anketler, performans testleri, gözlemci derecelendirmeleri, fizyolojik göstergeler — uygulanabilir.
- r_tt'den türetilen ölçümün standart hatası, bireysel puanlar etrafında klinik olarak yorumlanabilir güven aralıklarına olanak tanır.
- Hesaplanması ve raporlanması basittir ve hakemler ve uygulayıcılar tarafından evrensel olarak anlaşılır.
- Sınıf içi korelasyon varyantları, hem sıralama düzeni tutarlılığını hem de mutlak puan uyumunu aynı anda değerlendirmeye olanak tanır.
- Uygulamalar arası bir aralık seçmek zordur: evrensel olarak doğru tek bir aralık yoktur ve yanlış seçim tahmini artırabilir veya azaltabilir.
- Reaktif etkiler — hafıza, pratik, yorgunluk, duyarlılık — aracın ve aralığın bağlı olarak yeniden test korelasyonunu yukarı veya aşağı yönlü etkileyebilir.
- Gerçekten hızla değişen yapılar (durumlar, akut semptomlar) için düşük bir r_tt, zayıf güvenilirliği gerçek puan değişiminden ayırt etmez.
- Zaman noktaları arasındaki katılımcı kaybı, düşüş ölçülen yapıyla ilişkiliyse seçilim yanlılığına neden olur.
- Tek bir r_tt katsayısı yalnızca bir ölçüm hatası kaynağını (zaman) yakalar; öğe örneklemesinden veya puanlayıcı tutarsızlığından kaynaklanan hatayı yansıtmaz.
SSS
Test-tekrar güvenilirliği ile dahili tutarlılık arasındaki fark nedir?
Dahili tutarlılık (örneğin, Cronbach's alpha), tek bir uygulamadaki öğelerin bir yapıyı ne kadar homojen bir şekilde ölçtüğünü yansıtır — tek bir test durumundan tahmin edilir. Test-tekrar güvenilirliği zamansal kararlılığı yansıtır — iki uygulamadan tahmin edilir ve ölçüm hatası nedeniyle puanların zamanla ne kadar dalgalandığını yakalar. Bunlar farklı güvenilirlik kanıtı kaynaklarıdır ve tam bir psikometrik doğrulamada her ikisi de raporlanmalıdır.
Pearson r mi yoksa sınıf içi korelasyon katsayısı (ICC) mı kullanmalıyım?
Pearson r yalnızca sıralama düzeni uyumunu ölçer ve durumlar arasındaki ortalamadaki sistematik kaymalara duyarsızdır. ICC, hem sıralama düzeni uyumunu hem de mutlak uyumu ölçer, bu da yalnızca sıralamanın değil, puanların düzeyinin de önemli olduğu durumlarda onu daha uygun hale getirir. Çoğu klinik ve sağlık uygulaması için, iki yönlü karışık model ve mutlak uyum ile ICC tercih edilen indekstir.
Test ve tekrar test arasındaki aralık ne kadar uzun olmalı?
Evrensel olarak doğru bir aralık yoktur. Hafıza ve pratik etkilerini en aza indirecek kadar uzun (tipik olarak kendi kendine raporlama ölçekleri için en az iki hafta) ancak hedef yapının anlamlı bir şekilde değişmesinin beklenmeyeceği kadar kısa olmalıdır. Seçilen aralık, herhangi bir yayında teorik gerekçelere dayanılarak raporlanmalı ve gerekçelendirilmelidir.
Minimum kabul edilebilir test-tekrar katsayısı nedir?
Geleneksel eşikler araştırma araçları için r >= 0.70 ve uygulamalı veya klinik kararlarda kullanılan araçlar için r >= 0.80'dir. Bunlar katı kurallar değil, kılavuzlardır; yüksek derecede dinamik yapılar için daha düşük bir değer kabul edilebilir ve yüksek riskli bireysel değerlendirmeler için daha yüksek bir değer gereklidir.
Az sayıda öğesi olan kısa bir ölçek için test-tekrar güvenilirliği hesaplanabilir mi?
Evet. Dahili tutarlılığın aksine, test-tekrar güvenilirliği birden fazla öğe gerektirmez — tek bir öğe ölçümü veya bir indeks puanı için hesaplanabilir. Bu, onu kısa veya tek öğeli araçların kararlılığını göstermek için özellikle değerli kılar.
Kaynaklar
- Nunnally, J. C. & Bernstein, I. H. (1994). Psychometric Theory (3rd ed.). McGraw-Hill. ISBN: 978-0070478497
- Anastasi, A. & Urbina, S. (1997). Psychological Testing (7th ed.). Prentice Hall. ISBN: 978-0023030857
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Test-Retest Reliability. ScholarGate. https://scholargate.app/tr/psychometrics/test-retest-reliability
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Doğrulayıcı faktör analizi (DFA)Psikometri↔ karşılaştır
- Genelleştirilebilirlik Kuramı (G-Kuramı)Psikometri↔ karşılaştır
- Değerlendiriciler Arası Güvenilirlik (Cohen Kappa ve ICC)Psikometri↔ karşılaştır
- Ölçme Değişmezliği TestiPsikometri↔ karşılaştır