Eksik Veri ile MCMC
Markov Chain Monte Carlo with Missing Data · Ayrıca şöyle bilinir: MCMC missing data, data augmentation MCMC, Bayesian multiple imputation, MCMC imputation
Eksik veri ile MCMC, gözlemlenmeyen değerleri ek bilinmeyen parametreler olarak ele alan Bayesci bir hesaplama stratejisidir. Eksik değerleri kendi öngörüsel dağılımlarından örnekleme ile model parametrelerini kendi sonsal dağılımlarından örnekleme arasında gidip gelerek, algoritma eksiklikten kaynaklanan belirsizliği tam olarak hesaba katan geçerli bir birleşik sonsal dağılım üretir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+3 tane daha
Ne zaman kullanılır
Bayesci bir çerçeve içinde zaten çalıştığınız ve eksik rastgele (MAR) veya tamamen rastgele eksik (MCAR) varsayımı altında eksik verilerin ilkeli bir şekilde ele alınmasını gerektirdiğiniz durumlarda MCMC'yi eksik verilerle kullanın — boylamsal çalışmalar, klinik deneyler ve anket araştırmalarında yaygındır. Rastgele silme veya tekli doldurmaya göre daha üstündür çünkü eksiklik belirsizliğini tüm çıkarımlara yayar. Rastgele eksik olmayan (MNAR) verilerde eksiklik mekanizmasını açıkça modellemeden veya eksikliğin ihmal edilebilir olduğu (yüzde 5'ten az) ve tam vaka analizinin yeterli olacağı durumlarda kullanmayın. Hesaplama bütçesinin sınırlı olduğu ve daha hızlı bir sıklıkçı çoklu doldurma yaklaşımının yeterli olduğu durumlarda kaçının.
Güçlü yönler & sınırlılıklar
- Eksiklik belirsizliğini sonsal dağılımlara ve güven aralıklarına doğru bir şekilde yayar.
- Ayrı bir doldurma aşaması olmadan, Bayesci bir hiyerarşik veya regresyon modeli içinde yerel olarak çalışır.
- Çoklu eksiklik dahil olmak üzere keyfi eksik veri örüntülerini işler.
- Birden çok doldurulmuş veri kümesinden elde edilen sonuçları birleştirmek yerine tek, tutarlı bir sonsal dağılım üretir.
- Eksik veri modelinin analiz modeliyle bilgi paylaşmasına izin verir, birleşik bir belirtim yoluyla.
- MAR veya MCAR varsayımını gerektirir; MNAR veriler eksiklik mekanizması için açık bir model gerektirir.
- Tam verilerdeki standart MCMC'ye göre önemli ölçüde daha fazla hesaplama yoğundur, özellikle yüksek eksiklik oranlarında.
- Eksik verinin oranı büyük olduğunda veya eksiklik güçlü bir şekilde bilgilendirici olduğunda yakınsama yavaş olabilir.
- Eksik veri dağılımı için modelin yanlış belirtilmesi, daha basit doldurma yaklaşımlarından bile daha fazla yanlı çıkarımlara neden olabilir.
SSS
Bu, çoklu doldurmadan (MI) nasıl farklıdır?
Çoklu doldurma, birkaç tam veri kümesi oluşturur, her birini ayrı ayrı analiz eder ve ardından sonuçları Rubin kurallarına göre havuzlar. Eksik verilerle MCMC, doldurma ihtiyacını ortadan kaldırarak ve doldurma ile analiz modellerinin her zaman uyumlu olmasını sağlayarak, doldurma ve çıkarımı tek bir birleşik model ve örnekleyici içinde ele alır.
Bu, veriler rastgele eksik olmadığında (MNAR) çalışır mı?
Otomatik olarak değil. MNAR altında, bir değerin eksik olma olasılığı, gözlemlenmeyen değerin kendisine bağlıdır, bu nedenle eksiklik mekanizmasını birleşik modelin bir parçası olarak açıkça modellemelisiniz. Bunun olmadan, hangi MCMC algoritması kullanılırsa kullanılsın sonsal dağılım yanlı olacaktır.
Ne kadar eksik veri çok fazladır?
Evrensel bir eşik yoktur, ancak %40-50'nin üzerindeki eksiklik, sonsal kesinliği önemli ölçüde bozar ve yakınsamayı yavaşlatır. Örüntü, orantı kadar önemlidir: monoton eksiklik (damla gibi) genellikle keyfi çoklu eksiklikten daha kolay işlenir.
Bunu Stan veya PyMC'de kullanabilir miyim?
Evet. Hem Stan hem de PyMC, eksik değerleri örneklenmek üzere gizli değişkenler olarak bildirmeyi destekler. Stan bunları parametre olarak bildirmeyi gerektirir; PyMC bunları maskeli diziler veya açık gizli düğümler aracılığıyla işler. Her iki durumda da örnekleyici, bunları otomatik olarak ek bilinmeyenler olarak ele alır.
Eksik verilerle MCMC'nin yakınsadığını nasıl anlarım?
Hem model parametreleri hem de doldurulmuş değerlerin temsili bir kümesi için R-hat ve etkin örneklem büyüklüğünü kontrol edin. İz grafikleri iyi bir karışım göstermelidir. Daha yüksek eksiklik genellikle daha uzun zincirler gerektirir; varsayılan yinelemeleri ve inceltmeyi ikiye katlamak makul bir başlangıç noktasıdır.
Kaynaklar
- Little, R. J. A. & Rubin, D. B. (2002). Statistical Analysis with Missing Data (2nd ed.). Wiley. ISBN: 978-0471183860
- Tanner, M. A. & Wong, W. H. (1987). The calculation of posterior distributions by data augmentation. Journal of the American Statistical Association, 82(398), 528-540. DOI: 10.1080/01621459.1987.10478458 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Markov Chain Monte Carlo with Missing Data. ScholarGate. https://scholargate.app/tr/bayesian/mcmc-with-missing-data
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Bayes Hiyerarşik ModeliBayesçi↔ karşılaştır
- Eksik Veri ile Bayesci ÇıkarımBayesçi↔ karşılaştır
- Gibbs ÖrneklemesiBayesçi↔ karşılaştır
- Hamiltonian Monte CarloBayesçi↔ karşılaştır
- Metropolis-Hastings AlgoritmasıBayesçi↔ karşılaştır
- Çoklu Atamaİstatistik↔ karşılaştır