Eksik Verilerle Gibbs Örneklemesi
Gibbs Sampling with Missing Data Imputation · Ayrıca şöyle bilinir: data augmentation Gibbs sampler, Gibbs sampler with data augmentation, Bayesian imputation via Gibbs sampling, MCMC missing data imputation
Eksik verilerle Gibbs örneklemesi, gözlemlenmeyen değerleri model parametrelerinin yanı sıra ek bilinmeyenler olarak ele alır ve bir Markov zinciri Monte Carlo döngüsü içinde hepsini birlikte örnekler. Yöntem, eksik değerleri parametreler verildiğinde koşullu dağılımlarından çekme ile parametreleri tamamlanmış veriler verildiğinde koşullu dağılımlarından çekme arasında geçiş yaparak, her ikisi üzerinde eşzamanlı bir sonsal dağılım üretir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+2 tane daha
Ne zaman kullanılır
Bayesyen bir model uyarlarken ve verilerde, tam vaka analizi veya ayrı bir ön-imputasyon adımı yerine model içinde ele alınması gereken eksik değerler bulunduğunda eksik verilerle Gibbs örneklemesi kullanın. Özellikle eksik veri deseni karmaşık olduğunda, eksikliği tahmin eden yardımcı değişkenler mevcut olduğunda ve dahil edilmesi gerektiğinde veya hem imputasyon hem de parametre tahmini yoluyla tutarlı belirsizlik yayılımına ihtiyacınız olduğunda çok uygundur. Eksik veri mekanizması MNAR olduğunda ve bunun için bir model belirtmek istemediğinizde; eksiklik önemsiz derecede düşük olduğunda (yüzde 5'in altında) ve sadece uyarlamadan önce hızlıca imputasyon yapmak istediğinizde; veya hesaplama süresi kısıtlayıcı faktör olduğunda ve daha basit bir çoklu imputasyon prosedürü yeterli olacağında kullanmayın.
Güçlü yönler & sınırlılıklar
- Ayrı bir imputasyon aşaması olmaksızın, eksik verileri ve parametre tahminini tek bir tutarlı olasılıksal modelde ele alır.
- Hem eksiklikten hem de parametre tahmininden kaynaklanan tüm belirsizliği sonsal güvenilir aralıklara yayar.
- Çok değişkenli ve yapılandırılmış veriler dahil olmak üzere, keyfi olarak karmaşık eksik veri desenleri için çalışır.
- Eksikliği tahmin eden yardımcı değişkenler modele doğal olarak dahil edilebilir.
- Yan ürün olarak, ikincil analizler için kullanılabilir çoklu atanan veri setleri üretir.
- Kısmen gözlemlenen tüm değişkenler için ortak bir model belirtmeyi gerektirir, bu yüksek boyutlarda zor olabilir.
- Yalnızca MAR veya MCAR altında geçerlidir; MNAR ek bir duyarlılık modeli gerektirir.
- Hesaplama maliyeti, eksik değerlerin sayısı ve model karmaşıklığı ile ölçeklenir.
- Eksik veri oranları yüksek olduğunda veya parametreler ilişkili olduğunda yakınsama yavaş olabilir.
SSS
Bu, zincirlenmiş denklemlerle çoklu imputasyondan (MICE) nasıl farklıdır?
MICE, bir dizi regresyon modeli kullanarak her değişkeni sırayla atar ve ardından tamamlanmış veri setleri üzerinde ana modeli uyarlar, tahminleri Rubin kurallarıyla birleştirir. Eksik verilerle Gibbs örneklemesi, imputasyonu ve model uyarlamasını tek bir Bayesyen model içinde eşzamanlı olarak gerçekleştirir, ayrı bir birleştirme adımı olmaksızın tutarlı belirsizlik yayılımı sağlar. Bayesyen yaklaşım daha prensiplidir ancak tam bir ortak model belirtmeyi gerektirir.
Eksik veri mekanizması hakkında endişelenmem gerekiyor mu?
Evet. Standart yaklaşım, verilerin rastgele eksik (MAR) olduğunda geçerlidir, yani eksiklik yalnızca gözlemlenen miktarlara bağlıdır. Eğer eksiklik gözlemlenmeyen değerlerin kendisine bağlıysa (MNAR), eksik veri mekanizmasını açıkça modellemeniz veya duyarlılık analizleri yapmanız gerekir. Tam vaka analizi ve standart imputasyon yöntemleri bu gereksinimi paylaşır.
Yöntem, karışık değişken türlerini (sürekli, ikili, sıralı) işleyebilir mi?
Evet. Her değişken türüne uygun bir koşullu model verilir — sürekli için Normal, ikili için lojistik, sıralı için sıralı lojit — ve her biri için Gibbs adımları türetilir. Pratikte, JAGS ve Stan gibi yazılımlar, her gözlemlenen düğüm için olabilirlik belirtmenize ve eksik düğümleri gizli değişkenler olarak ele almanıza izin vererek bunu halleder.
Genellikle kaç iterasyon gereklidir?
Bu, modele ve eksik veri oranına bağlıdır. Yaygın bir başlangıç noktası, 1.000–2.000 ısınma çekimi ve ardından zincir başına 2.000–10.000 ısınma sonrası çekimdir, en az dört zincir paralel olarak çalıştırılır. Yakınsama teşhisleri (1.01'in altında R-hat, 400'ün üzerinde toplu ve kuyruk etkin örneklem büyüklükleri) sabit kurallar yerine nihai karara rehberlik etmelidir.
Hangi yazılımlar bu yaklaşımı destekliyor?
JAGS ve Stan, eksik değerlerin bilinmeyenler olarak beyan edilmesine ve Gibbs veya HMC taraması sırasında otomatik olarak örneklenmesine izin verir. R paketleri rjags, R2jags, rstan ve brms'in tümü bu iş akışını destekler. Python'da PyMC ve NumPyro eşdeğer işlevsellik sunar.
Kaynaklar
- Tanner, M. A. & Wong, W. H. (1987). The calculation of posterior distributions by data augmentation. Journal of the American Statistical Association, 82(398), 528–540. DOI: 10.1080/01621459.1987.10478458 ↗
- Little, R. J. A. & Rubin, D. B. (2002). Statistical Analysis with Missing Data (2nd ed.). Wiley. ISBN: 978-0471183860
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Gibbs Sampling with Missing Data Imputation. ScholarGate. https://scholargate.app/tr/bayesian/gibbs-sampling-with-missing-data
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Eksik Verili Bayesyen Hiyerarşik ModelBayesçi↔ karşılaştır
- Eksik Veri ile Bayesci ÇıkarımBayesçi↔ karşılaştır
- Veri Artırma (Data Augmentation)Derin öğrenme↔ karşılaştır
- Gibbs ÖrneklemesiBayesçi↔ karşılaştır
- Eksik Veri ile MCMCBayesçi↔ karşılaştır
- Çoklu Atamaİstatistik↔ karşılaştır