A/B Testi (Çevrimiçi Kontrollü Deney)
A/B Test (Online Controlled Experiment) · Ayrıca şöyle bilinir: split test, controlled experiment, two-variant test, A/B Testi (Online Kontrollü Deney)
Bir A/B testi, ölçülen bir sonucun anlamlı derecede farklı olup olmadığını belirlemek amacıyla, kullanıcıların iki grubuna eş zamanlı olarak bir kontrol varyantı (A) ve bir tedavi varyantı (B) maruz bırakan rastgele kontrollü bir denemedir. Modern çevrimiçi kontrollü deney çerçevesi, R. A. Fisher'in 1935'ten kalma klasik rastgeleleştirme ilkelerinden yararlanarak 2000'lerin başında Ron Kohavi ve meslektaşları tarafından Microsoft'ta sistematik hale getirildi. Web ürün geliştirme, dijital pazarlama ve deney platformlarında baskın nedensel çıkarım aracıdır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Kullanıcıları veya birimleri tam olarak iki varyanta rastgele atayabildiğinizde ve net birincil metriğiniz olduğunda bir A/B testi kullanın. Temel varsayımlar: kullanıcılar bağımsız ve rastgele atanır (gruplar arasında sızıntı yok); deney haftalık mevsimselliği yakalamak için yeterince uzun sürer; gruplar arasındaki örneklem oranı amaçlanan bölmeye uyar (örneklem oranı uyumsuzluğu kontrolü ile doğrulayın); ve çoklu metrik testi Bonferroni veya FDR prosedürleri ile düzeltilir. Orta düzey etki büyüklüklerine sahip ikili sonuçlar için grup başına yaklaşık 100 gözlem gerekir; güç analizi, başlatmadan önce gerekli örneklem boyutunu doğrulamalıdır.
Güçlü yönler & sınırlılıklar
- Rastgeleleştirme tüm karıştırıcı değişkenleri eş zamanlı olarak kontrol ettiği için güçlü nedensel kanıt sağlar.
- Yorumlaması kolaydır: istatistiksel olarak anlamlı bir sonuç, sonuç farklılıklarını doğrudan test edilen değişikliğe atfeder.
- İkili sonuçları (dönüşüm oranı), sürekli sonuçları (gelir, gecikme) ve sayım sonuçlarını (oturum başına sayfa) kapsayacak kadar esnektir.
- Bayes varyantları, ikili reddet/reddetmeme kararından genellikle daha eyleme geçirilebilir olasılıksal ifadeler (P(B > A)) üretir.
- Küçük etkileri tespit etmek için büyük örneklem boyutları gerektirir; yetersiz güçlü deneyler güvenilmez sonuçlar üretir.
- Rastgele atamanın imkansız veya etik olmadığı durumlarda kullanılamaz.
- Ağ etkileri ve gruplar arası etkileşim (örneğin, sosyal platformlar, pazar yerleri) bağımsızlık varsayımını ihlal eder ve tahminleri bozar.
- Çok sayıda eş zamanlı test çalıştırmak, çoklu karşılaştırma düzeltmeleri uygulanmadıkça aile bazında hata oranını artırır.
- SPRT ve diğer sürekli izleme yaklaşımları, planlanan bitiş tarihinden önce sonuçlara bakmak gerektiğinde gereklidir; naif bakış açısı Tip I hatayı artırır.
SSS
Numunem ne kadar büyük olmalı?
Deneyden önce bir güç analizi yapın: temel dönüşüm oranını, önemsediğiniz minimum tespit edilebilir artışı, istenen gücü (genellikle 0.80) ve anlamlılık düzeyini (genellikle 0.05) belirtin. İki oranlı z-testi formülü, grup başına gerekli n'yi verecektir. Kaba bir kural olarak, %5 temel oranda %10'luk bir göreli artışı tespit etmek, grup başına yaklaşık 5.000 gözlem gerektirir.
Sıklıkçı mı yoksa Bayesçi mi — hangi yaklaşımı kullanmalıyım?
Sıklıkçı testler (z-testi, t-testi) Tip I hata oranını belirli bir düzeyde kontrol eder ve düzenleyici varsayılanlardır. Bayes testleri P(B > A)'yı hesaplar ve isteğe bağlı durdurma kurallarına izin verir, bu da onları hızlı bir şekilde yayınlaması gereken ürün ekiplerinde popüler kılar. Her ikisi de geçerlidir; seçim, hata oranı garantilerinin mi yoksa olasılıksal ifadelerin mi paydaşlarınız için daha faydalı olduğuna bağlıdır.
Örneklem oranı uyumsuzluğu nedir ve neden önemlidir?
Örneklem oranı uyumsuzluğu (SRM), her bir varyanta atanan kullanıcıların oranı amaçlanan orandan farklı olduğunda meydana gelir. Küçük sapmalar bile — %50/50'lik bir bölmenin %48/52'ye inmesi — bozuk bir rastgeleleştirme mekanizmasına (örneğin, bot filtreleme, önbelleğe alma, yönlendirme hataları) işaret eder. Bir SRM, nedensel yorumlamayı geçersiz kılar; sonuçları analiz etmeden önce her zaman atama sayımları üzerinde bir ki-kare testi çalıştırın.
Aynı anda birden fazla A/B testi çalıştırabilir miyim?
Evet, testler ortogonal segmentlerdeyse veya platform uygun araya ekleme kontrolleri uyguluyorsa. Ancak, aynı popülasyonda birçok test çalıştırmak aile bazında hata oranını artırır. Birkaç birincil metriği izlerken Bonferroni veya Benjamini-Hochberg FDR düzeltmesini uygulayın ve eş zamanlı deneyler arasındaki etkileşim etkileri konusunda dikkatli olun.
Kaynaklar
- Kohavi, R., Tang, D., & Xu, Y. (2020). Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press. ISBN: 9781108724265
- Deng, A., Xu, Y., Kohavi, R., & Walker, T. (2013). Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data. KDD '13. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). A/B Test (Online Controlled Experiment). ScholarGate. https://scholargate.app/tr/experimental-design/ab-testing
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Bağımsızlık Ki-kare Testiİstatistik↔ karşılaştır
- Bağımsız Örneklem t-testiİstatistik↔ karşılaştır
- Çok Kollu Haydut (UCB, Thompson Sampling)Deney tasarımı↔ karşılaştır
- Rastgele Kontrollü Deney (RKD)Deney tasarımı↔ karşılaştır