Çok Kollu Haydut (UCB, Thompson Sampling)
Multi-Armed Bandit (UCB, Thompson Sampling) · Ayrıca şöyle bilinir: MAB, bandit algorithm, UCB1, Thompson sampling, epsilon-greedy, Çok Kollu Bandit (Multi-Armed Bandit — UCB, Thompson)
Çok kollu haydut (ÇKH), kümülatif pişmanlığı en aza indirirken aynı anda hangi kolun en iyi performansı gösterdiğini öğrenmek için denemeleri sıralı olarak rakip kollara tahsis eden uyarlanabilir bir deneysel çerçevedir. Robbins tarafından 1952'de biçimlendirilen ve Auer vd. (2002) tarafından sonlu zaman garantileri verilen bu yöntem, belirsiz seçeneklerin keşfi ile şu anda bilinen en iyi seçeneklerin sömürülmesi arasında denge kurar — erken durdurma veya maliyet-duyarlı tahsisin önemli olduğu durumlarda klasik A/B testinden daha iyi performans gösterir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Kol (varyantlar, tedaviler, içerik öğeleri) en yüksek ödülü veren ve öğrenme aşamasında kayıpları en aza indiren öğrenmeniz gerektiğinde çok kollu bir haydut kullanın. Ödüller durağan veya yavaş sürüklenen olmalıdır; durağan olmayan ayarlar için indirimli veya kayan pencere varyantları gereklidir. İkili veya sürekli ödül sinyalleri işe yarar. Thompson Sampling, gerçekliği kabaca yansıtan bir önsel dağılım gerektirir; UCB1 önselden bağımsızdır ancak sınırlı ödüller varsayar. Kümülatif tahminlerin dengelenmesinden önce kollar arasında en az yaklaşık 50 gözlem gerekir.
Güçlü yönler & sınırlılıklar
- Fırsat maliyetini en aza indirir: algoritma, deney sonuna kadar eşit olarak bölmek yerine sürekli olarak daha iyi performans gösteren kollara trafik kaydırır.
- İlkeli pişmanlık sınırları: UCB1, Auer vd. (2002) tarafından kanıtlanmış logaritmik en kötü durum garantileri sunar.
- Thompson Sampling ile Bayesçi güncelleme, doğal belirsizlik ölçümü sağlar ve önsel bilgiyi entegre eder.
- Çok sayıda kola ölçeklenir ve kullanıcı özelliklerinin kol seçimini bilgilendirdiği bağlamsal ayarlara doğal olarak genişler.
- Ödül durağanlığını varsayar; kol ortalamaları zamanla hızla sürüklenirse performans düşer.
- Thompson Sampling, yanlış belirtilmesi yakınsamayı yavaşlatabilecek bir önsel belirlemeyi gerektirir.
- Sabit bir örneklem boyutuna sahip standart bir A/B testinden daha az teknik paydaşlara iletmesi daha zordur.
- Kümülatif pişmanlık sınırları asimptotiktir; kol başına çok az deneme ile keşif bonusu aşırı keşif yapabilir.
SSS
Bir haydut standart bir A/B testinden nasıl farklıdır?
Standart bir A/B testi trafiği eşit olarak tahsis eder ve bir kazanan ilan etmeden önce sabit bir örnek toplanana kadar bekler, deneme sırasında yetersiz kolda oluşan kayıpları göz ardı eder. Bir haydut, kanıt biriktikçe daha iyi performans gösteren kollara daha fazla trafik yönlendirerek gerçek zamanlı tahsisi uyarlar, böylece beklenen fırsat maliyetini azaltır — daha karmaşık çıkarım pahasına.
UCB1 mi yoksa Thompson Sampling mi — hangisini seçmeliyim?
UCB1 deterministik ve önselden bağımsızdır, bu da denetlemeyi ve açıklamayı kolaylaştırır. Thompson Sampling rastgeleleştirilmiştir, pratikte genellikle daha hızlı yakınsar ve Bayesçi analizle doğal olarak bütünleşir. Makul önsel bilgilere (örn. geçmiş tıklama oranları) sahipseniz, Thompson Sampling genellikle tercih edilir; şeffaf keşif kuralları ve önsel varsayım istemiyorsanız, UCB1 güvenli bir varsayılan değerdir.
'Pişmanlık' nedir ve neden önemlidir?
Pişmanlık, en iyi kolu her zaman seçmeyerek kaybedilen toplam ödüldür. Keşfin maliyetini ölçer. UCB1, kümülatif pişmanlığın O(√(KT ln T))'den daha hızlı büyümeyeceğini garanti eder, bu da deney uzadıkça ortalama tur başına kaybın sıfıra yaklaştığı anlamına gelir. Maliyetin sabit olarak kabul edildiği sabit örneklem testinden farklı olarak, her denemenin gerçek bir maliyeti olduğu durumlarda pişmanlığı en aza indirmek doğru hedeftir.
İkiden fazla kolum olduğunda bir haydut kullanabilir miyim?
Evet — haydut algoritmaları K ≥ 2 kol için tasarlanmıştır ve doğal olarak ölçeklenir. K ayrı ikili A/B testi çalıştırmak aile bazında hata oranını artırır ve toplam fırsat maliyetini artırır; haydut, pişmanlık minimizasyonu hedefi aracılığıyla çoğulluğu örtük olarak ele alır.
Kaynaklar
- Auer, P., Cesa-Bianchi, N., & Fischer, P. (2002). Finite-Time Analysis of the Multiarmed Bandit Problem. Machine Learning, 47(2–3), 235–256. DOI: 10.1023/A:1013689704352 ↗
- Russo, D., Van Roy, B., Kazerouni, A., Osband, I., & Wen, Z. (2018). A Tutorial on Thompson Sampling. Foundations and Trends in Machine Learning, 11(1), 1–96. DOI: 10.1561/2200000070 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Multi-Armed Bandit (UCB, Thompson Sampling). ScholarGate. https://scholargate.app/tr/experimental-design/multiarm-bandit
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- A/B Testi (Çevrimiçi Kontrollü Deney)Deney tasarımı↔ karşılaştır
- Uyarlanabilir Klinik Deney TasarımıDeney tasarımı↔ karşılaştır
- Rastgele Kontrollü Deney (RKD)Deney tasarımı↔ karşılaştır
- Sıralı / Grup Sıralı Deneme TasarımıDeney tasarımı↔ karşılaştır