İçeriğe geçScholarGate
KütüphaneKitaplığımMasaReview StudioAsistan
Giriş
Bu sayfada
SezgiNasıl çalışırNe zaman kullanılırGüçlü yönler & sınırlılıklarYaygın tuzaklarUygulamalarSSS🔒 Tam yöntemi okuKaynaklarİlişkili yöntemler
Bu sayfaya atıf yapBu sayfada bir hata mı var? Bildir / düzeltme öner →
Ana sayfa›Deney tasarımı›Çok Kollu Haydut (UCB, Thompson Sampling)
Hypothesis test

Çok Kollu Haydut (UCB, Thompson Sampling)

Multi-Armed Bandit (UCB, Thompson Sampling) · Ayrıca şöyle bilinir: MAB, bandit algorithm, UCB1, Thompson sampling, epsilon-greedy, Çok Kollu Bandit (Multi-Armed Bandit — UCB, Thompson)

Çok kollu haydut (ÇKH), kümülatif pişmanlığı en aza indirirken aynı anda hangi kolun en iyi performansı gösterdiğini öğrenmek için denemeleri sıralı olarak rakip kollara tahsis eden uyarlanabilir bir deneysel çerçevedir. Robbins tarafından 1952'de biçimlendirilen ve Auer vd. (2002) tarafından sonlu zaman garantileri verilen bu yöntem, belirsiz seçeneklerin keşfi ile şu anda bilinen en iyi seçeneklerin sömürülmesi arasında denge kurar — erken durdurma veya maliyet-duyarlı tahsisin önemli olduğu durumlarda klasik A/B testinden daha iyi performans gösterir.

ScholarGate
  1. Hypothesis test
  2. v1
  3. 2 Kaynaklar
  4. PUBLISHED
Bu sayfaya atıf yap →
Araçlar & kaynaklar
Slaytları indir
Öğren & keşfet

Tam yöntemi oku

Yalnızca üyeler

Bu bölümü okumak için ücretsiz hesapla giriş yapın.

Giriş yap

Yöntem haritası

İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.

Çok Kollu Haydut (UCB, Thompson Sampling)
A/B Testi (Çevrimiçi Kon…Uyarlanabilir Klinik Den…Rastgele Kontrollü Deney…Sıralı / Grup Sıralı Den…

Ne zaman kullanılır

Kol (varyantlar, tedaviler, içerik öğeleri) en yüksek ödülü veren ve öğrenme aşamasında kayıpları en aza indiren öğrenmeniz gerektiğinde çok kollu bir haydut kullanın. Ödüller durağan veya yavaş sürüklenen olmalıdır; durağan olmayan ayarlar için indirimli veya kayan pencere varyantları gereklidir. İkili veya sürekli ödül sinyalleri işe yarar. Thompson Sampling, gerçekliği kabaca yansıtan bir önsel dağılım gerektirir; UCB1 önselden bağımsızdır ancak sınırlı ödüller varsayar. Kümülatif tahminlerin dengelenmesinden önce kollar arasında en az yaklaşık 50 gözlem gerekir.

Güçlü yönler & sınırlılıklar

Güçlü yönler
  • Fırsat maliyetini en aza indirir: algoritma, deney sonuna kadar eşit olarak bölmek yerine sürekli olarak daha iyi performans gösteren kollara trafik kaydırır.
  • İlkeli pişmanlık sınırları: UCB1, Auer vd. (2002) tarafından kanıtlanmış logaritmik en kötü durum garantileri sunar.
  • Thompson Sampling ile Bayesçi güncelleme, doğal belirsizlik ölçümü sağlar ve önsel bilgiyi entegre eder.
  • Çok sayıda kola ölçeklenir ve kullanıcı özelliklerinin kol seçimini bilgilendirdiği bağlamsal ayarlara doğal olarak genişler.
Sınırlılıklar
  • Ödül durağanlığını varsayar; kol ortalamaları zamanla hızla sürüklenirse performans düşer.
  • Thompson Sampling, yanlış belirtilmesi yakınsamayı yavaşlatabilecek bir önsel belirlemeyi gerektirir.
  • Sabit bir örneklem boyutuna sahip standart bir A/B testinden daha az teknik paydaşlara iletmesi daha zordur.
  • Kümülatif pişmanlık sınırları asimptotiktir; kol başına çok az deneme ile keşif bonusu aşırı keşif yapabilir.

SSS

Bir haydut standart bir A/B testinden nasıl farklıdır?

Standart bir A/B testi trafiği eşit olarak tahsis eder ve bir kazanan ilan etmeden önce sabit bir örnek toplanana kadar bekler, deneme sırasında yetersiz kolda oluşan kayıpları göz ardı eder. Bir haydut, kanıt biriktikçe daha iyi performans gösteren kollara daha fazla trafik yönlendirerek gerçek zamanlı tahsisi uyarlar, böylece beklenen fırsat maliyetini azaltır — daha karmaşık çıkarım pahasına.

UCB1 mi yoksa Thompson Sampling mi — hangisini seçmeliyim?

UCB1 deterministik ve önselden bağımsızdır, bu da denetlemeyi ve açıklamayı kolaylaştırır. Thompson Sampling rastgeleleştirilmiştir, pratikte genellikle daha hızlı yakınsar ve Bayesçi analizle doğal olarak bütünleşir. Makul önsel bilgilere (örn. geçmiş tıklama oranları) sahipseniz, Thompson Sampling genellikle tercih edilir; şeffaf keşif kuralları ve önsel varsayım istemiyorsanız, UCB1 güvenli bir varsayılan değerdir.

'Pişmanlık' nedir ve neden önemlidir?

Pişmanlık, en iyi kolu her zaman seçmeyerek kaybedilen toplam ödüldür. Keşfin maliyetini ölçer. UCB1, kümülatif pişmanlığın O(√(KT ln T))'den daha hızlı büyümeyeceğini garanti eder, bu da deney uzadıkça ortalama tur başına kaybın sıfıra yaklaştığı anlamına gelir. Maliyetin sabit olarak kabul edildiği sabit örneklem testinden farklı olarak, her denemenin gerçek bir maliyeti olduğu durumlarda pişmanlığı en aza indirmek doğru hedeftir.

İkiden fazla kolum olduğunda bir haydut kullanabilir miyim?

Evet — haydut algoritmaları K ≥ 2 kol için tasarlanmıştır ve doğal olarak ölçeklenir. K ayrı ikili A/B testi çalıştırmak aile bazında hata oranını artırır ve toplam fırsat maliyetini artırır; haydut, pişmanlık minimizasyonu hedefi aracılığıyla çoğulluğu örtük olarak ele alır.

Kaynaklar

  1. Auer, P., Cesa-Bianchi, N., & Fischer, P. (2002). Finite-Time Analysis of the Multiarmed Bandit Problem. Machine Learning, 47(2–3), 235–256. DOI: 10.1023/A:1013689704352 ↗
  2. Russo, D., Van Roy, B., Kazerouni, A., Osband, I., & Wen, Z. (2018). A Tutorial on Thompson Sampling. Foundations and Trends in Machine Learning, 11(1), 1–96. DOI: 10.1561/2200000070 ↗

Bu sayfayı kaynak gösterin

ScholarGate. (2026, June 1). Multi-Armed Bandit (UCB, Thompson Sampling). ScholarGate. https://scholargate.app/tr/experimental-design/multiarm-bandit

İlişkili yöntemler

A/B Testi (Çevrimiçi Kontrollü Deney)Uyarlanabilir Klinik Deney TasarımıRastgele Kontrollü Deney (RKD)Sıralı / Grup Sıralı Deneme Tasarımı

Hangi yöntem?

Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.

  • A/B Testi (Çevrimiçi Kontrollü Deney)Deney tasarımı↔ karşılaştır
  • Uyarlanabilir Klinik Deney TasarımıDeney tasarımı↔ karşılaştır
  • Rastgele Kontrollü Deney (RKD)Deney tasarımı↔ karşılaştır
  • Sıralı / Grup Sıralı Deneme TasarımıDeney tasarımı↔ karşılaştır
Yan yana karşılaştır →

Bu yönteme atıf yapanlar

A/B Testi (Çevrimiçi Kontrollü Deney)

Benzer yöntemler

Uyarlanabilir A/B TestiUyarlanabilir DeneyA/B Testi (Çevrimiçi Kontrollü Deney)Bayesçi OptimizasyonBayes Dinamik ProgramlamaUyarlanabilir Çok Kollu DeneyPragmatik A/B TestiÇevrimiçi Öğrenme

İlgili referans kavramlar

Pekiştirmeli ÖğrenmeHiperparametre OptimizasyonuStokastik OptimizasyonMarkov Karar SüreçleriArdışık Karar Verme (MDP'ler)Model Değerlendirme ve Seçimi

Bu sayfada bir hata mı var? Bildir / düzeltme öner →

ScholarGate — Multi-Armed Bandit (Multi-Armed Bandit (UCB, Thompson Sampling)). 2026-07-21 tarihinde şu adresten erişildi: https://scholargate.app/tr/experimental-design/multiarm-bandit · Veri seti: https://doi.org/10.5281/zenodo.20539026
Hızlı bilgiler
Originator
Robbins (1952); UCB1 by Auer et al. (2002); Thompson sampling by Thompson (1933)
Year
1952
Family
Adaptive experiment
Type
Sequential decision / bandit algorithm
Strategies
UCB1, Thompson Sampling, ε-greedy
MinSample
50
Parametric
Hayır
Outcome
binary or continuous reward
Stationarity
required (or slowly varying)
İlişkili yöntemler
A/B Testi (Çevrimiçi Kontrollü Deney)Uyarlanabilir Klinik Deney TasarımıRastgele Kontrollü Deney (RKD)Sıralı / Grup Sıralı Deneme Tasarımı
ScholarGate

Araştırma yöntemleri için içerik öncelikli bir referans kütüphanesi — her yöntemin ne olduğu, nasıl çalıştığı ve nereden geldiği.

Açık veri (CC-BY)

Keşfet

  • Kütüphane
  • Yöntemlerde ara…
  • Alanlara göre gez
  • Alanlar
  • Yolculuk
  • Karşılaştır
  • Hangi yöntem?

Başvuru

  • Konular
  • Atlas
  • Sözlük
  • Metodoloji
  • Felsefe

Çalışma alanı

  • Kitaplığım
  • Masa
  • Sohbet

Şirket

  • Hakkımızda
  • Fiyatlandırma
  • İletişim
  • Yöntem öner

Kayıtlar, başvuru amacıyla yayımlanmış kaynaklardan derlenmiştir. Herhangi bir bilginin doğruluğunu ve kendi kullanımınıza uygunluğunu denetlemek sizin sorumluluğunuzdadır.

© 2026 ScholarGate · Araştırma yöntemleri referans kütüphanesi
  • Gizlilik
  • Çerezler
  • Koşullar
  • Hesabı sil