İçeriğe geçScholarGate
KütüphaneKitaplığımMasaReview StudioAsistan
Giriş
Bu sayfada
SezgiNasıl çalışırNe zaman kullanılırGüçlü yönler & sınırlılıklarYaygın tuzaklarUygulamalarSSS🔒 Tam yöntemi okuKaynaklarİlişkili yöntemler
Bu sayfaya atıf yapBu sayfada bir hata mı var? Bildir / düzeltme öner →
Ana sayfa›Makine öğrenmesi›Q-Öğrenme
Machine learningReinforcement learning

Q-Öğrenme

Q-Learning (Off-Policy Temporal-Difference Control) · Ayrıca şöyle bilinir: Q-learning algorithm, tabular Q-learning, off-policy TD control, Q-öğrenme

Christopher Watkins ve Peter Dayan tarafından 1992'de tanıtılan Q-öğrenme, çevrenin bir modeline sahip olmadan, yalnızca deneyimden yola çıkarak her durumda her eylemi gerçekleştirmenin değerini — Q-fonksiyonunu — öğrenen model-serbest bir pekiştirmeli öğrenme algoritmasıdır. Politika dışıdır: keşifsel bir davranış politikası izlerken optimal eylem değerlerini öğrenir ve standart koşullar altında optimal politikaya kanıtlanabilir şekilde yakınsar.

ScholarGate
  1. Machine learning
  2. v1
  3. 2 Kaynaklar
  4. PUBLISHED
Bu sayfaya atıf yap →
Araçlar & kaynaklar
Slaytları indir
Öğren & keşfet

Tam yöntemi oku

Yalnızca üyeler

Bu bölümü okumak için ücretsiz hesapla giriş yapın.

Giriş yap

Yöntem haritası

İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.

Q-Öğrenme
Derin Pekiştirmeli Öğren…Dinamik ProgramlamaPolitika Gradyan Yönteml…

Ne zaman kullanılır

Geçişleri ve ödülleri örnekleyebildiğiniz ancak dinamikler hakkında bir modelinizin olmadığı (veya güvenilmez) olduğu durumlar olarak çerçevelenen sıralı karar verme problemleri için Q-öğrenmeyi kullanın — kontrol, oyunlar, yönlendirme, zamanlama ve uyarlanabilir sistemler. Tablosal Q-öğrenme, küçük, ayrık durum-eylem alanları için uygundur ve yeterli keşif ve azalan adım boyutu verildiğinde optimuma yakınsar. Büyük veya sürekli alanlar için tablo, bir fonksiyon yaklaştırıcı (Derin Q-Ağları) ile değiştirilir. Markov özelliğini ve durağan bir ortamı varsayar, örnek açısından verimsiz olabilir ve max operatörü, Çift Q-öğrenme gibi varyantlarla ele alınan iyimser (maksimum) bir yanlılık indükler. İstatiksel veya sürekli eylem politikası gerektiğinde, politika gradyan yöntemleri alternatiftir.

Güçlü yönler & sınırlılıklar

Güçlü yönler
  • Model-serbest: geçiş/ödül modeli gerektirmez, yalnızca örneklenmiş deneyim gerektirir.
  • Politika dışı: başka bir politika ile keşif yaparken optimal politikayı öğrenir.
  • Standart koşullar altında optimal eylem değerlerine kanıtlanabilir şekilde yakınsar.
  • Basit, temel ve Derin Q-Ağları ile birçok uzantının temelini oluşturur.
Sınırlılıklar
  • Tablosal form, büyük veya sürekli durum/eylem alanlarına ölçeklenmez.
  • Örnek açısından verimsiz; yakınsama için birçok bölüm gerekebilir.
  • Maks operatöründen kaynaklanan maksimizasyon yanlılığı (aşırı tahmin); Çift Q-öğrenme ile azaltılır.
  • Durağan bir Markov karar süreci varsayar; kısmi gözlemlenebilirlik veya sürüklenme altında zorlanır.

SSS

Q-öğrenmede 'politika dışı' ne anlama gelir?

Bu, Q-öğrenmenin optimal politikanın değerini, ajan farklı (keşifsel) bir davranış politikası izlerken öğrendiği anlamına gelir. Güncelleme hedefleri r + γ·max Q(s', a') — yani en iyi sonraki eylem — gerçekten alınan eylem değil, bu nedenle keşif öğrenilen optimumu yanlı hale getirmez.

Q-öğrenme Derin Q-Ağları (DQN) ile nasıl ilişkilidir?

DQN, Q-tablosunu, Q(s, a)'yı yaklaştıran derin bir sinir ağı ile değiştirerek, büyük veya sürekli (örneğin, piksel) durum alanlarında Q-öğrenmeyi mümkün kılar. Deneyim tekrarı ve hedef ağ gibi dengeleyici hileler ekler — ancak temel öğrenme kuralı Q-öğrenmenin zamansal fark güncellemesidir.

Q-öğrenme neden değerleri aşırı tahmin eder?

Güncellemedeki max operatörü, özellikle gürültülü ödüllerle, Q'yu yukarı doğru yanlı hale getiren aşırı iyimser tahminleri seçme eğilimindedir. Çift Q-öğrenme, iki tahminci kullanarak eylem seçimini değer değerlendirmesinden ayırarak bunu azaltır ve daha az yanlı ve genellikle daha iyi politikalar sağlar.

Kaynaklar

  1. Watkins, C. J. C. H., & Dayan, P. (1992). Q-learning. Machine Learning, 8(3–4), 279–292. DOI: 10.1007/BF00992698 ↗
  2. Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. ISBN: 978-0-262-03924-6

Bu sayfayı kaynak gösterin

ScholarGate. (2026, June 2). Q-Learning (Off-Policy Temporal-Difference Control). ScholarGate. https://scholargate.app/tr/machine-learning/q-learning

İlişkili yöntemler

Derin Pekiştirmeli ÖğrenmeDinamik ProgramlamaPolitika Gradyan Yöntemleri

Hangi yöntem?

Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.

  • Derin Pekiştirmeli ÖğrenmeDerin öğrenme↔ karşılaştır
  • Dinamik ProgramlamaOptimizasyon↔ karşılaştır
  • Politika Gradyan YöntemleriMakine öğrenmesi↔ karşılaştır
Yan yana karşılaştır →

Bu yönteme atıf yapanlar

Politika Gradyan Yöntemleri

Benzer yöntemler

Pekiştirmeli ÖğrenmeDerin Pekiştirmeli ÖğrenmePolitika Gradyan YöntemleriBayes Dinamik ProgramlamaZayıf Gözetimli Pekiştirmeli ÖğrenmeStokastik Dinamik ProgramlamaPekiştirmeli Öğrenme ile Transfer Öğrenmesiİnce Ayarlı Pekiştirmeli Öğrenme

İlgili referans kavramlar

Değer Tabanlı YöntemlerPekiştirmeli ÖğrenmeDerin Pekiştirmeli ÖğrenmeMarkov Karar SüreçleriPolitika Gradyan YöntemleriArdışık Karar Verme (MDP'ler)

Bu sayfada bir hata mı var? Bildir / düzeltme öner →

ScholarGate — Q-Learning (Q-Learning (Off-Policy Temporal-Difference Control)). 2026-07-21 tarihinde şu adresten erişildi: https://scholargate.app/tr/machine-learning/q-learning · Veri seti: https://doi.org/10.5281/zenodo.20539026
Hızlı bilgiler
Originator
Christopher Watkins & Peter Dayan
Year
1992
Type
Model-free reinforcement-learning control algorithm
Subfamily
Reinforcement learning
Policy
Off-policy (learns optimal Q while exploring)
Guarantee
Converges to optimal Q under standard conditions
İlişkili yöntemler
Derin Pekiştirmeli ÖğrenmeDinamik ProgramlamaPolitika Gradyan Yöntemleri
ScholarGate

Araştırma yöntemleri için içerik öncelikli bir referans kütüphanesi — her yöntemin ne olduğu, nasıl çalıştığı ve nereden geldiği.

Açık veri (CC-BY)

Keşfet

  • Kütüphane
  • Yöntemlerde ara…
  • Alanlara göre gez
  • Alanlar
  • Yolculuk
  • Karşılaştır
  • Hangi yöntem?

Başvuru

  • Konular
  • Atlas
  • Sözlük
  • Metodoloji
  • Felsefe

Çalışma alanı

  • Kitaplığım
  • Masa
  • Sohbet

Şirket

  • Hakkımızda
  • Fiyatlandırma
  • İletişim
  • Yöntem öner

Kayıtlar, başvuru amacıyla yayımlanmış kaynaklardan derlenmiştir. Herhangi bir bilginin doğruluğunu ve kendi kullanımınıza uygunluğunu denetlemek sizin sorumluluğunuzdadır.

© 2026 ScholarGate · Araştırma yöntemleri referans kütüphanesi
  • Gizlilik
  • Çerezler
  • Koşullar
  • Hesabı sil