Pekiştirmeli Öğrenme
Reinforcement Learning (Agent-Environment Reward Optimization) · Ayrıca şöyle bilinir: RL, reward-based learning, trial-and-error learning, policy optimization
Pekiştirmeli Öğrenme (RL), bir ajanın bir ortamla etkileşim kurarak, skaler ödül sinyalleri alarak ve kümülatif gelecek ödülü maksimize etmek için bir politikayı güncelleyerek sıralı kararlar almayı öğrendiği bir çerçevedir. Gözetimli öğrenmenin aksine, etiketlenmiş örnekler sağlanmaz; ajan optimal davranışı tamamen deneyim ve gecikmeli geri bildirim yoluyla keşfeder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+2 tane daha
Ne zaman kullanılır
Görev gecikmeli ödüllere sahip sıralı karar verme ve etiketlenmiş eğitim verisi olmadığında pekiştirmeli öğrenmeyi kullanın: oyun oynama, robotik kontrol, kaynak zamanlama, öneri sıralama veya insan geri bildirimiyle (RLHF) dil modellerini ince ayar yapma. RL, ortam ucuz bir şekilde simüle edilebiliyorsa ve ajan birçok kez etkileşim kurabiliyorsa uygundur. Bir denetimli veya kendi kendine denetimli yaklaşım sorunu çözebiliyorsa RL'yi KULLANMAYIN — RL örnek açısından verimsiz ve kararsızdır; ödül fonksiyonu belirtilmesi zorsa; gerçek ortamla etkileşimler simülatör olmadan pahalı veya tehlikeliyse; veya veri kümesi statik ve sabitse (çevrimdışı RL'yi dikkatle kullanın).
Güçlü yönler & sınırlılıklar
- Etiketlenmiş veri olmadan doğrudan etkileşimden öğrenir, bu da etiketlemenin imkansız olduğu durumlarda uygulanabilir olmasını sağlar.
- Karmaşık sıralı görevlerde (oyunlar, robotik, zamanlama) insanüstü stratejiler keşfetme yeteneği.
- Uzun vadeli planlama ve zamansal kredi atamasını doğal olarak modeller.
- Derin sinir ağlarıyla birleştirildiğinde yüksek boyutlu durum alanlarına (piksel, metin) ölçeklenir.
- RLHF, büyük dil modellerini insan tercihlerine uyumlu hale getirmeyi sağlar.
- Son derece örnek açısından verimsizdir: yakınsama için milyonlarca ortam etkileşimi gerektirebilir.
- Eğitim genellikle kararsızdır ve hiperparametreler, ödül şekillendirme ve rastgele tohumlara duyarlıdır.
- Ödül fonksiyonu tasarımı zordur; kötü belirtilmiş ödüller istenmeyen optimizasyona (ödül hackleme) neden olur.
- Görülmeyen durumlara veya ortamlara genelleme garanti edilmez.
- Kapsamlı simülasyon olmadan gerçek dünya dağıtımı risklidir; keşif tehlikeli eylemlere neden olabilir.
SSS
Pekiştirmeli öğrenmeyi gözetimli öğrenmeden ayıran nedir?
Gözetimli öğrenme etiketlenmiş girdi-çıktı çiftleri gerektirir ve sabit bir eşleme öğrenir. RL etiket gerektirmez; bunun yerine ajan eylemlerden sonra ödül sinyalleri alır ve deneme yanılma yoluyla ne yapması gerektiğini keşfetmelidir, bu da doğru eylemin önceden bilinmediği sıralı karar problemleri için uygun hale getirir.
Model-tabanlı ve model-serbest RL arasındaki fark nedir?
Model-serbest RL (örneğin, DQN, PPO), ortam dinamiklerinin açık bir modeli olmadan deneyimden doğrudan politikaları veya değer fonksiyonlarını öğrenir. Model-tabanlı RL, bir geçiş modeli öğrenir veya verilir ve planlama için kullanır. Model-tabanlı yöntemler genellikle daha örnek açısından verimlidir ancak öğrenmesi zor olabilen doğru bir model gerektirir.
Değer tabanlı ve politika gradyanı yöntemi arasında nasıl seçim yapmalıyım?
DQN gibi değer tabanlı yöntemler ayrık eylem alanlarında iyi çalışır ve nispeten kararlıdır. Politika gradyanı yöntemleri (REINFORCE, PPO, SAC) sürekli eylem alanlarını doğal olarak işler ve stokastik politikalar öğrenebilir. Aktör-eleştirmen yöntemleri her ikisini de birleştirir. Çoğu modern uygulama için PPO veya SAC güvenli başlangıç noktalarıdır.
RL tipik olarak ne kadar ortam etkileşimi gerektirir?
RL, bilindiği gibi örnek açlığı çeker. Basit tablosal görevler binlerce adımda yakınsayabilir; Atari DQN on milyonlarca kare gerektirdi; karmaşık robotik görevler yüz milyonlarca simülasyon adımı gerektirebilir. Bu, hızlı bir simülatörü zorunlu kılar ve pahalı etkileşimlere sahip birçok gerçek dünya problemi için RL'yi dışlar.
RLHF nedir ve neden önemlidir?
İnsan Geri Bildiriminden Pekiştirmeli Öğrenme, insan tercih karşılaştırmalarından bir ödül modeli eğitir ve ardından öğrenilen ödülü maksimize etmek için RL ile bir dil modelini ince ayar yapar. Büyük dil modellerini insan değerleriyle uyumlu hale getirmek için baskın tekniktir ve InstructGPT ve Claude gibi modellerin merkezindedir.
Kaynaklar
- Sutton, R. S. & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. ISBN: 978-0-262-03924-6
- Mnih, V., Kavukcuoglu, K., Silver, D., et al. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529–533. DOI: 10.1038/nature14236 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Reinforcement Learning (Agent-Environment Reward Optimization). ScholarGate. https://scholargate.app/tr/deep-learning/reinforcement-learning
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Politika Gradyan YöntemleriMakine öğrenmesi↔ karşılaştır
- Tekrarlayan Sinir AğıDerin öğrenme↔ karşılaştır