Pekiştirmeli Öğrenme ile Transfer Öğrenmesi
Transfer Learning Applied to Reinforcement Learning · Ayrıca şöyle bilinir: Transfer RL, TL for RL, cross-task reinforcement learning, inductive transfer in RL
Pekiştirmeli Öğrenme ile Transfer Öğrenmesi (Transfer RL), bir ajanın bir veya daha fazla kaynak görevde edindiği bilgiyi — politika ağırlıkları, değer fonksiyonları veya öğrenilmiş temsiller olarak kodlanmış — ilgili ancak farklı bir hedef görevi öğrenmeyi hızlandırmak veya iyileştirmek için yeniden kullandığı bir eğitim paradigmasıdır. Karmaşık veya pahalı ortamlarda sıfırdan pekiştirmeli öğrenmenin yol açtığı örnek-verimsizliği doğrudan ele alır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Hedef ortamın örnek-pahalı olduğu (fiziksel robotlar, klinik simülasyonlar, yüksek doğruluklu oyun motorları) ve bir veya daha fazla ilgili kaynak görevinin ucuz bir şekilde veya simülasyonda eğitilebildiği durumlarda Transfer RL kullanın. Hedef görev bölümleri maliyetli, zaman alıcı veya etik olarak kısıtlanmış olduğunda özellikle değerlidir. Kaynak ve hedef görevler yapısal olarak farklı olmadığında kullanmayın — olumsuz transfer, sıfırdan başlamaktan daha yavaş öğrenmeye neden olabilir. Ayrıca, bol miktarda ucuz hedef görev veriniz olduğunda bundan kaçının, bu durumda sıfırdan standart RL, transfer kurulumunun karmaşıklığı olmadan da iyi bir şekilde yakınsayabilir.
Güçlü yönler & sınırlılıklar
- Yeterli performansa ulaşmak için gereken hedef görev etkileşimlerinin sayısını önemli ölçüde azaltır.
- Başlangıç faydası: aktarılan politika genellikle ilk bölümden itibaren anlamlı bir şekilde şansın üzerinde performans gösterir.
- Maliyet, zaman veya güvenlik kısıtlamaları nedeniyle sıfırdan tam eğitimin pratik olmadığı alanlarda RL'yi mümkün kılar.
- Ağırlık başlatma veya ödül şekillendirme yoluyla tüm büyük RL algoritmalarıyla (DQN, PPO, SAC, vb.) uyumludur.
- Özellikle simülasyondan gerçeğe transferde güçlüdür, burada ucuz bir simülatör kaynak görev olarak hizmet eder.
- Olumsuz transfer: kötü seçilmiş bir kaynak görev, hedef görev performansını olumsuz etkileyen endüktif önyargılar getirebilir.
- Kaynak ve hedef görevler arasında anlamlı bir yapısal ilişki gerektirir; görevler arası eşlemeyi tanımlamak önemsiz olmayabilir.
- Artan boru hattı karmaşıklığı — kaynak eğitimi, transfer eşlemesi ve hedef adaptasyonun tümü yönetilmelidir.
- Yeni bir görev çifti için transferin yardımcı olup olmayacağını veya zarar verip vermeyeceğini önceden tahmin etmek zordur.
SSS
Olumsuz transfer nedir ve nasıl önlenir?
Olumsuz transfer, kaynak görev bilgisi hedef görev öğrenimini aktif olarak zarara uğrattığında meydana gelir — genellikle görevlerin çelişkili dinamiklere veya ödül yapılarına sahip olması nedeniyle. Her zaman transferi sıfırdan bir temel performansla karşılaştırın ve örnek verimliliğini ölçün; eğer transfer daha yavaşsa, kaynak ağırlıkları atın veya daha muhafazakar bir ince ayar programı kullanın.
Transfer RL herhangi bir RL algoritmasıyla çalışır mı?
Evet. Ağırlık başlatma transferi algoritmadan bağımsızdır: DQN, PPO, SAC veya başka bir algoritma ile bir kaynak politika eğitin, ardından ağ ağırlıklarını hedef görev eğitimi için başlangıç noktası olarak kopyalayın. Ödül şekillendirme de benzer şekilde uyumludur. Temel gereksinim, ağ mimarisinin görevler arasında paylaşılan veya eşlenebilir olmasıdır.
Transfer RL, ince ayarlanmış RL'den nasıl farklıdır?
İnce ayar genellikle önceden eğitilmiş bir politikanın aynı görevde veya çok benzer bir varyantta, genellikle daha düşük bir öğrenme oranıyla eğitime devam etmeyi ifade eder. Transfer RL, görevler arası eşleme, ödül şekillendirme ve örnek transferini içeren daha geniş bir paradigmadır ve açıkça kaynak ve hedef görevlerin durum veya eylem uzaylarında farklı olduğu durumu ele alır.
Simülasyondan gerçeğe transfer, Transfer RL'nin bir biçimi midir?
Evet. Simülasyondan gerçeğe, Transfer RL'nin en pratik olarak önemli örneklerinden biridir: kaynak görev ucuz bir simülatördür ve hedef görev fiziksel dünyadır. Simülasyon eğitimi sırasında alan rastgeleleştirmesi, aktarılan politikayı gerçeklik boşluğuna karşı dayanıklı hale getirmek için yaygın bir tekniktir.
Hangi metrikler raporlanmalı?
En azından şunları raporlayın: başlangıç performansı (herhangi bir ince ayardan önceki ilk hedef görev ödülü), önceden tanımlanmış bir performans eşiğine ulaşmak için gereken örnek sayısı ve tam ince ayardan sonra asimptotik performans. Her üçünü de hedef ortamda eğitilmiş sıfırdan bir RL temel performansıyla karşılaştırın.
Kaynaklar
- Taylor, M. E., & Stone, P. (2009). Transfer Learning for Reinforcement Learning Domains: A Survey. Journal of Machine Learning Research, 10, 1633–1685. link ↗
- Lazaric, A. (2012). Transfer in Reinforcement Learning: A Framework and a Survey. In M. Wiering & M. van Otterlo (Eds.), Reinforcement Learning: State-of-the-Art (pp. 143–173). Springer. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Transfer Learning Applied to Reinforcement Learning. ScholarGate. https://scholargate.app/tr/deep-learning/transfer-learning-reinforcement-learning
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Etki Alanı Uyumlu Pekiştirmeli ÖğrenmeDerin öğrenme↔ karşılaştır
- İnce Ayarlı Pekiştirmeli ÖğrenmeDerin öğrenme↔ karşılaştır
- Pekiştirmeli ÖğrenmeDerin öğrenme↔ karşılaştır
- Evrişimli Sinir Ağı ile Transfer ÖğrenmeDerin öğrenme↔ karşılaştır