Açıklanabilir Pekiştirmeli Öğrenme
Explainable Reinforcement Learning (XRL) · Ayrıca şöyle bilinir: XRL, interpretable reinforcement learning, transparent RL, explainable RL
Açıklanabilir Pekiştirmeli Öğrenme (APÖ), standart pekiştirmeli öğrenme ajanlarını, politikalarını, kararlarını ve öğrenilmiş davranışlarını insanlar için yorumlanabilir kılan yöntemlerle güçlendirir. APÖ, politikayı bir kara kutu olarak ele almak yerine, sonradan açıklamalar üretir veya doğası gereği şeffaf politikalar oluşturur; bu da yüksek riskli otomatik karar verme süreçlerinde güven doğrulaması, hata ayıklama ve hesap verebilirliği mümkün kılar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
APÖ'yü, PÖ ajanlarını yüksek riskli veya düzenlenmiş ortamlarda (sağlık tedavisi optimizasyonu, otonom sürüş, finansal ticaret veya güvenliğin kritik olduğu robotik) konuşlandırırken kullanın; burada paydaşların otomatik kararları denetlemesi, doğrulaması veya yasal olarak gerekçelendirmesi gerekir. APÖ, beklenmedik ajan davranışlarında hata ayıklama sırasında veya alan uzmanlarının politikanın alan bilgisiyle uyumlu olduğunu doğrulaması gerektiğinde geliştirme aşamasında da değerlidir. Gerçek zamanlı çıkarım kısıtlamaları açıklama üretiminin ek yükünü engellediğinde veya ortam o kadar düşük riskli olduğunda ki yorumlanabilirlik standart bir PÖ ajanı üzerinde pratik bir fayda sağlamadığında saf APÖ'den kaçının. Vekil tabanlı APÖ'yü, temel gerçek politika analizinin yerine kullanmayın; vekilin sadakati, açıklamalara güvenmeden önce doğrulanmalıdır.
Güçlü yönler & sınırlılıklar
- Otomatik karar verme ajanları için insan denetimini ve düzenleyici uyumluluğu sağlar.
- Bir ajanın neden beklenmedik veya güvensiz eylemler gerçekleştirdiğini ortaya çıkararak hata ayıklamayı destekler.
- Ajan kararlarının yanı sıra eyleme geçirilebilir açıklamalar sunarak paydaş güvenini artırır.
- Sonradan açıklama yöntemleri (SHAP, LIME, belirginlik) aracılığıyla çoğu PÖ mimarisiyle uyumludur.
- Doğası gereği yorumlanabilir politika varyantları (karar ağaçları, kural listeleri), daha basit ortamlarda optimaliteden ödün vermeden tam şeffaflık sunar.
- Öğrenilen politikanın alan bilgisiyle eşleştiğini alan uzmanı doğrulamasına olanak tanır.
- Sonradan açıklamalar sadakatsiz olabilir: politikayı toplu olarak iyi uyan bir vekil, bireysel kararları yine de yanlış temsil edebilir.
- Doğası gereği yorumlanabilir politika sınıfları (ağaçlar, doğrusal modeller), karmaşık, yüksek boyutlu ortamları eksik modelleyebilir ve görev performansını düşürebilir.
- Açıklamaların üretilmesi ve değerlendirilmesi, gerçek zamanlı veya gecikmeye duyarlı uygulamalarda engelleyici olabilecek hesaplama ek yükü ekler.
- Hiçbir tek APÖ yöntemi tüm PÖ paradigmalarına genellenemez; doğru açıklama yaklaşımını seçmek alan ve mimari bilgisi gerektirir.
- Açıklama kalitesinin insan değerlendirmeleri özneldir ve çalışmalar arasında standartlaştırılması zordur.
SSS
Sonradan APÖ ile doğası gereği yorumlanabilir PÖ arasındaki fark nedir?
Sonradan APÖ, önce bir kara kutu PÖ politikasını eğitir, ardından açıklama araçlarını (SHAP, LIME, belirginlik) uygular. Doğası gereği yorumlanabilir PÖ, politika sınıfının kendisini baştan insan tarafından okunabilir bir biçimle (karar ağacı, kural listesi) sınırlar. Sonradan yöntemler daha esnektir ancak daha az sadıktır; doğası gereği yorumlanabilir yöntemler tamamen şeffaftır ancak karmaşık ortamlarda performanstan ödün verebilir.
SHAP değerleri doğrudan bir PÖ ajanına uygulanabilir mi?
Evet — SHAP, her eylem kararını girdi durum özelliklerine atfetmek için Q-fonksiyonuna veya politika ağına uygulanabilir. Ancak SHAP, özellik bağımsızlığını ve katkıların toplanabilirliğini varsayar; bu, güçlü durum bağımlılıkları olan sıralı karar problemlerinde geçerli olmayabilir, bu nedenle sonuçlar dikkatli yorumlanmalıdır.
Açıklamalar eklemek ajanın performansını düşürür mü?
Sonradan açıklamalar, politika öğrenildikten sonra üretilir ve politikayı değiştirmez, bu nedenle eğitim zamanında performans maliyeti taşımazlar. Doğası gereği yorumlanabilir politika sınıfları, hipotez alanını kısıtladıkları için yüksek boyutlu görevlerde derin ağlardan daha kötü performans gösterebilir. Takas, ortam karmaşıklığına ve gereken şeffaflık düzeyine bağlıdır.
Bir açıklamanın güvenilir olup olmadığını nasıl değerlendiririm?
Vekil sadakatini ölçün (açıklama modelinin politikanın kararlarını ayrılmış yörüngelerde ne kadar doğru yeniden ürettiği), insanların açıklamayı göz önüne alarak ajanın eylemlerini doğru bir şekilde tahmin edip edemediğini kontrol etmek için kullanıcı çalışmaları yapın ve açıklama kararlılığını test edin (benzer durumlar benzer açıklamalar üretir mi?).
Yapay zeka düzenleyici uyumluluğu için APÖ gerekli midir?
AB Yapay Zeka Yasası veya benzeri çerçevelerle yönetilen yargı bölgelerinde, yüksek riskli yapay zeka sistemleri (otonom karar verme ajanları dahil) kararlarının anlamlı açıklamalarını sağlamalıdır. APÖ, PÖ tabanlı sistemler için bu gereksinimi karşılamanın başlıca teknik yaklaşımlarından biridir.
Kaynaklar
- Puiutta, E., & Veith, E. M. S. P. (2020). Explainable Reinforcement Learning: A Survey. In Machine Learning and Knowledge Extraction (CD-MAKE 2020), Lecture Notes in Computer Science, vol. 12279, pp. 77–95. Springer. DOI: 10.1007/978-3-030-57321-8_5 ↗
- Explainable artificial intelligence. Wikipedia. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Explainable Reinforcement Learning (XRL). ScholarGate. https://scholargate.app/tr/deep-learning/explainable-reinforcement-learning
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Dikkat MekanizmasıDerin öğrenme↔ karşılaştır
- Açıklanabilir BERT Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Pekiştirmeli ÖğrenmeDerin öğrenme↔ karşılaştır