Gated Recurrent Unit (GRU)
Ayrıca şöyle bilinir: GRU, GRU network, gated RNN, GRU cell
Cho ve diğ. tarafından 2014'te tanıtılan Gated Recurrent Unit (GRU), zaman adımları boyunca bilgiyi seçici olarak tutmak veya atmak için iki öğrenilmiş kapı — bir güncelleme kapısı ve bir sıfırlama kapısı — kullanan, basitleştirilmiş bir tekrarlayan sinir ağıdır ve LSTM'den daha az parametreyle etkili dizi modellemesi sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+10 tane daha
Ne zaman kullanılır
GRU'yu doğal dil, zaman serileri, konuşma veya olay günlükleri gibi sıralı verilerle çalışırken — özellikle hesaplama kaynakları sınırlıysa veya eğitim hızı önemliyse — kullanın, çünkü GRU, LSTM'den daha hızlı eğitilir ve genellikle karşılaştırılabilir doğrulukla daha az parametre kullanır. Metin sınıflandırma, duygu analizi, adlandırılmış varlık tanıma, dil modellemesi ve tek değişkenli veya çok değişkenli zaman serisi tahmini gibi görevler için uygundur. LSTM'yi, LSTM'nin ek bellek hücresinin doğruluk avantajı sağlayabileceği çok uzun dizileriniz varsa veya ek hesaplama gücünüz varsa tercih edin. Sıralı olmayan, tablo verileri için, beslemeli ağların veya ağaç tabanlı modellerin daha uygun olduğu durumlarda GRU'dan kaçının.
Güçlü yönler & sınırlılıklar
- LSTM'den daha az parametre (dört yerine iki kapı), daha hızlı eğitim ve daha düşük bellek kullanımı sağlar.
- Basit RNN'lerin kaybolan gradyan sorununu hafifleterek uzun menzilli zamansal bağımlılıkların öğrenilmesini sağlar.
- Daha basit mimarisine rağmen birçok NLP ve zaman serisi karşılaştırmasında LSTM ile rekabetçi doğruluk.
- Ayarlanması daha kolay: LSTM'den daha az hiperparametre (gizli boyut, katman sayısı, bırakma).
- Daha zengin bağlamsal temsiller için çift yönlü ve yığılmış varyantlar uygulaması kolaydır.
- LSTM'nin ayrı bellek hücresinin belirgin bir avantaj sağladığı çok uzun dizilerde LSTM'den daha az performans gösterebilir.
- Uzun bağlamlı NLP görevleri için Transformer tabanlı modellerden daha yavaş ve daha fazla bellek gerektirir.
- Doğal olarak sıralı hesaplama, Transformer'ların aksine eğitim sırasında paralelliği sınırlar.
- Gizli boyut, bırakma ve öğrenme oranı gibi hiperparametrelere duyarlıdır; dikkatli ayar gerektirir.
SSS
Ne zaman GRU'yu LSTM yerine seçmeliyim?
GRU, eğitim hızının ve parametre verimliliğinin önemli olduğu ve dizilerinizin aşırı uzun olmadığı durumlarda iyi bir varsayılan seçenektir. LSTM, özel bellek hücresi sayesinde çok uzun dizilerde bir avantaja sahip olabilir, ancak ampirik sonuçlar genellikle göreve özgüdür, bu nedenle her ikisini de deneyin ve bir doğrulama setinde karşılaştırın.
GRU değişken uzunluklu dizileri işleyebilir mi?
Evet. Dizileri her yığın içinde tekdüze bir uzunluğa doldurun, ardından GRU'ya dolgu jetonlarını yok saymasını söylemek için bir maskeleme katmanı veya PyTorch'taki paketlenmiş dizi mekanizmasını kullanın. Maskeleme olmadan model, dolgu verilerinden yanlış desenler öğrenir.
Çift yönlü bir GRU kullanmalı mıyım?
Çıkarım zamanında tam dizinin mevcut olduğu metin sınıflandırma veya NER gibi görevler için, çift yönlü bir GRU (BiGRU), her diziyi hem ileri hem de geri işleyerek her jetona hem geçmiş hem de gelecek bağlamına erişim sağlar. Gerçek zamanlı veya nedensel tahminler için yalnızca ileri yön geçerlidir.
GRU hala Transformer'larla rekabetçi mi?
Küçük-orta ölçekli veri kümeleri ve daha kısa diziler için GRU rekabetçi kalır ve önceden eğitime tabi tutulmamış bir Transformer'dan çok daha hızlı eğitilir. Büyük ölçekli NLP görevleri için, önceden eğitilmiş Transformer'lar (BERT, RoBERTa) genellikle GRU'dan önemli ölçüde daha iyi performans gösterir.
Ayarlanacak temel hiperparametreler nelerdir?
En önemlileri gizli boyut (katman başına birim sayısı), yığılmış katman sayısı (1-3 yaygındır), katmanlar arasındaki bırakma oranı ve öğrenme oranıdır. Gradyan kırpma (yaklaşık 1-5 maksimum norm), eğitimi dengelemek için şiddetle tavsiye edilir.
Kaynaklar
- Cho, K., van Merrienboer, B., Gulcehre, C., Bahdanau, D., Bougares, F., Schwenk, H., & Bengio, Y. (2014). Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation. In Proceedings of EMNLP 2014, pp. 1724–1734. link ↗
- Chung, J., Gulcehre, C., Cho, K., & Bengio, Y. (2014). Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling. NIPS 2014 Deep Learning Workshop. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Gated Recurrent Unit (GRU). ScholarGate. https://scholargate.app/tr/deep-learning/gated-recurrent-unit
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- BERT Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Uzun Kısa Süreli Bellek (LSTM)Derin öğrenme↔ karşılaştır
- Tekrarlayan Sinir AğıDerin öğrenme↔ karşılaştır