Uzun Kısa Süreli Bellek (LSTM)
Long Short-Term Memory Network (LSTM) · Ayrıca şöyle bilinir: LSTM, LSTM network, LSTM-RNN, long short-term memory RNN
Uzun Kısa Süreli Bellek (LSTM), 1997 yılında Hochreiter ve Schmidhuber tarafından tanıtılan, kapılı bir tekrarlayan sinir ağı mimarisidir. Özel bellek hücreleri ve üç öğrenilmiş kapı — unutma, girdi ve çıktı — kullanarak uzun diziler boyunca bağımlılıkları öğrenmek üzere tasarlanmıştır. Bu kapılar, her zaman adımında hangi bilginin saklanacağını, güncelleneceğini veya ileriye aktarılacağını kontrol eder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+13 tane daha
Ne zaman kullanılır
LSTM, gözlemlerin sırasının önemli olduğu ve ilgili bağlamın birçok adımı kapsayabileceği görevler için çok uygundur: metin sınıflandırması, duygu analizi, adlandırılmış varlık tanıma, makine çevirisi, zaman serisi tahmini ve konuşma işleme. Dizileriniz orta uzunlukta (onlarca ila birkaç yüz adım) olduğunda ve kapı parametrelerini öğrenmek için yeterli etiketli veriye (genellikle binlerce örnek) sahip olduğunuzda LSTM'yi seçin. Çok uzun diziler için veya paralelliğin kritik olduğu durumlarda, Transformer genellikle tercih edilir. Daha kısa diziler için veya basitliğin önemli olduğu durumlarda, bir GRU (daha az parametre) veya önceden eğitilmiş ince ayarlı bir model (BERT, RoBERTa) daha uygun olabilir.
Güçlü yönler & sınırlılıklar
- Gradyan yok olması olmadan uzun menzilli bağımlılıkları yakalamak için özel olarak tasarlanmıştır.
- Esnek mimari: dizi sınıflandırması, belirteç etiketleme, üretim ve tahmin için çalışır.
- Kara kutu alternatiflerine kıyasla yorumlanabilir kapı yapısı — unutma, girdi ve çıktı kapıları.
- Çift yönlü uzantı (BiLSTM), dizileri her iki yönde de işleyerek bağlamı iki katına çıkarır.
- NLP, konuşma ve zaman serisi alanlarında kanıtlanmış geniş bir uygulama yelpazesi.
- Sıralı hesaplama tamamen paralelleştirilemediği için Transformer'lardan daha yavaş eğitilir.
- Önemli miktarda etiketli veri gerektirir; küçük veri kümelerinde dropout'a rağmen aşırı uyum eğilimindedir.
- Çok uzun diziler (yüzlerce adım), sınırlı hücre kapasitesi nedeniyle hala LSTM'ler için zorlayıcıdır.
- Hiperparametre ayarı — gizli birimler, katmanlar, dropout, öğrenme oranı — zaman alıcı olabilir.
- Birçok NLP görevi için, önceden eğitilmiş Transformer modelleri artık sıfırdan eğitilmiş LSTM'lerden daha iyi performans göstermektedir.
SSS
LSTM ve GRU arasındaki fark nedir?
Bir GRU, unutma ve girdi kapılarını tek bir güncelleme kapısında birleştirir ve ayrı bir hücre durumuna sahip değildir, bu da daha az parametreye ve daha hızlı eğitime yol açar. LSTM'ler, çok hassas uzun süreli bellek gerektiren görevlerde GRU'lardan biraz daha iyi performans gösterme eğilimindedir, ancak fark genellikle küçüktür ve veri kümesine bağlıdır.
Çift yönlü bir LSTM kullanmalı mıyım?
Göreviniz, tahminler yapmadan önce tam diziye erişime izin veriyorsa — sınıflandırma, NER veya çevrimdışı tahmin — bir BiLSTM, hem geçmiş hem de gelecek bağlamı dahil ederek doğruluğu tipik olarak artırır. Tahminlerin gerçek zamanlı olarak yapılması gerekiyorsa (çevrimiçi tahmin, akış), tek yönlü bir LSTM kullanın.
Bir LSTM yerine ne zaman bir Transformer seçmeliyim?
Yeterli hesaplama gücüne sahip çoğu modern NLP görevi için, önceden eğitilmiş Transformer'lar (BERT, RoBERTa), sıfırdan eğitilmiş LSTM'lerden daha iyi performans gösterir. Hesaplama veya gecikme kısıtlı olduğunda, dizileriniz metin yerine sayısal zaman serisi olduğunda veya büyük bir önceden eğitilmiş modeli ince ayarlamak için çok az veriniz olduğunda bir LSTM seçin.
Değişken uzunluktaki dizileri nasıl ele alırım?
Daha kısa dizileri ortak bir uzunluğa doldurun, kayıp hesaplamasında doldurma belirteçlerini yok saymak için bir maske oluşturun ve doldurulmuş konumların gizli durumu etkilememesi için paketlenmiş diziler (PyTorch) veya maskeleme katmanları (Keras/TensorFlow) kullanın.
Kaç LSTM katmanı ve gizli birim kullanmalıyım?
Çoğu görev için 64-512 gizli birime sahip bir ila iki yığılmış LSTM katmanı makul bir başlangıç aralığıdır. Daha fazla katman ve birim kapasiteyi artırır ancak aynı zamanda eğitim süresini ve aşırı uyum riskini de artırır; katmanlar arasında dropout kullanın ve ayrılmış bir küme veya çapraz doğrulama ile doğrulayın.
Kaynaklar
- Hochreiter, S. & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. DOI: 10.1162/neco.1997.9.8.1735 ↗
- Graves, A., Mohamed, A.-R. & Hinton, G. (2013). Speech recognition with deep recurrent neural networks. Proceedings of ICASSP 2013, pp. 6645–6649. IEEE. DOI: 10.1109/ICASSP.2013.6638947 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Long Short-Term Memory Network (LSTM). ScholarGate. https://scholargate.app/tr/deep-learning/long-short-term-memory
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- BERT Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Gated Recurrent Unit (GRU)Derin öğrenme↔ karşılaştır
- Tekrarlayan Sinir AğıDerin öğrenme↔ karşılaştır
- Cümle Gömme (Sentence Embeddings)Derin öğrenme↔ karşılaştır