FastText
FastText: Subword-Level Word Embeddings and Efficient Text Classification · Ayrıca şöyle bilinir: fastText, fast text, subword embedding, character n-gram embedding, bag of tricks text classification
FastText, Facebook AI Research (Joulin, Bojanowski, Grave ve Mikolov, 2016–2017) tarafından geliştirilen, her kelimeyi karakter n-gram vektörlerinin toplamı olarak temsil eden bir kelime gömme ve metin sınıflandırma çerçevesidir. Bu yaklaşım, görülmemiş ve morfolojik olarak zengin kelimeler için anlamlı temsiller oluşturmaya olanak tanır ve derin sinir ağı alternatiflerinden kat kat daha hızlı metin sınıflandırması gerçekleştirmeyi sağlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
FastText, morfolojik olarak zengin diller veya çok sayıda nadir ve görülmemiş kelime içeren alanlar için genelleme yapan verimli kelime temsillerine ihtiyaç duyduğunuzda ve eğitim hızı bir kısıtlama olduğunda uygundur. Metin sınıflandırması için, orta ila büyük ölçekli veri kümelerinde (on binlerce örnek veya daha fazla) orta ila yüksek sayıda kategori ile mükemmeldir. Duygu analizi, dil tanımlama, konu etiketleme ve çok etiketli etiketleme için uygundur. Varsayımlar: girdi token'laştırılmış metindir; gömme boyutu ve n-gram aralığı hiperparametreler olarak kabul edilir. Çok kısa metinler veya aşırı küçük veri kümeleri için, daha basit kelime torbası (bag-of-words) taban çizgileri daha az ek yükle eşit derecede iyi performans gösterebilir. Bağlamsal temsillerin kritik olduğu durumlarda — örneğin, çok anlamlı kelimelerin belirsizliğini giderme — BERT gibi Transformer tabanlı modelleri göz önünde bulundurun.
Güçlü yönler & sınırlılıklar
- Alt kelime parçası vektörlerini birleştirerek kelime dışı kelimeleri doğal olarak işler, bu da onu morfolojik olarak zengin diller (Fince, Türkçe, Arapça vb.) için sağlam hale getirir.
- Eğitim son derece hızlıdır: standart bir CPU üzerinde saniyede milyonlarca kelime, GPU altyapısı olmadan büyük veri kümeleri üzerinde yinelemeye olanak tanır.
- Metin sınıflandırma doğruluğu, hesaplama maliyetinin çok altında, derin konvolüsyonel ağlarla rekabetçidir.
- Önceden eğitilmiş vektörler 157 dil için kamuya açıktır, bu da yerel eğitim olmadan anında transfer sağlar.
- Doğrusal sınıflandırıcıyı incelemek kolaydır ve karar sınırı derin mimarilere kıyasla şeffaftır.
- Kelime temsilleri bağlamdan bağımsızdır: bir kelime, verilen bir cümledeki anlamına bakılmaksızın aynı vektörü alır, BERT veya GPT gibi bağlamsal modellerin aksine.
- Ortalama havuzlanmış belge temsili, kelime sırasını ve sözdizimsel yapıyı kaybeder, bu da bileşimsel anlama gerektiren görevlerde performansı olumsuz etkileyebilir.
- Morfolojik olarak zengin diller için karakter n-gram kelime hazinesi çok büyüyebilir, bu da bellek ayak izini artırır.
- Çok küçük veri kümelerinde (birkaç yüz belgeden az) performans, basit tf-idf artı lojistik regresyon taban çizgilerini geçmeyebilir.
- Model, adlandırılmış varlık tanıma veya eş gönderme çözünürlüğü gibi ince taneli bağlamsal belirsizliği gerektiren görevler için daha az uygundur.
SSS
FastText, Word2Vec'ten nasıl farklıdır?
Word2Vec, tüm kelime token'ı başına bir vektör atar ve eğitimde bulunmayan kelimeleri temsil edemez. FastText, her kelimeyi karakter n-gram'larına ayırır ve vektörlerini toplar, böylece parça temsillerini birleştirerek herhangi bir kelime — yazım hataları ve yeni kelimeler dahil — için bir gömme üretir. Bu, FastText'i morfolojik olarak zengin dillerde ve gürültülü metinlerde önemli ölçüde daha sağlam hale getirir.
NLP görevim için FastText mi yoksa BERT mi kullanmalıyım?
Eğitim hızı, düşük bellek ve kelime dışı kelime sağlamlığının öncelikli olduğu veya GPU kaynaklarının mevcut olmadığı durumlarda FastText tercih edilir. Görev bağlamsal kelime anlamı belirsizliği gerektirdiğinde, ince taneli dilbilgisel yapının önemli olduğu veya önceden eğitilmiş bir modelin orta büyüklükte etiketlenmiş bir veri kümesinde ince ayarlanabildiği ve çıkarım gecikmesinin kabul edilebilir olduğu durumlarda BERT ve Transformer tabanlı modeller tercih edilir.
Hangi n-gram aralığını kullanmalıyım?
Orijinal makaleler, kelime gömmeleri için 3-6 uzunlukta karakter n-gram'ları ve metin sınıflandırması için 2'ye kadar karakter n-gram'ları (kelime bigramları) kullanır. Uzun morfemlere sahip eklemeli diller için, maksimum uzunluğu 6 veya 7'ye çıkarmak kapsama alanını iyileştirebilir. Pratikte, minimum ve maksimum n-gram uzunluklarını hiperparametre olarak kabul etmek ve bunları ayrılmış bir doğrulama kümesinde ayarlamak en iyisidir.
FastText birden fazla dili tek bir modelde işleyebilir mi?
Evet. Model karakter n-gram düzeyinde çalıştığı için, çok dilli metin üzerinde eğitilmiş tek bir model, aynı komut dosyasını kullanan diller arasında alt kelime temsillerini paylaşabilir. Facebook, Wikipedia üzerinde eğitilmiş 157 dili kapsayan hizalanmış çok dilli FastText vektörleri yayınladı, bu da diller arası transfer öğrenimi için kullanılabilir.
Kaynaklar
- Joulin, A., Grave, E., Bojanowski, P. & Mikolov, T. (2017). Bag of Tricks for Efficient Text Classification. In Proceedings of EACL 2017, Short Papers, pp. 427–431. ACL. DOI: 10.18653/v1/e17-2068 ↗
- Bojanowski, P., Grave, E., Joulin, A. & Mikolov, T. (2017). Enriching Word Vectors with Subword Information. Transactions of the Association for Computational Linguistics, 5, 135–146. DOI: 10.1162/tacl_a_00051 ↗
- Goldberg, Y. (2017). Neural Network Methods for Natural Language Processing. Morgan & Claypool Publishers. ISBN: 978-1-62705-298-6
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). FastText: Subword-Level Word Embeddings and Efficient Text Classification. ScholarGate. https://scholargate.app/tr/deep-learning/fasttext
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Naive BayesMakine öğrenmesi↔ karşılaştır
- Word2VecMetin madenciliği↔ karşılaştır