Cümle Gömme (Sentence Embeddings)
Sentence Embeddings (Dense Vector Representations of Sentences) · Ayrıca şöyle bilinir: sentence vectors, sentence representations, SBERT, semantic sentence encoding
Cümle Gömme, bir cümleyi veya kısa bir metni, anlamsal anlamını yakalayan tek, sabit uzunlukta yoğun bir vektöre dönüştürür. Bu vektörler, anlamsal benzerlik, kümeleme, erişim ve sınıflandırma gibi sonraki görevlerin ham metin yerine sayısal temsiller üzerinde çalışmasına olanak tanır, bu da onları modern Doğal Dil İşleme (NLP) işlem hatlarındaki en çok yönlü yapı taşlarından biri haline getirir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+42 tane daha
Ne zaman kullanılır
Anlamsal benzerliği ölçmeniz, belgeleri kümelemeniz, yoğun erişim gerçekleştirmeniz veya her örnek için görevlere özgü etiketler olmadan bir sınıflandırıcıya metin beslemeniz gerektiğinde cümle gömmeleri kullanın. Orta ila büyük miktarda metniniz olduğunda ve görevler arasında aktarılan genel amaçlı bir temsile ihtiyaç duyduğunuzda üstünlük sağlarlar. Ham cümle gömmeleri — ince ayar veya görev başlığı olmadan — kalibre edilmiş olasılıklar veya yorumlanabilir özellik ağırlıkları gerektirdiğinde kullanmayın. Ayrıca çok kısa metinler (bir veya iki kelime), önceden eğitilmiş bir kodlayıcının bulunmadığı diller veya milyonlarca uzun belgeyi kodlamak maliyetli olabileceğinden hesaplama kaynaklarının önemli ölçüde kısıtlı olduğu durumlar için uygun değildir.
Güçlü yönler & sınırlılıklar
- Kelime torbası (bag-of-words) ve TF-IDF'nin kaçırdığı eşanlamlılık ve paralellik gibi zengin anlamsal anlamı yakalayın.
- Önceden eğitilmiş modeller, az veya hiç etiketli veriyle yeni alanlara kutudan çıktığı gibi aktarılır.
- Çıkarımda hızlı: kodlandıktan sonra, FAISS tarzı dizinlerle milyonlarca vektör üzerinde benzerlik araması milisaniyeler sürer.
- Çok yönlü: aynı gömmeler kümeleme, erişim, anlamsal tekilleştirme ve sınıflandırma için hizmet eder.
- Çok dilli varyantlar (örneğin, paraphrase-multilingual-mpnet) tek bir modelle diller arası benzerliği ele alır.
- Gömme kalitesi, önceden eğitilmiş modelin kalitesine ve alanına büyük ölçüde bağlıdır; alan dışı metin performansı düşürür.
- Çok uzun belgeleri tek bir sabit vektör olarak temsil etmek, ince taneli yerel bilgiyi kaybeder.
- Sonraki kararlar için kosinüs benzerliği eşikleri ampirik olarak kalibre edilmeli ve evrensel değildir.
- Milyonlarca belge için gömmeleri depolamak önemli disk alanı gerektirir; büyük kodlayıcı modeller GPU belleği gerektirir.
SSS
Hangi önceden eğitilmiş modeli kullanmalıyım?
İngilizce genel amaçlı benzerlik için, sentence-transformers kütüphanesinden 'all-mpnet-base-v2' güçlü bir varsayılan değerdir. Çok dilli görevler için 'paraphrase-multilingual-mpnet-base-v2' 50'den fazla dili kapsar. Bir modele karar vermeden önce her zaman hedef alanınızdan küçük bir örnek üzerinde kıyaslama yapın.
Bu, BERT'i doğrudan kullanmaktan nasıl farklıdır?
Standart BERT, belirteç düzeyindeki görevler için optimize edilmiş belirteç başına temsiller üretir. Ham çıktısını (örneğin, [CLS] vektörü) cümle gömme olarak kullanmak, zayıf kosinüs benzerliği sonuçları verir. Sentence-BERT, BERT'i zıt bir hedefle ince ayarlar, böylece ortaya çıkan vektörler açıkça cümle düzeyinde karşılaştırma için yapılandırılır.
Kaç etiketli örneğe ihtiyacım var?
Sentence-transformers kütüphanesinden kullanıma hazır cümle gömme modelleri, çıkarım için sıfır etiketli örnek gerektirir. Alanınızda ince ayar yaparsanız, benzerlik etiketlerine sahip birkaç yüz cümle çifti bile performansı fark edilir şekilde iyileştirebilir.
Uzun belgeler için cümle gömmeleri kullanabilir miyim?
Çoğu kodlayıcının bir belirteç sınırı vardır (BERT tabanlı modeller için 512 belirteç). Daha uzun metinler için belgeyi cümlelere veya paragraflara ayırabilir, her parçayı gömebilir ve parça vektörlerini havuzlayabilirsiniz. Alternatif olarak, Longformer gibi modeller daha uzun bağlamları yerel olarak işler.
Gömmelerimin kalitesini nasıl değerlendiririm?
Standart kıyaslamalar STS-B (Anlamsal Metin Benzerliği Kıyaslaması) ve MTEB'i (Kitlesel Metin Gömme Kıyaslaması) içerir. Kendi verilerinizde, benzerlik puanlarına sahip insan tarafından etiketlenmiş cümle çiftleri, model puanları ile insan yargıları arasındaki Spearman korelasyonunu hesaplamanıza olanak tanır.
Kaynaklar
- Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing (EMNLP), 3980–3990. DOI: 10.18653/v1/D19-1410 ↗
- Kiros, R., Zhu, Y., Salakhutdinov, R., Zemel, R. S., Torralba, A., Urtasun, R., & Fidler, S. (2015). Skip-Thought Vectors. Advances in Neural Information Processing Systems (NeurIPS), 28. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Sentence Embeddings (Dense Vector Representations of Sentences). ScholarGate. https://scholargate.app/tr/deep-learning/sentence-embeddings
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- BERT Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Uzun Kısa Süreli Bellek (LSTM)Derin öğrenme↔ karşılaştır
- RoBERTa Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Konu ModellemeDerin öğrenme↔ karşılaştır