Çok dilli Cümle Gömme
Multilingual Sentence Embeddings (Cross-lingual Dense Representations) · Ayrıca şöyle bilinir: multilingual sentence representations, cross-lingual sentence embeddings, mSE, multilingual semantic embeddings
Çok dilli cümle gömmeleri, birçok dilden gelen cümleleri, dilinden bağımsız olarak anlamsal olarak eşdeğer cümlelerin birbirine yakın yerleştiği tek bir paylaşılan vektör uzayına eşler. LaBSE, çok dilli Sentence-BERT ve mUSE gibi modeller, herhangi bir çeviri yapmadan 50 ila 100'den fazla dilde metinleri karşılaştırmayı, getirmeyi ve sınıflandırmayı pratik hale getirmiştir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+9 tane daha
Ne zaman kullanılır
Veri kümeniz birden çok dili kapsadığında ve anlamsal arama, çapraz dil benzerliği, belge kümeleme, paralel veri kümesi madenciliği, sıfır atışlı çapraz dil sınıflandırması veya diller arası yinelenen algılama için birleşik bir temsile ihtiyaç duyduğunuzda çok dilli cümle gömmelerini kullanın. Yöntem, hedef dilde etiketli verinin az olduğu ancak başka bir dilde (örneğin, İngilizce) bol olduğu durumlarda üstündür. Tüm metin tek bir dilde olduğunda tek dilli gömmelerin yerine kullanmaktan kaçının — tek dilli modeller genellikle bu durum için daha güçlüdür. Ayrıca, opak yoğun vektörler yerine yorumlanabilir dilbilimsel özellikler gerektirdiğinizde veya hedef dilleriniz kaynakları az ve önceden eğitilmiş model tarafından kapsanmayan diller olduğunda da kaçının.
Güçlü yönler & sınırlılıklar
- Çeviri olmadan tek bir modelden 50-100'den fazla dilde anlamsal karşılaştırma ve getirme olanağı sağlar.
- Güçlü sıfır atışlı çapraz dil aktarımı — İngilizce gömmeler üzerinde bir sınıflandırıcı eğitin ve diğer dillere uygulayın.
- Çıkarımda hesaplama açısından verimli: bir kez göm, hızlı kosinüs benzerliği veya yaklaşık en yakın komşu araması ile karşılaştır.
- Açık kaynaklı kütüphaneler (Sentence-Transformers, HuggingFace) tarafından birçok önceden eğitilmiş çok dilli kontrol noktası ile iyi desteklenir.
- Etiketli veri olmasa bile önceden eğitilmiş bir model bunları kapsıyorsa, kaynakları az diller için kullanışlıdır.
- Ön eğitim verilerinde yeterince temsil edilmeyen kaynakları az veya morfolojik olarak karmaşık diller için kalite düşer.
- Gömme alanı yoğundur ve opakdır — iki cümlenin neden benzer kabul edildiğini açıklamak zordur.
- Büyük transformatör omurgaları (milyarlarca parametre) önemli GPU belleği ve depolama gerektirir.
- Mevcut olduklarında yüksek kaynaklı diller için ince ayarlanmış tek dilli modellere göre performans geride kalır.
- Gömme hizalaması kusurludur: kültürel olarak nüanslı veya deyimsel ifadeler diller arasında doğru şekilde eşlenmeyebilir.
SSS
Hangi çok dilli cümle gömme modeliyle başlamalıyım?
LaBSE (Feng ve diğerleri, 2022) 109 dili kapsar ve getirme ve benzerlik görevlerinde güçlü performans gösterir. Sentence-Transformers kütüphanesindeki paraphrase-multilingual-mpnet-base-v2 modeli, 50'den fazla dil için daha hafif bir ayak izi ile pratik bir alternatiftir.
Çok dilli gömmeler, her şeyi İngilizce'ye çevirmekle nasıl karşılaştırılır?
Her iki yaklaşım da rekabetçidir. İngilizce'ye çevirmek, güçlü tek dilli İngilizce modellerin mevcut olması nedeniyle genellikle yüksek doğruluk elde eder, ancak çeviri maliyeti ve gecikmesi ekler ve ince çapraz dil nüanslarını kaybedebilir. Çok dilli gömmeler uçtan uca çalışır ve çeviriden kaçınır, ancak çevirinin neredeyse mükemmel olduğu yüksek kaynaklı dil çiftlerinde geride kalabilir.
Kendi alanımda çok dilli bir gömme modelini ince ayarlayabilir miyim?
Evet. Alanlara özgü paralel veya eşanlamlı verilerle ince ayar yapmak — zıt veya üçlü kayıp kullanarak — yasal, tıbbi veya bilimsel metinler gibi özel veri kümelerinde performansı önemli ölçüde artırabilir.
Hangi değerlendirme metriklerini kullanmalıyım?
Getirme görevleri için Ortalama Karşılıklı Sıralama (MRR) veya Ortalama Ortalama Hassasiyet (MAP) kullanın. Sınıflandırma için doğruluk ve makro F1 kullanın. Benzerlik görevleri için insan yargılarıyla Pearson/Spearman korelasyonunu kullanın. Tutarsızlıkları yakalamak için her zaman dil başına ve toplu bir çapraz dil kıyaslamasında değerlendirin.
Çok dilli cümle gömmeleri çok düşük kaynaklı diller için uygun mu?
Kapsam modele göre değişir. LaBSE ve mBERT birçok düşük kaynaklı dili içerir, ancak gömme kalitesi, seyrek eğitim verilerine sahip diller için daha düşüktür. Düşük kaynaklı bir dil için bir modele bağlı kalmadan önce dil özelindeki kıyaslama sonuçlarını kontrol edin.
Kaynaklar
- Reimers, N. & Gurevych, I. (2020). Making Monolingual Sentence Embeddings Multilingual using Knowledge Distillation. Proceedings of EMNLP 2020, 4512–4525. link ↗
- Feng, F., Yang, Y., Cer, D., Arivazhagan, N. & Wang, W. (2022). Language-agnostic BERT Sentence Embedding. Proceedings of ACL 2022, 878–891. DOI: 10.18653/v1/2022.acl-long.62 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Multilingual Sentence Embeddings (Cross-lingual Dense Representations). ScholarGate. https://scholargate.app/tr/deep-learning/multilingual-sentence-embeddings
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- BERT Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Çok Dilli RoBERTa Tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Çok dilli TransformerDerin öğrenme↔ karşılaştır
- Cümle Gömme (Sentence Embeddings)Derin öğrenme↔ karşılaştır
- Cümle Gömme ile Transfer ÖğrenmeDerin öğrenme↔ karşılaştır