Metin Sıklığı Analizi — Kelime ve N-gram Sayımları
Text Frequency Analysis (Word and N-gram Frequency Analysis) · Ayrıca şöyle bilinir: word frequency analysis, n-gram frequency analysis, Metin Frekans Analizi
Metin sıklığı analizi, bir derlemde kelimelerin, n-gram'ların ve ifadelerin ne sıklıkla geçtiğini sayarak içerik örüntülerini ve baskın temaları ortaya çıkaran betimsel bir metin madenciliği yöntemidir. George K. Zipf'in (1949) formüle ettiği, az sayıda terimin çok sık geçtiği, çoğunun ise nadir olduğu sıklık dağılımı içgörüsüne dayanır ve nicel metin analizine en temel ve yaygın kullanılan giriş noktalarından biridir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Metin verileriniz olduğunda ve baskın kelime dağarcığı, n-gram'lar veya ifadeler hakkında betimsel veya keşifsel bir ilk bakış istediğinizde metin sıklığı analizi kullanın. Kesitsel ve boylamsal derlemlere uygundur ve yalnızca mütevazı miktarda metin (yaklaşık 10 belge veya daha fazla) gerektirir. Uygun ön işleme — jetonlama, durdurma kelimesi kaldırma ve indirgeme — önce yapılmalıdır ve derlem boyutu ve dil çeşitliliğinin sıklıkların güvenilirliğini etkilediğini unutmamalısınız.
Güçlü yönler & sınırlılıklar
- Basit, şeffaf ve yorumlanması kolaydır — nicel metin analizine en temel giriş noktasıdır.
- Ham sayımlardan doğrudan içerik örüntülerini ve baskın temaları ortaya çıkarır, etiketlenmiş eğitim verisi gerektirmez.
- Hem kelimeler, hem n-gram'lar hem de ifadeler üzerinde çalışır, bu nedenle farklı anlam birimlerine uyum sağlar.
- Derlem boyutu ve dil çeşitliliği sıklıkların güvenilirliğini etkiler.
- Ham sayımlar yüzey kelime dağarcığını yakalar ancak bağlamı, anlamı veya duygu durumunu yakalamaz.
- Sonuçlar, durdurma kelimesi listeleri ve indirgeme gibi ön işleme seçimlerine büyük ölçüde bağlıdır.
SSS
Metin sıklığı analizi aslında neyi sayar?
Bir derlemde tek tek kelimelerin, bitişik kelime dizilerinin (bigramlar ve trigramlar gibi n-gram'lar) ve tekrarlanan ifadelerin ne sıklıkla geçtiğini sayar, ardından bunları sıralar. Çıktı, baskın terimleri ve temaları ortaya çıkaran bir sıklık tablosudur.
Neden önce metni ön işlemeden geçirmem gerekiyor?
Jetonlama, durdurma kelimesi kaldırma ve indirgeme olmadan, yüksek sıklıkta işlev kelimeleri ve aynı kelimenin eğik varyantları sayımları domine eder ve gerçek içeriği gizler. Tutarlı ön işleme, sıklıkların karşılaştırılabilir ve anlamlı olmasını sağlar.
Zipf yasası nedir ve neden burada önemlidir?
Zipf yasası, az sayıda kelimenin çok sık geçtiği, çoğunun ise nadir olduğu ve uzun bir kuyruk oluşturduğu tipik deseni tanımlar. Sıralanmış sıklık listesinin şeklini açıklar ve nadir kelime kuyruğunu aşırı okumaya karşı uyarır.
Ne kadar metne ihtiyacım var?
Yaklaşık on belge veya daha fazla mütevazı bir derlem işe yarar, ancak derlem boyutu ve dil çeşitliliği sıklıkların ne kadar güvenilir olduğunu etkiler — daha büyük ve daha temsili derlemler daha kararlı sayımlar verir.
Kaynaklar
- Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Addison-Wesley. link ↗
- Manning, C. D. & Schütze, H. (1999). Foundations of Statistical Natural Language Processing. MIT Press. ISBN: 9780262133609
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Text Frequency Analysis (Word and N-gram Frequency Analysis). ScholarGate. https://scholargate.app/tr/text-mining/frequency-analysis-text
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Sözcüksel ÇeşitlilikMetin madenciliği↔ karşılaştır
- Duygu AnaliziMetin madenciliği↔ karşılaştır
- TF-IDFMetin madenciliği↔ karşılaştır
- Konu ModellemeDerin öğrenme↔ karşılaştır