NMF Konu Modelleme
Topic Modeling with Non-negative Matrix Factorization · Ayrıca şöyle bilinir: non-negative matrix factorization topic modeling, NMF topics, Konu Modelleme — NMF
NMF konu modellemesi, Lee ve Seung (1999) tarafından tanıtılan ve parçalara dayalı ayrıştırma olan Negatif Olmayan Matris Ayrıştırması'nı (Non-negative Matrix Factorization - NMF) kullanarak bir derlemden belge-konu dağılımlarını çıkarır. Bir belge-terim matrisini iki negatif olmayan matrise ayrıştırarak, az sayıda konu elde eder ve LDA'dan daha yorumlanabilir konular üretme eğilimindedir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Yeterli sayıda belgeniz olduğunda (yaklaşık 50 veya daha fazla) ve konuların sayısını k önceden belirleyebildiğinizde bir metin derlemini keşfetmek veya tanımlamak için NMF konu modellemesini kullanın. Belge-terim matrisi olarak temsil edilen metin verilerini bekler, TF-IDF vektörleştirmesi tercih edilir. Yorumlanabilir, adlandırılabilir konular olasılıksal bir modelden daha önemli olduğunda iyi bir uyum sağlar.
Güçlü yönler & sınırlılıklar
- Toplamsal, parçalara dayalı ayrıştırması sayesinde LDA'dan daha yorumlanabilir konular üretir.
- Metin için standart temsil olan TF-IDF belge-terim matrisleri üzerinde doğal olarak çalışır.
- Kavramsal olarak basittir: açık bir belge-konu ve konu-terim ayrımı ile tek bir matris ayrıştırması.
- Konu sayısı k, verilerden öğrenilmek yerine önceden seçilmelidir.
- Kararlı konuları kurtarmak için yeterli sayıda belgeye (yaklaşık 50 veya daha fazla) ihtiyaç duyar.
- Olasılıksal bir modelin aksine, üretken bir açıklama veya konular üzerindeki ilkeli belirsizlik sağlamaz.
SSS
NMF konu modellemesi LDA'dan nasıl farklıdır?
Her ikisi de belge-konu dağılımlarını çıkarır, ancak NMF tüm bileşenleri negatif olmayan ve toplamsal olmaya zorlayan bir matris ayrıştırmasıdır, oysa LDA olasılıksal bir üretken modeldir. NMF'nin toplamsal, parçalara dayalı yapısı, konularını LDA'nınkinden daha yorumlanabilir hale getirme eğilimindedir.
Konu sayısı k'yi nasıl seçerim?
k, NMF verilerden öğrenmediği için uydurmadan önce ayarlanmalıdır. Alan bilgisinden ve birkaç k değeri boyunca konuların yorumlanabilirliğini ve tutarlılığını karşılaştırarak seçin.
Neden ham sayımlar yerine TF-IDF tercih edilir?
TF-IDF, her yerde görünen kelimelerin ağırlığını azaltır ve belgeleri ayıran terimleri vurgular, bu da ayrıştırma için daha temiz bir sinyal sağlar ve daha keskin, daha adlandırılabilir konular üretir.
Kaç belgeye ihtiyacım var?
Yaklaşık 50 veya daha fazlası önerilen minimumdur. Çok az belgeyle elde edilen konular kararsız hale gelir ve bir sonraki uydurmadan değişebilir.
Kaynaklar
- Lee, D.D. & Seung, H.S. (1999). Learning the Parts of Objects by Non-negative Matrix Factorization. Nature, 401, 788-791. DOI: 10.1038/44565 ↗
- Arora, S., Ge, R., Halpern, Y., Mimno, D., Moitra, A., Sontag, D., Wu, Y. & Zhu, M. (2013). A Practical Algorithm for Topic Modeling with Provable Guarantees. Proceedings of the 30th International Conference on Machine Learning (ICML), 280-288. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Topic Modeling with Non-negative Matrix Factorization. ScholarGate. https://scholargate.app/tr/text-mining/topic-modeling-nmf
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- BERT Gömme VektörleriMetin madenciliği↔ karşılaştır
- BERTopicMetin madenciliği↔ karşılaştır
- Belge KümelemeMetin madenciliği↔ karşılaştır
- TF-IDFMetin madenciliği↔ karşılaştır