Öz-denetimli NMF Konu Modeli
Self-supervised Non-negative Matrix Factorization Topic Model · Ayrıca şöyle bilinir: SS-NMF, self-supervised topic modeling, NMF with self-supervised signals, contrastive NMF topic model
Öz-denetimli NMF Konu Modeli, klasik Negatif Olmayan Matris Ayrıştırmayı (Non-negative Matrix Factorization - NMF) konu keşfi için genişleterek, NMF optimizasyonuna maskelenmiş kelime yeniden yapılandırma veya zıtlık hedefleri gibi öz-denetimli öğrenme sinyallerini dahil eder. Bu sayede, insan etiketli veri gerektirmeden metin derlemlerinden daha tutarlı ve anlamsal olarak anlamlı konular elde edilir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli veri olmadığında metin derleminden yorumlanabilir konu yapıları gerektiğinde, özellikle klasik LDA veya düz NMF düşük tutarlılığa sahip konular ürettiğinde Öz-denetimli NMF Konu Modellerini kullanın. Özellikle maskeli tahmin veya zıtlık artırmadan gelen bağlamsal sinyallerin anlamlı rehberlik sağladığı orta ila büyük derlemlerde etkilidir. Yeterli etiketli veriniz varsa denetimli sınıflandırma için kullanmayın, derlem çok küçükse (birkaç yüzden az belge) veya belirsizlik tahminleriyle olasılıksal belge başına konu dağılımlarına ihtiyacınız varsa – bu durumda ProdLDA gibi bir sinirsel varyasyonel konu modeli daha uygun olabilir.
Güçlü yönler & sınırlılıklar
- Düzenleyici olarak öz-denetimli sinyallerden yararlanarak düz NMF'den daha anlamsal olarak tutarlı konular üretir.
- Tamamen denetimsiz: etiketli belge gerektirmez, bu da onu herhangi bir etiketsiz metin derlemine uygulanabilir kılar.
- Negatif olmama kısıtlaması, doğal olarak yorumlanabilir, parçalara dayalı, toplamsal konu temsilleri sağlar.
- Esnek çerçeve: öz-denetimli hedef, alana bağlı olarak değiştirilebilir (zıtlık, maskeli, sözde-etiket).
- Verimli çarpımsal güncelleme veya stokastik gradyan optimizasyonu ile büyük kelime dağarcıklarına ve derlemlere ölçeklenir.
- Konu sayısı K önceden belirtilmelidir; konu kalitesi bu seçime duyarlıdır.
- Öz-denetimli sinyal tasarımı alan bilgisi gerektirir – yanlış artırma stratejileri konu tutarlılığını zedeleyebilir.
- Yakınsama yerel bir optimuma ulaşır; rastgele başlatma, çalıştırmalar arasında değişken sonuçlara yol açabilir.
- Ortak hiperparametre ayarlaması (lambda, K, artırma politikası), standart NMF veya LDA'ya kıyasla karmaşıklık ekler.
- Açık bir olasılıksal üretken model eksikliğinden dolayı, konular üzerinde Bayes belirsizlik tahminleri mevcut değildir.
SSS
Bu, konu modellemesi için standart NMF'den nasıl farklıdır?
Standart NMF, yalnızca belge-terim matrisi ile ayrıştırması arasındaki yeniden yapılandırma hatasını en aza indirir ve tamamen kelime eş-oluşumuna dayanır. Öz-denetimli NMF, verinin kendisinden türetilen yardımcı bir kayıp ekler – maskeli kelime tahmini veya zıt belge eşleştirme gibi – bu da faktörleri yalnızca istatistiksel olarak kompakt olanlara değil, anlamsal olarak tutarlı konulara doğru yönlendirir.
Konu sayısı K'yı nasıl seçerim?
Modeli bir dizi K değeri için çalıştırın ve her çözümü, tutulmuş bir kelime dağarcığı alt kümesi üzerinde NPMI (Normalleştirilmiş Noktasal Karşılıklı Bilgi) gibi bir konu tutarlılık metriği kullanarak değerlendirin. Yalnızca şaşkınlık (perplexity) kötü bir rehberdir; insan yargısı veya konu başına en iyi N kelime üzerindeki otomatik tutarlılık puanları daha güvenilirdir.
Hangi öz-denetimli hedefi kullanmalıyım?
Maskelenmiş kelime yeniden yapılandırması, genel metin derlemleri için iyi çalışır ve önceden eğitilmiş bir belirteç (tokenizer) ile uygulaması kolaydır. Zıtlık hedefleri (örn. SimCSE tarzı belge artırması), daha keskin konu sınırları verme eğilimindedir. Sözde-etiket tutarlılığı, küçük miktarda konu yapısının zaten şüphelenildiği durumlarda kullanışlıdır. Maskeli yeniden yapılandırma ile başlayın ve tutarlılık puanları düşükse değiştirin.
Torba-kelime matrisi yerine önceden eğitilmiş BERT gömme (embedding) kullanabilir miyim?
Evet. Bazı öz-denetimli NMF varyantları, terim-sayım matrisi (D x V) yerine bir bağlamsal gömme matrisini (D x d) çarpanlara ayırır. Bu genellikle anlamsal kaliteyi artırır, ancak torba-kelime NMF'nin sağladığı doğrudan kelime düzeyinde yorumlanabilirliği feda eder. Takas, aşağı akış kullanıcılarının ham konu-kelime listelerini okuması gerekip gerekmediğine bağlıdır.
Sonuç çalıştırmalar arasında tekrarlanabilir mi?
NMF ve öz-denetimli uzantıları dışbükey değildir ve yerel optimumlara yakınsar. Farklı başlatmalarla birden fazla rastgele yeniden başlatma şiddetle tavsiye edilir ve en iyi çözüm yalnızca yeniden yapılandırma kaybı yerine konu tutarlılık puanı ile seçilmelidir.
Kaynaklar
- Shi, T., Guo, X., Lv, J., & Yu, P. S. (2022). Self-supervised NMF-based graph contrastive learning for semi-supervised node classification. In Proceedings of the 36th AAAI Conference on Artificial Intelligence. link ↗
- Lee, D. D., & Seung, H. S. (1999). Learning the parts of objects by non-negative matrix factorization. Nature, 401(6755), 788–791. DOI: 10.1038/44565 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Non-negative Matrix Factorization Topic Model. ScholarGate. https://scholargate.app/tr/deep-learning/self-supervised-nmf-topic-model
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gizli Dirichlet Tahsisi (LDA)Makine öğrenmesi↔ karşılaştır
- Negatif Olmayan Matris Ayrıştırması (NMF)Makine öğrenmesi↔ karşılaştır