MFCC (Mel-Frekans Kepstral Katsayıları)
Mel-Frequency Cepstral Coefficients · Ayrıca şöyle bilinir: mel-cepstral features, MFCC features, mel-frequency features
Mel-Frekans Kepstral Katsayıları (MFCC'ler), insan işitsel algısını taklit eden ses özelliklerinin kompakt bir temsilidir. Davis ve Mermelstein tarafından 1980'de tanıtılan MFCC'ler, konuşma tanıma ve çevresel ses analizi için fiili özellik çıkarma yöntemidir. Ses sinyallerinin frekans bilgisini, fonetik içeriği yakalayan ve ilgisiz ayrıntıları atan küçük bir katsayı kümesine sıkıştırırlar.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
MFCC'leri konuşma tanıma, konuşmacı tanımlama, duygu tespiti ve çevresel ses sınıflandırması için kullanın. Otomatik konuşma tanıma (ASR) sistemleri ve derin öğrenme modelleri için endüstri standardıdırlar. Açık konuşma veya çevresel yapıya sahip ses sinyallerine uygulayın. Modifikasyon olmadan müzik analizi için kaçının (müzik spektral akı veya kroma gibi farklı özellikler gerektirir).
Güçlü yönler & sınırlılıklar
- Kompakt temsil (~ çerçeve başına 13 katsayı) hesaplama maliyetini ve depolamayı azaltır
- İnsan işitsel algısıyla uyumlu; algısal olarak önemli bilgileri yakalar
- Konuşmacı değişkenliğine ve orta düzey gürültüye karşı dayanıklı
- Konuşma tanıma çerçevelerinde (HTK, Kaldi, TensorFlow) yaygın olarak uygulanmıştır
- Faz bilgisini atar; ses tek başına MFCC'lerden yeniden oluşturulamaz
- Çerçeveler içindeki durağanlığı varsayar; kısa vadeli özellikler uzun vadeli desenleri kaçırır (delta/ivme ile üstesinden gelinir)
- Müzik için optimal değil; müzik özellikleri (spektral merkez, kroma vb.) genellikle daha iyidir
- Mikrofon özelliklerine ve arka plan gürültüsüne duyarlı (normalleştirme gerektirir)
SSS
Hz yerine neden mel ölçeği kullanılır?
İnsan işitmesi perdenin doğrusal değil, logaritmik olarak algılar. Mel ölçeği bunu yansıtır: 1 mel, perdedeki 1 fark edilebilen değişiklik'e karşılık gelir. Frekansları mel ölçeğine göre gruplandırmak algısal farklılıkları daha iyi yakalar.
Delta ve ivme katsayıları nelerdir?
Delta katsayıları, MFCC'lerin zaman içindeki değişim oranını; ivme katsayıları ise ikinci türevi yakalar. Bunları statik MFCC'lere eklemek, konuşma tanımayı önemli ölçüde iyileştirir (özellik vektörü yaklaşık 13 yerine 39 sayı).
Kaç tane MFCC katsayısı seçeceğime nasıl karar veririm?
Konuşma için 12-13 statik katsayı standarttır. Deltalar ve ivmeler dahil olmak üzere toplam 39-40 (13 × 3) kullanın. Farklı alanlar veya örnekleme hızları için deney yapın; daha fazla katsayı daha fazla ayrıntı yakalar ancak aşırı uyum sağlayabilir.
Kaynaklar
- Davis, S., & Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Transactions on Acoustics, Speech, and Signal Processing, 28(4), 357-366. DOI: 10.1109/TASSP.1980.1163420 ↗
- Young, S. J., Evermann, G., Gales, M. J., et al. (1996). The HTK Book. Cambridge University Engineering Department. link ↗
- Moustakides, G. V., & Rougui, J. A. (2004). Optimal filtering for polynomial signal models. IEEE Transactions on Signal Processing, 52(8), 2219-2230. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Mel-Frequency Cepstral Coefficients. ScholarGate. https://scholargate.app/tr/applied-physics/mfcc
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- AmbisonicsUygulamalı fizik↔ karşılaştır
- Head-Related Transfer FunctionUygulamalı fizik↔ karşılaştır
- Bağımsız Vektör AnaliziUygulamalı fizik↔ karşılaştır