Введение
Сигнальное представление, используемое в автоматическом распознавании речи. В обработке звука мел-частотный цепстр (MFC) представляет собой представление краткосрочного спектра мощности звука, основанное на линейном косинусном преобразовании логарифмического спектра мощности на нелинейной мел-шкале частот. Коэффициенты мел-частотного цепстра (MFCC) – это коэффициенты, которые в совокупности составляют MFC. Они выводятся из типа цепстрального представления аудиофрагмента (нелинейный «спектр спектра»). Различие между цепстром и мел-частотным цепстром заключается в том, что в MFC частотные полосы равномерно распределены по мел-шкале, что точнее приближает реакцию человеческой слуховой системы, чем линейно расположенные частотные полосы, используемые в обычном спектре. Такое частотное искажение может обеспечить более эффективное представление звука, например, при аудиокомпрессии, что потенциально может снизить пропускную способность передачи и требования к хранению аудиосигналов. MFCC обычно получают следующим образом:
In sound processing, the mel frequency cepstrum (MFC) is a representation of the short term power spectrum of a sound, based on a linear cosine transform of a log power spectrum on a nonlinear mel scale of frequency. Mel frequency cepstral coefficients (MFCCs) are coefficients that collectively make up an MFC. They are derived from a type of cepstral representation of the audio clip (a nonlinear "spectrum of a spectrum"). The difference between the cepstrum and the mel frequency cepstrum is that in the MFC, the frequency bands are equally spaced on the mel scale, which approximates the human auditory system's response more closely than the linearly spaced frequency bands used in the normal spectrum. This frequency warping can allow for better representation of sound, for example, in audio compression that might potentially reduce the transmission bandwidth and the storage requirements of audio signals. MFCCs are commonly derived as follows:
Вычисляют преобразование Фурье (оконного фрагмента) сигнала. Отображают мощности спектра, полученного выше, на мел-шкалу, используя треугольные перекрывающиеся окна или, альтернативно, окна с косинусным перекрытием. Вычисляют логарифмы мощностей на каждой из мел-частот. Вычисляют дискретное косинусное преобразование списка мел-логарифмических мощностей, как если бы это был сигнал. MFCC – это амплитуды полученного спектра. В этом процессе могут быть вариации, например, различия в форме или интервале окон, используемых для отображения шкалы, или добавление динамических признаков, таких как коэффициенты «дельта» и «дельта-дельта» (разности первого и второго порядка между кадрами). Европейский институт стандартов телекоммуникаций в начале 2000-х годов определил стандартизированный алгоритм MFCC для использования в мобильных телефонах.
Приложения
MFCC широко используются в качестве признаков в системах распознавания речи, например, в системах, способных автоматически распознавать цифры, произносимые по телефону. MFCC также всё чаще находят применение в задачах извлечения музыкальной информации, таких как классификация жанров, оценка аудиоподобия и другие.
MFCC для распознавания динамиков
Поскольку частотные полосы Мела распределены равномерно в MFCC и они во многом схожи с речевой системой человека, MFCC можно эффективно использовать для идентификации говорящих. Например, их можно использовать для распознавания модели сотового телефона, принадлежащего говорящему, и получения дополнительной информации о нём.
Чувствительность к шуму
Значения MFCC недостаточно устойчивы к добавлению шума, поэтому в системах распознавания речи обычно нормализуют их значения, чтобы снизить влияние шума. Некоторые исследователи предлагают модификации базового алгоритма MFCC для повышения устойчивости, например, возведение логарифмических мел-амплитуд в подходящую степень (примерно 2 или 3) перед дискретным косинусным преобразованием (DCT), что уменьшает влияние низкоэнергетических компонентов.