Введение

Сигнальное представление, используемое в автоматическом распознавании речи. В обработке звука мел-частотный цепстр (MFC) представляет собой представление краткосрочного спектра мощности звука, основанное на линейном косинусном преобразовании логарифмического спектра мощности на нелинейной мел-шкале частот. Коэффициенты мел-частотного цепстра (MFCC) – это коэффициенты, которые в совокупности составляют MFC. Они выводятся из типа цепстрального представления аудиофрагмента (нелинейный «спектр спектра»). Различие между цепстром и мел-частотным цепстром заключается в том, что в MFC частотные полосы равномерно распределены по мел-шкале, что точнее приближает реакцию человеческой слуховой системы, чем линейно расположенные частотные полосы, используемые в обычном спектре. Такое частотное искажение может обеспечить более эффективное представление звука, например, при аудиокомпрессии, что потенциально может снизить пропускную способность передачи и требования к хранению аудиосигналов. MFCC обычно получают следующим образом:

Вычисляют преобразование Фурье (оконного фрагмента) сигнала. Отображают мощности спектра, полученного выше, на мел-шкалу, используя треугольные перекрывающиеся окна или, альтернативно, окна с косинусным перекрытием. Вычисляют логарифмы мощностей на каждой из мел-частот. Вычисляют дискретное косинусное преобразование списка мел-логарифмических мощностей, как если бы это был сигнал. MFCC – это амплитуды полученного спектра. В этом процессе могут быть вариации, например, различия в форме или интервале окон, используемых для отображения шкалы, или добавление динамических признаков, таких как коэффициенты «дельта» и «дельта-дельта» (разности первого и второго порядка между кадрами). Европейский институт стандартов телекоммуникаций в начале 2000-х годов определил стандартизированный алгоритм MFCC для использования в мобильных телефонах.

Приложения

MFCC широко используются в качестве признаков в системах распознавания речи, например, в системах, способных автоматически распознавать цифры, произносимые по телефону. MFCC также всё чаще находят применение в задачах извлечения музыкальной информации, таких как классификация жанров, оценка аудиоподобия и другие.

MFCC для распознавания динамиков

Поскольку частотные полосы Мела распределены равномерно в MFCC и они во многом схожи с речевой системой человека, MFCC можно эффективно использовать для идентификации говорящих. Например, их можно использовать для распознавания модели сотового телефона, принадлежащего говорящему, и получения дополнительной информации о нём.

Чувствительность к шуму

Значения MFCC недостаточно устойчивы к добавлению шума, поэтому в системах распознавания речи обычно нормализуют их значения, чтобы снизить влияние шума. Некоторые исследователи предлагают модификации базового алгоритма MFCC для повышения устойчивости, например, возведение логарифмических мел-амплитуд в подходящую степень (примерно 2 или 3) перед дискретным косинусным преобразованием (DCT), что уменьшает влияние низкоэнергетических компонентов.