Кіріспе
Автоматты сөйлеуді тануда қолданылатын сигналды бейнелеу әдісі.
Дыбыс өңдеуде, Мел жиілік сепструмы (MFC) – дыбыстың қысқа мерзімді қуат спектрін бейнелеу болып табылады, ол Мел жиіліктерінің сызықтық емес шкаласындағы логарифмдік қуат спектрінің сызықтық косинус түрлендіруіне негізделген. Мел жиілік кепстральдық коэффициенттері (MFCC) – MFC құрамына кіретін коэффициенттер. Олар аудио үзіндісінің (сызықтық емес «спектрдің спектрі») цепстральдық бейнелеу түрінен шығарылады. Сепструм мен Мел жиілік сепструмы арасындағы айырмашылық – МФК-да жиілік жолақтары Мел шкаласында тең аралықта орналасқан, бұл адамның есту жүйесінің реакциясын, қалыпты спектрде қолданылатын сызықтық аралықтағы жиілік жолақтарына қарағанда жақын көрсетеді. Бұл жиілік бұрмалауы дыбысты жақсырақ бейнелеуге мүмкіндік береді, мысалы, аудио сигналдарының тарату ені мен сақтау талаптарын азайтуға болатын аудио сығымдауда. MFCC әдетте келесідей шығарылады: Сигналдың (терезеленген үзіндінің) Фурье түрлендіруін алыңыз. Алынған спектрдің қуаттарын үшбұрышты немесе косинус жапсарлас терезелерді пайдалана отырып, Мел шкаласына бейнелеңіз. Мел жиіліктеріндегі қуаттардың логарифмдерін алыңыз. Мел логарифмдік қуаттарының дискретті косинус түрлендіруін жүзеге асырыңыз, оны сигнал ретінде қарастырыңыз. MFCC – нәтижесіндегі спектрдің амплитудасы. Бұл процесте әртүрлі өзгерістер болуы мүмкін, мысалы: масштабты бейнелеу үшін қолданылатын терезелердің пішіні немесе арақашықтығы, немесе «дельта» және «дельта-дельта» (бірінші және екінші реттік кадрлар арасындағы айырмашылық) коэффициенттері сияқты динамикалық ерекшеліктерді қосу. 2000 жылдардың басында Еуропалық телекоммуникациялық стандарттар институты ұялы телефондарда қолданылатын стандартталған MFCC алгоритмін анықтады.
In sound processing, the mel frequency cepstrum (MFC) is a representation of the short term power spectrum of a sound, based on a linear cosine transform of a log power spectrum on a nonlinear mel scale of frequency. Mel frequency cepstral coefficients (MFCCs) are coefficients that collectively make up an MFC. They are derived from a type of cepstral representation of the audio clip (a nonlinear "spectrum of a spectrum"). The difference between the cepstrum and the mel frequency cepstrum is that in the MFC, the frequency bands are equally spaced on the mel scale, which approximates the human auditory system's response more closely than the linearly spaced frequency bands used in the normal spectrum. This frequency warping can allow for better representation of sound, for example, in audio compression that might potentially reduce the transmission bandwidth and the storage requirements of audio signals. MFCCs are commonly derived as follows:
Take the Fourier transform of (a windowed excerpt of) a signal. Map the powers of the spectrum obtained above onto the mel scale, using triangular overlapping windows or alternatively, cosine overlapping windows. Take the logs of the powers at each of the mel frequencies. Take the discrete cosine transform of the list of mel log powers, as if it were a signal. The MFCCs are the amplitudes of the resulting spectrum. There can be variations on this process, for example: differences in the shape or spacing of the windows used to map the scale, or addition of dynamics features such as "delta" and "delta delta" (first and second order frame to frame difference) coefficients. The European Telecommunications Standards Institute in the early 2000s defined a standardised MFCC algorithm to be used in mobile phones.
Қолданбалар
МФКК-лар сөйлеуді тану жүйелерінде кеңінен қолданылады, мысалы, телефон арқылы айтылған сандарды автоматты түрде танитын жүйелерде. МФКК-лар музыкалық ақпаратты іздеу саласында да қолданыс таппақ, жанрларды жіктеу, аудио ұқсастығын анықтау және басқа да қолданбаларда жиі қолданылады.
Дауысты тану үшін MFCC
Mel жиіліктері MFCC-де тең бөлінгендіктен және адамның дауыс қабылдау жүйесіне ұқсас болғандықтан, MFCC динамиктерді анықтау үшін тиімді қолданылады. Мысалы, оны динамиктің ұялы телефон моделін анықтау үшін, сондай-ақ динамик туралы толық ақпарат алу үшін пайдалануға болады.
Шу сезімталдығы
MFCC мәндері қосымша шу болғанда өте тұрақты емес, сондықтан сөйлеуді тану жүйелерінде шудың ықпалын азайту үшін олардың мәндерін қалыпқа келтіру жиі қолданылады. Кейбір зерттеушілер негізгі MFCC алгоритмін жақсарту үшін өзгерістер ұсынады, мысалы, дискретті косинус түрлендіруін (DCT) есептемес бұрын логарифмдік мел амплитудаларын тиісті дәрежеге (шамамен 2 немесе 3) көтеру арқылы, бұл төмен энергиялы компоненттердің ықпалын азайтады.