Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Source-filter моделі сөйлеуді дауыс жолдары сияқты дыбыс көзі мен сызықты акустикалық сүзгі – дауыс жолының үйлесімі ретінде бейнелейді. Бұл модель тек жуықтау болғанымен, қарапайымдылығына байланысты сөйлеу синтезі және сөйлеу талдауы сияқты көптеген қолданыстарда кеңінен қолданылады. Ол сондай-ақ сызықтық болжаммен байланысты. Модельдің дамуы Гуннар Фанттың ерте жұмысына үлкен қарыз, бірақ Кен Стивенс сияқты басқа да ғалымдар сөйлеудің акустикалық талдауы мен сөйлеу синтезіне негізделген модельдерге маңызды үлес қосты. Фант Цутому Чиба мен Масато Кадзияманың еңбектерін пайдаланды, олар дауыстың акустикалық қасиеттері мен дауыс жолының пішіні арасындағы байланысты алғаш рет көрсетті.
The source–filter model represents speech as a combination of a sound source, such as the vocal cords, and a linear acoustic filter, the vocal tract. While only an approximation, the model is widely used in a number of applications such as speech synthesis and speech analysis because of its relative simplicity. It is also related to linear prediction. The development of the model is due, in large part, to the early work of Gunnar Fant, although others, notably Ken Stevens, have also contributed substantially to the models underlying acoustic analysis of speech and speech synthesis. Fant built off the work of Tsutomu Chiba and Masato Kajiyama, who first showed the relationship between a vowel's acoustic properties and the shape of the vocal tract.
Қолданбалар
Әр түрлі дыбыстарды олардың бастауларының қасиеттері және спектрлік пішіні бойынша әртүрлі дәрежеде ажыратуға болады. Дауысты дыбыстар (мысалы, дауыстылар) көбінесе мерзімді көмекейлік қоздырылудың арқасында кем дегенде бір бастауға ие, оны уақыт бойынша импульстік тізбек ретінде және жиілік бойынша гармоникалар ретінде шамалауға болады, сондай-ақ тілдің орналасуы және еріндердің иілуі сияқты факторларға байланысты сүзгі арқылы. Ал, [fricatives], мысалы, [s] және [ʃ], ауыз қуысы немесе жұтқыншақтағы тарылу кезінде пайда болатын турбулентті шудың кем дегенде бір бастауы бар. "[v] және [z]" сияқты дауысты фрикативтерде екі бастау бар – біреуі көмекейде, екіншісі көмекейдің үстіндегі тарылуда.
To varying degrees, different phonemes can be distinguished by the properties of their source(s) and their spectral shape. Voiced sounds (e. g., vowels) have at least one source due to mostly periodic glottal excitation, which can be approximated by an impulse train in the time domain and by harmonics in the frequency domain, and a filter that depends on, for example, tongue position and lip protrusion. On the other hand, fricatives, such as and , have at least one source due to turbulent noise produced at a constriction in the oral cavity or pharynx. So called voiced fricatives, such as and , have two sources one at the glottis and one at the supra glottal constriction.
Сөйлеу синтезі
Сөйлеу өндірісінің бастапқы-фильтрлік моделін іске асыру кезінде дыбыс көзі немесе қоздыру сигналы, дауысты сөйлеу үшін периодтық импульстар тізбегі, ал дауыссыз сөйлеу үшін ақ шу ретінде моделенеді. Дауыстық жол сүзгісі ең қарапайым жағдайда барлық полюстік сүзгі арқылы жуықтатылады, мұнда коэффициенттер қайта өндірілетін сөйлеу сигналының орташа квадраттық қатесін азайту үшін сызықтық болжау арқылы алынады. Қоздыру сигналының сүзгілік жауаппен конволюциясы синтезделген сөйлеуді құрайды.
In implementation of the source–filter model of speech production, the sound source, or excitation signal, is often modelled as a periodic impulse train, for voiced speech, or white noise for unvoiced speech. The vocal tract filter is, in the simplest case, approximated by an all pole filter, where the coefficients are obtained by performing linear prediction to minimize the mean squared error in the speech signal to be reproduced. Convolution of the excitation signal with the filter response then produces the synthesised speech.
Адамның сөйлеу процесін модельдеу
Адам сөйлеуінің жасалуында дыбыс көзі – дауыс баулары, олар қысылғанда үнемі қайталамалы дыбыс, ал босаңсығанда апериодты (ақ шу) дыбыс тудырады. Сүзгі – дауыс жолының қалған бөлігі, ол жұтқыншақ, ауыз және мұрын қуысын өзгерту арқылы пішінін өзгерте алады. Фант бұл көзді және сүзгіні тиісінше дауыс шығару мен артикуляциямен салыстырады. Көзден әртүрлі күштіліктегі бірнеше гармоникалар шығады, олар дауыс жолы арқылы өтіп, сөйлеу дыбысын жасау үшін күшейтіледі немесе әлсіретеді.
In human speech production, the sound source is the vocal folds, which can produce a periodic sound when constricted or an aperiodic (white noise) sound when relaxed. The filter is the rest of the vocal tract, which can change shape through manipulation of the pharynx, mouth, and nasal cavity. Fant roughly compares the source and filter to phonation and articulation, respectively. The source produces a number of harmonics of varying amplitudes, which travel through the vocal tract and are either amplified or attenuated to produce a speech sound.