Модель «источник-фильтр» в речевом синтезе и анализе: упрощенное представление речи, основанное на работе вокальных связок и голосового тракта. История развития модели.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Модель «источник-фильтр» представляет речь как комбинацию источника звука, такого как голосовые связки, и линейного акустического фильтра – речевого тракта. Несмотря на то, что это лишь приближение, модель широко используется в различных областях, таких как синтез и анализ речи, благодаря своей относительной простоте. Она также связана с линейным предсказанием. Разработка модели во многом обусловлена ранними работами Гуннара Фанта, хотя и другие исследователи, в частности Кен Стивенс, внесли значительный вклад в модели, лежащие в основе акустического анализа речи и синтеза речи. Фант опирался на работы Цутому Чибы и Масато Кадзиямы, которые первыми показали взаимосвязь между акустическими свойствами гласных и формой речевого тракта.
The source–filter model represents speech as a combination of a sound source, such as the vocal cords, and a linear acoustic filter, the vocal tract. While only an approximation, the model is widely used in a number of applications such as speech synthesis and speech analysis because of its relative simplicity. It is also related to linear prediction. The development of the model is due, in large part, to the early work of Gunnar Fant, although others, notably Ken Stevens, have also contributed substantially to the models underlying acoustic analysis of speech and speech synthesis. Fant built off the work of Tsutomu Chiba and Masato Kajiyama, who first showed the relationship between a vowel's acoustic properties and the shape of the vocal tract.
Приложения
В разной степени различные фонемы можно различить по характеристикам их источника (источников) и их спектральной форме. Звонкие звуки (например, гласные) имеют как минимум один источник, обусловленный преимущественно периодическим колебанием голосовых связок, которое можно аппроксимировать импульсной последовательностью во временной области и гармониками в частотной области, а также фильтром, зависящим, например, от положения языка и округления губ. С другой стороны, щелевые звуки, такие как и , имеют как минимум один источник, обусловленный турбулентным шумом, возникающим при сужении в ротовой полости или глотке. Так называемые звонкие щелевые звуки, такие как и , имеют два источника – один в голосовых связках и один в надгортанном сужении.
To varying degrees, different phonemes can be distinguished by the properties of their source(s) and their spectral shape. Voiced sounds (e. g., vowels) have at least one source due to mostly periodic glottal excitation, which can be approximated by an impulse train in the time domain and by harmonics in the frequency domain, and a filter that depends on, for example, tongue position and lip protrusion. On the other hand, fricatives, such as and , have at least one source due to turbulent noise produced at a constriction in the oral cavity or pharynx. So called voiced fricatives, such as and , have two sources one at the glottis and one at the supra glottal constriction.
Синтез речи
При реализации модели производства речи, основанной на принципе "источник-фильтр", источник звука, или сигнал возбуждения, часто моделируется как периодический ряд импульсов для гласных и звонких согласных, или как белый шум для глухих согласных. Фильтр голосового тракта в простейшем случае аппроксимируется фильтром всех полюсов, коэффициенты которого определяются методом линейного предсказания для минимизации среднеквадратичной ошибки в речевом сигнале, подлежащем воспроизведению. Свертка сигнала возбуждения с импульсной характеристикой фильтра затем генерирует синтезированную речь.
In implementation of the source–filter model of speech production, the sound source, or excitation signal, is often modelled as a periodic impulse train, for voiced speech, or white noise for unvoiced speech. The vocal tract filter is, in the simplest case, approximated by an all pole filter, where the coefficients are obtained by performing linear prediction to minimize the mean squared error in the speech signal to be reproduced. Convolution of the excitation signal with the filter response then produces the synthesised speech.
Моделирование человеческой речевой продукции
В человеческой речи источником звука служат голосовые связки, которые могут производить периодический звук при сужении или апериодический (белый шум) звук при расслаблении. Фильтр – это остальная часть голосового тракта, способная изменять форму за счет манипуляций с глоткой, ротовой полостью и носовой полостью. Фант приблизительно сопоставляет источник и фильтр с фонацией и артикуляцией соответственно. Источник генерирует ряд гармоник различной амплитуды, которые распространяются по голосовому тракту и усиливаются или ослабляются для формирования речевого звука.
In human speech production, the sound source is the vocal folds, which can produce a periodic sound when constricted or an aperiodic (white noise) sound when relaxed. The filter is the rest of the vocal tract, which can change shape through manipulation of the pharynx, mouth, and nasal cavity. Fant roughly compares the source and filter to phonation and articulation, respectively. The source produces a number of harmonics of varying amplitudes, which travel through the vocal tract and are either amplified or attenuated to produce a speech sound.