Модель интонационных контуров Momel: анализ и синтез.
Momel
Анализ и синтез интонаций с помощью алгоритма Momel (CNRS). Изучение паттернов интонации, отделение от сегментной структуры речи для точного сравнения.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Momel (Моделирование мелодии) — алгоритм, разработанный Дэниелом Хирстом и Робертом Эспессером в CNRS Laboratoire Parole et Langage, Экс-ан-Прованс, для анализа и синтеза интонационных паттернов.
Momel (Modelling melody) is an algorithm developed by Daniel Hirst and Robert Espesser at the CNRS Laboratoire Parole et Langage, Aix en Provence:
for the analysis and synthesis of intonation patterns.
Цель
Анализ необработанных кривых основной частоты для изучения интонации должен учитывать, что говорящие одновременно формируют интонационную модель и произносят последовательность слогов, состоящих из сегментных звуков. Фактические необработанные кривые основной частоты, доступные для акустического анализа, являются результатом взаимодействия этих двух компонентов, что затрудняет сравнение интонационных моделей, произносимых с различным слоговым составом. Например, сравните интонационные модели в фразах "Это папе" и "Это маме".
The analysis of raw fundamental frequency curves for the study of intonation needs to take into account the fact that speakers are simultaneously producing an intonation pattern and a sequence of syllables made up of segmental phones. The actual raw fundamental frequency curves which can be analysed acoustically are the result of an interaction between these two components and this makes it difficult to compare intonation patterns when they are produced with different segmental material. Compare for example the intonation patterns on the utterances It's for papa and It's for mama.
Последствия
С одной стороны, два высказывания "Маме!" и "Папе!" таким образом можно было бы моделировать с использованием одних и тех же целевых точек (следовательно, одного и того же макромелодического компонента), в то время как "Маме?" и "Папе?" также имели бы те же целевые точки, но, вероятно, отличающиеся от первой пары. С другой стороны, высказывания "Маме!" и "Маме?" можно было бы моделировать с одним и тем же микромелодическим профилем, но с разными целевыми точками, а "Папе!" и "Папе?" также имели бы один и тот же микромелодический профиль, но отличающийся от первой пары. Алгоритм Momel выводит то, что его авторы называют фонетическим представлением интонационной модели, нейтральным по отношению к речепроизводству и речевосприятию, поскольку, хотя он и не основан на модели производства или восприятия, он содержит достаточно информации для использования в качестве входных данных для моделей любого из этих процессов. Относительная теоретическая нейтральность алгоритма позволила использовать его в качестве первого шага при получении представлений, таких как модели Фудзисаки (Mixdorff 1999), ToBI (Maghbouleh 1999, Wightman & al. 2000) или INTSINT (Hirst & Espesser 1993, Hirst et al. 2000).
On the one hand, two utterances "For Mama!" and "For Papa!" could thus be modelled with the same target points (hence the same macromelodic component) while "For Mama?" and "For Papa?" would also have the same target points but which would probably be different from those of the first pair. On the other hand, the utterances "For Mama!" and "For Mama?" could be modelled with the same micromelodic profile but with different target point, while "For Papa!" and "For Papa?" would also have the same micromelodic profile but which would be different from those of the first pair. The Momel algorithm derives what its authors refer to as a phonetic representation of an intonation pattern which is neutral with respect to speech production and speech perception since while not explicitly derived from a model of either production or perception it contains sufficient information to allow it to be used as input to models of either process. The relatively theory neutral nature of the algorithm has allowed it to be used as a first step in deriving representations such as those of the Fujisaki model (Mixdorff 1999), ToBI (Maghbouleh 1999, Wightman & al. 2000) or INTSINT (Hirst & Espesser 1993, Hirst et al. 2000).