Введение

Спектр фонетического резонанса в речи, или его максимум

В науке о речи и фонетике форманта — это широкий спектральный максимум, возникающий в результате акустического резонанса человеческого голосового тракта. В акустике форманта обычно определяется как широкий пик или локальный максимум в спектре. Для гармонических звуков, при таком определении, частота форманты иногда принимается за частоту гармоники, наиболее усиленной резонансом. Различие между этими двумя определениями заключается в том, характеризуют ли "форманты" механизмы образования звука или сам звук. На практике частота спектрального пика незначительно отличается от соответствующей резонансной частоты, за исключением случаев, когда гармоники совпадают с резонансной частотой, или когда источник звука преимущественно негармоничен, как, например, при шепоте и вокальном фри. Можно сказать, что комната обладает формантами, характерными для данной конкретной комнаты, благодаря её резонансам, то есть способу отражения звука от стен и предметов. Комнатные форманты такого рода усиливаются, подчеркивая определенные частоты и поглощая другие, что, например, используется Элвином Люсье в его композиции «Я сижу в комнате». В акустической цифровой обработке сигналов влияние совокупности формант (например, комнаты) на сигнал может быть представлено импульсной характеристикой. Как в речи, так и в комнатах, форманты являются характерными признаками резонансов пространства. Считается, что они возбуждаются акустическими источниками, такими как голос, и формируют (фильтруют) звуки этих источников, но сами не являются источниками звука.

История

С акустической точки зрения, фонетика сталкивалась с серьезной проблемой, связанной с идеей о том, что эффективная длина голосового тракта влияет на гласные звуки. Действительно, при изменении длины голосового тракта масштабируются все акустические резонаторы, формируемые полостями рта, а вместе с ними и их резонансные частоты. Поэтому оставалось неясным, каким образом гласные могут определяться частотами, если говорящие с разной длиной голосового тракта, например, басы и сопрано, способны производить звуки, воспринимаемые как принадлежащие к одной и той же фонетической категории. Должен был существовать способ нормализации спектральной информации, определяющей идентичность гласных. Решение этой проблемы предложил Герман в 1894 году, введя термин "форманта". По его мнению, гласный – это особое акустическое явление, зависящее от периодического возникновения специфического обертона, или "форманты", или "характеристической" черты. Частота форманты может незначительно меняться, не изменяя при этом характер гласного звука. Например, для долгого "е" (ee или iy) самая низкая частота форманты может колебаться от 350 до 440 Гц даже у одного и того же человека.

Формантская оценка

Форманты, рассматриваются ли они как акустические резонансы голосового тракта или как локальные максимумы в речевом спектре, подобные полосовым фильтрам, определяются их частотой и спектральной шириной (полосой пропускания). Существуют различные методы для получения этой информации. Формантные частоты, в акустическом понимании, могут быть оценены по частотному спектру звука с использованием спектрограммы (как показано на рисунке) или анализатора спектра. Однако для оценки акустических резонансов голосового тракта (то есть речевого определения формант) из записи речи можно использовать линейное предсказательное кодирование. Альтернативный подход заключается в извлечении спектральной огибающей путем подавления основной частоты, а затем поиске локальных максимумов в этой огибающей.

Формантские участки

Первые два форманта важны для определения качества гласных и часто считаются соответствующими измерениям открытости/закрытости (или низкости/высоты) и передне-заднего ряда (которые традиционно связывают с формой и положением языка). Таким образом, первый формант F1 имеет более высокую частоту для открытого или низкого гласного, такого как , и более низкую частоту для закрытого или высокого гласного, такого как или ; а второй формант F2 имеет более высокую частоту для переднего гласного, такого как , и более низкую частоту для заднего гласного, такого как .

Гласные почти всегда имеют четыре или более различимых форманта, а иногда и более шести. Однако первые два форманта наиболее важны для определения качества гласных и часто отображаются друг относительно друга на диаграммах гласных, хотя это упрощение не позволяет учесть некоторые аспекты качества гласных, такие как округление. Многие исследователи занимались проблемой поиска оптимального соответствия между положением гласных на формантных диаграммах и их положением на традиционном четырехугольнике гласных. Пионерская работа Ладефогеда использовала шкалу Мела, поскольку утверждалось, что она лучше соответствует слуховому восприятию высоты тона, чем акустической мере основной частоты, выраженной в герцах. Двумя альтернативами шкале Мела являются шкала Барка и шкала ERB. Другой широко используемой стратегией является отображение разницы между F1 и F2 вместо F2 на горизонтальной оси.

Формант певца

Исследования частотного спектра подготовленных ораторов и классических певцов, особенно мужских, указывают на отчетливый формант около 3000 Гц (между 2800 и 3400 Гц), который отсутствует в обычной речи или в спектрах неподготовленных ораторов или певцов. Считается, что он связан с одним или несколькими высшими резонансами голосового тракта. Именно это усиление энергии на частоте 3000 Гц позволяет певцам быть услышанными и понятыми поверх звучания оркестра. Этот формант активно развивается в процессе вокальной тренировки, например, посредством упражнений, известных как "voce di strega" или "голос ведьмы", и возникает благодаря тому, что определенная часть голосового тракта функционирует как резонатор. В классической музыке и вокальной педагогике это явление также называют "сквилло".