Введение

Сегментация речи — это процесс выявления границ между словами, слогами или фонемами в спонтанной устной речи. Этот термин относится как к когнитивным процессам, используемым человеком, так и к искусственным процессам обработки естественного языка. Сегментация речи является частью общей области восприятия речи и важной подзадачей в технологически ориентированной сфере распознавания речи, которую невозможно эффективно решить изолированно. Как и в большинстве задач обработки естественного языка, необходимо учитывать контекст, грамматику и семантику, и даже в этом случае результат часто представляет собой вероятностное разделение (основанное на статистической оценке правдоподобия), а не однозначное. Хотя основная сложность сегментации речи в разных языках, по-видимому, связана с коартикуляцией — явлением, которое может возникать как между соседними словами, так и внутри одного слова — в следующих разделах будут рассмотрены и другие проблемы, а также стратегии их решения. Эта проблема частично соотносится с задачей сегментации текста, возникающей в языках, традиционно не использующих пробелы между словами, таких как китайский и японский, в отличие от систем письма, где пробел служит разделителем слов, указывающим на границы сегментации речи. Однако даже для этих языков сегментация текста зачастую значительно проще, чем сегментация речи, поскольку письменный язык обычно не подвержен влиянию соседних слов и часто содержит дополнительные подсказки, отсутствующие в устной речи (например, использование китайских иероглифов для корней слов в японском языке).

Лексическое распознавание

В естественных языках значение сложного высказывания можно понять, разложив его на более мелкие лексические сегменты (приблизительно, слова языка), сопоставив каждому сегменту значение и объединив эти значения в соответствии с грамматическими правилами языка. Хотя лексическое распознавание, вероятно, не используется младенцами в первый год жизни из-за их крайне ограниченного словарного запаса, оно является одним из основных процессов, вовлеченных в сегментацию речи у взрослых. В современных исследованиях выделяют три основные модели лексического распознавания: во-первых, модель доступа к целому слову, утверждающая, что слова представлены в лексиконе в виде единого целого; во-вторых, модель разложения, согласно которой морфологически сложные слова разбиваются на морфемы (корни, основы, аффиксы и т. д.) и затем интерпретируются; и в-третьих, точка зрения, согласно которой используются обе модели – и доступ к целому слову, и разложение, – но модель доступа к целому слову обеспечивает определенные вычислительные преимущества и поэтому доминирует в процессе лексического распознавания. Например, в модели доступа к целому слову слово "cats" может быть сохранено и найдено по буквам: сначала "c", затем "ca", "cat" и, наконец, "cats". То же самое слово в модели разложения, скорее всего, будет храниться под корневым словом "cat" и может быть найдено после удаления суффикса "s". Аналогично, слово "falling" будет сохранено как "fall" с добавлением инфлекции "ing". Хотя сторонники модели разложения признают, что морфемный анализ может потребовать значительно больше вычислений, они утверждают, что выделение морфологической информации необходимо для других процессов (например, синтаксического анализа), которые могут происходить параллельно с лексическим поиском. В целом, исследования систем лексического распознавания человека ограничены из-за недостатка экспериментальных данных, позволяющих однозначно различить три основные модели. Более того, одно и то же высказывание может иметь разные значения в зависимости от того, как оно разделено на слова. Популярный пример, часто приводимый в этой области, – фраза "How to wreck a nice beach" (как испортить хороший пляж), которая звучит очень похоже на "How to recognize speech" (как распознать речь). Как показывает этот пример, корректная лексическая сегментация зависит от контекста и семантики, опирающихся на весь объем человеческих знаний и опыта, и, следовательно, потребует передовых технологий распознавания образов и искусственного интеллекта для реализации на компьютере. Лексическое распознавание особенно ценно в области компьютерного распознавания речи, поскольку возможность построения и поиска сети семантически связанных понятий значительно повысит эффективность программного обеспечения для распознавания речи. Статистические модели могут использоваться для сегментации и выравнивания записанной речи по словам или фонемам. Области применения включают автоматическую синхронизацию губ для мультфильмов, создание субтитров с эффектом "подпрыгивающего мяча" и лингвистические исследования. Программное обеспечение для автоматической сегментации и выравнивания доступно в коммерческой продаже.

Фонатактические сигналы

Для большинства разговорных языков границы между лексическими единицами трудно определить; фонотактика является одним из ответов на эту проблему. Можно было бы ожидать, что межсловные пробелы, используемые многими письменными языками, такими как английский или испанский, соответствовали бы паузам в их устной форме, но это верно только в очень медленной речи, когда говорящий намеренно вставляет эти паузы. В обычной речи обычно можно услышать, как несколько слов подряд произносятся без пауз между ними, и часто конечные звуки одного слова плавно переходят или сливаются с начальными звуками следующего слова. Представление о том, что речь строится как письмо, как последовательность отдельных гласных и согласных, может быть пережитком алфавитного наследия для некоторых языковых сообществ. На самом деле, произношение гласных зависит от окружающих согласных, так же как и согласные подвержены влиянию окружающих гласных; это называется коартикуляцией. Например, в слове "kit" [k] произносится дальше вперед, чем в слове "caught". Но гласный в слове "kick" фонетически отличается от гласного в слове "kit", хотя мы обычно этого не замечаем. Кроме того, в разговорной речи происходят языковые изменения, специфичные для каждого языка, которые значительно отличаются от орфографии. Например, в английском языке фразу "hit you" часто уместнее было бы написать как "hitcha". С точки зрения декомпозиции, во многих случаях фонотактика помогает говорящим определить, где проводить границы слов. В английском языке слово "strawberry" воспринимается говорящими как состоящее (фонетически) из двух частей: "straw" и "berry". Другие интерпретации, такие как "stra" и "wberry", исключаются английской фонотактикой, которая не допускает сочетание "wb" в начале слова. Другие примеры включают "day/dream" и "mile/stone", которые вряд ли будут интерпретированы как "da/ydream" или "mil/estone" из-за фонотактической вероятности или маловероятности определенных кластеров. Предложение "Five women left", которое можно фонетически транскрибировать как [faɪvwɪmɘnlɛft], является значимым, поскольку ни /vw/ в /faɪvwɪmɘn/, ни /nl/ в /wɪmɘnlɛft/ не допускаются в качестве начала слога или коды в английской фонотактике. Эти фонотактические сигналы часто позволяют говорящим легко различать границы между словами. Гармония гласных в таких языках, как финский, также может служить фонотактическими сигналами. Хотя система не позволяет сочетать передние и задние гласные в пределах одной морфемы, сложные слова позволяют двум морфемам сохранять свою собственную гармонию гласных, сосуществуя в слове. Поэтому в сложных словах, таких как "selkä/ongelma" ("боль в спине"), где гармония гласных различается между двумя составляющими сложного слова, граница будет находиться там, где происходит переключение гармонии – между "ä" и "ö" в данном случае. Тем не менее, бывают случаи, когда фонотактика не помогает в сегментации. Слова с неясными кластерами или неконтрастной гармонией гласных, как в "opinto/uudistus" ("реформа образования"), не предоставляют фонотактических подсказок о том, как их сегментировать. Однако, с точки зрения модели целого слова, считается, что эти слова хранятся как полные слова, поэтому составляющие части не обязательно имеют отношение к лексическому распознаванию.

У младенцев и нерожденных детей

Младенцы – одна из основных областей исследований в области сегментации речи. Поскольку младенцы к первому году жизни еще не овладели словарным запасом, способным обеспечить обширные контекстные подсказки или поиск слов на основе вероятности, как упоминалось выше, они часто вынуждены полагаться главным образом на фонотактические и ритмические сигналы (причем просодия является доминирующим сигналом), все из которых зависят от языка. В возрасте от 6 до 9 месяцев младенцы начинают терять способность различать звуки, отсутствующие в их родном языке, и становятся более восприимчивыми к звуковой структуре родного языка, а способность к сегментации слов проявляется примерно в 7,5 месяцев. Хотя для точного понимания процессов, которые используют младенцы для начала сегментации речи, необходимы дальнейшие исследования, текущие и прошлые исследования показывают, что младенцы, изучающие английский язык, воспринимают ударные слоги как начало слов. К 7,5 месяцам младенцы, по-видимому, способны сегментировать двусложные слова с сильным-слабым ударением, хотя слабые-сильные паттерны ударения часто интерпретируются неверно, например, "guiTAR is" может быть воспринято как "GUI TARis". Кажется, что младенцы также демонстрируют определенную сложность в отслеживании частоты и вероятности слов, например, осознавая, что, хотя слоги "the" и "dog" часто встречаются вместе, "the" также часто встречается с другими слогами, что может привести к тому, что "dog" будет проанализирован как отдельное слово или понятие, а не как "thedog". Изучающие язык люди – еще одна группа, исследуемая в контексте сегментации речи. В некоторых отношениях освоение сегментации речи может быть более сложным для изучающего второй язык, чем для младенца, не только из-за незнакоства с вероятностями и ограничениями звуков, но и особенно из-за чрезмерного применения паттернов родного языка. Хотя некоторые паттерны могут встречаться в разных языках, например, слоговая сегментация французского и английского языков, они могут быть неэффективны для таких языков, как японский, который использует систему сегментации на основе моры. Более того, фонотактические ограничения, такие как ограничительный кластер /ld/ в немецком или голландском языках, допустимы (без обязательной маркировки границ) в английском языке. Даже связь между ударением и длиной гласной, которая может казаться интуитивно понятной носителям английского языка, может отсутствовать в других языках, поэтому изучающие второй язык сталкиваются с особенно серьезными трудностями при изучении языка и его сегментационных сигналов.