Введение

CMU Sphinx, также называемый Sphinx, является общим термином для описания группы систем распознавания речи, разработанных в Университете Карнеги-Меллона. Среди них - серия распознавателей речи (Sphinx 2 4) и тренажер акустической модели (SphinxTrain). В 2000 году группа Sphinx в Карнеги-Меллоне взяла на себя обязательство открыть несколько компонентов распознавания речи, включая Sphinx 2 и позже Sphinx 3 (в 2001 году). Декодеры речи поставляются с акустическими моделями и приложениями для образцов. Доступные ресурсы включают в себя программное обеспечение для обучения акустической модели, сборку языковой модели и общедоступный словарь произношения cmudict. Sphinx включает в себя ряд программных систем, описанных ниже.

Сфинкс

Sphinx - это непрерывная система распознавания речи, независимая от говорящего, использующая скрытые акустические модели Маркова (HMM) и статистическую модель языка n грамм. Он был разработан Кай Фу Ли. Сфинкс показал возможность непрерывной речи, независимого от говорящего распознавания большого словарного запаса, возможность которого в то время была под вопросом (1986). Сфинкс представляет только исторический интерес; он был заменен в исполнении последующими версиями. В архивной статье подробно описывается система.

Сфинкс 2

Быстрый ориентированный на производительность распознаватель, первоначально разработанный Сюэдун Хуан в Карнеги-Меллон и выпущенный в качестве открытого исходного кода с лицензией BSD на SourceForge Кевином Лензо в LinuxWorld в 2000 году. Sphinx 2 фокусируется на распознавании в реальном времени, подходящем для приложений с помощью разговорного языка. Как таковой, он включает в себя такие функции, как конечная точка, генерация частичных гипотез, динамическое переключение языковой модели и так далее. Он используется в диалоговых системах и системах изучения языков. Он может использоваться в компьютерных системах PBX, таких как Asterisk. Код Sphinx 2 также был включен в ряд коммерческих продуктов. Он больше не находится в активной разработке (кроме рутинного обслуживания). Разработка декодера в реальном времени происходит в рамках проекта "Корманный Сфинкс". В архивной статье описывается система.

Сфинкс 3

Sphinx 2 использовал полунепрерывное представление для акустического моделирования (т.е. для всех моделей используется один набор гауссиан, при этом отдельные модели представлены в виде вектора веса над этими гауссианцами). Сфинкс 3 принял распространенное непрерывное представление HMM и использовался в основном для высокой точности, не в реальном времени. Недавние разработки (в алгоритмах и в аппаратном обеспечении) сделали Sphinx 3 "близким" к реальному времени, хотя еще не подходят для критических интерактивных приложений. Sphinx 3 находится в активной разработке и в сочетании со SphinxTrain обеспечивает доступ к ряду современных методов моделирования, таких как LDA / MLLT, MLLR и VTLN, которые улучшают точность распознавания (см. статью о распознавании речи для описания этих методов).

Сфинкс в кармане

Версия Sphinx, которая может использоваться в встроенных системах (например, на основе процессора ARM). PocketSphinx находится в активной разработке и включает в себя такие функции, как арифметика фиксированной точки и эффективные алгоритмы для вычислений GMM.