Введение

Стандарт цифровых документов VoiceXML (VXML) — это стандарт цифровых документов, предназначенный для описания интерактивных медиа и голосовых диалогов между человеком и компьютером. Он используется для разработки приложений, работающих с аудио и голосовым ответом, таких как банковские системы и автоматизированные порталы клиентской поддержки. Приложения VoiceXML разрабатываются и внедряются аналогично тому, как веб-браузер интерпретирует и визуально отображает язык гипертекстовой разметки (HTML), полученный с веб-сервера. Документы VoiceXML интерпретируются голосовым браузером, а в типичных архитектурах развертывания пользователи взаимодействуют с голосовыми браузерами через общедоступную коммутируемую телефонную сеть (PSTN). Формат документов VoiceXML основан на языке расширяемой разметки (XML). Это стандарт, разработанный консорциумом World Wide Web Consortium (W3C).

История

AT&T Corporation, IBM, Lucent и Motorola создали VoiceXML Forum в марте 1999 года с целью разработки стандартного языка разметки для описания голосовых диалогов. К сентябрю 1999 года Форум опубликовал VoiceXML 0.9 для получения отзывов от участников, а в марте 2000 года – VoiceXML 1.0. Вскоре после этого Форум передал управление стандартом организации W3C. W3C разработал несколько промежуточных версий VoiceXML 2.0, которые достигли статуса "Рекомендации" в марте 2004 года. VoiceXML 2.1 добавил к VoiceXML 2.0 относительно небольшой набор дополнительных функций, основанный на отзывах об использовании стандарта 2.0. Он обратно совместим с VoiceXML 2.0 и получил статус Рекомендации W3C в июне 2007 года.

Будущие версии стандарта

VoiceXML 3.0 должен был стать следующим крупным релизом VoiceXML с новыми ключевыми возможностями. Однако, после роспуска Форума VoiceXML в мае 2022 года, разработка нового стандарта была прекращена.

Сопутствующие стандарты

Фреймворк речевого интерфейса W3C также определяет другие стандарты, тесно связанные с VoiceXML.

SRGS и SISR

Спецификация грамматики распознавания речи (SRGS) используется для указания распознавателю речи, какие образцы предложений он должен ожидать. Эти образцы называются грамматиками. После того как распознаватель речи определит наиболее вероятное услышанное предложение, ему необходимо извлечь из него семантический смысл и вернуть его интерпретатору VoiceXML. Эта семантическая интерпретация определяется стандартом семантической интерпретации для распознавания речи (SISR). SISR используется внутри SRGS для определения семантических результатов, связанных с грамматиками, то есть набора присваиваний ECMAScript, которые формируют семантическую структуру, возвращаемую распознавателем речи.

SSML

Язык разметки речевого синтеза (SSML) используется для добавления к текстовым запросам информации о том, как наилучшим образом синтезировать речь, например, какой голос использовать или когда говорить громче или тише.

Пожалуйста

Спецификация лексикона произношения (PLS) используется для определения произношения слов. Полученная информация о произношении предназначена для использования как в системах распознавания речи, так и в системах синтеза речи в приложениях голосового доступа.

CCXML

Call Control eXtensible Markup Language (CCXML) — это дополнительный стандарт W3C. Интерпретатор CCXML используется на некоторых платформах VoiceXML для обработки начальной установки соединения между вызывающим абонентом и голосовым браузером, а также для предоставления услуг телефонии, таких как переадресация и завершение вызова голосовым браузером. CCXML также может использоваться вне контекста VoiceXML.

MSML, MSCML, MediaCTRL

В приложениях медиасерверов часто возникает необходимость во взаимодействии нескольких каналов связи, например, в многосторонней конференции. В VoiceXML для этих целей были выявлены некоторые недостатки, поэтому компании разработали специализированные языки сценариев для работы в такой среде. Решением компании Convedia стал язык разметки медиасервера (MSML), а компании Snowshore – язык разметки управления медиасервером (MSCML). В настоящее время Snowshore принадлежит Dialogic, а Convedia – Radisys. Эти языки также содержат "перехватчики", позволяющие внешним скриптам (например, VoiceXML) выполняться на каналах связи, где требуется функциональность IVR. Рабочая группа IETF под названием mediactrl ("управление медиа") работала над созданием преемника этих систем сценариев, который, как ожидается, станет открытым и широко принятым стандартом. Рабочая группа mediactrl завершила свою работу в 2013 году.