Кіріспе
VoiceXML (VXML) – адамдар мен компьютерлер арасындағы интерактивті медиа және дауыс диалогтарын анықтауға арналған цифрлық құжат стандарты. Ол банктік жүйелер және автоматтандырылған клиенттерге қызмет көрсету порталдары сияқты аудио және дауыстық жауап беру қолданбаларын жасау үшін қолданылады. VoiceXML қолданбалары веб-серверден алатын гипермәтіндік таңбалау тілін (HTML) веб-браузер түсініп, визуализациялайтындай әдіспен жасалады және орналастырылады. VoiceXML құжаттары дауыс браузерлермен түсіндіріледі және кең таралған орналастыру архитектураларында пайдаланушылар дауыс браузерлермен қоғамдық телефон желісі (PSTN) арқылы байланысады. VoiceXML құжатының форматы кеңейтілген таңбалау тіліне (XML) негізделген. Бұл стандартты World Wide Web Consortium (W3C) әзірлеген.
VoiceXML (VXML) is a digital document standard for specifying interactive media and voice dialogs between humans and computers. It is used for developing audio and voice response applications, such as banking systems and automated customer service portals. VoiceXML applications are developed and deployed in a manner analogous to how a web browser interprets and visually renders the Hypertext Markup Language (HTML) it receives from a web server. VoiceXML documents are interpreted by a voice browser and in common deployment architectures, users interact with voice browsers via the public switched telephone network (PSTN). The VoiceXML document format is based on Extensible Markup Language (XML). It is a standard developed by the World Wide Web Consortium (W3C).
Тарих
AT&T корпорациясы, IBM, Lucent және Motorola 1999 жылдың наурызында дауыс диалогтарын сипаттау үшін стандартты таңбалау тілін әзірлеу мақсатында VoiceXML Forum құрды. 1999 жылдың қыркүйегінде Форум мүшелердің пікірін алу үшін VoiceXML 0.9 нұсқасын жариялады, ал 2000 жылдың наурызында VoiceXML 1.0 нұсқасын шығарды. Содан кейін Форум стандартты басқаруды W3C-ге берді. W3C VoiceXML 2.0-ның бірнеше аралық нұсқаларын жасады, олар 2004 жылдың наурыз айында "Ұсыным" статусына қол жеткізді. VoiceXML 2.1, 2.0 стандартының іске асырылуынан алынған пікірлерге негізделген, 2.0 нұсқасына шамалы қосымша мүмкіндіктер қосты. Ол VoiceXML 2.0-мен үйлесімді және 2007 жылдың маусым айында W3C ұсынысы мәртебесіне ие болды.
Стандарттың болашақ нұсқалары
VoiceXML 3.0 жаңа маңызды мүмкіндіктерімен VoiceXML-дің келесі үлкен шығарылымы болжаныпты. Бірақ, 2022 жылдың мамырында VoiceXML форумы таратылғандықтан, жаңа стандартты әзірлеу жобасы тоқтатылды.
Қатысушы стандарттар
W3C-тің Дауыс интерфейсінің аясы VoiceXML-мен тығыз байланысты басқа да стандарттарды анықтайды.
SRGS және SISR
Сөйлеуді тану грамматикалық ерекшелігі (SRGS) сөйлеуді тану құрылғысына қандай сөйлем үлгілерін күту керектігін көрсету үшін пайдаланылады: осы үлгілер грамматикалар деп аталады. Сөйлеуді танушы естіген сөйлемнің ең мүмкін нұсқасын анықтағаннан кейін, ол осы сөйлемнің семантикалық мағынасын іздеп алып, оны VoiceXML интерпретаторына қайтаруы тиіс. Осы семантикалық түсіндіру Сөйлеуді тануға арналған семантикалық интерпретация (SISR) стандарты арқылы анықталады. SISR, SRGS ішінде грамматикалармен байланысты семантикалық нәтижелерді, яғни сөйлеуді танушы қайтаратын семантикалық құрылымды құратын ECMAScript тапсырмалары жиынтығын көрсету үшін қолданылады.
SSML
Сөйлеу синтезі таңбалау тілі (SSML) мәтіндік сұрауларды синтетикалық сөйлеуде оңтайлы түрде беру үшін, мысалы, қандай сөйлеу синтезаторының дауысын қолдану керек немесе қашан дауысты қаттырақ немесе жұмсақ айту керек екені туралы ақпаратпен толықтыруға қолданылады.
СӨЗ
Pronunciation Lexicon Specification (PLS) сөздердің қалай дұрыс айтылатынын анықтауға арналған. Дайындалған айтылу ақпараты дауыстық қолданбаларда сөзді тану және сөзді жасау жүйелері үшін пайдаланылады.
CCXML
Call Control eXtensible Markup Language (CCXML) – W3C-нің толықтыратын стандарты. CCXML интерпретаторы кейбір VoiceXML платформаларында шалушы мен дауыстық браузер арасындағы бастапқы қоңырауды орнатуды басқару және қоңырауды басқаға жіберу, қоңырауды ажырату сияқты телекоммуникациялық қызметтерді дауыстық браузерге ұсыну үшін пайдаланылады. CCXML VoiceXML контексінен тыс жерлерде де қолданылуы мүмкін.
MSML, MSCML, MediaCTRL
Медиасерверлік қолданбаларда, мысалы, көп тарапты конференцияда бірнеше шақыру бөлігінің бір-бірімен өзара әрекеттесуі жиі қажет болады. VoiceXML-де осы қолданба үшін кейбір жетіспеушіліктер анықталды, сондықтан компаниялар осы ортамен жұмыс істеу үшін арнайы сценарий тілдерін жасады. Media Server Markup Language (MSML) Convedia-ның шешімі болды, ал Media Server Control Markup Language (MSCML) Snowshore-дың шешімі болды. Snowshore қазір Dialogic компаниясына, ал Convedia қазір Radisys компаниясына тиесілі. Бұл тілдер сонымен қатар "қосымша нүктелерді" (hooks) қамтиды, соның арқасында IVR функционалдығы қажет болған шақыру бөліктерінде сыртқы сценарийлер (VoiceXML сияқты) іске қосылуы мүмкін. Осы сценарий жүйелерінің ізбасары үшін жұмыс істеген mediactrl ("медиа басқару") деп аталатын IETF жұмыс тобы болды, оның ашық және кеңінен қабылданған стандартқа айналуы үміті бар еді. Mediactrl жұмыс тобы 2013 жылы жұмысын аяқтады.