Введение

Техника пользовательского интерфейса

Голосовой пользовательский интерфейс (VUI) обеспечивает взаимодействие человека с компьютером посредством речи, используя распознавание речи для понимания произносимых команд и ответов на вопросы, и, как правило, синтез речи для воспроизведения ответа. Голосовое командное устройство – это устройство, управляемое с помощью голосового пользовательского интерфейса. Голосовые пользовательские интерфейсы внедрены в автомобили, системы домашней автоматизации, компьютерные операционные системы, бытовую технику, такую как стиральные машины и микроволновые печи, и пульты дистанционного управления телевизорами. Они являются основным способом взаимодействия с виртуальными помощниками на смартфонах и умных колонках. Более ранние автоматические информаторы (направляющие телефонные звонки на нужный внутренний номер) и интерактивные системы голосового ответа (выполняющие более сложные операции по телефону) могут реагировать на нажатие кнопок клавиатуры посредством тонов DTMF, однако системы с полноценным голосовым пользовательским интерфейсом позволяют абонентам озвучивать запросы и ответы, не нажимая никаких кнопок. Современные голосовые командные устройства не зависят от конкретного голоса, поэтому они могут распознавать речь разных людей, независимо от акцента или диалекта. Они также способны одновременно обрабатывать несколько команд, разделять голосовые сообщения и предоставлять адекватную обратную связь, точно имитируя естественную беседу.

Обзор

VUI – это интерфейс для любого речевого приложения. Еще совсем недавно управление машиной посредством простой речи было возможно лишь в научной фантастике. До недавнего времени эта область считалась частью искусственного интеллекта. Однако прогресс в таких технологиях, как синтез речи, распознавание речи, обработка естественного языка и облачные сервисы, способствовал широкому распространению подобных интерфейсов. VUI стали более привычными, и люди все чаще используют преимущества, которые предоставляют эти интерфейсы, не требующие использования рук и глаз, во многих ситуациях. VUI должны надежно реагировать на ввод данных, иначе они будут отвергнуты и часто высмеяны пользователями. Разработка качественного VUI требует междисциплинарных знаний в области компьютерных наук, лингвистики и психологии взаимодействия человека с компьютером – навыков, которые дороги и трудно найти. Даже при наличии современных инструментов разработки, создание эффективного VUI требует глубокого понимания как задач, которые необходимо выполнить, так и целевой аудитории, которая будет использовать конечную систему. Чем точнее VUI соответствует ментальной модели пользователя, тем проще им будет пользоваться, практически без обучения, что приведет к повышению эффективности и удовлетворенности пользователя. VUI, предназначенный для широкой публики, должен быть максимально простым в использовании и предоставлять обширную помощь и инструкции для новых пользователей. Напротив, VUI, разработанный для небольшой группы опытных пользователей (включая специалистов выездного обслуживания), должен быть ориентирован в первую очередь на производительность и меньше на помощь и инструкции. Такие приложения должны оптимизировать сценарии вызовов, минимизировать запросы, исключать ненужные повторения и поддерживать сложные "диалоги со смешанной инициативой", позволяющие пользователям вводить несколько фрагментов информации в одном высказывании и в любом порядке или комбинации. Короче говоря, речевые приложения должны быть тщательно разработаны для конкретного автоматизируемого бизнес-процесса. Не все бизнес-процессы одинаково хорошо подходят для речевой автоматизации. Как правило, чем сложнее запросы и операции, тем сложнее их автоматизировать и тем выше вероятность неудачи при использовании широкой публикой. В некоторых случаях автоматизация просто невозможна, и единственным решением является помощь оператора. Например, автоматизировать горячую линию юридических консультаций будет крайне сложно. С другой стороны, речь идеально подходит для обработки быстрых и рутинных операций, таких как изменение статуса рабочего заказа, заполнение табеля рабочего времени или отчета о расходах, или перевод средств между счетами.

История

Ранние применения VUI включали голосовой набор телефонных номеров, либо напрямую, либо через (обычно Bluetooth) гарнитуру или автомобильную аудиосистему. В 2007 году в бизнес-статье CNN сообщалось, что индустрия голосового управления оценивается более чем в миллиард долларов, и что такие компании, как Google и Apple, стремятся разработать функции распознавания речи. С момента публикации этой статьи мир увидел множество устройств с голосовым управлением. Кроме того, Google разработал движок распознавания речи под названием Pico TTS, а Apple представила Siri. Устройства голосового управления становятся все более распространенными, и постоянно появляются инновационные способы использования человеческого голоса. Например, Business Week предполагает, что в будущем человеческий голос станет пультом дистанционного управления. В настоящее время Xbox Live поддерживает такие функции, а Джобс намекал на подобную функцию в новой Apple TV.

Программные продукты голосового управления на вычислительных устройствах

Как Apple Mac, так и Windows PC предоставляют встроенные функции распознавания речи в своих последних операционных системах.

Microsoft Windows

Две операционные системы Microsoft, Windows 7 и Windows Vista, предоставляют функции распознавания речи. Microsoft встроила голосовые команды в свои операционные системы, чтобы предоставить возможность людям, желающим ограничить использование мыши и клавиатуры, при этом сохраняя или повышая общую продуктивность.

Windows Vista (англ.) (англ.)

С помощью голосового управления Windows Vista пользователь может диктовать документы и электронные письма в распространенных приложениях, запускать и переключаться между приложениями, управлять операционной системой, форматировать документы, сохранять документы, редактировать файлы, эффективно исправлять ошибки и заполнять веб-формы. Программное обеспечение для распознавания речи автоматически обучается при каждом использовании, а распознавание речи доступно для английского (США), английского (Великобритания), немецкого (Германия), французского (Франция), испанского (Испания), японского, китайского (традиционного) и китайского (упрощенного) языков. Кроме того, в комплект поставки программного обеспечения входит интерактивный учебный курс, который можно использовать для обучения как пользователя, так и движка распознавания речи.

Windows 7

В дополнение ко всем возможностям, представленным в Windows Vista, Windows 7 предлагает мастер настройки микрофона и руководство по использованию этой функции.

Mac OS X

Все компьютеры Mac OS X поставляются с предустановленным программным обеспечением для распознавания речи. Это программное обеспечение не привязано к конкретному пользователю и позволяет пользователю "перемещаться по меню и вводить сочетания клавиш; произносить названия флажков, переключателей, пунктов списка и кнопок; а также открывать, закрывать, управлять и переключаться между приложениями". Однако на веб-сайте Apple рекомендуется приобрести коммерческий продукт под названием Dictate, который является тем же программным обеспечением для Mac OS.

Голосовые команды для мобильных устройств

Любое мобильное устройство с операционной системой Android, Microsoft Windows Phone, iOS 9 или более поздней версии, или Blackberry OS поддерживает голосовое управление. Помимо встроенного программного обеспечения для распознавания речи в каждой операционной системе мобильного телефона, пользователь может загружать сторонние приложения голосового управления из магазинов приложений соответствующих операционных систем: Apple App Store, Google Play, Windows Phone Marketplace (ранее Windows Marketplace for Mobile) или BlackBerry App World.

ОС Android

Google разработала операционную систему с открытым исходным кодом под названием Android, которая позволяет пользователю выполнять голосовые команды, такие как: отправка текстовых сообщений, прослушивание музыки, получение маршрутов, звонки в организации, звонки контактам, отправка электронной почты, просмотр карты, переход на веб-сайты, создание заметок и поиск в Google. Программное обеспечение для распознавания речи доступно на всех устройствах, начиная с Android 2.2 "Froyo", но языковые настройки должны быть установлены на английский язык. Google представила Google Assistant вместе с Android 7.0 "Nougat". Она значительно превосходит предыдущую версию. Amazon.com предлагает Echo, который использует кастомизированную версию Android от Amazon для обеспечения голосового управления.

Microsoft Windows

Windows Phone — это операционная система мобильных устройств Microsoft. В Windows Phone 7.5 приложение для голосового управления не требует привязки к конкретному пользователю и позволяет: звонить контакту из списка, набирать любой номер телефона, повторно набирать последний номер, отправлять текстовое сообщение, вызывать голосовую почту, открывать приложение, прочитывать запланированные встречи, узнавать состояние телефона и искать информацию в интернете. Кроме того, голосовое управление можно использовать во время телефонного разговора, выполняя следующие действия: ввод номера, включение громкой связи или набор другого номера, при этом текущий разговор будет поставлен на удержание. Также Siri работает с Bluetooth-гарнитурой и проводными наушниками.

Amazon Alexa (полное название)

В 2014 году Amazon представила устройство Alexa для умного дома. Изначально его основной функцией был просто умный динамик, позволяющий пользователю управлять им голосом. Со временем Alexa превратилась в устройство-новинку, способное управлять бытовой техникой с помощью голосовых команд. Сейчас с помощью Alexa можно управлять практически любой техникой, включая лампочки и системы отопления. Благодаря голосовому управлению, Alexa подключается к технологиям умного дома, позволяя запирать двери, регулировать температуру и активировать различные устройства. Этот вид искусственного интеллекта позволяет просто задать вопрос, после чего Alexa ищет, находит и озвучивает ответ.

Невербальные вклады

Хотя большинство голосовых пользовательских интерфейсов предназначены для взаимодействия посредством разговорной речи, в последнее время проводятся исследования по разработке интерфейсов, воспринимающих невербальные человеческие звуки в качестве входных данных. В таких системах пользователь управляет интерфейсом, издавая неречевые звуки, такие как гудение, свист или выдувание воздуха в микрофон. Одним из примеров невербального голосового интерфейса является Blendie – интерактивная художественная инсталляция, созданная Келли Добсон. В ее основе – классический блендер 1950-х годов, переоборудованный для реагирования на входной сигнал с микрофона. Чтобы управлять блендером, пользователь должен имитировать механические звуки, которые обычно издает блендер: блендер будет вращаться медленно в ответ на низкий рык пользователя и увеличивать скорость при издавании более высоких вокальных звуков. Другой пример – VoiceDraw, исследовательская система, позволяющая создавать цифровые рисунки людям с ограниченными двигательными возможностями. VoiceDraw позволяет пользователям "рисовать" штрихи на цифровом холсте, модулируя гласные звуки, которые соответствуют направлениям кисти. Модулируя другие паралингвистические характеристики (например, громкость голоса), пользователь может управлять различными параметрами рисунка, такими как толщина мазка. Другие подходы включают использование невербальных звуков для расширения сенсорных интерфейсов (например, на мобильном телефоне) и поддержки новых типов жестов, которые невозможно реализовать только с помощью ввода пальцами.

Транскрипция

Хотя технология распознавания речи значительно улучшилась за последние годы, голосовые пользовательские интерфейсы по-прежнему подвержены ошибкам разбора или транскрипции, когда речь пользователя интерпретируется неверно. Такие ошибки особенно часто возникают при использовании в речи специализированной лексики (например, медицинской терминологии) или нестандартного написания, например, названий музыкальных исполнителей или песен.

Понимание

Эффективная разработка систем, обеспечивающих максимальное понимание речи, остаётся открытой областью исследований. Голосовые пользовательские интерфейсы, интерпретирующие и управляющие состоянием диалога, сложны в проектировании из-за внутренней сложности интеграции таких задач обработки естественного языка, как разрешение кореференции, распознавание именованных сущностей, поиск информации и управление диалогом. Большинство современных голосовых помощников отлично справляются с выполнением отдельных команд, но ограничены в способности поддерживать диалог, выходящий за рамки узкой задачи или нескольких реплик.

Будущее использование

В настоящее время портативные устройства, такие как КПК или мобильные телефоны, используют небольшие кнопки для ввода данных пользователем. Они либо встроены в устройство, либо являются частью интерфейса сенсорного экрана, как, например, в Apple iPod Touch и приложении Siri для iPhone. Многократное нажатие кнопок на устройствах с такими маленькими кнопками может быть утомительным и неточным, поэтому удобный, точный и надежный голосовой пользовательский интерфейс (VUI) потенциально может стать серьезным прорывом в простоте их использования. Тем не менее, такой VUI также был бы полезен пользователям ноутбуков и настольных компьютеров, поскольку он решил бы множество проблем, связанных с использованием клавиатуры и мыши, включая повторяющиеся травмы, такие как синдром запястного канала, трудности навигации и ввода текста в цифровых интерфейсах для людей с нарушениями зрения, а также низкую скорость набора текста для неопытных пользователей клавиатуры. Кроме того, использование клавиатуры обычно предполагает сидение или стояние неподвижно перед подключенным дисплеем; в отличие от этого, VUI позволит пользователю быть гораздо более мобильным, поскольку голосовой ввод устраняет необходимость смотреть на клавиатуру. Такие разработки могут изменить облик современных устройств и оказать далеко идущее влияние на то, как пользователи с ними взаимодействуют. Портативные устройства будут разрабатываться с большими, более удобными для просмотра экранами, поскольку клавиатура не потребуется. Устройствам с сенсорным экраном больше не нужно будет разделять дисплей между контентом и экранной клавиатурой, обеспечивая полноэкранный просмотр контента. Ноутбуки можно будет по сути уменьшить вдвое по размеру, поскольку половина, занимаемая клавиатурой, будет исключена, а все внутренние компоненты будут интегрированы за дисплеем, что фактически приведет к созданию простого планшетного компьютера. Настольные компьютеры будут состоять из центрального процессора и экрана, что позволит сэкономить место на столе, которое в противном случае занимала бы клавиатура, и устранит выдвижные подставки для клавиатуры, встроенные под столешницей. Пульты дистанционного управления для телевизоров и клавиатуры на десятках других устройств, от микроволновых печей до копировальных аппаратов, также можно будет упразднить. Однако для реализации таких разработок потребуется преодолеть многочисленные трудности. Во-первых, VUI должен быть достаточно сложным, чтобы различать ввод, такой как команды, и фоновые разговоры; в противном случае будут регистрироваться ложные команды, и подключенное устройство будет работать со сбоями. Стандартный запрос, например, знаменитое обращение "Компьютер!" из научно-фантастических телешоу и фильмов, таких как "Звездный путь", может активировать VUI и подготовить его к получению дальнейшего ввода от того же говорящего. Предположительно, VUI также может включать в себя человекоподобное представление: голос или даже персонаж на экране, например, который отвечает (например, "Да, Вамши?") и продолжает общаться с пользователем, чтобы уточнить полученный ввод и обеспечить его точность. Во-вторых, VUI должен работать в связке с высокоразвитым программным обеспечением для точной обработки и поиска/получения информации или выполнения действия в соответствии с предпочтениями конкретного пользователя. Например, если Саманта предпочитает информацию из определенной газеты и хочет, чтобы информация была представлена в виде списка, она может сказать: "Компьютер, найди мне информацию о наводнении в южном Китае прошлой ночью"; в ответ VUI, знакомый с ее предпочтениями, "найдет" факты о "наводнении" в "южном Китае" из этого источника, преобразует их в список и предоставит ей на экране и/или в голосовой форме, с указанием источника. Следовательно, потребуется точное программное обеспечение для распознавания речи, а также определенная степень искусственного интеллекта со стороны машины, связанной с VUI.

Последствия для конфиденциальности

Проблемы конфиденциальности вызывают опасения, связанные с тем, что голосовые команды доступны поставщикам голосовых пользовательских интерфейсов в незашифрованном виде и, следовательно, могут быть переданы третьим лицам и обработаны несанкционированным или неожиданным образом. Помимо лингвистического содержания записанной речи, манера речи и характеристики голоса пользователя могут неявно содержать информацию о его биометрической идентичности, чертах личности, телосложении, физическом и психическом состоянии здоровья, поле, гендере, настроениях и эмоциях, социально-экономическом статусе и географическом происхождении.