Введение
Форма взаимодействия человека и машины с использованием нескольких режимов ввода/вывода.
Многомодальное взаимодействие предоставляет пользователю несколько способов взаимодействия с системой. Мультимодальный интерфейс обеспечивает несколько различных инструментов для ввода и вывода данных. Многомодальное взаимодействие человека и компьютера предполагает естественное взаимодействие с виртуальной и физической средами. Оно облегчает свободную и естественную коммуникацию между пользователями и автоматизированными системами, обеспечивая гибкий ввод (речь, рукописный ввод, жесты) и вывод (синтез речи, графика). Многомодальное объединение (фьюжн) комбинирует данные из различных модальностей, разрешая неоднозначности. Две основные группы мультимодальных интерфейсов ориентированы на альтернативные методы ввода и комбинированный ввод/вывод. Использование нескольких модальностей ввода повышает удобство использования, принося пользу пользователям с ограниченными возможностями. Мобильные устройства часто используют XHTML+Voice для ввода. Мультимодальные биометрические системы используют несколько биометрических параметров для преодоления ограничений. Многомодальный анализ тональности включает анализ текста, аудио и визуальных данных для классификации тональности. GPT 4, мультимодальная языковая модель, интегрирует различные модальности для улучшения понимания языка. Многомодальные системы вывода представляют информацию посредством визуальных и слуховых сигналов, используя тактильные и обонятельные ощущения. Многомодальное объединение (фьюжн) интегрирует информацию из различных модальностей, применяя методы, основанные на распознавании, принятии решений и гибридный многоуровневый фьюжн. Неоднозначности во многомодальном вводе разрешаются методами предотвращения, постобработки и приближенного разрешения.
Введение
Мультимодальное взаимодействие человека и компьютера относится к "взаимодействию с виртуальной и физической средой посредством естественных способов коммуникации". Это подразумевает, что мультимодальное взаимодействие обеспечивает более свободное и естественное общение, связывая пользователей с автоматизированными системами как при вводе, так и при выводе информации. В частности, мультимодальные системы могут предлагать гибкую, эффективную и удобную среду, позволяющую пользователям взаимодействовать посредством различных способов ввода, таких как речь, рукописный ввод, жесты рук и взгляд, и получать информацию от системы посредством различных способов вывода, таких как синтез речи, интеллектуальная графика и другие модальности, оптимально комбинированные. Мультимодальная система должна распознавать входные данные из различных модальностей, объединяя их в соответствии с временными и контекстными ограничениями для обеспечения их интерпретации. Этот процесс известен как мультимодальное слияние и является предметом многочисленных исследований, начиная с девяностых годов и по настоящее время. Объединенные входные данные интерпретируются системой. Естественность и гибкость могут приводить к множеству интерпретаций для каждой модальности (канала) и при их одновременном использовании, что, как следствие, может вызывать мультимодальную неоднозначность, обычно из-за неточностей, шумов или других подобных факторов. Для разрешения неоднозначности предложено несколько методов. В конечном итоге система возвращает пользователю результаты через различные модальные каналы (разделенные), организованные в соответствии с последовательной обратной связью (расщеплением). Широкое распространение мобильных устройств, датчиков и веб-технологий предоставляет достаточные вычислительные ресурсы для управления сложностью, связанной с мультимодальным взаимодействием. "Использование облачных вычислений для привлечения общих вычислительных ресурсов к управлению сложностью мультимодального взаимодействия представляет собой перспективу. Действительно, облачные вычисления позволяют предоставлять общие, масштабируемые и конфигурируемые вычислительные ресурсы, которые могут быть динамически и автоматически выделены и освобождены".
Мультимодальный вход
Две основные группы мультимодальных интерфейсов объединились: одна посвящена альтернативным методам ввода, а другая – комбинированным методам ввода/вывода. Первая группа интерфейсов объединяла различные режимы ввода данных от пользователя, выходящие за рамки традиционных клавиатуры и мыши, такие как речь, перо, касание, жесты, взгляд, а также движения головы и тела. Наиболее распространенный такой интерфейс сочетает визуальный режим (например, дисплей, клавиатура и мышь) с голосовым режимом (распознавание речи для ввода, синтез речи и записанный звук для вывода). Однако могут использоваться и другие режимы, такие как ввод с помощью пера или тактильный ввод/вывод. Мультимодальные пользовательские интерфейсы являются областью исследований в области взаимодействия человека и компьютера (HCI). Преимущество множественных режимов ввода заключается в повышении удобства использования: недостатки одного режима компенсируются преимуществами другого. Например, на мобильном устройстве с небольшим визуальным интерфейсом и клавиатурой слово может быть довольно сложно набрать, но очень легко произнести (например, Poughkeepsie). Представьте, как можно получать доступ и осуществлять поиск в каталогах цифровых медиа с этих же устройств или приставок. В одном реальном примере информация о пациенте в операционной доступна членам хирургической бригады в устной форме для поддержания антисептической среды и представляется в почти реальном времени в звуковой и визуальной формах для максимального понимания. Мультимодальные пользовательские интерфейсы ввода имеют значение для обеспечения доступности. Хорошо спроектированное мультимодальное приложение может использоваться людьми с различными ограничениями. Пользователи с нарушениями зрения полагаются на голосовой режим с некоторым вводом с клавиатуры, а пользователи с нарушениями слуха – на визуальный режим с некоторым речевым вводом. Другие пользователи могут оказаться "ситуационно ограниченными" (например, носить перчатки в шумной обстановке, водить машину или вводить номер кредитной карты в общественном месте) и будут просто использовать подходящие режимы по своему усмотрению. С другой стороны, мультимодальное приложение, требующее от пользователей умения использовать все режимы, является плохо спроектированным. Наиболее распространенная форма мультимодальности ввода на рынке использует язык веб-разметки XHTML+Voice (X+V) – открытую спецификацию, разработанную компаниями IBM, Motorola и Opera Software. В настоящее время X+V рассматривается W3C и объединяет несколько рекомендаций W3C, включая XHTML для визуальной разметки, VoiceXML для голосовой разметки и XML Events – стандарт для интеграции языков XML. Мультимодальные браузеры, поддерживающие X+V, включают IBM WebSphere Everyplace Multimodal Environment, Opera для Embedded Linux и Windows, а также ACCESS Systems NetFront для Windows Mobile. Для разработки мультимодальных приложений разработчики программного обеспечения могут использовать комплект разработки программного обеспечения, такой как IBM WebSphere Multimodal Toolkit, основанный на фреймворке Eclipse с открытым исходным кодом, который включает отладчик, редактор и симулятор X+V.
Мультимодальный выход
Вторая группа мультимодальных систем предоставляет пользователям мультимедийные дисплеи и мультимодальный вывод, преимущественно в виде визуальных и слуховых сигналов. Дизайнеры интерфейсов также начали использовать другие модальности, такие как тактильные ощущения и обоняние. Предлагаемые преимущества мультимодальных систем вывода включают синергию и избыточность. Информация, представленная через несколько модальностей, объединяется и относится к различным аспектам одного и того же процесса. Использование нескольких модальностей для обработки одной и той же информации обеспечивает увеличение пропускной способности передачи данных. В настоящее время мультимодальный вывод используется главным образом для улучшения соответствия между средой передачи и контентом, а также для поддержки управления вниманием в информационно насыщенной среде, где операторы испытывают значительные требования к визуальному вниманию. Важным этапом в разработке мультимодального интерфейса является создание естественных соответствий между модальностями, информацией и задачами. Слуховой канал отличается от зрения рядом характеристик. Он всенаправленный, мимолетный и всегда доступен. Это не только перспективный, но и уникальный канал коммуникации. В отличие от зрения и слуха, двух традиционных чувств, используемых в HCI, осязание является проксимальным: оно воспринимает объекты, находящиеся в контакте с телом, и двунаправленным, поскольку поддерживает как восприятие, так и воздействие на окружающую среду. Примеры слуховой обратной связи включают слуховые иконки в компьютерных операционных системах, сигнализирующие о действиях пользователя (например, удаление файла, открытие папки, ошибка), речевой вывод для предоставления навигационных подсказок в транспортных средствах и речевой вывод для предупреждения пилотов в современных кабинах самолетов. Примеры тактильных сигналов включают вибрацию рычага указателя поворота для предупреждения водителей о наличии автомобиля в слепой зоне, вибрацию автомобильного сиденья в качестве предупреждения для водителей и вибратор на современных самолетах, предупреждающий пилотов о приближающемся срыве. Прозрачность взаимодействия с контентом повышается при обеспечении непосредственной и прямой связи посредством значимого отображения, таким образом, пользователь получает прямую и немедленную обратную связь на ввод, а реакция на контент становится доступностью интерфейса (Gibson 1979).
Мультимодальный синтез
Процесс интеграции информации из различных входных модальностей и объединения ее в единую команду называется мультимодальным синтезом. Он включает в себя принятие решений на основе данных и гибридный многоуровневый синтез. Синтез на основе распознавания (также известный как ранний синтез) заключается в объединении результатов работы каждого модального распознавателя с использованием механизмов интеграции, таких как, например, статистические методы интеграции, теория агентов, скрытые марковские модели, искусственные нейронные сети и т.д. Примерами стратегий синтеза на основе распознавания являются фреймы действий и ходы диалога. Алгоритмам сложно учитывать многомерность; существуют переменные, выходящие за рамки текущих вычислительных возможностей. Например, семантическое значение: два предложения могут иметь одинаковое лексическое значение, но нести разную эмоциональную информацию.
Неоднозначность
Действия или команды пользователя генерируют мультимодальные входные данные (мультимодальные сообщения, отражающие временные отношения между вовлеченными модальностями и связи между фрагментами информации, ассоциированными с этими модальностями). Естественное соответствие между мультимодальным входом, предоставляемым различными каналами взаимодействия (визуальным, слуховым и тактильным), информацией и задачами подразумевает необходимость решения типичных проблем человеческого общения, таких как неоднозначность. Неоднозначность возникает, когда существует более одной возможной интерпретации входных данных. Снижение мультимодальной неоднозначности может достигаться как уменьшением выразительности грамматики языка, так и ее расширением. Разрешение неоднозначностей a posteriori использует медиационный подход, а также механизмы отмены и выбора. Методы приближенного разрешения не требуют участия пользователя в процессе устранения неоднозначности. Для их реализации могут использоваться различные теории, такие как нечеткая логика, марковские случайные поля, байесовские сети и скрытые марковские модели.