Введение
Распознавание жестов – это область исследований и разработок в информатике и языковых технологиях, посвященная распознаванию и интерпретации человеческих жестов. Являясь поддисциплиной компьютерного зрения, оно использует математические алгоритмы для интерпретации жестов. Распознавание жестов открывает путь для компьютеров к лучшему пониманию и интерпретации языка тела человека, что ранее было невозможно посредством текстовых или стандартных графических (GUI) пользовательских интерфейсов. Жесты могут исходить от любого движения или состояния тела, но чаще всего они возникают из лица или рук. Одной из областей в этой сфере является распознавание эмоций на основе выражений лица и жестов рук. Пользователи могут выполнять простые жесты для управления или взаимодействия с устройствами, не касаясь их физически. Было предпринято множество попыток использования камер и алгоритмов компьютерного зрения для интерпретации языка жестов, однако идентификация и распознавание позы, походки, пространственных отношений и моделей человеческого поведения также являются предметом методов распознавания жестов.
Gesture recognition is an area of research and development in computer science and language technology concerned with the recognition and interpretation of human gestures. A subdiscipline of computer vision, it employs mathematical algorithms to interpret gestures. Gesture recognition offers a path for computers to begin to better understand and interpret human body language, previously not possible through text or unenhanced graphical (GUI) user interfaces. Gestures can originate from any bodily motion or state, but commonly originate from the face or hand. One area of the field is emotion recognition derived from facial expressions and hand gestures. Users can make simple gestures to control or interact with devices without physically touching them. Many approaches have been made using cameras and computer vision algorithms to interpret sign language, however, the identification and recognition of posture, gait, proxemics, and human behaviors is also the subject of gesture recognition techniques.
Типы жестов
В компьютерных интерфейсах различают два типа жестов: мы рассматриваем онлайн-жесты, которые также можно рассматривать как прямые манипуляции, такие как масштабирование и вращение, и, в отличие от них, оффлайн-жесты обычно обрабатываются после завершения взаимодействия; например, круг рисуется для активации контекстного меню. Оффлайн-жесты: жесты, которые обрабатываются после взаимодействия пользователя с объектом. Примером является жест для активации меню. Онлайн-жесты: жесты, представляющие собой прямое манипулирование. Они используются для масштабирования или вращения объекта.
Бесконтактный интерфейс
Бесконтактный пользовательский интерфейс (TUI) — это развивающийся тип технологии, позволяющий управлять устройством посредством движений тела и жестов, без использования клавиатуры, мыши или экрана.
Типы бесконтактной технологии
Существует множество устройств, использующих этот тип интерфейса, таких как смартфоны, ноутбуки, игровые приставки, телевизоры и музыкальное оборудование. Один из видов бесконтактного интерфейса использует Bluetooth-соединение смартфона для активации системы управления посещениями компании. Это позволяет избежать необходимости касаться интерфейса, ради удобства или чтобы избежать потенциального источника заражения, например, во время пандемии COVID-19.
Алгоритмы
В зависимости от типа входных данных, подход к интерпретации жеста может быть реализован различными способами. Однако большинство техник опираются на ключевые точки, представленные в трехмерной системе координат. На основе относительного движения этих точек жест может быть распознан с высокой точностью, зависящей от качества входных данных и используемого алгоритма. Для интерпретации движений тела необходимо классифицировать их по общим характеристикам и смыслу, который они могут передавать. Например, в языке жестов каждый жест соответствует слову или фразе. В литературе выделяют два основных подхода к распознаванию жестов: основанный на 3D-модели и основанный на анализе изображения. Первый метод использует трехмерную информацию о ключевых элементах тела для получения важных параметров, таких как положение ладони или углы в суставах. Подходы, производные от него, например, объемные модели, требуют значительных вычислительных ресурсов и дальнейших технологических разработок для реализации анализа в реальном времени. В качестве альтернативы, системы, основанные на анализе изображения, используют изображения или видео для непосредственной интерпретации. Такие модели проще в обработке, но обычно не обладают достаточной обобщающей способностью для взаимодействия человека и компьютера.
Алгоритмы на основе 3D-моделирования
При подходе к 3D-моделированию могут использоваться объемные или скелетные модели, или даже их комбинация. Объемные подходы широко применяются в индустрии компьютерной анимации и для задач компьютерного зрения. Модели обычно создаются из сложных 3D-поверхностей, таких как NURBS или полигональные сетки. Основной недостаток этого метода – его высокая вычислительная сложность, и системы для анализа в реальном времени пока находятся в разработке. В настоящее время более перспективным подходом представляется сопоставление простых примитивных объектов с наиболее важными частями тела человека (например, цилиндров для рук и шеи, сферы для головы) и анализ их взаимодействия. Более того, некоторые абстрактные структуры, такие как суперквадрики и обобщенные цилиндры, могут оказаться еще более подходящими для аппроксимации частей тела.
Модели, основанные на внешности
Модели, основанные на внешнем виде, больше не используют пространственное представление тела, а извлекают свои параметры непосредственно из изображений или видео, используя базу данных шаблонов. Некоторые из них основаны на деформируемых двумерных шаблонах частей человеческого тела, в частности, рук. Деформируемые шаблоны – это наборы точек на контуре объекта, используемые как узлы интерполяции для аппроксимации контура. Одна из простейших функций интерполяции – линейная, которая вычисляет среднюю форму на основе наборов точек, параметров изменчивости точек и внешней деформации. Эти модели, основанные на шаблонах, в основном применяются для отслеживания рук, но также могут использоваться для простой классификации жестов. Второй подход в обнаружении жестов с использованием моделей, основанных на внешнем виде, использует последовательности изображений в качестве шаблонов жестов. Параметрами для этого метода являются сами изображения или определенные признаки, извлеченные из них. Чаще всего используется один (моноскопический) или два (стереоскопических) вида.
Модели на основе электромиографии
Электромиография (ЭМГ) изучает электрические сигналы, генерируемые мышцами в теле. Классифицируя данные, полученные от мышц руки, можно определить выполняемое действие и, таким образом, передать жест во внешнее программное обеспечение. Также возможно отслеживание движений головы, мимики или направления взгляда.
Социальная приемлемость
Одной из существенных проблем внедрения интерфейсов управления жестами на потребительских мобильных устройствах, таких как смартфоны и умные часы, является влияние жестов на социальную приемлемость ввода. В то время как жесты могут обеспечивать быстрый и точный ввод данных на многих новых компьютерных устройствах с нестандартными форм-факторами, их внедрение и полезность часто ограничиваются социальными, а не техническими факторами. В связи с этим, разработчики методов ввода жестами могут стремиться к балансу между техническими требованиями и готовностью пользователей выполнять жесты в различных социальных ситуациях. Кроме того, различные аппаратные средства и сенсорные механизмы поддерживают распознавание разных типов жестов.
Мобильное устройство
Жестовые интерфейсы на мобильных устройствах и устройствах малого форм-фактора часто поддерживаются наличием датчиков движения, таких как инерциальные измерительные блоки (IMU). На этих устройствах распознавание жестов основано на выполнении пользователями движений, которые могут быть распознаны этими датчиками. Это потенциально может затруднить захват сигналов от деликатных или медленных жестов, поскольку их может быть сложно отличить от естественных движений или шума. В результате опроса и исследования удобства использования жестов, исследователи выяснили, что жесты, включающие деликатные движения, похожие на существующие технологии, кажущиеся или ощущающиеся естественными для любого действия, и приятные пользователям, с большей вероятностью будут приняты. В то же время жесты, выглядящие странно, неудобные в исполнении, мешающие общению или требующие необычных движений, чаще вызывали неприятие. Важным фактором при взаимодействии с носимыми компьютерами является выбор места для размещения устройства и осуществления взаимодействия. Исследование отношения посторонних к взаимодействию с носимыми устройствами, проведенное в США и Южной Корее, выявило различия в восприятии использования носимых компьютеров мужчинами и женщинами, частично обусловленные разными областями тела, считающимися социально чувствительными.
Общественные объекты
Общественные инсталляции, такие как интерактивные публичные дисплеи, обеспечивают доступ к информации и отображают интерактивные медиа в общественных местах, таких как музеи, галереи и театры. В то время как сенсорные экраны часто используются для ввода данных в публичные дисплеи, жестовые интерфейсы предоставляют дополнительные преимущества, такие как улучшенная гигиена, взаимодействие на расстоянии и повышенная заметность, а также могут способствовать более выразительному взаимодействию. Для измерения побочного эффекта в виде усталости рук исследователи разработали методику, названную "Потребляемая выносливость".