Введение

Распознавание говорящего по голосу

Распознавание говорящего – это идентификация личности по характеристикам голоса. Оно используется для ответа на вопрос "Кто говорит?". Термин "распознавание голоса" может относиться как к распознаванию говорящего, так и к распознаванию речи. Проверка говорящего (также называемая аутентификацией говорящего) противопоставляется идентификации, а распознавание говорящего отличается от сегментации речи (определения моментов времени, когда говорит один и тот же говорящий). Распознавание говорящего может упростить задачу перевода речи в системах, обученных на конкретных голосах, или использоваться для аутентификации или подтверждения личности говорящего в рамках процедуры безопасности. Распознавание говорящего имеет историю, насчитывающую около четырех десятилетий к 2019 году, и использует акустические признаки речи, которые, как было установлено, различаются у разных людей. Эти акустические закономерности отражают как анатомические особенности, так и приобретенные поведенческие модели.

Проверка и идентификация

Существует два основных направления применения технологий и методологий распознавания говорящих. Если говорящий заявляет о своей принадлежности к определенной личности, а голос используется для подтверждения этого заявления, это называется верификацией или аутентификацией. С другой стороны, идентификация – это задача определения личности неизвестного говорящего. В определенном смысле, верификация говорящего представляет собой сопоставление «один к одному», где голос конкретного говорящего сравнивается с определенным шаблоном, в то время как идентификация говорящего – это сопоставление «один ко многим», где голос сравнивается с несколькими шаблонами. С точки зрения безопасности, идентификация отличается от верификации. Верификация говорящих обычно используется в качестве «стража» для обеспечения доступа к защищенной системе. Эти системы работают со знанием пользователей и, как правило, требуют их сотрудничества. Системы идентификации говорящих также могут быть реализованы скрытно, без ведома пользователя, для идентификации говорящих в ходе беседы, оповещения автоматизированных систем об изменении говорящего, проверки, зарегистрирован ли пользователь в системе, и т.д. В криминалистических целях обычно сначала проводится процесс идентификации говорящего для создания списка «наиболее вероятных совпадений», а затем выполняется серия процессов верификации для установления окончательного соответствия. Сопоставление образцов голоса говорящего со списком наиболее вероятных совпадений помогает определить, является ли это одним и тем же человеком, исходя из степени сходства или различий. Сторона обвинения и сторона защиты используют это в качестве доказательства, чтобы установить, является ли подозреваемый настоящим преступником.

Обучение

Одна из первых технологий обучения, достигших коммерческого успеха, была реализована в кукле Джули от Worlds of Wonder в 1987 году. В то время независимость от диктора считалась важным прорывом, и системам требовался период обучения. Реклама куклы 1987 года содержала слоган: "Наконец-то кукла, которая понимает вас", хотя она описывалась как продукт, "который дети могли обучить реагировать на их голос". Даже спустя десятилетие термин "распознавание голоса" подразумевал независимость от диктора.

Варианты распознавания динамиков

Каждая система распознавания говорящего состоит из двух фаз: регистрации и верификации. В процессе регистрации голос говорящего записывается, и обычно извлекается ряд признаков для создания голосового профиля, шаблона или модели. На фазе верификации образец речи или "речевой фрагмент" сравнивается с ранее созданным голосовым профилем. В системах идентификации речевой фрагмент сравнивается с несколькими голосовыми профилями для определения наилучшего соответствия, в то время как системы верификации сравнивают речевой фрагмент с одним голосовым профилем. Благодаря этому процессу верификация происходит быстрее, чем идентификация. Системы распознавания говорящего делятся на две категории: зависимые от текста и независимые от текста. Зависимое от текста распознавание требует, чтобы текст был одинаковым как при регистрации, так и при верификации. В зависимой от текста системе подсказки могут быть общими для всех говорящих (например, общая парольная фраза) или уникальными. Кроме того, для создания сценария многофакторной аутентификации можно использовать общие секреты (например, пароли и PIN-коды) или информацию, основанную на знаниях. Напротив, независимые от текста системы не требуют использования конкретного текста. Они чаще всего используются для идентификации говорящего, поскольку требуют минимального или вообще никакого участия говорящего. В этом случае текст во время регистрации и тестирования различается. Фактически, регистрация может происходить без ведома пользователя, как это часто бывает в криминалистических приложениях. Поскольку независимые от текста технологии не сравнивают сказанное при регистрации и верификации, приложения для верификации обычно также используют распознавание речи для определения того, что говорит пользователь в момент аутентификации. В независимых от текста системах используются как акустические, так и методы анализа речи.

Технология

Распознавание говорящих – это задача распознавания образов. Различные технологии, используемые для обработки и хранения голосовых отпечатков, включают в себя оценку частоты, скрытые марковские модели, модели гауссовских смесей, алгоритмы сопоставления с образцом, нейронные сети, матричное представление, векторное квантование и деревья решений. Для сравнения речевых образцов с голосовыми отпечатками традиционно используются более простые методы, такие как косинусное сходство, благодаря их простоте и эффективности. Некоторые системы также используют методы "анти-говорящего", такие как когортные модели и мировые модели. Спектральные признаки преимущественно используются для представления характеристик говорящих. Линейное предсказательное кодирование (ЛПК) – это метод кодирования речи, применяемый в распознавании и верификации говорящих. Уровень окружающего шума может затруднять сбор как исходных, так и последующих голосовых образцов. Алгоритмы шумоподавления могут быть использованы для повышения точности, однако неправильное применение может привести к обратному эффекту. Снижение производительности может быть вызвано изменениями в поведенческих характеристиках голоса, а также записью с использованием одного телефона и верификацией на другом. Ожидается увеличение интеграции с продуктами двухфакторной аутентификации. Изменения голоса, связанные со старением, могут со временем снижать производительность системы. Некоторые системы адаптируют модели говорящих после каждой успешной верификации для учета таких долгосрочных изменений голоса, хотя существуют дискуссии относительно общего влияния автоматической адаптации на безопасность.

Правовые последствия

В связи с принятием такого законодательства, как Общий регламент по защите данных в Европейском союзе и Закон о защите прав потребителей Калифорнии в Соединенных Штатах, возникло много дискуссий об использовании распознавания голоса на рабочем месте. В сентябре 2019 года ирландский разработчик технологий распознавания речи Soapbox Labs предупредил о возможных правовых последствиях.

Приложения

Первый международный патент был подан в 1983 году на основе телекоммуникационных исследований, проведенных в CSELT (Италия) Микеле Кавацца и Альберто Чиарамеллой, в качестве основы для будущих телекоммуникационных услуг для конечных клиентов и для улучшения методов снижения шума в сети. В период с 1996 по 1998 год технология распознавания голоса использовалась на пограничном переходе Скоби–Коронах, чтобы позволить зарегистрированным местным жителям, не имеющим ничего для декларирования, пересекать границу между Канадой и США, когда контрольно-пропускные пункты были закрыты на ночь. Система была разработана для Службы иммиграции и натурализации США компанией Voice Strategies из Уоррена, штат Мичиган. В 2013 году Barclays Wealth, подразделение частного банкинга Barclays, стала первой финансовой организацией, внедрившей голосовую биометрию в качестве основного средства идентификации клиентов в своих колл-центрах. Система использовала пассивное распознавание голоса для подтверждения личности телефонных клиентов в течение 30 секунд обычного разговора. Она была разработана компанией Nuance (которая в 2011 году приобрела компанию Loquendo, выделившуюся из CSELT для разработки технологий распознавания речи), компанией, стоящей за технологией Siri от Apple. 93% клиентов оценили систему на «9 из 10» по скорости, простоте использования и безопасности. Распознавание голоса также может использоваться в уголовных расследованиях, например, при расследовании казней Джеймса Фоули и Стивена Сотлоффа в 2014 году, среди прочих. В феврале 2016 года британский банк HSBC и его интернет-банк First Direct объявили о предложении 15 миллионам клиентов своего биометрического банковского программного обеспечения для доступа к онлайн- и телефонным счетам с использованием отпечатков пальцев или голоса. В 2023 году Vice News и The Guardian независимо друг от друга продемонстрировали возможность обхода стандартных систем аутентификации голоса в финансовом секторе, используя голоса, сгенерированные искусственным интеллектом на основе примерно пяти минут голосовых образцов целевого человека.