Введение

Анализ голоса — это изучение звуков речи для целей, отличных от лингвистического содержания, например, при распознавании речи. Такие исследования в основном включают медицинский анализ голоса (фониатрия), но также и идентификацию говорящего. Более спорным является мнение, что правдивость или эмоциональное состояние говорящего можно определить с помощью анализа голосового стресса или многоуровневого анализа голоса.

Методы анализа

Проблемы с голосом, требующие голосового анализа, чаще всего возникают из-за голосовых складок или мышц гортани, контролирующих их, поскольку складки подвергаются силам столкновения с каждым циклом вибрации и высыханию от воздуха, проходящего через небольшое пространство между ними, а мышцы гортани интенсивно работают во время речи или пения и подвержены утомлению. Однако динамический анализ голосовых складок и их движения физически затруднителен. Расположение голосовых складок практически исключает прямое, инвазивное измерение движения. Менее инвазивные методы визуализации, такие как рентген или ультразвуковое исследование, не подходят, поскольку голосовые складки окружены хрящом, что искажает качество изображения. Движения голосовых складок происходят быстро, основные частоты обычно находятся в диапазоне от 80 до 300 Гц, что делает невозможным использование обычного видео. Стробоскопическое и высокоскоростное видео предлагают решение, но для визуализации голосовых складок необходимо ввести в горло волоконно-оптический зонд, соединенный с камерой, что затрудняет речь. Кроме того, попадание инородных тел в глотку обычно вызывает рвотный рефлекс, который останавливает голосообразование и закрывает гортань. К тому же, стробоскопическая визуализация эффективна только при близкопериодическом характере вибрации голосовых складок. В настоящее время наиболее важными косвенными методами являются обратная фильтрация записей с микрофона или записи воздушного потока изо рта и электроглотография (ЭГГ). При обратной фильтрации речевой звук (форма волны акустического давления, полученная с помощью микрофона) или форма волны воздушного потока изо рта, записанная с помощью маски с круговой вентиляцией (CV), регистрируется вне рта, а затем фильтруется математическим методом для устранения влияния голосового тракта. Этот метод оценивает источник звука в процессе голосообразования, записывая выходной сигнал и используя вычислительную модель для обратного преобразования эффектов голосового тракта. Другим неинвазивным косвенным методом оценки движения голосовых складок является электроглотография, при которой электроды, расположенные по обе стороны горла на уровне голосовых складок, регистрируют изменения проводимости горла в зависимости от площади соприкосновения голосовых складок. Таким образом, получается информация об области контакта в одном измерении. Ни обратная фильтрация, ни ЭГГ не позволяют полностью описать сложную трехмерную картину движения голосовых складок, но могут предоставить полезные косвенные данные об этом движении. Другой подход к проведению голосового анализа – изучение характеристик голоса. К ним относятся фонация, высота тона, громкость и темп речи. Эти характеристики можно использовать для оценки голоса человека и помощи в процессе голосового анализа. Фонацию обычно оценивают, анализируя различные типы данных, собранных у человека, такие как слова с долгими гласными, слова с большим количеством фонем или обычная речь. Высоту тона можно оценить, попросив человека произнести максимально высокие и низкие звуки, а также звуки между ними. В этом может помочь клавиатура. Громкость важна для оценки, поскольку у некоторых людей она влияет на способ произношения определенных звуков. Некоторым людям необходимо говорить громче для определенных фонем по сравнению с другими, чтобы их произнести. Это можно проверить, попросив человека поддерживать одинаковую громкость при пении гаммы. Темп речи также важен, поскольку он отражает скорость речи человека.

Использование в медицине

Медицинское исследование голоса может включать, например, анализ голоса пациентов, перенесших операцию по удалению полипа с голосовых связок. Компьютерные методы могут использоваться для объективной оценки подобных проблем. Опытный голосотерапевт способен достаточно надежно оценить голос, однако это требует обширной подготовки и все еще остается субъективным. Еще одна активно исследуемая область в медицинском анализе голоса – оценка голосовой нагрузки. Голосовые связки человека, длительное время говорящего, подвергаются утомлению, то есть процесс речи создает нагрузку на связки и утомляет ткани. У профессиональных пользователей голоса (например, учителей, продавцов) это утомление может приводить к голосовым сбоям и больничным листам. Анализ голоса изучается как объективный метод оценки подобных проблем. Анализ голоса играл важную роль в исследовании паралича голосовых связок, влияя на различные функции связок – от речи до дыхания. Он используется для оценки эффективности тиропластики (медиальной тиропластики) в улучшении состояния голосовых связок после операции. Традиционная запись голоса применяется для предоперационной записи голосов отобранных пациентов, которые затем сравниваются с послеоперационными записями, а также используются более сложные методы записи, такие как электроглотография, фотоглотография и видеокимография. Медицинские специалисты способны читать и понимать результаты сложных записей, но для получения точных результатов в этих экспериментах необходимы знания специалиста по голосу. Эксперты по голосу играли важную роль в сопоставлении физического и неврологического обследований голосовых связок, что способствовало успеху операции благодаря их тренированному слуху. Перцептивная оценка голоса сильно зависит от качества голоса, которое предпочтительно оценивается специалистами по голосу (логопедами). Профессиональный аналитик голоса обладает тренированным слухом и способен отсеивать избыточные факторы, которые могут исказить результаты.

Использование в криминалистике

Анализ голоса используется в области криминалистики, называемой аудиофоренсикой. Эти анализы обычно проводятся для оценки подлинности аудиозаписи, усиления скрытых под фоновым шумом деталей, интерпретации аудиозаписи с точки зрения эксперта-криминалиста или, в некоторых случаях, для идентификации говорящего. Эксперт применяет различные методы в ходе анализа. Минимальный набор процедур включает "критическое прослушивание, анализ формы сигнала и спектральный анализ". Критическое прослушивание подразумевает детальное разделение на составляющие как основных, так и фоновых звуков путем многократного прослушивания. Анализ формы сигнала визуализирует аудиозапись, позволяя эксперту выявить возможные аномалии. Спектральный анализ визуализирует частоты аудиозаписи, чтобы эксперт мог выделить интересующие детали. Значительную роль звук сыграл, например, в деле Трейвона Мартина, где запись телефонного звонка в полицию была проанализирована, чтобы установить, кому принадлежал крик, слышимый на фоне – Джорджу Циммерману или Мартину.

Криминалистский голос

Специалисты в области судебной экспертизы голоса анализируют записи, исследуя переданную и сохраненную речь, улучшая и расшифровывая ее для уголовных расследований, судебных разбирательств и федеральных агентств. Для использования аудиозаписей в суде судебно-фонетический эксперт должен удостовериться в их подлинности, выявить признаки подделки, улучшить качество звука и интерпретировать речь. Их первоочередная задача – обеспечить разборчивость речи на записи. Часто образцы имеют плохое качество звука из-за внешних факторов, таких как ветер или движение. В других случаях ухудшение качества связано с техническими неисправностями записывающего устройства. Любая работа по идентификации говорящего не может быть начата, пока запись не будет приведена в надлежащее состояние. Для улучшения разборчивости используются компьютерные программы, позволяющие фильтровать и устранять шумы. Компьютерное программное обеспечение также способно преобразовывать речь в спектры и волновые формы, что полезно для судебно-фонетического анализа. Однако любые изменения записи должны производиться после создания копии оригинала. Важной частью работы судебно-фонетического эксперта является идентификация говорящего. Процесс интерпретации может включать в себя восстановление хронологии событий, транскрибирование диалога и идентификацию неизвестных или неразборчивых звуков в аудиозаписи. В суде эксперт в конечном итоге объясняет обстоятельства, связанные с аудиодоказательствами, предоставляя разъяснения соответствующих акустических и физических принципов, чтобы объяснить, что подтверждается записью. Отчеты должны содержать подробную информацию, включая описание того, что происходит на записи, объяснение причин неразборчивости или не слышимости отдельных фрагментов, а также описание недостающей информации.

Идентификация спикера

Анализ голоса играет роль в идентификации говорящего. Это происходит, когда личность говорящего неизвестна и её необходимо установить из множества других голосов или подозреваемых в рамках расследования преступления или судебного разбирательства. Точная идентификация говорящего и голосов, особенно в уголовных делах, зависит от ряда факторов, таких как знакомство с голосом, степень воздействия, временная задержка, тон голоса, маскировка голоса и акцент. Знакомство с говорящим повышает вероятность правильной идентификации и распознавания голоса. Чем больше человек слышал голос, тем легче ему правильно его идентифицировать, даже если он незнакомый. Слушатель, прослушавший более продолжительный фрагмент речи или чаще подвергавшийся воздействию голоса, лучше распознает его, чем тот, кто слышал лишь одно слово. Временная задержка между моментом прослушивания голоса и моментом идентификации говорящего снижает вероятность установления личности. Тон голоса влияет на способность правильно идентифицировать говорящего. Если тон голоса на записи не соответствует обычному тону говорящего в момент сравнения, анализ становится более сложным. Маскировка голоса, например, шепот, также затрудняет точную идентификацию. В некоторых случаях людям, говорящим на том же языке, что и анализируемый говорящий, легче его идентифицировать благодаря акценту и особенностям произношения. Идентификация говорящего дополнительно осложняется искажениями, вызванными техническими особенностями записи, а также факторами, связанными с самим говорящим, такими как эмоциональное состояние или скрытые мотивы, приводящие к расхождению между его голосом и голосом на записи. Методы идентификации говорящего в криминалистике включают использование показаний очевидцев, распознающих голоса, которые они слышали, ауральный перцептивный подход, проводимый специалистом на основе анализа просодических характеристик речи, и компьютерные методы.