Введение

Отклик, характеризующий то, как ухо воспринимает звук из определенной точки в пространстве. Функция пространственной передачи, связанная с головой (HRTF), – это отклик, характеризующий то, как ухо воспринимает звук из определенной точки в пространстве. Когда звук достигает слушателя, размер и форма головы, ушей, слухового прохода, плотность головы, размер и форма носовой и ротовой полостей – все это преобразует звук и влияет на его восприятие, усиливая одни частоты и ослабляя другие. В общем случае, HRTF усиливает частоты в диапазоне 2–5 кГц с основным резонансом +17 дБ на частоте 2700 Гц. Однако, частотная характеристика сложнее, чем просто один пик, охватывает широкий спектр частот и значительно различается у разных людей. Пара HRTF для двух ушей может быть использована для синтеза бинаурального звука, который воспринимается как исходящий из определенной точки в пространстве. Это передаточная функция, описывающая, как звук из конкретной точки достигнет уха (обычно внешнего отверстия слухового канала). Некоторые потребительские домашние развлекательные устройства, предназначенные для воспроизведения объемного звука через стереонаушники (с двумя динамиками), используют HRTF. Некоторые алгоритмы обработки HRTF также включены в компьютерное программное обеспечение для имитации воспроизведения объемного звука через акустические системы.

Локализация звука

У людей всего два уха, но они способны локализовать звуки в трех измерениях – по дальности (расстоянию), по направлению вверх и вниз (по высоте), спереди и сзади, а также по сторонам (азимут). Это возможно благодаря совместной работе мозга, внутреннего уха и наружных ушей (пина), которые делают выводы о местоположении источника звука. Эта способность локализовать источники звука могла развиться у людей и их предков как эволюционная необходимость, поскольку глаза способны видеть лишь малую часть окружающего мира, а зрение затруднено в темноте, в то время как локализация источника звука работает во всех направлениях с разной степенью точности, независимо от освещения. Люди определяют местоположение источника звука, используя информацию, полученную от одного уха (монауральные сигналы), и сравнивая информацию, полученную обоими ушами (разностные сигналы или бинауральные сигналы). К разностным сигналам относятся разность во времени прибытия и разность в интенсивности. Монауральные сигналы возникают в результате взаимодействия между источником звука и анатомией человека, при котором исходный звук модифицируется до попадания в ушной канал для обработки слуховой системой. Эти модификации кодируют местоположение источника и могут быть зафиксированы посредством импульсной характеристики, которая связывает местоположение источника и местоположение уха. Эта импульсная характеристика называется характеристикой, связанной с головой (HRIR). Свертка произвольного звука с HRIR преобразует звук в тот, который был бы услышан слушателем, если бы он воспроизводился в месте источника, с ухом слушателя в точке приема. HRIR используются для создания виртуального объемного звучания. HRTF – это преобразование Фурье HRIR. HRTF для левого и правого уха (выраженные выше как HRIR) описывают фильтрацию источника звука (x(t)) перед тем, как он воспринимается левым и правым ухом как xL(t) и xR(t) соответственно. HRTF также можно описать как изменения звука при переходе от направления в свободном пространстве к звуку, достигающему барабанной перепонки. Эти изменения включают форму наружного уха слушателя, форму головы и тела слушателя, акустические характеристики пространства, в котором воспроизводится звук, и так далее. Все эти характеристики влияют на то, насколько точно слушатель может определить направление, откуда исходит звук. В стандарте AES69 2015 года Audio Engineering Society (AES) определила формат файла SOFA для хранения пространственно-ориентированных акустических данных, таких как характеристики передачи, связанные с головой (HRTF). Программные библиотеки и файлы SOFA собраны на веб-сайте Sofa Conventions.

Как работает HRTF

Механизм, лежащий в основе этого явления, варьируется у разных людей, поскольку форма их головы и ушных раковин различается. HRTF описывает, как заданное звуковое воздействие (параметризованное по частоте и местоположению источника) фильтруется дифракционными и отражательными свойствами головы, ушной раковины и туловища, прежде чем звук достигнет преобразовательной системы барабанной перепонки и внутреннего уха (см. Слуховая система). С биологической точки зрения, предварительная фильтрация звука этими внешними структурами, зависящая от местоположения источника, способствует нейронному определению местоположения источника, в частности, определению его высоты.

Локализация звука в виртуальном слуховом пространстве

Основное предположение при создании виртуального звукового пространства заключается в том, что если акустические волны, достигающие барабанных перепонок слушателя, идентичны при прослушивании через наушники и в свободном поле, то и восприятие слушателя должно быть таким же. Как правило, звуки, воспроизводимые через наушники, воспринимаются как исходящие изнутри головы. В виртуальном звуковом пространстве наушники должны обеспечивать ощущение, что звук исходит извне ("экстериоризация" звука). Используя HRTF, можно пространственно позиционировать звуки с помощью техники, описанной ниже, которая выполняет физическое моделирование на полной 3D-модели головы, и EAC, который использует нейронную сеть, обученную на основе существующих HRTF, и работает с фотографиями и другими приблизительными измерениями.

Технология записи и воспроизведения

Записи, обработанные с помощью HRTF, например, в компьютерной игровой среде (см. A3D, EAX и OpenAL), которая аппроксимирует HRTF слушателя, могут быть услышаны через стереонаушники или динамики и интерпретированы как звуки, исходящие со всех направлений, а не только из двух точек по обе стороны головы. Воспринимаемая точность результата зависит от того, насколько точно набор данных HRTF соответствует характеристикам собственных ушей, хотя обобщенный HRTF может быть предпочтительнее точного измерения, сделанного по одному уху. Некоторые производители, такие как Apple и Sony, предлагают различные HRTF для выбора пользователем в зависимости от формы его уха. Windows 10 и более поздние версии поставляются с Microsoft Spatial Sound, той же пространственной аудиоструктурой, которая используется на Xbox One и Hololens 2. На ПК с Windows или Xbox One фреймворк может использовать несколько различных аудиопроцессоров, включая Windows Sonic для наушников, Dolby Atmos и DTS Headphone:X, для применения HRTF. Фреймворк способен воспроизводить как источники окружающего звука с фиксированным положением, так и динамические источники "объектов", которые могут перемещаться в пространстве. Apple также предлагает Spatial Sound для своих устройств, используемых с наушниками, произведенными Apple или Beats. Для воспроизведения музыки в наушниках можно включить Dolby Atmos и применить HRTF. HRTF (или, точнее, позиции объектов) могут изменяться в зависимости от отслеживания положения головы для поддержания иллюзии направления. Qualcomm Snapdragon имеет аналогичную пространственную аудиосистему с отслеживанием положения головы, используемую некоторыми брендами телефонов Android. YouTube использует HRTF с отслеживанием положения головы для видео в формате 360 градусов и VR. В настоящее время Linux не может напрямую обрабатывать какие-либо из проприетарных форматов пространственного аудио (окружающий звук плюс динамические объекты). SoundScape Renderer предлагает направленный синтез звука. PulseAudio и PipeWire могут обеспечивать виртуальный окружающий звук (каналы с фиксированным местоположением) с использованием HRTF. Последние версии PipeWire также способны обеспечивать динамическое пространственное отображение с использованием HRTF, однако интеграция с приложениями все еще находится в процессе разработки. Пользователи могут настраивать собственные позиционные и динамические источники звука, а также имитировать конфигурацию с окружающими динамиками, используя существующие настройки. Кроссплатформенная OpenAL Soft, являющаяся реализацией OpenAL, использует HRTF для улучшения локализации звука. Пространственные аудиосистемы Windows и Linux поддерживают любые модели стереонаушников, в то время как Apple разрешает использовать пространственный звук только с Bluetooth-гарнитурами Apple или Beats.