Введение
Отклик, характеризующий то, как ухо воспринимает звук из определенной точки в пространстве. Функция пространственной передачи, связанная с головой (HRTF), – это отклик, характеризующий то, как ухо воспринимает звук из определенной точки в пространстве. Когда звук достигает слушателя, размер и форма головы, ушей, слухового прохода, плотность головы, размер и форма носовой и ротовой полостей – все это преобразует звук и влияет на его восприятие, усиливая одни частоты и ослабляя другие. В общем случае, HRTF усиливает частоты в диапазоне 2–5 кГц с основным резонансом +17 дБ на частоте 2700 Гц. Однако, частотная характеристика сложнее, чем просто один пик, охватывает широкий спектр частот и значительно различается у разных людей. Пара HRTF для двух ушей может быть использована для синтеза бинаурального звука, который воспринимается как исходящий из определенной точки в пространстве. Это передаточная функция, описывающая, как звук из конкретной точки достигнет уха (обычно внешнего отверстия слухового канала). Некоторые потребительские домашние развлекательные устройства, предназначенные для воспроизведения объемного звука через стереонаушники (с двумя динамиками), используют HRTF. Некоторые алгоритмы обработки HRTF также включены в компьютерное программное обеспечение для имитации воспроизведения объемного звука через акустические системы.
A head related transfer function (HRTF) is a response that characterizes how an ear receives a sound from a point in space. As sound strikes the listener, the size and shape of the head, ears, ear canal, density of the head, size and shape of nasal and oral cavities, all transform the sound and affect how it is perceived, boosting some frequencies and attenuating others. Generally speaking, the HRTF boosts frequencies from 2–5 kHz with a primary resonance of +17 dB at 2,700 Hz. But the response curve is more complex than a single bump, affects a broad frequency spectrum, and varies significantly from person to person. A pair of HRTFs for two ears can be used to synthesize a binaural sound that seems to come from a particular point in space. It is a transfer function, describing how a sound from a specific point will arrive at the ear (generally at the outer end of the auditory canal). Some consumer home entertainment products designed to reproduce surround sound from stereo (two speaker) headphones use HRTFs. Some forms of HRTF processing have also been included in computer software to simulate surround sound playback from loudspeakers.
Локализация звука
У людей всего два уха, но они способны локализовать звуки в трех измерениях – по дальности (расстоянию), по направлению вверх и вниз (по высоте), спереди и сзади, а также по сторонам (азимут). Это возможно благодаря совместной работе мозга, внутреннего уха и наружных ушей (пина), которые делают выводы о местоположении источника звука. Эта способность локализовать источники звука могла развиться у людей и их предков как эволюционная необходимость, поскольку глаза способны видеть лишь малую часть окружающего мира, а зрение затруднено в темноте, в то время как локализация источника звука работает во всех направлениях с разной степенью точности, независимо от освещения. Люди определяют местоположение источника звука, используя информацию, полученную от одного уха (монауральные сигналы), и сравнивая информацию, полученную обоими ушами (разностные сигналы или бинауральные сигналы). К разностным сигналам относятся разность во времени прибытия и разность в интенсивности. Монауральные сигналы возникают в результате взаимодействия между источником звука и анатомией человека, при котором исходный звук модифицируется до попадания в ушной канал для обработки слуховой системой. Эти модификации кодируют местоположение источника и могут быть зафиксированы посредством импульсной характеристики, которая связывает местоположение источника и местоположение уха. Эта импульсная характеристика называется характеристикой, связанной с головой (HRIR). Свертка произвольного звука с HRIR преобразует звук в тот, который был бы услышан слушателем, если бы он воспроизводился в месте источника, с ухом слушателя в точке приема. HRIR используются для создания виртуального объемного звучания. HRTF – это преобразование Фурье HRIR. HRTF для левого и правого уха (выраженные выше как HRIR) описывают фильтрацию источника звука (x(t)) перед тем, как он воспринимается левым и правым ухом как xL(t) и xR(t) соответственно. HRTF также можно описать как изменения звука при переходе от направления в свободном пространстве к звуку, достигающему барабанной перепонки. Эти изменения включают форму наружного уха слушателя, форму головы и тела слушателя, акустические характеристики пространства, в котором воспроизводится звук, и так далее. Все эти характеристики влияют на то, насколько точно слушатель может определить направление, откуда исходит звук. В стандарте AES69 2015 года Audio Engineering Society (AES) определила формат файла SOFA для хранения пространственно-ориентированных акустических данных, таких как характеристики передачи, связанные с головой (HRTF). Программные библиотеки и файлы SOFA собраны на веб-сайте Sofa Conventions.
regardless of the surrounding light. Humans estimate the location of a source by taking cues derived from one ear (monaural cues), and by comparing cues received at both ears (difference cues or binaural cues). Among the difference cues are time differences of arrival and intensity differences. The monaural cues come from the interaction between the sound source and the human anatomy, in which the original source sound is modified before it enters the ear canal for processing by the auditory system. These modifications encode the source location and may be captured via an impulse response which relates the source location and the ear location. This impulse response is termed the head related impulse response (HRIR). Convolution of an arbitrary source sound with the HRIR converts the sound to that which would have been heard by the listener if it had been played at the source location, with the listener's ear at the receiver location. HRIRs have been used to produce virtual surround sound. The HRTF is the Fourier transform of HRIR. HRTFs for left and right ear (expressed above as HRIRs) describe the filtering of a sound source (x(t)) before it is perceived at the left and right ears as xL(t) and xR(t), respectively. The HRTF can also be described as the modifications to a sound from a direction in free air to the sound as it arrives at the eardrum. These modifications include the shape of the listener's outer ear, the shape of the listener's head and body, the acoustic characteristics of the space in which the sound is played, and so on. All these characteristics will influence how (or whether) a listener can accurately tell what direction a sound is coming from. In the AES69 2015 standard, the Audio Engineering Society (AES) has defined the SOFA file format for storing spatially oriented acoustic data like head related transfer functions (HRTFs). SOFA software libraries and files are collected at the Sofa Conventions website.
Как работает HRTF
Механизм, лежащий в основе этого явления, варьируется у разных людей, поскольку форма их головы и ушных раковин различается. HRTF описывает, как заданное звуковое воздействие (параметризованное по частоте и местоположению источника) фильтруется дифракционными и отражательными свойствами головы, ушной раковины и туловища, прежде чем звук достигнет преобразовательной системы барабанной перепонки и внутреннего уха (см. Слуховая система). С биологической точки зрения, предварительная фильтрация звука этими внешними структурами, зависящая от местоположения источника, способствует нейронному определению местоположения источника, в частности, определению его высоты.
Локализация звука в виртуальном слуховом пространстве
Основное предположение при создании виртуального звукового пространства заключается в том, что если акустические волны, достигающие барабанных перепонок слушателя, идентичны при прослушивании через наушники и в свободном поле, то и восприятие слушателя должно быть таким же. Как правило, звуки, воспроизводимые через наушники, воспринимаются как исходящие изнутри головы. В виртуальном звуковом пространстве наушники должны обеспечивать ощущение, что звук исходит извне ("экстериоризация" звука). Используя HRTF, можно пространственно позиционировать звуки с помощью техники, описанной ниже, которая выполняет физическое моделирование на полной 3D-модели головы, и EAC, который использует нейронную сеть, обученную на основе существующих HRTF, и работает с фотографиями и другими приблизительными измерениями.
Технология записи и воспроизведения
Записи, обработанные с помощью HRTF, например, в компьютерной игровой среде (см. A3D, EAX и OpenAL), которая аппроксимирует HRTF слушателя, могут быть услышаны через стереонаушники или динамики и интерпретированы как звуки, исходящие со всех направлений, а не только из двух точек по обе стороны головы. Воспринимаемая точность результата зависит от того, насколько точно набор данных HRTF соответствует характеристикам собственных ушей, хотя обобщенный HRTF может быть предпочтительнее точного измерения, сделанного по одному уху. Некоторые производители, такие как Apple и Sony, предлагают различные HRTF для выбора пользователем в зависимости от формы его уха. Windows 10 и более поздние версии поставляются с Microsoft Spatial Sound, той же пространственной аудиоструктурой, которая используется на Xbox One и Hololens 2. На ПК с Windows или Xbox One фреймворк может использовать несколько различных аудиопроцессоров, включая Windows Sonic для наушников, Dolby Atmos и DTS Headphone:X, для применения HRTF. Фреймворк способен воспроизводить как источники окружающего звука с фиксированным положением, так и динамические источники "объектов", которые могут перемещаться в пространстве. Apple также предлагает Spatial Sound для своих устройств, используемых с наушниками, произведенными Apple или Beats. Для воспроизведения музыки в наушниках можно включить Dolby Atmos и применить HRTF. HRTF (или, точнее, позиции объектов) могут изменяться в зависимости от отслеживания положения головы для поддержания иллюзии направления. Qualcomm Snapdragon имеет аналогичную пространственную аудиосистему с отслеживанием положения головы, используемую некоторыми брендами телефонов Android. YouTube использует HRTF с отслеживанием положения головы для видео в формате 360 градусов и VR. В настоящее время Linux не может напрямую обрабатывать какие-либо из проприетарных форматов пространственного аудио (окружающий звук плюс динамические объекты). SoundScape Renderer предлагает направленный синтез звука. PulseAudio и PipeWire могут обеспечивать виртуальный окружающий звук (каналы с фиксированным местоположением) с использованием HRTF. Последние версии PipeWire также способны обеспечивать динамическое пространственное отображение с использованием HRTF, однако интеграция с приложениями все еще находится в процессе разработки. Пользователи могут настраивать собственные позиционные и динамические источники звука, а также имитировать конфигурацию с окружающими динамиками, используя существующие настройки. Кроссплатформенная OpenAL Soft, являющаяся реализацией OpenAL, использует HRTF для улучшения локализации звука. Пространственные аудиосистемы Windows и Linux поддерживают любые модели стереонаушников, в то время как Apple разрешает использовать пространственный звук только с Bluetooth-гарнитурами Apple или Beats.