Введение

Изменение скорости или длительности звукового сигнала без изменения его высоты тона.

Растяжение времени — это процесс изменения скорости или длительности звукового сигнала без изменения его высоты тона. Изменение высоты тона — это обратный процесс: изменение высоты тона без изменения скорости. Сдвиг высоты тона — это изменение высоты тона, реализованное в эффекте и предназначенное для живых выступлений. Контроль высоты тона — более простой процесс, который одновременно изменяет высоту тона и скорость, замедляя или ускоряя запись. Эти процессы часто используются для согласования высоты тона и темпа двух предварительно записанных фрагментов для сведения, когда эти фрагменты невозможно переиграть или пересемплировать. Растяжение времени часто используется для корректировки радио- и телевизионной рекламы, чтобы она точно соответствовала 30 или 60 секундам. Оно также может быть использовано для приведения более длинного материала к заданному временному интервалу, например, к часовому эфиру.

Переборка

Самый простой способ изменить длительность или высоту тона аудиозаписи — изменить скорость воспроизведения. Для цифровой аудиозаписи это можно реализовать посредством изменения частоты дискретизации. При использовании этого метода частоты в записи всегда масштабируются в той же пропорции, что и скорость, тем самым изменяя воспринимаемую высоту тона. Замедление записи для увеличения длительности также понижает высоту тона, а ускорение для сокращения длительности, соответственно, повышает, создавая так называемый эффект «бурундука». При повторной дискретизации аудио с заметным понижением высоты тона предпочтительнее использовать исходный аудиоматериал с более высокой частотой дискретизации, поскольку замедление скорости воспроизведения приводит к воспроизведению аудиосигнала с более низким разрешением, что снижает воспринимаемую чёткость звука. И наоборот, при повторной дискретизации аудио с заметным повышением высоты тона предпочтительнее использовать интерполяционный фильтр, так как частоты, превышающие частоту Найквиста (определяемую частотой дискретизации программного обеспечения или устройства воспроизведения), обычно создают нежелательные звуковые искажения, явление, также известное как алиасинг.

Синусоидальное спектральное моделирование

Другой метод растяжения времени основан на спектральной модели сигнала. В этом методе пики идентифицируются в кадрах с использованием STFT сигнала, а синусоидальные "треки" создаются путем соединения пиков в соседних кадрах. Затем эти треки ресинтезируются в новом временном масштабе. Этот метод может давать хорошие результаты как с полифоническим, так и с перкуссионным материалом, особенно когда сигнал разделяется на поддиапазоны. Однако этот метод более требователен к вычислительным ресурсам, чем другие методы.

СОЛА

Рабинер и Шафер в 1978 году предложили альтернативное решение, работающее во временной области: попытаться найти период (или, эквивалентно, фундаментальную частоту) заданного участка волны, используя алгоритм определения высоты тона (обычно пик автокорреляции сигнала или, реже, цепстральная обработка), и плавно переходить от одного периода к другому. Этот метод называется гармоническим масштабированием во временной области или синхронизированным методом перекрытия и сложения (SOLA). Он работает несколько быстрее, чем фазовый вокодер на менее мощных компьютерах, но дает сбой, когда автокорреляция неверно оценивает период сигнала со сложной гармоникой (например, в оркестровых произведениях). Adobe Audition (ранее Cool Edit Pro) решает эту проблему, ища период, наиболее близкий к центральному периоду, заданному пользователем. Этот период должен быть целым кратным темпу и находиться в диапазоне от 30 Гц до самой низкой басовой частоты. Это гораздо более узкий подход, чем обработка на основе фазового вокодера, но может быть менее требовательным к вычислительным ресурсам для приложений реального времени. Он обеспечивает наиболее связные результаты для отдельных звуков с определенной высотой, таких как голос или монофонические музыкальные инструменты. Высококачественные коммерческие пакеты обработки звука либо комбинируют обе техники (например, разделяя сигнал на синусоидальные и переходные составляющие), либо используют другие методы, основанные на вейвлет-преобразовании или обработке искусственными нейронными сетями, обеспечивая наилучшее качество изменения длительности звука.

Скорость слуха и скорость разговора

Для конкретного случая речи, растяжение времени можно осуществить с помощью PSOLA. Сжатая речь – это представление вербального текста в сжатом времени. Вопреки ожиданию, что ускорение снижает понимание, Херб Фридман утверждает, что "эксперименты показали: мозг работает наиболее эффективно, когда скорость поступления информации через уши – посредством речи – соответствует "средней" скорости чтения, которая составляет примерно 200–300 слов в минуту, в то время как средняя скорость речи находится в пределах 100–150 слов в минуту". Прослушивание сжатой речи рассматривается как эквивалент скорочтения.

Масштабирование высоты

Эти методы также могут использоваться для транспонирования аудиосемпла при постоянной скорости или длительности. Этого можно достичь растяжением времени с последующей передискретизацией до исходной длины. Альтернативно, частоту синусоид в синусоидальной модели можно изменить напрямую, а затем реконструировать сигнал в соответствующем временном масштабе. Транспонирование можно назвать масштабированием частоты или изменением высоты тона, в зависимости от точки зрения. Например, можно повысить высоту тона каждой ноты на чистую квинту, сохраняя темп неизменным. Эту транспозицию можно рассматривать как "изменение высоты тона", "сдвиг" каждой ноты на 7 клавиш на клавиатуре фортепиано, или добавление фиксированного значения в шкале Мела, или добавление фиксированного значения в линейном пространстве высоты тона. Ту же транспозицию можно рассматривать как "масштабирование частоты", "масштабирование" (умножение) частоты каждой ноты на 3/2. Музыкальная транспозиция сохраняет соотношения гармонических частот, определяющих тембр звука, в отличие от сдвига частоты, выполняемого амплитудной модуляцией, которая добавляет фиксированное частотное смещение к частоте каждой ноты. (В теории можно выполнить буквальное масштабирование высоты тона, при котором положение в музыкальном пространстве высоты тона масштабируется [более высокая нота будет смещена на больший интервал в линейном пространстве высоты тона, чем более низкая нота], но это крайне необычно и не соответствует музыкальным принципам.) Обработка во временной области здесь работает гораздо лучше, поскольку размытие менее заметно, но масштабирование вокальных семплов искажает форманты, создавая эффект, похожий на эффект "Алвина и бурундуков", который может быть желательным или нежелательным. Процесс, сохраняющий форманты и характер голоса, включает анализ сигнала с помощью канального вокодера или LPC-вокодера в сочетании с одним из нескольких алгоритмов определения высоты тона, а затем его ресинтез на другой основной частоте. Подробное описание старых аналоговых методов записи для изменения высоты тона можно найти на .

В потребительском программном обеспечении

Коррекция высоты тона при изменении длительности звука реализована во всех современных веб-браузерах как часть стандарта HTML для воспроизведения медиафайлов. Аналогичные средства управления широко распространены в медиаприложениях и фреймворках, таких как GStreamer и Unity.