Введение
Устройство для шифрования, преобразования и синтеза голоса – голосовой кодер.
the voice encoder
Вокодер (/'voʊkoʊdər/, портманто слов "voice" – голос и "encoder" – кодер) – это категория кодирования речи, которая анализирует и синтезирует человеческий голосовой сигнал для сжатия аудиоданных, мультиплексирования, шифрования голоса или преобразования голоса. Вокодер был изобретен в 1938 году Гомером Дадли в Bell Labs как средство синтеза человеческой речи. Эта работа была развита в канальный вокодер, который использовался в качестве голосового кодека для телекоммуникаций с целью кодирования речи и экономии полосы пропускания при передаче. Шифруя управляющие сигналы, можно обеспечить защиту голосовой передачи от перехвата. Основное применение этого метода – безопасная радиосвязь. Преимущество этого метода шифрования заключается в том, что передаются не исходные сигналы, а лишь огибающие полосно-пропускных фильтров. Приемному устройству необходимо быть настроенным в той же конфигурации фильтров для повторного синтеза спектра исходного сигнала. Вокодер также широко используется как электронный музыкальный инструмент. Декодирующая часть вокодера, называемая водером, может использоваться независимо для синтеза речи.
Теория
Голос человека состоит из звуков, генерируемых голосовыми связками при открытии и закрытии голосовой щели, что создает периодическую форму волны с множеством гармоник. Этот основной звук затем фильтруется носом и горлом (сложная резонансная система каналов), чтобы контролируемым образом создавать различия в гармоническом составе (форманты), формируя широкий спектр звуков, используемых в речи. Существует также другой набор звуков, известных как глухие и взрывные звуки, которые создаются или модифицируются ртом различными способами. Вокодер анализирует речь, измеряя, как изменяются ее спектральные характеристики во времени. Это приводит к серии сигналов, представляющих эти частоты в любой конкретный момент времени, когда говорит пользователь. Проще говоря, сигнал разделяется на несколько частотных диапазонов (чем больше их число, тем точнее анализ), и уровень сигнала в каждом диапазоне дает мгновенное представление о спектральной энергетике. Для воссоздания речи вокодер просто обращает этот процесс, обрабатывая широкополосный источник шума, пропуская его через фильтр, который формирует частотный состав на основе первоначально записанной последовательности чисел. В частности, в кодировщике входной сигнал проходит через многополосный фильтр, затем выход каждой полосы измеряется с помощью огибающей, а сигналы от огибающих передаются в декодер. Декодер применяет их в качестве управляющих сигналов к соответствующим усилителям выходных каналов фильтра. Информация о мгновенной частоте исходного голосового сигнала (в отличие от его спектральных характеристик) отбрасывается, поскольку ее сохранение не было важным для первоначального использования вокодера в качестве средства шифрования. Именно этот дегуманизирующий аспект процесса вокодирования делает его полезным для создания специальных голосовых эффектов в популярной музыке и аудиоразвлечениях. Вместо точного воспроизведения формы волны, процесс вокодирования передает по каналу связи только параметры вокальной модели. Поскольку параметры изменяются медленно по сравнению с исходной речевой формой волны, полоса пропускания, необходимая для передачи речи, может быть уменьшена. Это позволяет большему количеству речевых каналов использовать заданный канал связи, например, радиоканал или подводный кабель. Аналоговые вокодеры обычно анализируют входящий сигнал, разделяя его на несколько настроенных частотных полос или диапазонов. Для восстановления сигнала несущий сигнал пропускается через серию этих настроенных полосно-пропускных фильтров. В примере типичного голоса робота в качестве несущего используется шум или пилообразная форма волны. Обычно используется от 8 до 20 полос. Амплитуда модулятора для каждой из отдельных аналитических полос генерирует напряжение, которое используется для управления усилителями соответствующих несущих полос. В результате частотные компоненты модулирующего сигнала отображаются на несущем сигнале в виде дискретных изменений амплитуды в каждой частотной полосе. Часто присутствует неподдерживаемый диапазон или сибильный канал, предназначенный для частот, выходящих за пределы аналитических полос для обычной речи, но все же важных для ее восприятия. Примерами являются слова, начинающиеся с букв s, f, ch или других шипящих звуков. Использование этой полосы позволяет получить узнаваемую речь, хотя и звучащую несколько механически. Вокодеры часто включают вторую систему для генерации глухих звуков, использующую генератор шума вместо основной частоты. Этот сигнал смешивается с выходным сигналом несущей для повышения четкости. В алгоритме канального вокодера, при рассмотрении только амплитудной компоненты аналитического сигнала и игнорировании фазовой, голос может звучать неразборчиво; о методах исправления этого см. в разделе о фазовом вокодере.
История
Разработка вокодера была начата в 1928 году инженером Bell Labs Гомером Дадли, которому были выданы патенты на него 21 марта 1939 года и 16 ноября 1937 года. Для демонстрации способности секции декодирования к синтезу речи, водер (демонстратор работы с голосом) был представлен публике в здании AT&T на Всемирной выставке в Нью-Йорке 1939–1940 годов. Водер состоял из электронного генератора, источника звука, генерирующего тональный сигнал и генератора шума для создания шипения, 10-полосного резонаторного фильтра с усилителями переменного усиления, выполняющего функцию голосового тракта, а также ручных регуляторов, включая набор клавиш, чувствительных к нажатию, для управления фильтрами, и педаль для управления тоном. Фильтры, управляемые клавишами, преобразуют тональный сигнал и шипение в гласные, согласные и интонации. Это была сложная в управлении машина, но опытный оператор мог воспроизводить разборчивую речь. Вокодер Дадли использовался в системе SIGSALY, разработанной инженерами Bell Labs в 1943 году. SIGSALY применялась для зашифрованной голосовой связи во время Второй мировой войны. Голосовой кодер KO 6 был выпущен в 1949 году ограниченным тиражом; он являлся близким аналогом SIGSALY со скоростью 1200 бит/с. В 1953 году голосовой кодер KY 9 THESEUS со скоростью 1650 бит/с использовал твердотельную логику для уменьшения веса по сравнению с SIGSALY, а в 1961 году голосовой кодер HY 2, 16-канальная система со скоростью 2400 бит/с, весил и стал последней реализацией канального вокодера в защищенной системе связи. Последующие работы в этой области стали использовать цифровое кодирование речи. Наиболее широко используемой техникой кодирования речи является линейное предсказательное кодирование (LPC). Другая техника кодирования речи, адаптивная дифференциальная импульсно-кодовая модуляция (ADPCM), была разработана П. Каммиски, Никилом С. Джаянтом и Джеймсом Л. Фланаганом в Bell Labs в 1973 году.
Линейная прогнозирование
С конца 1970-х годов большинство немузыкальных вокодеров реализованы с использованием линейного предсказания, при котором спектральная огибающая (форманты) целевого сигнала оценивается всеполюсным IIR-фильтром. В кодировании с линейным предсказанием всеполюсный фильтр заменяет банкполосный фильтр, использовавшийся в предшествующих системах, и применяется на кодировщике для ослабления сигнала (то есть выравнивания спектра), а затем на декодировщике для восстановления спектральной формы целевого речевого сигнала. Одним из преимуществ такого типа фильтрации является то, что положение спектральных пиков линейного предсказателя полностью определяется целевым сигналом и может быть настолько точным, насколько позволяет временной интервал фильтрации. Это отличается от вокодеров, реализованных с использованием фильтров с фиксированной шириной полосы, где положение спектральных пиков ограничено доступными фиксированными частотными диапазонами. Фильтрация LP также имеет недостатки: сигналы, содержащие большое количество частотных составляющих, могут превышать количество частот, которые может представить линейный предсказывающий фильтр. Это ограничение является основной причиной того, что LP-кодирование почти всегда используется в сочетании с другими методами в высококомпрессионных голосовых кодерах.
Интерполятивная волновая форма
Вокодер волновой интерполяции (WI) был разработан в AT&T Bell Laboratories около 1995 года У. Б. Клейном, а затем, AT&T разработала версию с пониженной сложностью для участия в конкурсе защищенных вокодеров, организованном Министерством обороны США. Значительные усовершенствования кодера WI были внесены в Калифорнийском университете в Санта-Барбаре. AT&T владеет основными патентами, относящимися к WI, а другие организации – дополнительными патентами.
Использование в музыке
Для музыкальных приложений в качестве несущей используется источник музыкальных звуков, а не извлечение основной частоты. Например, можно использовать звук синтезатора на входе фильтр-банка – техника, получившая распространение в 1970-х годах.
История
Вернер Мейер Эпплер, немецкий ученый, проявлявший особый интерес к электронному синтезу голоса, опубликовал в 1948 году диссертацию об электронной музыке и синтезе речи с точки зрения синтеза звука. Позже он сыграл важную роль в основании Студии электронной музыки WDR в Кельне в 1951 году. Одной из первых попыток использования вокодера при создании музыки стал синтезатор Siemens, разработанный в студии Siemens для электронной музыки в период с 1956 по 1959 год. В 1968 году Роберт Муг разработал один из первых твердотельных музыкальных вокодеров для студии электронной музыки Университета Буффало. В 1968 году Брюс Хаак создал прототип вокодера под названием Farad, в честь Майкла Фарадея. Он впервые прозвучал на альбоме "The Electronic Record For Children", выпущенном в 1969 году, а затем на его рок-альбоме The Electric Lucifer, выпущенном в 1970 году. В 1970 году Венди Карлос и Роберт Муг построили еще один музыкальный вокодер – десятиполосное устройство, вдохновленное конструкциями вокодеров Гомера Дадли. Изначально он назывался спектральным кодером-декодером, а позже просто вокодером. Несущий сигнал поступал с модульного синтезатора Moog, а модулятор – с микрофонного входа. Выход десятиполосного вокодера был достаточно разборчивым, но требовал четкой артикуляции речи. В 1972 году первый электронный музыкальный альбом Исао Томиты Electric Samurai: Switched on Rock стал ранней попыткой применения техники синтеза речи к электронной рок-музыке. Альбом содержал электронные версии современных рок- и поп-песен с использованием синтезированных голосов вместо человеческих. В 1974 году он использовал синтезированные голоса в своем популярном альбоме классической музыки Snowflakes are Dancing, который имел мировой успех и способствовал популяризации электронной музыки. В 1973 году британская группа Emerson, Lake and Palmer использовала вокодер в своем альбоме Brain Salad Surgery для песни "Karn Evil 9: 3rd Impression". В песне "The Raven" 1975 года из альбома Tales of Mystery and Imagination группы The Alan Parsons Project Алан Парсонс исполнял вокал через вокодер EMI. Согласно сопроводительной документации к альбому, "The Raven" стала первой рок-песней с использованием цифрового вокодера. Pink Floyd использовали вокодер на трех своих альбомах: сначала на альбоме "Animals" 1977 года в песнях "Sheep" и "Pigs (Three Different Ones)", затем в 1987 году на альбоме "A Momentary Lapse of Reason" в песнях "A New Machine Part 1" и "A New Machine Part 2", и, наконец, в 1994 году на альбоме "The Division Bell" в песне "Keep Talking". The Electric Light Orchestra были одними из первых, кто использовал вокодер в коммерческих целях, с их альбомом 1977 года Out of the Blue. Группа широко использовала его на альбоме, включая хиты "Sweet Talkin' Woman" и "Mr. Blue Sky". На последующих альбомах группа использовала его эпизодически, особенно в своих хитах "The Diary of Horace Wimp" и "Confusion" с альбома Discovery 1979 года, в треках "Prologue", "Yours Truly, 2095" и "Epilogue" с альбома Time 1981 года и "Calling America" с альбома Balance of Power 1986 года. В конце 1970-х французский дуэт Space Art использовал вокодер во время записи своего второго альбома Trip in the Centre Head. Фил Коллинз использовал вокодер для создания вокального эффекта в своем международном хите 1981 года "In the Air Tonight". Вокодеры время от времени появлялись в поп-записях, чаще всего просто как специальный эффект, а не как ключевой элемент работы. Однако многие экспериментальные электронные артисты в жанре new age часто использовали вокодер более комплексно в конкретных произведениях, например, Жан-Мишель Жарр (на Zoolook, 1984) и Майк Олдфилд (на QE2, 1980 и Five Miles Out, 1982). Модуль вокодера и его использование Майком Олдфилдом можно отчетливо увидеть на его DVD Live At Montreux 1981 (трек "Sheba"). Есть также артисты, которые сделали вокодеры неотъемлемой частью своей музыки, как в целом, так и на протяжении длительного периода. Примерами являются немецкая синт-поп группа Kraftwerk, японская группа новой волны Polysics, Stevie Wonder ("Send One Your Love", "A Seed's a Star") и джазовый/фьюжн клавишник Герби Хэнкок в конце 1970-х годов. В 1982 году Нил Янг использовал Sennheiser Vocoder VSM201 на шести из девяти треков на альбоме Trans. Хор и бридж песни Майкла Джексона "P.Y.T. (Pretty Young Thing)" содержат вокодер ("Pretty young thing/You make me sing"), благодаря сессионному музыканту Майклу Боддикеру. Coldplay использовали вокодер в некоторых своих песнях. Например, в песнях "Major Minus" и "Hurts Like Heaven", обе из альбома Mylo Xyloto (2011), вокал Криса Мартина в основном обработан вокодером. В песне "Midnight" из альбома Ghost Stories (2014) Мартин также поет через вокодер. Скрытый трек "X Marks the Spot" из альбома A Head Full of Dreams также был записан через вокодер. Нойзкор группа Atari Teenage Riot использовала вокодеры в различных своих песнях и живых выступлениях, таких как Live at the Brixton Academy (2002) наряду с другими цифровыми аудио технологиями, как старыми, так и новыми. В песне "By the Way" группы Red Hot Chili Peppers используется вокодерный эффект на вокале Энтони Кидиса. Среди наиболее последовательных пользователей вокодера при имитации человеческого голоса – Daft Punk, которые использовали этот инструмент со своего первого альбома Homework (1997) до своей последней работы Random Access Memories (2013) и считают слияние технологического и человеческого голоса "идентичностью своего музыкального проекта". Например, текст песни "Around the World" (1997) полностью обработан вокодером, "Get Lucky" (2013) содержит смесь естественного и обработанного человеческого голоса, а "Instant Crush" (2013) представляет собой вокал Джулиана Касабланкаса через вокодер. Ye (Kanye West) использовал вокодер в аутро своей песни "Runaway" (2010). Продюсер Zedd, американская кантри-певица Maren Morris и американский музыкальный дуэт Grey создали песню под названием "The Middle", в которой использовался вокодер и которая достигла первой десятки чартов в 2018 году.
Голосовые эффекты в других видах искусства
Голоса роботов стали повторяющимся элементом популярной музыки в течение 20-го века. Помимо вокодеров, существует несколько других методов создания вариаций этого эффекта, таких как: Sonovox, Talk box, Auto-Tune, кольцевая модуляция и гребенчатый фильтр.
ring modulation and comb filter.)