Введение
Метод анализа и кодирования речи
Линейное предсказательное кодирование (ЛПК) — это метод, используемый преимущественно в обработке аудиосигналов и речевой обработке для представления спектральной огибающей цифрового речевого сигнала в сжатом виде, с использованием информации линейной предсказательной модели. ЛПК является наиболее распространенным методом в кодировании и синтезе речи. Это эффективная техника анализа речи и полезный метод для кодирования качественной речи при низкой скорости передачи данных.
Обзор
LPC исходит из предположения, что речевой сигнал создается источником колебаний на конце трубки (для звонких звуков), с периодическим добавлением шипящих и взрывных звуков (для глухих звуков, таких как шипящие и взрывные согласные). Несмотря на кажущуюся простоту, эта модель «источник-фильтр» на самом деле является достаточно точным приближением к реальности производства речи. Голосовая щель (пространство между голосовыми связками) генерирует источник колебаний, который характеризуется своей интенсивностью (громкостью) и частотой (высотой тона). Голосовой тракт (гортань и ротовая полость) формирует трубку, характеризующуюся своими резонансами; эти резонансы порождают форманты, или усиленные полосы частот в производимом звуке. Шипящие и взрывные звуки генерируются работой языка, губ и гортани при произнесении шипящих и взрывных согласных. LPC анализирует речевой сигнал, оценивая форманты, удаляя их влияние из сигнала и оценивая интенсивность и частоту оставшегося источника колебаний. Процесс удаления формант называется обратной фильтрацией, а сигнал, остающийся после вычитания отфильтрованного модельного сигнала, называется остаточным сигналом. Числовые значения, описывающие интенсивность и частоту источника колебаний, форманты и остаточный сигнал, могут быть сохранены или переданы. LPC синтезирует речевой сигнал, обращая процесс: используя параметры источника колебаний и остаточный сигнал для создания исходного сигнала, форманты для создания фильтра (который представляет трубку) и пропуская исходный сигнал через фильтр, получая речь. Поскольку речевые сигналы изменяются во времени, этот процесс выполняется на коротких отрезках речевого сигнала, называемых кадрами; обычно 30–50 кадров в секунду обеспечивают разборчивую речь с хорошей степенью сжатия.
Ранняя история
Линейное предсказание (оценка сигнала) восходит как минимум к 1940-м годам, когда Норберт Винер разработал математическую теорию для вычисления оптимальных фильтров и предсказателей для обнаружения сигналов, скрытых в шуме. Вскоре после того, как Клод Шеннон заложил основы общей теории кодирования, работы по предсказывающему кодированию были выполнены C. Чапином Катлером, Бернардом М. Оливером и Генри С. Харрисоном. Питер Элиас в 1955 году опубликовал две статьи о предсказывающем кодировании сигналов. Линейные предсказатели были независимо применены к анализу речи Фумитадой Итакурой из Университета Нагои и Шузо Сайто из Nippon Telegraph and Telephone в 1966 году, а в 1967 году – Бишну С. Аталом, Манфредом Р. Шредером и Джоном Бургом. Итакура и Сайто описали статистический подход, основанный на оценке максимального правдоподобия; Атал и Шредер – адаптивный линейный предсказывающий подход; Бург – подход, основанный на принципе максимальной энтропии. В 1969 году Итакура и Сайто представили метод, основанный на частной корреляции (PARCOR), Глен Каллер предложил кодирование речи в реальном времени, а Бишну С. Атал продемонстрировал LPC-кодировщик речи на ежегодном собрании Американского акустического общества. В 1971 году компания Philco Ford продемонстрировала LPC в реальном времени с использованием 16-битного LPC-оборудования; было продано четыре экземпляра. Технология LPC была усовершенствована Бишну Аталом и Манфредом Шредером в 1970-х – 1980-х годах. Впоследствии она стала основой для метода перцептивного кодирования, используемого в формате сжатия аудио MP3, представленном в 1993 году. LPC лежит в основе технологии передачи голоса по IP (VoIP). Он обычно используется для анализа и ресинтеза речи. Он применяется в качестве метода сжатия голоса телефонными компаниями, например, в стандарте GSM. Он также используется в защищенной беспроводной связи, где голос необходимо оцифровать, зашифровать и передать по узкому голосовому каналу; ранним примером является система Navajo I, разработанная правительством США.
Синтез LPC может быть использован для создания вокодеров, в которых музыкальные инструменты служат сигналом возбуждения для фильтра, изменяющегося во времени и оцениваемого на основе речи певца. Это достаточно популярно в электронной музыке. Пол Лански создал известное произведение компьютерной музыки «notjustmoreidlechatter», используя линейное предсказывающее кодирование. Больше, чем просто болтовня. LPC 10-го порядка был использован в популярной образовательной игрушке Speak & Spell 1980-х годов. Предсказатели LPC используются в кодеках Shorten, MPEG 4 ALS, FLAC, SILK и других аудиокодеках без потерь. LPC привлек внимание как инструмент для тонального анализа скрипок и других струнных музыкальных инструментов.
A 10th order LPC was used in the popular 1980s Speak & Spell educational toy. LPC predictors are used in Shorten, MPEG 4 ALS, FLAC, SILK audio codec, and other lossless audio codecs. LPC has received some attention as a tool for use in the tonal analysis of violins and other stringed musical instruments.