Введение
Сжатие аудио с потерями, применяемое к человеческой речи.
Кодирование речи – это применение сжатия данных к цифровым аудиосигналам, содержащим речь. Кодирование речи использует оценку параметров, специфичных для речи, с применением методов обработки аудиосигналов для моделирования речевого сигнала, в сочетании с общими алгоритмами сжатия данных для представления полученных параметров в компактном битовом потоке. Типичными областями применения кодирования речи являются мобильная телефония и голосовая связь по IP (VoIP). Наиболее широко используемой техникой кодирования речи в мобильной телефонии является линейное предсказательное кодирование (LPC), а в приложениях VoIP – LPC и модифицированное дискретное косинусное преобразование (MDCT). Методы, используемые в кодировании речи, схожи с теми, что применяются при сжатии и кодировании аудиоданных, где учитываются особенности психоакустики для передачи только информации, релевантной для человеческой слуховой системы. Например, при кодировании речи в голосовом диапазоне передается только информация в частотном диапазоне от 400 до 3500 Гц, при этом восстановленный сигнал сохраняет достаточную разборчивость. Кодирование речи отличается от других видов аудиокодирования тем, что речь – это более простой сигнал, чем другие аудиосигналы, и доступна статистическая информация о ее свойствах. В результате, некоторая слуховая информация, важная при общем аудиокодировании, может быть избыточной в контексте кодирования речи. Кодирование речи акцентирует внимание на сохранении разборчивости и естественности речи при использовании ограниченного объема передаваемых данных. Кроме того, большинство речевых приложений требуют низкой задержки кодирования, поскольку задержка препятствует речевому взаимодействию.
Образец компонда рассматривается как форма кодирования речи
Алгоритмы закона А и закона μ, используемые в цифровой телефонии G.711 PCM, можно рассматривать как ранний предшественник кодирования речи, требующий всего 8 бит на отсчет, но обеспечивающий эффективное разрешение в 12 бит. Логарифмическая компрессия соответствует восприятию человеческого слуха: низкоамплитудный шум слышен на фоне низкоамплитудной речи, но маскируется высокоамплитудной речью. Хотя это привело бы к неприемлемым искажениям в музыкальном сигнале, пиковая форма речевых сигналов в сочетании с простой частотной структурой речи – как периодической волны с одной основной частотой и случайными шумовыми всплесками – делает эти очень простые алгоритмы мгновенного сжатия приемлемыми для речи. В то время было опробовано множество других алгоритмов, в основном варианты дельта-модуляции, но после тщательного рассмотрения разработчики первых цифровых систем телефонии выбрали алгоритмы закона А/μ. В момент их разработки, 33%-ное снижение полосы пропускания при очень низкой вычислительной сложности представляло собой отличный инженерный компромисс. Их качество звука остается приемлемым, и необходимости в их замене в стационарной телефонной сети не возникло. В 2008 году ITU-T стандартизировал кодек G.711.1, имеющий масштабируемую структуру. Частота дискретизации входного сигнала составляет 16 кГц.
Современная компрессия речи
Большая часть последующих работ в области сжатия речи была обусловлена военными исследованиями в сфере цифровой связи для защищенных военных радиостанций, где для обеспечения эффективной работы в неблагоприятных радиоусловиях использовались очень низкие скорости передачи данных. Одновременно с этим, в виде интегральных схем VLSI, была доступна значительно большая вычислительная мощность, чем для ранних методов сжатия. В результате современные алгоритмы сжатия речи могли использовать гораздо более сложные методы, чем в 1960-х годах, для достижения значительно более высоких коэффициентов сжатия. Наиболее распространенные алгоритмы кодирования речи основаны на линейном предсказательном кодировании (LPC). В частности, наиболее часто используемой схемой кодирования речи является кодирование LPC с кодовой модуляцией линейного предсказания (CELP), которое, например, используется в стандарте GSM. В CELP моделирование разделено на два этапа: этап линейного предсказания, моделирующий спектральную огибающую, и модель на основе кодовой книги, моделирующая остаточную составляющую линейной предсказательной модели. В CELP коэффициенты линейного предсказания (LPC) вычисляются и квантуются, как правило, в виде пар линейчатых спектров (LSP). Помимо непосредственного кодирования речевого сигнала, часто необходимо использовать кодирование канала для передачи, чтобы избежать потерь из-за ошибок передачи. Для достижения наилучших общих результатов кодирования методы кодирования речи и кодирования канала выбираются в паре, при этом наиболее важные биты в потоке речевых данных защищаются более надежным кодированием канала. Модифицированное дискретное косинусное преобразование (MDCT) используется в технике LD MDCT, применяемой в формате AAC LD, представленном в 1999 году. С тех пор MDCT широко используется в приложениях передачи голоса по IP (VoIP), таких как широкополосный аудиокодек G.729.1, представленный в 2006 году, Apple FaceTime (с использованием AAC LD), представленный в 2010 году, и кодек CELT, представленный в 2011 году. Opus – это бесплатный аудиокодек с открытым исходным кодом. Он объединяет алгоритм SILK, ориентированный на речь и основанный на LPC, и алгоритм CELT, основанный на MDCT с низкой задержкой, переключаясь между ними или комбинируя их по мере необходимости для достижения максимальной эффективности. Он широко используется для VoIP-звонков в WhatsApp. Игровая консоль PlayStation 4 также использует Opus для системного голосового чата PlayStation Network. Были продемонстрированы различные кодеки с еще более низкими битовыми скоростями. Codec2, работающий на скоростях передачи данных до 450 бит/с, используется в любительском радио. В настоящее время НАТО использует MELPe, обеспечивающий разборчивую речь при скорости 600 бит/с и ниже. Также появились подходы к нейронным вокодерам: Lyra от Google обеспечивает «почти жуткое» качество при 3 кбит/с. Satin от Microsoft также использует машинное обучение, но имеет более высокую настраиваемую битовую скорость и обеспечивает широкополосную связь.