Введение
Стандарт сжатия звука Harmonic Vector Excitation Coding, сокращенно HVXC, — это алгоритм кодирования речи, определенный в стандарте MPEG 4 Part 3 (MPEG 4 Audio) для кодирования речи при очень низкой скорости передачи данных. HVXC поддерживает скорости передачи данных 2 и 4 кбит/с в режимах фиксированной и переменной скорости передачи данных, а также частоту дискретизации 8 кГц. Он также работает при более низких скоростях передачи данных, таких как 1,2–1,7 кбит/с, используя технику переменной скорости передачи данных. Общая алгоритмическая задержка кодировщика и декодировщика составляет 36 мс. Он был опубликован как подраздел 2 стандарта ISO/IEC 14496-3:1999 (MPEG 4 Audio) в 1999 году. Расширенная версия HVXC была опубликована в MPEG 4 Audio Version 2 (ISO/IEC 14496-3:1999/Amd 1:2000). Набор инструментов MPEG 4 Natural Speech Coding использует два алгоритма: HVXC и CELP (Code Excited Linear Prediction). HVXC используется при низкой скорости передачи данных 2 или 4 кбит/с. Более высокие скорости передачи данных, чем 4 кбит/с, а также 3,85 кбит/с, обеспечиваются алгоритмом CELP.
Harmonic Vector Excitation Coding, abbreviated as HVXC is a speech coding algorithm specified in MPEG 4 Part 3 (MPEG 4 Audio) standard for very low bit rate speech coding. HVXC supports bit rates of 2 and 4 kbit/s in the fixed and variable bit rate mode and sampling frequency of 8 kHz. It also operates at lower bitrates, such as 1.2 1.7 kbit/s, using a variable bit rate technique. The total algorithmic delay for the encoder and decoder is 36 ms. It was published as subpart 2 of ISO/IEC 14496 3:1999 (MPEG 4 Audio) in 1999. An extended version of HVXC was published in MPEG 4 Audio Version 2 (ISO/IEC 14496 3:1999/Amd 1:2000). MPEG 4 Natural Speech Coding Tool Set uses two algorithms: HVXC and CELP (Code Excited Linear Prediction). HVXC is used at a low bit rate of 2 or 4 kbit/s. Higher bitrates than 4 kbit/s in addition to 3.85 kbit/s are covered by CELP.
Линейная предсказуемая кодировка
HVXC использует линейное предсказательное кодирование (LPC) с блочной адаптацией каждые 20 мс. Параметры LPC преобразуются в коэффициенты пар линейчатого спектра (LSP), которые совместно квантуются. Остаточный сигнал LPC классифицируется как речевой (тональный) или неречевой (шумовой). В случае речевого сигнала остаток кодируется параметрическим представлением (функционируя как вокодер), а в случае неречевого сигнала – квантуется остаточная форма сигнала (тем самым работая как гибридный речевой кодек).
Голосовое (гармоническое) остаточное кодирование
В озвученных сегментах остаточный сигнал представлен двумя параметрами: периодом основного тона и спектральной оболочкой. Период основного тона оценивается по пиковым значениям автокорреляции остаточного сигнала. В этом процессе остаточный сигнал сравнивается со сдвинутыми копиями самого себя, и сдвиг, обеспечивающий наибольшее сходство по мере линейной зависимости, идентифицируется как период основного тона. Спектральная оболочка представлена набором значений амплитуды, по одному на гармонику. Для извлечения этих значений остаточный сигнал LPC преобразуется в частотную область DFT. Спектр DFT сегментируется на полосы, по одной полосе на гармонику. Частотная полоса для m-й гармоники состоит из коэффициентов DFT от (m - 1/2)ω0 до (m + 1/2)ω0, где ω0 – частота основного тона. Значение амплитуды для m-й гармоники выбирается для оптимального представления этих коэффициентов DFT. Фазовая информация в этом процессе отбрасывается. Затем спектральная оболочка кодируется с использованием векторного квантования с переменной размерностью. Этот процесс также называют гармоническим VQ. Чтобы речь со смесью озвученного и неозвученного возбуждения звучала более естественно и плавно, различают три различных режима озвученной речи (Смешанный голос 1, Смешанный голос 2, Полный голос). Степень озвученности определяется значением нормализованной функции автокорреляции при сдвиге в один период основного тона. В зависимости от выбранного режима, декодер добавляет различные количества полосно-пропускаемого гауссовского шума к синтезированному гармоническому сигналу.
Беззвучное (VXC) остаточное кодирование
Неозвученные сегменты кодируются в соответствии со схемой CELP, которая также называется кодированием векторным возбуждением (VXC). Кодирование CELP в HVXQ выполняется исключительно с использованием стохастического кодового словаря. В других кодеках CELP динамический кодовый словарь дополнительно используется для осуществления долгосрочного предсказания озвученных сегментов. Однако, поскольку HVXC не использует CELP для озвученных сегментов, динамический кодовый словарь отсутствует в его структуре.