Введение
Техника улучшения цифрового звука при низкой скорости передачи данных
Спектральное полосное воспроизведение (SBR) – это технология для улучшения аудио- или речевых кодеков, особенно при низких битрейтах, основанная на гармонической избыточности в частотной области. Её можно комбинировать с любым кодеком сжатия звука: сам кодек передает нижние и средние частоты спектра, а SBR воспроизводит высокочастотное содержимое, транспонируя гармоники из нижних и средних частот на стороне декодера. Некоторая управляющая информация для восстановления огибающей высокочастотного спектра передается в виде дополнительной информации. При необходимости технология также реконструирует или адаптивно смешивает шумоподобную информацию в выбранных частотных диапазонах для точного воспроизведения сигналов, которые изначально не содержали или содержали мало тональных составляющих. Идея SBR основана на принципе, что психоакустическая часть человеческого мозга склонна анализировать высокие частоты с меньшей точностью; следовательно, гармонические явления, связанные с процессом спектрального полосного воспроизведения, должны быть точными лишь с точки зрения восприятия, а не технически или математически.
История и использование
Шведская компания Coding Technologies (приобретенная Dolby в 2007 году) разработала и впервые начала использовать SBR в своем кодеке, основанном на MPEG 2 AAC, под названием aacPlus, который впервые появился в 2001 году. Этот кодек был представлен в MPEG и стал основой для MPEG 4 High Efficiency AAC (HE AAC), стандартизированного в 2003 году. Ларс Лильджерид, Кристофер Кьёрлинг и Мартин Дитц получили премию IEEE Masaru Ibuka Consumer Electronics Award в 2013 году за их работу по разработке и продвижению HE AAC. Метод SBR, разработанный Coding Technologies, также использовался с WMA 10 Professional для создания WMA 10 Pro LBR и с MP3 для создания mp3PRO. HE AAC, использующий SBR, применяется в системах вещания, таких как DAB+, Digital Radio Mondiale (включая xHE AAC), HD Radio и XM Satellite Radio. Если проигрыватель не может использовать дополнительную информацию, переданную вместе с "обычными" сжатыми аудиоданными, он все равно может воспроизвести "базовые" данные (например, с частотой дискретизации 22,05 кГц вместо 44,1 кГц), что приведет к приглушенному (из-за отсутствия высоких частот), но в целом приемлемому звуку. Это происходит, например, при воспроизведении файла mp3PRO с помощью MP3-проигрывателя, не поддерживающего информацию SBR. Часть CELT в Opus выполняет спектральное складывание на уровне бинов MDCT, что делает ее менее продвинутой, но с меньшей задержкой по сравнению с SBR. Dolby Digital Plus (E AC3) выполняет спектральное расширение (SPX). SPX преобразует высокочастотные компоненты в метаданные и аналогичен вычислению многоканальной связи в E AC3. Dolby AC 4 расширяет эту технику до расширенного спектрального расширения (A SPX) с возможностью чередования с обычными, нерасширенными данными во временной или частотной области. В результате SPX может быть выборочно отключен для сложных фрагментов.
Методы
Кодирование SBR генерирует пониженную в частоте дискретизации (обычно 2:1) аудиосигнал и управляющую информацию. В ранней публикации управляющие данные описываются как полученные с помощью анализа с помощью квадратурного зеркального фильтра (QMF) и оценочного модуля огибающей. Декодирование SBR требует транспонирования гармоник, что является разновидностью растяжения звука во времени и изменения высоты тона. Традиционный подход начинается с коротких интервалов дискретного преобразования Фурье (DFT), фазовой коррекции, обратного дискретного преобразования Фурье (IDFT) и завершается методом наложения с добавлением. Этот метод чувствителен к переходным процессам, которые могут вызывать эхо, что требует добавления отступов (50% в USAC) к DFT. Более новый подход – использование QMF. Один банк фильтров может выполнять операцию растяжения во времени и изменения высоты тона, снижая вычислительную сложность.