Введение

Формат сжатия аудио с потерями

MPEG 1 Audio Layer II или MPEG 2 Audio Layer II (MP2, иногда некорректно называемый Musicam или MUSICAM) — это формат сжатия аудио с потерями, определённый стандартом ISO/IEC 11172-3 вместе с MPEG 1 Audio Layer I и MPEG 1 Audio Layer III (MP3). Несмотря на то, что MP3 гораздо более популярен для использования на компьютерах и в интернете, MP2 остаётся доминирующим стандартом для аудиовещания.

Музыка

Кодирование MPEG 1 Audio Layer 2 было разработано на основе аудиокодека MUSICAM (Masking pattern adapted Universal Subband Integrated Coding And Multiplexing), созданного Centre commun d'études de télévision et télécommunications (CCETT), Philips и Institut für Rundfunktechnik (IRT) в 1989 году в рамках общеевропейской межправительственной исследовательской и опытно-конструкторской инициативы EUREKA 147 для разработки системы вещания аудио и данных на стационарные, портативные или мобильные приемники (учрежденной в 1987 году). Изначально это был проект Digital Audio Broadcast (DAB), которым руководил Эгон Мейер Энгелен из Deutsche Forschungs und Versuchsanstalt für Luft und Raumfahrt (позже переименованной в Deutsches Zentrum für Luft und Raumfahrt, Немецкий аэрокосмический центр) в Германии. Европейское сообщество финансировало этот проект, известный как EU 147, с 1987 по 1994 год в рамках исследовательской программы EUREKA. Система Eureka 147 состояла из трех основных элементов: кодирование аудио MUSICAM (универсальное субполосное интегрированное кодирование и мультиплексирование с адаптацией маскирования), кодирование и мультиплексирование передачи и модуляция COFDM. MUSICAM был одним из немногих кодеков, способных обеспечить высокое качество звука при битовых скоростях в диапазоне от 64 до 192 кбит/с на монофонический канал. Он был разработан для соответствия техническим требованиям большинства приложений (в области вещания, телекоммуникаций и записи на цифровые носители) – низкая задержка, низкая сложность, устойчивость к ошибкам, короткие блоки доступа и т.д. Являясь предшественником формата и технологии MP3, кодек MUSICAM основан на целочисленной арифметике, 32-полосном преобразовании и психоакустической модели. Он был разработан в первую очередь для цифрового аудиовещания и цифрового телевидения и был представлен CCETT (Франция) и IRT (Германия) в Атланте на конференции IEEE ICASSP. Этот кодек, интегрированный в систему вещания с использованием модуляции COFDM, был продемонстрирован в эфире и на практике совместно с Radio Canada и CRC Canada во время выставки NAB (Лас-Вегас) в 1991 году. Реализация аудиочасти этой системы вещания основывалась на двухчиповом кодировщике (один для субполосного преобразования, другой для психоакустической модели, разработанной командой Г. Штолла (IRT Germany), позже известной как Psychoacoustic model I в аудиостандарте ISO MPEG) и декодере реального времени с использованием одного чипа Motorola 56001 DSP, работающего на программном обеспечении для целочисленной арифметики, разработанном командой Y. F. Dehery (CCETT, Франция). Простота соответствующего декодера в сочетании с высоким качеством звука этого кодека, впервые использующего частоту дискретизации 48 кГц и входной формат 20 бит/образец (наивысший доступный стандарт дискретизации в 1991 году, совместимый с профессиональным цифровым студийным стандартом ввода AES/EBU), стали основными причинами для последующего принятия характеристик MUSICAM в качестве базовых функций для передового кодека цифрового музыкального сжатия, такого как MP3. Алгоритм аудиокодирования, используемый системой цифрового аудиовещания Eureka 147, был подвергнут процессу стандартизации в рамках ISO/Moving Pictures Expert Group (MPEG) в 1989–1994 годах. Кодирование звука MUSICAM было использовано в качестве основы для некоторых схем кодирования MPEG 1 и MPEG 2 Audio. Большинство ключевых особенностей MPEG 1 Audio были непосредственно унаследованы от MUSICAM, включая фильтр-банк, обработку во временной области, размеры аудиокадров и т.д. Однако были внесены улучшения, и фактический алгоритм MUSICAM не был использован в окончательном стандарте MPEG 1 Audio Layer II. С момента завершения разработки MPEG 1 Audio и MPEG 2 Audio (в 1992 и 1994 годах) оригинальный алгоритм MUSICAM больше не используется. Название MUSICAM часто ошибочно используется, когда подразумевается MPEG 1 Audio Layer II. Это может привести к путанице, поскольку название MUSICAM является зарегистрированным товарным знаком различных компаний в разных регионах мира. (Musicam – это название, используемое для MP2 в некоторых спецификациях для Astra Digital Radio, а также в документах DAB BBC.) Проект Eureka 147 привел к публикации европейского стандарта ETS 300 401 в 1995 году для DAB, который в настоящее время получил всемирное признание. Стандарт DAB использует MPEG 1 Audio Layer II (ISO/IEC 11172 3) для частоты дискретизации 48 кГц и MPEG 2 Audio Layer II (ISO/IEC 13818 3) для частоты дискретизации 24 кГц.

MPEG Audio (Аудио MPEG)

В конце 1980-х годов группа экспертов ISO по движущимся изображениям (MPEG) начала работу по стандартизации цифрового кодирования аудио и видео, которое, как ожидалось, найдет широкое применение в цифровом радио- и телевещании (впоследствии DAB, DMB, DVB), а также при использовании на CD-ROM (впоследствии Video CD). Аудиокодек MUSICAM был одним из 14 предложений для стандарта MPEG 1 Audio, представленных в ISO в 1989 году. Стандарт MPEG 1 Audio включал три аудио "слоя" (методы кодирования), известные сегодня как Layer I (MP1), Layer II (MP2) и Layer III (MP3). Все алгоритмы для MPEG 1 Audio Layer I, II и III были утверждены в 1991 году в качестве проектного варианта комитета ISO 11172 и завершены в 1992 году в рамках MPEG 1 – первого набора стандартов MPEG, что привело к созданию международного стандарта ISO/IEC 11172-3 (также известного как MPEG 1 Audio или MPEG 1 Part 3), опубликованного в 1993 году. MPEG 2 Part 3 (ISO/IEC 13818-3) определил дополнительные битрейты и частоты дискретизации для MPEG 1 Audio Layer I, II и III. Новые частоты дискретизации вдвое меньше тех, что были изначально определены для MPEG 1 Audio. MPEG 2 Part 3 также расширил возможности аудио MPEG 1, позволив кодировать аудиопрограммы с более чем двумя каналами, вплоть до 5.1-канального звучания.

Переменная битовая частота

MPEG-аудио может использовать переменную битовую скорость (VBR), но широкой поддержки это не получило. Второй слой может применять метод переключения битовой скорости. Каждый фрейм может быть создан с использованием различной битовой скорости. Согласно ISO/IEC 11172-3:1993, разделу 2.4.2.3: для обеспечения минимальной задержки и сложности декодер (MPEG-аудио) не обязан поддерживать непрерывно изменяемую битовую скорость в слоях I или II.

Как работает формат MP2

MP2 является поддиапазонным аудиокодеком, что означает, что сжатие происходит во временной области с использованием банка фильтров с низкой задержкой, формирующего 32 частотных компонента. В отличие от него, MP3 – это трансформационный аудиокодек с гибридным банком фильтров, что означает, что сжатие происходит в частотной области после гибридного (двойного) преобразования из временной области. MPEG Audio Layer II является базовым алгоритмом стандартов MP3. Все психоакустические характеристики и структуры формата кадров MP3 основаны на базовом алгоритме и формате MP2. MP2-кодек может использовать межканальную избыточность с помощью опционального кодирования интенсивности "совместного стерео". Как и MP3, MP2 является кодеком перцептивного кодирования, что означает, что он удаляет информацию, которую человеческая слуховая система не сможет легко различить. Для определения информации, подлежащей удалению, аудиосигнал анализируется в соответствии с психоакустической моделью, учитывающей параметры человеческого слуха. Исследования в области психоакустики показали, что при наличии сильного сигнала на определенной частоте, более слабые сигналы на частотах, близких к частоте сильного сигнала, не воспринимаются слуховой системой. Это явление называется частотным маскированием. Перцептивные аудиокодеки используют частотное маскирование, игнорируя информацию на частотах, которые считаются неразличимыми, что позволяет выделить больше данных для воспроизведения воспринимаемых частот. MP2 разделяет входной аудиосигнал на 32 поддиапазона, и если аудио в поддиапазоне признается неразличимым, этот поддиапазон не передается. MP3, напротив, преобразует входной аудиосигнал в частотную область, используя 576 частотных компонентов. Таким образом, MP3 обладает более высоким частотным разрешением, чем MP2, что позволяет применять психоакустическую модель более избирательно. Следовательно, MP3 имеет больший потенциал для снижения битрейта. Использование дополнительного инструмента энтропийного кодирования и более высокая частотная точность (за счет большего числа частотных поддиапазонов, используемых в MP3) объясняют, почему MP3 не требует такого высокого битрейта, как MP2, для достижения приемлемого качества звука. В то же время, MP2 демонстрирует лучшие характеристики, чем MP3 во временной области, благодаря своему более низкому частотному разрешению. Это подразумевает меньшую задержку кодирования – что может упростить редактирование аудио – а также "устойчивость" и сопротивление ошибкам, которые могут возникать в процессе цифровой записи или при передаче данных. Банк поддиапазонных фильтров MP2 также обеспечивает встроенную функцию "подавления переходных процессов" благодаря специфическому эффекту временного маскирования его основного фильтра. Эта уникальная особенность семейства MPEG 1 Audio обеспечивает очень хорошее качество звука для аудиосигналов с быстрыми изменениями энергии, таких как ударные инструменты. Поскольку форматы MP2 и MP3 используют один и тот же базовый банк поддиапазонных фильтров, оба формата выигрывают от этой характеристики.

Применение MP2

Часть стандартов цифрового радио DAB и цифрового телевидения DVB. Слой II обычно используется в индустрии вещания для распространения аудио в прямом эфире через спутниковые, ISDN и IP-сетевые соединения, а также для хранения аудио в цифровых системах воспроизведения. Примером является система распространения программ PRSS Content Depot от NPR. Content Depot распространяет аудио MPEG 1 L2 в формате Broadcast Wave File. MPEG2 с RIFF-заголовками (используется в файлах wav) специфицирован в стандартах RIFF/WAV. В результате Windows Media Player напрямую воспроизводит файлы Content Depot, однако менее продвинутые wav-плееры часто этого не делают. Поскольку процесс кодирования и декодирования был бы значительной нагрузкой на процессор в первых поколениях систем вещательного воспроизведения, профессиональные системы обычно реализуют кодек аппаратно, например, делегируя задачу кодирования и декодирования совместимой звуковой карте, а не центральному процессору. Все DVD-видеоплееры в странах PAL содержат стерео-MP2-декодеры, что делает MP2 потенциальным конкурентом Dolby Digital на этих рынках. DVD-видеоплееры в странах NTSC не обязаны декодировать MP2-аудио, хотя большинство из них это делают. В то время как некоторые DVD-регистраторы хранят аудио в формате MP2, и многие потребительские DVD-диски используют этот формат, коммерческие DVD с MP2-аудиотреками встречаются редко. MPEG 1 Audio Layer II является стандартным аудиоформатом, используемым в форматах Video CD и Super Video CD (VCD и SVCD также поддерживают переменную битовую скорость и MPEG Multichannel, добавленные MPEG 2). MPEG 1 Audio Layer II является стандартным аудиоформатом, используемым в стандарте MHP для приставок. MPEG 1 Audio Layer II является аудиоформатом, используемым в видеокамерах HDV. MP2-файлы совместимы с некоторыми портативными аудиоплеерами.

Названия и расширения

Термин MP2 и расширение имени файла mp2 обычно относятся к данным MPEG 1 Audio Layer II, но также могут относиться к MPEG 2 Audio Layer II — расширению, в основном обратно совместимому, которое добавляет поддержку многоканального звука, кодирования с переменным битрейтом и дополнительных частот дискретизации, определенных в ISO/IEC 13818-3. Аббревиатура MP2 также иногда ошибочно используется для обозначения видео MPEG 2 или аудио MPEG 2 AAC.