Введение

Цифровой аудио формат, url = MP3 (формально MPEG 1 Audio Layer III или MPEG 2 Audio Layer III) с поддержкой других специалистов в области цифровых технологий в других странах. Изначально определенный как третий аудиоформат стандарта MPEG 1, он был сохранен и дополнительно расширен — с определением дополнительных битрейтов и поддержкой большего количества аудиоканалов — в качестве третьего аудиоформата последующего стандарта MPEG 2. Третья версия, известная как MPEG 2.5, — расширенная для лучшей поддержки более низких битрейтов — обычно реализуется, но не является признанным стандартом. MP3 (или mp3) как формат файла обычно обозначает файлы, содержащие элементарный поток MPEG 1 Audio или MPEG 2 Audio закодированных данных, без дополнительных сложностей стандарта MP3. Что касается аудиокомпрессии (аспекта стандарта, наиболее заметного для конечных пользователей и за который он наиболее известен), MP3 использует компрессию данных с потерями для кодирования данных с использованием неточных приближений и частичного отбрасывания данных. Это позволяет значительно уменьшить размер файлов по сравнению с несжатым аудио. Сочетание небольшого размера и приемлемого качества привело к буму распространения музыки в Интернете в середине и конце 1990-х годов, при этом MP3 служил ключевой технологией в то время, когда пропускная способность и объем памяти все еще были ограничены. Формат MP3 вскоре стал ассоциироваться с противоречиями, связанными с нарушением авторских прав, музыкальным пиратством и файлообменными сервисами MP3.com и Napster, среди прочих. С появлением портативных медиаплееров, в том числе смартфонов, поддержка MP3 остается практически универсальной. Компрессия MP3 работает путем уменьшения (или приближения) точности определенных компонентов звука, которые, согласно психоакустическому анализу, находятся за пределами слуховых возможностей большинства людей. Этот метод обычно называют перцептивным кодированием или психоакустическим моделированием. В начале 2000-х годов проигрыватели компакт-дисков все чаще стали поддерживать воспроизведение MP3-файлов на CD с данными. Moving Picture Experts Group (MPEG) разработала MP3 как часть стандартов MPEG 1 и, позднее, MPEG 2. MPEG 1 Audio (MPEG 1 Part 3), включавший MPEG 1 Audio Layer I, II и III, был одобрен в качестве проекта комитета для стандарта ISO/IEC в 1991 году, корни которого восходят к работам Фумитады Итакуры (Университет Нагои) и Сюдзо Саито (Nippon Telegraph and Telephone) в 1966 году. В 1978 году Бишну С. Атал и Манфред Р. Шредер из Bell Labs предложили LPC-кодек речи, называемый адаптивным предсказательным кодированием, который использовал алгоритм психоакустического кодирования, использующий свойства маскировки человеческого уха. Дальнейшая оптимизация Шредером и Аталом совместно с Дж. Л. Холлом была позже представлена в статье 1979 года. не оказала немедленного влияния на основное направление развития психоакустических кодеков. Дискретное косинусное преобразование (DCT), тип преобразования для компрессии с потерями, предложенный Насиром Ахмедом в 1972 году, было разработано Ахмедом совместно с Т. Натараджаном и К. Р. Рао в 1973 году; они опубликовали свои результаты в 1974 году. Это привело к разработке модифицированного дискретного косинусного преобразования (MDCT), предложенного J. P. Princen, A. W. Johnson и A. B. Bradley в 1987 году, после более ранних работ Принсена и Брэдли в 1986 году. MDCT впоследствии стал ключевой частью алгоритма MP3. Эрнст Терхардт и другие исследователи разработали алгоритм, описывающий слуховую маскировку с высокой точностью в 1982 году. В декабре 1988 года MPEG объявил о необходимости создания стандарта аудиокодирования. В июне 1989 года было представлено 14 алгоритмов аудиокодирования. Из-за определенных сходств между этими предложениями по кодированию они были объединены в четыре группы разработки. Первая группа — ASPEC, от Fraunhofer Gesellschaft, AT&T, France Telecom, Deutsche и Thomson Brandt. Вторая группа — MUSICAM, разработанная компаниями Matsushita, CCETT, ITT и Philips. Третья группа — ATAC (ATRAC Coding), от Fujitsu, JVC, NEC и Sony. И четвертая группа — SB ADPCM, от NTT и BTRL. после работы над MUSICAM совместно с Matsushita и Philips с 1989 года. с Radio Canada и CRC Canada во время выставки NAB (Лас-Вегас) в 1991 году. Реализация аудиочасти этой системы вещания основывалась на двухчиповом кодировщике (один для преобразования подполос, другой для психоакустической модели, разработанной командой Г. Штолла (IRT Германия), позже известной как психоакустическая модель I) и декодировщике в реальном времени с использованием одного чипа Motorola 56001 DSP, работающего на программном обеспечении для целочисленной арифметики, разработанном командой Y. F. Dehery (CCETT, Франция). Простота соответствующего декодера в сочетании с высоким качеством звука этого кодека, впервые использовавшего частоту дискретизации 48 кГц и входной формат 20 бит/образец (наивысший доступный стандарт дискретизации в 1991 году, совместимый с профессиональным цифровым студийным стандартом AES/EBU), стали основными причинами для последующего принятия характеристик MUSICAM в качестве базовых функций для продвинутого кодека сжатия цифровой музыки. Во время разработки программного обеспечения кодирования MUSICAM команда Штолла и Дехери тщательно использовала набор высококачественных аудиоматериалов для оценки, отобранных группой специалистов по аудио из Европейского вещательного союза, которые впоследствии использовались в качестве эталона для оценки кодеков сжатия музыки. Было обнаружено, что метод субполосного кодирования эффективен не только для перцептивного кодирования высококачественных звуковых материалов, но и особенно для кодирования критических ударных звуковых материалов (барабаны, треугольник и т. д.) благодаря специфическому временному эффекту маскировки фильтр-банки подполос MUSICAM (это преимущество является специфической особенностью методов кодирования с коротким преобразованием). В качестве аспиранта Университета Эрлангена-Нюрнберга Карлхайнц Бранденбург начал работать над цифровой компрессией музыки в начале 1980-х годов, сосредоточившись на том, как люди воспринимают музыку. Он завершил свою докторскую диссертацию в 1989 году. В 1990 году Бранденбург стал ассистентом профессора в Эрлангене-Нюрнберге. Там он продолжил работу над компрессией музыки с учеными из Института Генриха Герца Общества Фраунгофера. В 1993 году он присоединился к штату Fraunhofer HHI. был выбран из-за своей простоты и устойчивости к ошибкам, а также из-за высокой вычислительной эффективности. Эта песня была выбрана из-за своей почти монофонической природы и широкого спектрального содержания, что облегчает выявление недостатков формата сжатия при воспроизведении. Этот трек обладает интересным свойством: два канала почти, но не полностью, идентичны, что приводит к ситуации, когда депрессия уровня бинауральной маскировки вызывает пространственное размаскирование шумовых артефактов, если кодировщик не распознает ситуацию и не применяет исправления, аналогичные тем, которые подробно описаны в психоакустической модели MPEG 2 AAC. Некоторые более критические аудиофрагменты (глокеншпиль, треугольник, аккордеон и т. д.) были взяты с эталонного компакт-диска EBU V3/SQAM и использовались профессиональными звукорежиссерами для оценки субъективного качества форматов MPEG Audio.

Публичное размещение

Реализация эталонного программного обеспечения для моделирования, написанная на языке C и впоследствии известная как ISO 11172-5, была разработана (в 1991–1996 годах) членами комитета ISO MPEG Audio для создания MPEG Audio файлов, соответствующих битовому формату (Layer 1, Layer 2, Layer 3). В марте 1994 года она была одобрена в качестве проекта технического отчета ISO/IEC и опубликована в виде документа CD 11172-5 в апреле 1994 года. Она предназначалась для использования в цифровом вещании (радио DAB, телевидение DVB) в потребительских приемниках и приставках. 7 июля 1994 года Общество Фраунгофера выпустило первый программный MP3-кодировщик под названием l3enc.

Другие версии

Дальнейшая работа над аудио MPEG с использованием несжатых аудиофайлов привела к тому, что этот архив начал распространять по сети Интернет с низкой скоростью соединения сжатые аудиофайлы MPEG в формате MP2 (Layer II), а позднее – файлы MP3, когда стандарт был полностью разработан. Популярность MP3 начала стремительно расти с появлением аудиоплеера Winamp от Nullsoft, выпущенного в 1997 году, который в 2023 году по-прежнему имел сообщество из 80 миллионов активных пользователей. В 1998 году был выпущен первый портативный цифровой аудиоплеер MPMan, разработанный компанией SaeHan Information Systems, штаб-квартира которой находится в Сеуле, Южная Корея, а затем, также в 1998 году, был представлен Rio PMP300, несмотря на попытки RIAA юридически препятствовать его распространению. MP3 также позволяет использовать более короткие блоки в грануле, вплоть до 192 отсчетов; эта функция применяется при обнаружении переходных процессов. Это ограничивает временное распространение шума квантования, сопровождающего переходный процесс (см. психоакустику). Частотное разрешение ограничено небольшим размером длинного блока, что снижает эффективность кодирования. Декодирование, напротив, четко определено в стандарте. Большинство декодеров "соответствуют битовому потоку", то есть декомпрессированный вывод, который они генерируют из данного MP3-файла, будет идентичен, с учетом определенной погрешности округления, выводу, математически определенному в высоком стандарте ISO/IEC (ISO/IEC 11172-3). Поэтому сравнение декодеров обычно основывается на их вычислительной эффективности (то есть на объеме используемой памяти или времени процессора в процессе декодирования). Со временем эта проблема стала менее актуальной, поскольку тактовая частота процессоров перешла от МГц к ГГц. Общая задержка кодирования/декодирования не определена, что означает отсутствие официальных механизмов для воспроизведения без пауз. Однако некоторые кодировщики, такие как LAME, могут добавлять дополнительные метаданные, позволяющие поддерживающим это функциям проигрывателям обеспечивать бесшовное воспроизведение.