Введение

Компьютерное распознавание музыкальной нотации

Оптическое распознавание музыки (ОРМ) — это область исследований, посвященная разработке методов автоматического чтения музыкальной нотации в документах. Цель ОРМ — научить компьютер читать и интерпретировать ноты, а также создавать машиночитаемую версию нотного текста. После оцифровки музыку можно сохранить в распространенных форматах файлов, таких как MIDI (для воспроизведения) и MusicXML (для верстки). Ранее это ошибочно называли «оптическим распознаванием музыкальных символов». В связи со значительными различиями, использование этого термина не рекомендуется.

История

Оптическое распознавание печатных нот началось в конце 1960-х годов в Массачусетском технологическом институте, когда первые сканеры изображений стали доступными для исследовательских институтов. Из-за ограниченной памяти ранних компьютеров первые попытки ограничивались лишь несколькими тактами музыки. В 1984 году японская исследовательская группа из Университета Васеда разработала специализированного робота, названного WABOT (WAseda roBOT), который мог читать ноты с листа перед собой и аккомпанировать певцу на электрическом органе. Ранние исследования в области ОМР проводились Итиро Фудзинагой, Николасом Картером, Киа Нг, Дэвидом Бэйнбриджем и Тимом Беллом. Эти исследователи разработали многие из техник, которые используются и сегодня. Первое коммерческое приложение OMR, MIDISCAN (ныне SmartScore), было выпущено в 1991 году компанией Musitek. Появление смартфонов с хорошими камерами и достаточной вычислительной мощностью открыло путь к мобильным решениям, в которых пользователь делает снимок смартфоном, а устройство непосредственно обрабатывает изображение.

Связь с другими областями

Оптическое распознавание музыки связано с другими областями исследований, включая компьютерное зрение, анализ документов и поиск музыкальной информации. Оно актуально для практикующих музыкантов и композиторов, которые могут использовать системы OMR для ввода нот в компьютер, что упрощает процесс сочинения, транскрибирования и редактирования музыки. В библиотеке система OMR может сделать нотные издания доступными для поиска, а для музыковедов она позволит проводить масштабные количественные музыковедческие исследования.

OMR против OCR

Оптическое распознавание музыки часто сравнивают с оптическим распознаванием символов. Дональд Бёрд также собрал ряд интересных и сложных примеров музыкальной нотации, демонстрирующих её крайнюю сложность.

Выходы систем OMR

Типичные области применения систем OMR включают создание звуковой версии нотного текста (именуемой воспроизводимостью). Распространенный способ создания такой версии – генерация MIDI-файла, который затем может быть синтезирован в аудиофайл. Однако MIDI-файлы не способны хранить информацию о нотной записи (расположении нот) или энагармоническом написании. Если нотные тексты распознаются с целью удобства чтения человеком (именуемой перепечатываемостью), необходимо восстановить структурированное кодирование, включающее точную информацию о верстке и нотной записи. Для хранения этой информации подходят форматы MEI и MusicXML. Помимо этих двух областей применения, может быть интересно также извлечение метаданных из изображения или организация поиска по нему. В отличие от первых двух областей применения, для выполнения этих задач может быть достаточно менее глубокого понимания нотного текста.

Общие рамки (2001)

В 2001 году Дэвид Бэйнбридж и Тим Белл опубликовали свою работу, посвященную проблемам ОМР, в которой они проанализировали предыдущие исследования и выделили общую структуру для ОМР. Они классифицировали опубликованные исследования и уточнили конвейер OMR, разделив его на четыре этапа: предварительная обработка, распознавание музыкальных символов, реконструкция музыкальной нотации и построение конечного представления. Эта структура стала фактическим стандартом для ОМР и до сих пор используется (хотя иногда и с несколько отличающейся терминологией). Для каждого этапа они приводят обзор используемых методов решения соответствующей задачи. Эта публикация является самой цитируемой работой в области исследований ОМР по состоянию на 2019 год.

Глубокое обучение (с 2016 года)

С появлением глубокого обучения многие задачи компьютерного зрения сместились от императивного программирования с использованием разработанных вручную эвристик и конструирования признаков к машинному обучению. В области оптического распознавания музыки успешные попытки решения задач обработки нотного стана, обнаружения музыкальных объектов и реконструкции музыкальной нотации были предприняты с использованием глубокого обучения. Были предложены даже совершенно новые подходы, включая решение OMR сквозным способом с использованием моделей "последовательность-в-последовательность", которые принимают на вход изображение нотного листа и напрямую выдают распознанную музыку в упрощенном формате.

Опрос по увольнению сотрудников

Для систем, разработанных до 2016 года, обнаружение и удаление нотных станков представляло собой значительное препятствие. Был организован научный конкурс для улучшения существующих методов и развития этой области. Благодаря отличным результатам и современным технологиям, которые сделали этап удаления нотных станков ненужным, этот конкурс был прекращен. Однако свободно доступный набор данных CVC MUSCIMA, разработанный для этого соревнования, по-прежнему имеет большое значение для исследований OMR, поскольку он содержит 1000 высококачественных изображений рукописных музыкальных партитур, транскрибированных 50 разными музыкантами. Он был дополнительно расширен до набора данных MUSCIMA++, который содержит детальные аннотации для 140 из 1000 страниц.

SIMSSA

Проект "Единый интерфейс для поиска и анализа музыкальных партитур" (SIMSSA) — вероятно, самый масштабный проект, целью которого является обучение компьютеров распознаванию музыкальных нотных записей и обеспечению доступа к ним. Несколько подпроектов уже успешно завершены, в том числе Liber Usualis и Cantus Ultimus.

ТРОМПА

Towards Richer Online Music Public domain Archives (TROMPA) — это международный исследовательский проект, финансируемый Европейским Союзом, изучающий способы повышения доступности цифровых музыкальных ресурсов, находящихся в общественном достоянии.

Набор данных

Разработка систем OMR выигрывает от наличия тестовых наборов данных достаточного размера и разнообразия, чтобы гарантировать работу разрабатываемой системы в различных условиях. Однако, из-за юридических ограничений и потенциальных нарушений авторских прав, сложно собрать и опубликовать такой набор данных. Наиболее известные наборы данных для OMR перечислены и проанализированы проектом OMR Datasets и включают в себя CVC MUSCIMA, MUSCIMA++, DeepScores, PrIMuS, HOMUS и SEILS, а также Universal Music Symbol Collection. Французская компания Newzik пошла другим путем при разработке своей технологии OMR Maestria, используя случайную генерацию нот. Использование синтетических данных позволило избежать проблем с авторским правом и обучить алгоритмы искусственного интеллекта музыкальным примерам, которые редко встречаются в реальном репертуаре, что, по утверждениям компании, привело к более точному распознаванию музыки.