Кіріспе

Музыкалық ноталарды компьютерлік тану

Оптикалық музыканы тану (ОМР) – құжаттардағы музыкалық нотацияны есептеу арқылы оқу қалай жүзеге асырылатынын зерттейтін ғылыми сала. ОМР-дің мақсаты – компьютерге ноталарды оқып, түсіндіруді үйрету және жазылған музыканың машинамен оқылатын нұсқасын жасау. Музыка цифрлық түрде сақталғаннан кейін, оны MIDI (ойнату үшін) және MusicXML (беттік жобалау үшін) сияқты кең таралған файл форматтарында сақтауға болады. Бұрын бұл технология қате түрде "музыкалық оптикалық таңбаларды тану" деп те аталып келген. Маңызды айырмашылықтар болғандықтан, бұл термин енді қолданылмайды.

Тарих

Баспа музыканың оптикалық тануы 1960 жылдардың соңында Массачусетс технология институтында басталды, сол кезде алғашқы сурет сканерлері ғылыми-зерттеу институттары үшін қолжетімді болды. Ерте компьютерлердің жады шектеулі болғандықтан, алғашқы тырастар тек бірнеше тактымен ғана шектелді. 1984 жылы Жапонияның Васеда университетінің зерттеу тобы арнайы робот жасады, ол WABOT (WAseda roBOT) деп аталды, ол алдындағы нота тізімін оқи алатын және электрлік органмен әншіге сүйемелдейтін болды. OMR саласындағы алғашқы зерттеулерді Ичиро Фуджинага, Николас Картер, Киа Нг, Дэвид Бэйнбридж және Тим Белл жүргізді. Осы зерттеушілер қазірге дейін қолданылып келе жатқан көптеген техникаларды әзірледі. Бірінші коммерциялық OMR қолданбасы, MIDISCAN (қазір SmartScore), 1991 жылы Musitek Corporation ұсынды. Жақсы камералары мен жеткілікті есептеу қуаты бар смартфондардың пайда болуы, пайдаланушы смартфонмен сурет түсіріп, құрылғы тікелей суретті өңдейтін мобильді шешімдерге жол ашты.

Басқа салалармен байланысы

Оптикалық музыканы тану компьютерлік көру, құжат талдауы және музыкалық ақпаратты іздеу сияқты басқа да зерттеу салаларымен байланысты. Бұл OMR жүйелерін музыканы компьютерге енгізу құралы ретінде қолдана алатын музыканттар мен композиторлар үшін маңызды, осы арқылы музыка жазу, көшіру және өңдеу процесін жеңілдетеді. Кітапханада OMR жүйесі ноталарды іздеуге мүмкіндік береді, ал музыкатанушылар үшін бұл үлкен көлемде сандық музыкатану зерттеулерін жүргізуге жағдай жасайды.

OMR және OCR

Оптикалық музыканы тану оптикалық таңбаларды танумен жиі салыстырылады. Дональд Бёрд музыкалық нотацияның жоғары күрделілігін көрсететін, сонымен қатар ерекше мысалдарды да жинады.

OMR жүйелерінің шығыстары

OMR жүйелерінің кең таралған қолданыс аймақтарының бірі – музыкалық ноталардың естілетін нұсқасын жасау (қайта ойнату мүмкіндігі). Мұндай нұсқаны жасаудың ең көп қолданылатын тәсілі – аудио файлға түрлендірілетін MIDI файлын құру. Алайда, MIDI файлдары ноталардың жазылу форматы (қалай орналасқандығы) немесе энармониялық жазуды сақтай алмайды. Музыкалық ноталар адамдар оқуы үшін танылса (қайта басып шығару мүмкіндігі), құрылымдалған кодты қалпына келтіру қажет, ол ноталардың орналасуы және безендірілуі туралы нақты ақпаратты қамтиды. Осы ақпаратты сақтау үшін MEI және MusicXML форматтары қолайлы. Бұл екі қолданыстан өзге, бейнеден метадеректерді алу немесе іздеу функциясын қосу да пайдалы болуы мүмкін. Бұл міндеттерді орындау үшін алғашқы екі қолданысқа қарағанда музыкалық ноталарды түсінудің төменгі деңгейі жеткілікті.

Жалпы ережелер (2001)

2001 жылы Дэвид Бэйнбридж және Тим Белл OMR-дің қиындықтарына арналған жұмысын жариялады, онда олар бұрынғы зерттеулерді шолып, OMR үшін жалпы аясты анықтады. Олар жарияланған зерттеулерді жіктеді және OMR процесін төрт кезеңге бөлді: алдын ала өңдеу, музыкалық символдарды тану, музыкалық нотацияны қалпына келтіру және соңғы бейнелеуді құру. Бұл ая OMR үшін де-факто стандартқа айналды және бүгінге дейін қолданылып келеді (кейде сәл өзгеше терминологиямен). Олар әр кезең үшін сол мәселені шешуге қолданылатын техникаларға шолу жасайды. 2019 жылға дейін бұл жарияланым OMR зерттеулері бойынша ең көп сілтемеленген мақала болып табылады.

Терең оқыту (2016 жылдан бастап)

Терең оқыту пайда болғаннан бері, көптеген компьютерлік көру мәселелері қолмен жасалған ережелермен императивті бағдарламалаудан және ерекшеліктерді жасаудан машиналық оқытуға қарай жылды. Оптикалық музыканы тануда, нота тақтасын өңдеу кезеңі, музыкалық нысандарды анықтау кезеңі, сондай-ақ музыкалық жазуды қайта құру кезеңі терең оқыту арқылы шешілді. Тіпті толығымен жаңа тәсілдер ұсынылды, оның ішінде OMR-ді бастапқыдан соңына дейін реттілік-ретілік модельдермен шешу, бұл модельдер музыкалық ноталардың суретін алып, танылған музыканы қарапайым форматта тікелей шығарады.

Қызметкерлерді жұмыстан шығару туралы дау

2016 жылға дейін жасалған жүйелер үшін персоналды анықтау және жою үлкен қиындық тудырды. Осы саланың дамуын жеделдету және жаңа жетістіктерге қол жеткізу үшін ғылыми байқау ұйымдастырылды. Қол жеткізілген жоғары нәтижелер мен қазіргі заманғы технологиялар персоналды жою қадамын қажетсіз еткендіктен, бұл байқау тоқтатылды. Дегенмен, осы байқау үшін әзірленген CVC MUSCIMA деректер жинағы OMR зерттеулері үшін әлі де өте маңызды, себебі ол 50 түрлі музыкантпен жазылған 1000 жоғары сапалы қолжазба музыкалық ноталардың суреттерін қамтиды. Бұл деректер жинағы MUSCIMA++ деректер жинағына толықтырылды, ол 1000 беттің 140-ы үшін егжей-тегжейлі түсіндірмелерді қамтиды.

SIMSSA

Музыкалық ноталарды іздеу және талдаудың бірыңғай интерфейсі (SIMSSA) жобасы, компьютерлерге музыкалық ноталарды тануды және оларды қолжетімді етуді үйретуге бағытталған, бәлкім, ең ірі жоба болар. Liber Usualis және Cantus Ultimus сияқты бірнеше қосалқы жобалар қазірдің өзінде сәтті аяқталды.

ТРОМПА

Richer Online Music Public domain Archives (TROMPA) – Еуропалық Одақ демеушілігімен жүзеге асырылып жатқан, қоғамдық домендегі цифрлық музыка ресурстарын қолжетімді ету жолдарын зерттейтін халықаралық ғылыми жоба.

Деректер жиынтығы

OMR жүйелерін дамыту үшін жеткілікті көлемде және әртүрлілікке ие сынақ деректер жинағы қажет, бұл жүйенің әртүрлі жағдайларда жұмыс істейтініне кепілдік береді. Дегенмен, заңдық себептер мен авторлық құқықты бұзу мүмкіндігіне байланысты мұндай деректерді жинақтау және жариялау қиынға соғады. OMR үшін ең маңызды деректер жинақтары OMR деректер жинақтары жобасында тізімделген және қысқаша сипатталған, оларға CVC MUSCIMA, MUSCIMA++, DeepScores, PrIMuS, HOMUS, SEILS деректер жинақтары және Universal Music Symbol Collection кіреді. Француз компаниясы Newzik өзінің Maestria OMR технологиясын дамытуда басқа тәсіл қолданды – кездейсоқ ноталар жасау арқылы. Синтетикалық деректерді пайдалану авторлық құқық мәселелерін шешуге және жасанды интеллект алгоритмдерін нақты репертуарда сирек кездесетін музыкалық жағдайларға оқытуға көмектесті, нәтижесінде (компания мәлімдемесі бойынша) музыканы дәлірек тануға қол жеткізілді.