Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Музыкалық ноталарды компьютерлік тану
Computer recognition of music notation
Оптикалық музыканы тану (ОМР) – құжаттардағы музыкалық нотацияны есептеу арқылы оқу қалай жүзеге асырылатынын зерттейтін ғылыми сала. ОМР-дің мақсаты – компьютерге ноталарды оқып, түсіндіруді үйрету және жазылған музыканың машинамен оқылатын нұсқасын жасау. Музыка цифрлық түрде сақталғаннан кейін, оны MIDI (ойнату үшін) және MusicXML (беттік жобалау үшін) сияқты кең таралған файл форматтарында сақтауға болады. Бұрын бұл технология қате түрде "музыкалық оптикалық таңбаларды тану" деп те аталып келген. Маңызды айырмашылықтар болғандықтан, бұл термин енді қолданылмайды.
Optical music recognition (OMR) is a field of research that investigates how to computationally read musical notation in documents. The goal of OMR is to teach the computer to read and interpret sheet music and produce a machine readable version of the written music score. Once captured digitally, the music can be saved in commonly used file formats, e. g. MIDI (for playback) and MusicXML (for page layout). In the past it has, misleadingly, also been called "music optical character recognition". Due to significant differences, this term should no longer be used.
Тарих
Баспа музыканың оптикалық тануы 1960 жылдардың соңында Массачусетс технология институтында басталды, сол кезде алғашқы сурет сканерлері ғылыми-зерттеу институттары үшін қолжетімді болды. Ерте компьютерлердің жады шектеулі болғандықтан, алғашқы тырастар тек бірнеше тактымен ғана шектелді. 1984 жылы Жапонияның Васеда университетінің зерттеу тобы арнайы робот жасады, ол WABOT (WAseda roBOT) деп аталды, ол алдындағы нота тізімін оқи алатын және электрлік органмен әншіге сүйемелдейтін болды. OMR саласындағы алғашқы зерттеулерді Ичиро Фуджинага, Николас Картер, Киа Нг, Дэвид Бэйнбридж және Тим Белл жүргізді. Осы зерттеушілер қазірге дейін қолданылып келе жатқан көптеген техникаларды әзірледі. Бірінші коммерциялық OMR қолданбасы, MIDISCAN (қазір SmartScore), 1991 жылы Musitek Corporation ұсынды. Жақсы камералары мен жеткілікті есептеу қуаты бар смартфондардың пайда болуы, пайдаланушы смартфонмен сурет түсіріп, құрылғы тікелей суретті өңдейтін мобильді шешімдерге жол ашты.
Optical music recognition of printed sheet music started in the late 1960s at the Massachusetts Institute of Technology when the first image scanners became affordable for research institutes. Due to the limited memory of early computers, the first attempts were limited to only a few measures of music. In 1984, a Japanese research group from Waseda University developed a specialized robot, called WABOT (WAseda roBOT), which was capable of reading the music sheet in front of it and accompanying a singer on an electric organ. Early research in OMR was conducted by Ichiro Fujinaga, Nicholas Carter, Kia Ng, David Bainbridge, and Tim Bell. These researchers developed many of the techniques that are still being used today. The first commercial OMR application, MIDISCAN (now SmartScore), was released in 1991 by Musitek Corporation. The availability of smartphones with good cameras and sufficient computational power, paved the way to mobile solutions where the user takes a picture with the smartphone and the device directly processes the image.
Басқа салалармен байланысы
Оптикалық музыканы тану компьютерлік көру, құжат талдауы және музыкалық ақпаратты іздеу сияқты басқа да зерттеу салаларымен байланысты. Бұл OMR жүйелерін музыканы компьютерге енгізу құралы ретінде қолдана алатын музыканттар мен композиторлар үшін маңызды, осы арқылы музыка жазу, көшіру және өңдеу процесін жеңілдетеді. Кітапханада OMR жүйесі ноталарды іздеуге мүмкіндік береді, ал музыкатанушылар үшін бұл үлкен көлемде сандық музыкатану зерттеулерін жүргізуге жағдай жасайды.
Optical music recognition relates to other fields of research, including computer vision, document analysis, and music information retrieval. It is relevant for practicing musicians and composers that could use OMR systems as a means to enter music into the computer and thus ease the process of composing, transcribing, and editing music. In a library, an OMR system could make music scores searchable and for musicologists it would allow to conduct quantitative musicological studies at scale.
OMR және OCR
Оптикалық музыканы тану оптикалық таңбаларды танумен жиі салыстырылады. Дональд Бёрд музыкалық нотацияның жоғары күрделілігін көрсететін, сонымен қатар ерекше мысалдарды да жинады.
Optical music recognition has frequently been compared to Optical character recognition. Donald Byrd also collected a number of interesting examples as well as extreme examples of music notation that demonstrate the sheer complexity of music notation.
OMR жүйелерінің шығыстары
OMR жүйелерінің кең таралған қолданыс аймақтарының бірі – музыкалық ноталардың естілетін нұсқасын жасау (қайта ойнату мүмкіндігі). Мұндай нұсқаны жасаудың ең көп қолданылатын тәсілі – аудио файлға түрлендірілетін MIDI файлын құру. Алайда, MIDI файлдары ноталардың жазылу форматы (қалай орналасқандығы) немесе энармониялық жазуды сақтай алмайды. Музыкалық ноталар адамдар оқуы үшін танылса (қайта басып шығару мүмкіндігі), құрылымдалған кодты қалпына келтіру қажет, ол ноталардың орналасуы және безендірілуі туралы нақты ақпаратты қамтиды. Осы ақпаратты сақтау үшін MEI және MusicXML форматтары қолайлы. Бұл екі қолданыстан өзге, бейнеден метадеректерді алу немесе іздеу функциясын қосу да пайдалы болуы мүмкін. Бұл міндеттерді орындау үшін алғашқы екі қолданысқа қарағанда музыкалық ноталарды түсінудің төменгі деңгейі жеткілікті.
Typical applications for OMR systems include the creation of an audible version of the music score (referred to as replayability). A common way to create such a version is by generating a MIDI file, which can be synthesised into an audio file. MIDI files, though, are not capable of storing engraving information (how the notes were laid out) or enharmonic spelling. If the music scores are recognized with the goal of human readability (referred to as reprintability), the structured encoding has to be recovered, which includes precise information on the layout and engraving. Suitable formats to store this information include MEI and MusicXML. Apart from those two applications, it might also be interesting to just extract metadata from the image or enable searching. In contrast to the first two applications, a lower level of comprehension of the music score might be sufficient to perform these tasks.
Жалпы ережелер (2001)
2001 жылы Дэвид Бэйнбридж және Тим Белл OMR-дің қиындықтарына арналған жұмысын жариялады, онда олар бұрынғы зерттеулерді шолып, OMR үшін жалпы аясты анықтады. Олар жарияланған зерттеулерді жіктеді және OMR процесін төрт кезеңге бөлді: алдын ала өңдеу, музыкалық символдарды тану, музыкалық нотацияны қалпына келтіру және соңғы бейнелеуді құру. Бұл ая OMR үшін де-факто стандартқа айналды және бүгінге дейін қолданылып келеді (кейде сәл өзгеше терминологиямен). Олар әр кезең үшін сол мәселені шешуге қолданылатын техникаларға шолу жасайды. 2019 жылға дейін бұл жарияланым OMR зерттеулері бойынша ең көп сілтемеленген мақала болып табылады.
In 2001, David Bainbridge and Tim Bell published their work on the challenges of OMR, where they reviewed previous research and extracted a general framework for OMR. They categorized the published research and refined the OMR pipeline into the four stages: Preprocessing, Music symbols recognition, Musical notation reconstruction and Final representation construction. This framework became the de facto standard for OMR and is still being used today (although sometimes with slightly different terminology). For each block, they give an overview of techniques that are used to tackle that problem. This publication is the most cited paper on OMR research as of 2019.
Терең оқыту (2016 жылдан бастап)
Терең оқыту пайда болғаннан бері, көптеген компьютерлік көру мәселелері қолмен жасалған ережелермен императивті бағдарламалаудан және ерекшеліктерді жасаудан машиналық оқытуға қарай жылды. Оптикалық музыканы тануда, нота тақтасын өңдеу кезеңі, музыкалық нысандарды анықтау кезеңі, сондай-ақ музыкалық жазуды қайта құру кезеңі терең оқыту арқылы шешілді. Тіпті толығымен жаңа тәсілдер ұсынылды, оның ішінде OMR-ді бастапқыдан соңына дейін реттілік-ретілік модельдермен шешу, бұл модельдер музыкалық ноталардың суретін алып, танылған музыканы қарапайым форматта тікелей шығарады.
With the advent of deep learning, many computer vision problems have shifted from imperative programming with hand crafted heuristics and feature engineering towards machine learning. In optical music recognition, the staff processing stage, the music object detection stage, as well as the music notation reconstruction stage have seen successful attempts to solve them with deep learning. Even completely new approaches have been proposed, including solving OMR in an end to end fashion with sequence to sequence models, that take an image of music scores and directly produce the recognized music in a simplified format.
Қызметкерлерді жұмыстан шығару туралы дау
2016 жылға дейін жасалған жүйелер үшін персоналды анықтау және жою үлкен қиындық тудырды. Осы саланың дамуын жеделдету және жаңа жетістіктерге қол жеткізу үшін ғылыми байқау ұйымдастырылды. Қол жеткізілген жоғары нәтижелер мен қазіргі заманғы технологиялар персоналды жою қадамын қажетсіз еткендіктен, бұл байқау тоқтатылды. Дегенмен, осы байқау үшін әзірленген CVC MUSCIMA деректер жинағы OMR зерттеулері үшін әлі де өте маңызды, себебі ол 50 түрлі музыкантпен жазылған 1000 жоғары сапалы қолжазба музыкалық ноталардың суреттерін қамтиды. Бұл деректер жинағы MUSCIMA++ деректер жинағына толықтырылды, ол 1000 беттің 140-ы үшін егжей-тегжейлі түсіндірмелерді қамтиды.
For systems that were developed before 2016, staff detection and removal posed a significant obstacle. A scientific competition was organized to improve the state of the art and advance the field. Due to excellent results and modern techniques that made the staff removal stage obsolete, this competition was discontinued. However, the freely available CVC MUSCIMA dataset that was developed for this challenge is still highly relevant for OMR research as it contains 1000 high quality images of handwritten music scores, transcribed by 50 different musicians. It has been further extended into the MUSCIMA++ dataset, which contains detailed annotations for 140 out of 1000 pages.
SIMSSA
Музыкалық ноталарды іздеу және талдаудың бірыңғай интерфейсі (SIMSSA) жобасы, компьютерлерге музыкалық ноталарды тануды және оларды қолжетімді етуді үйретуге бағытталған, бәлкім, ең ірі жоба болар. Liber Usualis және Cantus Ultimus сияқты бірнеше қосалқы жобалар қазірдің өзінде сәтті аяқталды.
The Single Interface for Music Score Searching and Analysis project (SIMSSA) is probably the largest project that attempts to teach computers to recognize musical scores and make them accessible. Several sub projects have already been successfully completed, including the Liber Usualis and Cantus Ultimus.
ТРОМПА
Richer Online Music Public domain Archives (TROMPA) – Еуропалық Одақ демеушілігімен жүзеге асырылып жатқан, қоғамдық домендегі цифрлық музыка ресурстарын қолжетімді ету жолдарын зерттейтін халықаралық ғылыми жоба.
Towards Richer Online Music Public domain Archives (TROMPA) is an international research project, sponsored by the European Union that investigates how to make public domain digital music resources more accessible.
Деректер жиынтығы
OMR жүйелерін дамыту үшін жеткілікті көлемде және әртүрлілікке ие сынақ деректер жинағы қажет, бұл жүйенің әртүрлі жағдайларда жұмыс істейтініне кепілдік береді. Дегенмен, заңдық себептер мен авторлық құқықты бұзу мүмкіндігіне байланысты мұндай деректерді жинақтау және жариялау қиынға соғады. OMR үшін ең маңызды деректер жинақтары OMR деректер жинақтары жобасында тізімделген және қысқаша сипатталған, оларға CVC MUSCIMA, MUSCIMA++, DeepScores, PrIMuS, HOMUS, SEILS деректер жинақтары және Universal Music Symbol Collection кіреді. Француз компаниясы Newzik өзінің Maestria OMR технологиясын дамытуда басқа тәсіл қолданды – кездейсоқ ноталар жасау арқылы. Синтетикалық деректерді пайдалану авторлық құқық мәселелерін шешуге және жасанды интеллект алгоритмдерін нақты репертуарда сирек кездесетін музыкалық жағдайларға оқытуға көмектесті, нәтижесінде (компания мәлімдемесі бойынша) музыканы дәлірек тануға қол жеткізілді.
The development of OMR systems benefits from test datasets of sufficient size and diversity to ensure the system being developed works under various conditions. However, due to legal reasons and potential copyright violations, it is challenging to compile and publish such a dataset. The most notable datasets for OMR are referenced and summarized by the OMR Datasets project and include the CVC MUSCIMA, MUSCIMA++, DeepScores, PrIMuS, HOMUS, and SEILS dataset, as well as the Universal Music Symbol Collection. French company Newzik took a different approach in the development of its OMR technology Maestria, by using random score generation. Using synthetic data helped with avoiding copyright issues and training the artificial intelligence algorithms on musical cases that rarely occur in actual repertoire, ultimately resulting in (according to claims by the company) more accurate music recognition.