Original title:
Automatizovaný přepis a spartace historických hlasových knih
Translated title:
Automated transcription and full score reconstruction of historical vocal books
Authors:
Ivakhniuk, Roman ; Turčínek, Jan (referee) ; Faltýnek, Jan (advisor) Document type: Bachelor's theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta strojního inženýrství Abstract:
[eng][cze]
Tato bakalářská práce představuje softwarové řešení pro přepis historické hudby ze 17. století vytištěné Pierrem Ballardem. V současné době nelze vzhledem k vysoké časové náročnosti manuální transkripce zvukově vyhodnotit tyto digitalizované skladby bez vynaložení značného úsilí. K vyřešení tohoto problému tato práce implementuje vícestupňový proces optického rozpoznávání hudby (Optical Music Recognition – OMR) s využitím neuronových sítí architektury YOLO. Výsledný software s názvem nanoScore rozděluje proces transkripce do čtyř kroků: detekce notových osnov, detekce hudebních symbolů, klasifikace jejich vertikální pozice a algoritmická rekonstrukce polyfonní partitury do formátu MusicXML. Pro zvládnutí občasných chyb v predikcích neuronových sítí je k dispozici interaktivní poloautomatický režim, který uživatelům umožňuje opravit nepřesnosti ještě před vygenerováním konečné partitury. Evaluace natrénovaných modelů prokazuje jejich vysokou úspěšnost. Hodnota mAP50 dosáhla 0,995 u detekce osnov a 0,927 u detekce symbolů, zatímco klasifikace pozice dosáhla Top-1 přesnosti 0,982. Při testování na svazku hlasových knih o rozsahu 384 stran dosáhl software rytmické synchronizace u 71,5 % taktů napříč všemi čtyřmi hlasy. Díky efektivnímu zpracování na běžných procesorech poskytuje toto řešení muzikologům i laikům dostupný nástroj pro generování přibližného zvukového náhledu přímo ze snímků. To jim umožňuje si skladbu poslechnout a zhodnotit ještě předtím, než přistoupí k její manuální transkripci.
This bachelor's thesis presents a software solution for transcribing 17th-century historical music printed by Pierre Ballard. Currently, evaluating the sound of these digitized compositions is impossible before investing significant time into manual transcription. To solve this, this work implements a multi-stage Optical Music Recognition (OMR) pipeline using YOLO neural networks. The software, named nanoScore, breaks the transcription process into four steps: detecting staves, detecting musical symbols, classifying their vertical positions, and algorithmically reconstructing the polyphonic score into a MusicXML format. To handle occasional neural network prediction errors, an interactive semiautomatic mode allows users to correct mistakes before the final score is generated. Evaluation of the trained models shows high accuracy. Staff and symbol detection reached an mAP50 of 0.995 and 0.927, respectively, and position classification achieved a Top-1 accuracy of 0.982. When tested on a 384-page partbook, the software achieved rhythmic synchronization for 71.5% of the measures across all four voices. Running efficiently on a standard consumer CPU, the pipeline provides musicologists and laypersons with an accessible tool to generate an approximate sound assessment from images, allowing them to hear and evaluate a piece before committing to a manual transcription.
Keywords:
detekce objektů; Historický notový zápis; klasifikace obrazu; MusicXML; optické rozpoznávání hudby (OMR); spartace; YOLO (You Only Look Once); Historical music notation; image classification; MusicXML; object detection; Optical Music Recognition (OMR); score reconstruction; YOLO (You Only Look Once)
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/259232