Original title:
Přenos stylu zpracování zvukových nahrávek s využitím neuronových sítí
Translated title:
Style transfer of audio recording processing using neural networks
Authors:
Mostecký, Jan ; Ištvánek, Matěj (referee) ; Miklánek, Štěpán (advisor) Document type: Master’s theses
Year:
2026
Language:
cze Publisher:
Vysoké učení technické v Brně. Fakulta elektrotechniky a komunikačních technologií Abstract:
[cze][eng]
Tato diplomová práce se zabývá problematikou přenosu stylu zpracování zvukových nahrávek pomocí neuronových sítí. Cílem je navrhnout a implementovat model, který dokáže aplikovat řetězec zvukových efektů na nezpracovanou nahrávku tak, aby výsledný zvuk odpovídal charakteru referenční nahrávky. Teoretická část se zaměřuje na principy neuronových sítí a jejich využití při zpracování zvukového signálu, přehled metod přenosu stylu hudební nahrávky a popis tří pro masteringový proces klíčových zvukových efektů – parametrického ekvalizéru, kompresoru a saturátoru – včetně jejich matematických modelů a možností implementace. V praktické části je popsán návrh systému založeného na diferenciovatelných efektech implementovaných v knihovně PyTorch, včetně experimentálního ověření funkčnosti na testovacích zvukových sadách. Výsledky ukazují, že optimalizací parametrů efektů lze dosáhnout částečného přenosu charakteru referenční nahrávky a jsou diskutována omezení strojového učení pro danou problematiku i možnosti dalšího rozvoje.
This master's thesis addresses the problem of audio production style transfer using neural networks. The objective is to design and implement a~model capable of applying a~chain of audio effects to a~raw recording so that the resulting sound matches the character of a~reference track. The theoretical section focuses on the principles of neural networks and their application in audio signal processing, provides an overview of audio style transfer methods, and describes three key audio effects for the mastering process -- parametric equalizer, compressor, and saturator -- including their mathematical models and implementation possibilities. The practical section describes the design of a~system based on differentiable effects implemented in the PyTorch library, including experimental validation of its functionality on test audio datasets. The results demonstrate that by optimizing the effect parameters, a~partial transfer of the reference recording's character can be achieved. Furthermore, the limitations of machine learning for this specific problem are discussed, alongside potential avenues for future development.
Keywords:
Compressor; Equiliser; Mashine Learning; Neural network; Saturator; Style Transfer; Ekvalizér; Kompresor; Neuronová síť; Přenos Stylu; Saturátor; Strojové učení
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/257741