Original title:
Modelování zvukových efektů s nelineární převodní charakteristikou pomocí metod strojového učení
Translated title:
Modeling of sound effects with nonlinear transfer characteristics using machine learning
Authors:
Bařinka, Václav ; Říha, Kamil (referee) ; Nimmerrichter, Benjamin (advisor) Document type: Master’s theses
Year:
2026
Language:
cze Publisher:
Vysoké učení technické v Brně. Fakulta elektrotechniky a komunikačních technologií Abstract:
[cze][eng]
Diplomová práce se zabývá návrhem, implementací a vyhodnocením systému pro neuronovou emulaci nelineárních zvukových efektů s pamětí v reálném čase. Navržená architektura HybridAmpModel vychází z hybridního strukturovaného black-box přístupu s topologií L-NL-L, fyzikálně motivovanou signálovým řetězcem kytarového zesilovače. Tvoří ji trénovatelný předřazený FIR filtr, nelineární jádro na bázi temporální konvoluční sítě (TCN) s exponenciálně dilatovanými kauzálními konvolucemi a FiLM (Feature-wise Linear Modulation) podmínění parametru gain s aktivační funkcí Snake. Model je trénován na reálných nahrávkách dvou cílových zařízení: digitálního pluginu SGA1566 a analogového elektronkového zesilovače Laney Ironheart, za použití kombinované ztrátové funkce ESR (Error-to-Signal Ratio) a MR-STFT (Multi-Resolution Short-Time Fourier Transform) s pre-emfázním filtrem. Byly natrénovány čtyři hloubkové varianty architektury (5, 7, 8 a 10 vrstev). Natrénované modely jsou exportovány pomocí knihovny RTNeural a nasazeny jako funkční VST3 pluginy v prostředí JUCE 8 s nulovým algoritmickým zpožděním. Nejlepšího objektivního výsledku bylo dosaženo u varianty SGA1566 10L (validační ESR 8,7\%) a Laney Ironheart 8L (ESR 53,8\%). Subjektivní poslechový on-line test (29 respondentů, metodiky MUSHRA, ABX a párové porovnání preferencí) dosáhl průměrného MUSHRA skóre 55,4 bodů. Výsledky preferenčního testu ukázaly, že celková preference originálu (56,2\%) není na zvolené hladině významnosti statisticky průkazně odlišná od náhodné volby, přičemž u variant SGA1566 8L a Laney 5L respondenti dokonce preferovali predikci modelu před originálem. Generovaný zvuk tak navzdory měřitelným odchylkám disponuje vysokou estetickou hodnotou a je posluchači vnímán jako muzikální a prakticky použitelný.
This diploma thesis presents the design, implementation, and evaluation of a system for real-time neural emulation of nonlinear audio effects. The proposed HybridAmpModel architecture follows a hybrid structured black-box approach with an L-NL-L topology physically motivated by the signal chain of a guitar amplifier. It consists of a trainable front-end FIR filter, a nonlinear core based on a Temporal Convolutional Network (TCN) with exponentially dilated causal convolutions, and FiLM (Feature-wise Linear Modulation) conditioning on the gain parameter using the Snake activation function. The model is trained on real recordings of two target devices — the digital plugin SGA1566 and the analog tube guitar amplifier Laney Ironheart — using a combined loss function comprising ESR (Error-to-Signal Ratio) and MR-STFT (Multi-Resolution Short-Time Fourier Transform) with a pre-emphasis filter. Four depth variants of the architecture were trained (5, 7, 8, and 10 layers). The trained models are exported using the RTNeural library and deployed as functional VST3 plugins built on the JUCE 8 framework with zero algorithmic latency. The best objective results were achieved by the SGA1566 10L variant (validation ESR 8.7\%) and the Laney Ironheart 8L variant (ESR 53.8\%). A subjective online listening test (29 respondents, MUSHRA, ABX, and paired preference methods) achieved an average MUSHRA score of 55.4 points. The preference test results showed that the overall preference for the original recording (56.2\%) was not statistically distinguishable from random selection. Moreover, for the SGA1566 8L and Laney 5L variants, respondents actually preferred the model's prediction over the original. The generated sound, despite measurable deviations, possesses high aesthetic value and is perceived by listeners as musical and practically usable.
Keywords:
FiLM conditioning; guitar amplifier emulation; MUSHRA listening test.; Neural networks; RTNeural; Snake activation function; temporal convolutional network; VST3 plugin; emulace kytarového zesilovače; FiLM podmínění; Neuronové sítě; poslechový test MUSHRA.; RTNeural; Snake aktivační funkce; temporální konvoluční síť; VST3 plugin
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/257756