Original title:
PARAMETRICKY EFEKTIVNÍ MODELY PRO AUTOMATICKÉ ROZPOZNÁVÁNÍ ŘEČI A JAZYKA
Translated title:
PARAMETER EFFICIENT MODELS FOR DOMAIN SPECIFIC SPEECH AND LANGUAGE RECOGNITION
Authors:
Prasad, Amrutha ; Lee, Hung-yi (referee) ; Ircing, Pavel (referee) ; Motlíček, Petr (advisor) Document type: Doctoral theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Rozsáhlé předtrénované akustické modely se staly základem moderních řečových technologií a dosahují špičkového výkonu v celé řadě úloh. Jejich obrovský počet parametrů však představuje značné výzvy pro nasazení v prostředích s omezenými zdroji a kritickými pro bezpečnost. Tato disertační práce se zabývá návrhem a evaluací redukce modelů a parametricky efektivních metodologií pro automatické rozpoznávání řeči (ASR) a identifikaci jazyka (LID). Výzkum se primárně zaměřuje na oblast řízení letového provozu (ATC), t.j., vysoce náročný scénář charakterizovaný omezeným jazykovým kontextem, silným šumem pozadí a vysokou diverzitou mluvčích, což z něj činí ideální testovací prostředí pro hodnocení robustního zpracování řeči v reálných podmínkách. Abychom zmírnili výpočetní náklady bez snížení výkonu, práce se nejprve zaměřuje na specifické diskriminátory, které jsou implementovány v modelech typu XLS-R. Pro úlohu LID je tradiční diskriminátor typu TDNN nahrazen faktorizovanou neuronovou sítí (TDNN-F), čímž se dosahuje 30–50% redukce parametrů při zachování plné diskriminační kapacity. Dále práce zkoumá použití "Normalizing Flows" metody k modelování komplexních distribucí. To efektivně obchází tradiční Gaussovské předpoklady pravděpodobnostní lineární diskriminační analýzy (PLDA) a odstraňuje potřebu normalizace délky audio nahrávek. U dvou ze tří datových sad, "Flow" model konzistentně poskytoval vyšší přesnost než metoda PLDA. Práce poté zkoumá strukturální kompresi samotných základních modelů. Faktorizace matic pomocí SVD dekompozice je aplikována na dopředné vrstvy neuronových sítí ( v modelech XLS-R a Whisper), a to jak samostatně, tak ve spojení s adaptací LoRA. Na rozdíl od standardních metod, které omezují množství parametrů pouze během adaptace modelů, tato faktorizace zmenšuje velikost modelu jak během trénování, tak i inference. Účinnost navržených technik je testována na třech datových sadách pro detekci jazyka (LID) a dvou sadách pro rozpoznávání řeči (ASR). U modelu XLS-R je množství parametrů sníženo o 23–50% s minimálním snížením přesnosti modelů. U Whisper modelů vede 28% redukce parametrů ke snížení WER o 1,8%, zatímco 50% redukce nemá žádný vliv na WER.
Large pretrained acoustic models have become foundational to modern speech technologies, achieving state-of-the-art performance across a variety of tasks. However, their massive parameter counts pose significant challenges for deployment in resource-constrained and safety-critical environments. This doctoral thesis addresses these limitations by proposing and evaluating model compression and parameter-efficient methodologies for Automatic Speech Recognition (ASR) and Language Identification (LID). The research primarily focuses on the Air Traffic Control (ATC) domain—a highly demanding scenario characterized by reduced linguistic context, elevated background noise, and high speaker diversity, making it an ideal testbed for evaluating robust speech processing under real-world constraints. To mitigate computational costs without sacrificing performance, the thesis first targets task-specific back-end discriminators built on top of the XLS-R model. For the LID task, the traditional Time-Delay Neural Network (TDNN) backend discriminator is replaced with Factorized Time-Delay Neural Networks (TDNN-F), achieving a 30–50% parameter reduction while maintaining full discriminative capacity. Furthermore, the thesis explores the use of Normalizing Flows to model complex embedding distributions. This effectively circumvents the traditional Gaussian assumptions of Probabilistic Linear Discriminant Analysis (PLDA) scoring and removes the need for length normalization. For two of the three datasets, the Flow model consistently yielded higher accuracy than the PLDA scoring method. The thesis then investigates structural compression within the foundational models themselves. Low-rank matrix factorization via Singular Value Decomposition (SVD) is applied to the feed-forward layers of transformer architectures (XLS-R and Whisper), both independently and in conjunction with Low-Rank Adaptation (LoRA). Unlike standard parameter-efficient methods that constrain the parameter budget only during fine-tuning, this factorization reduces model size during both training and inference. The effectiveness of the proposed techniques is tested on three datasets for LID and on two datasets for ASR. For the XLS-R model, parameters are reduced by 23–50% with minimal to no performance degradation. For Whisper, a 28% parameter reduction yields a 1.8% absolute improvement in Word Error Rate (WER), while a 50% reduction introduces no degradation.
Keywords:
Automatické rozpoznávání řeči; Faktorizace matic; Redukce množství parametrů; Rozpoznání jazyka; Automatic speech recognition; Language recognition; Low-rank matrix factorization; Parameter reduction
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: https://hdl.handle.net/11012/260597