Original title:
Evaluace a adaptace open-source systémů pro automatické rozpoznávání řeči s přiřazením identity mluvčího
Translated title:
Evaluation and adaptation of open-source models for speaker-attributed automatic speech recognition
Authors:
Bohata, Daniel Svatopluk ; Klement, Dominik (referee) ; Polok, Alexander (advisor) Document type: Bachelor's theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Cílem této práce je vyhodnocení a adaptace open-source modelů pro rozpoznávání řeči s přiřazením identity mluvčího (SA-ASR). Je provedeno systematické srovnání různých open-source SA-ASR systémů v rámci benchmarku EMMA MT-ASR, zahrnujícího jak kontrolované, simulované korpusy, tak náročné nahrávky z reálného světa. Benchmark je rozšířen o telefonní korpus Switchboard. Hlavním technickým přínosem práce je adaptace modelu Diarization-Conditioned Whisper (DiCoW) z offline systému na plně streamovací SA-ASR systém. Toho je dosaženo pomocí rozšíření LocalAgreement-2 policy na více mluvčí a integrací NVIDIA Streaming Sortformer jako zdroje diarizačních masek v reálném čase. Výsledný systém je veřejně dostupný spolu s interaktivní webovou ukázkou. Je provedena řada experimentů s dotrénováním modelu s cílem snížit mezeru ve výkonu způsobenou použitím skutečných diarizačních masek. Výsledky ukazují, že dotrénování modelu DiCoW pomocí Sortformer masek zlepšuje výkon v simulovaných podmínkách, ale neplatí obecně i na nahrávky ze schůzek, a že doladění modelu Whisper pomocí Sortformer masek nefunguje na datech z reálného světa.
This thesis addresses the evaluation and adaptation of open-source models for speaker-attributed automatic speech recognition (SA-ASR). Systematic benchmarking of multiple open-source SA-ASR systems is conducted under the EMMA MT-ASR evaluation benchmark, covering both controlled simulated corpora and challenging real-world recordings. The benchmark is further extended with the Switchboard conversational telephone corpus. The primary technical contribution is the adaptation of Diarization-Conditioned Whisper (DiCoW) from an offline system into a fully streaming SA-ASR system. This is achieved by extending the LocalAgreement-2 incremental decoding policy to the multi-speaker setting and integrating NVIDIA's Streaming Sortformer as the live diarization source. The resulting system is released publicly alongside an interactive web demonstration. A series of fine-tuning experiments is conducted to reduce the performance gap that arises from using real diarization masks. The results show that fine-tuning DiCoW using Sortformer masks improves performance on simulated conditions but does not generalize to real meeting recordings, and that fine-tuning Whisper using Sortformer masks does not work with real-world data.
Keywords:
Automatické rozpoznávání řeči; Diarizace; DiCoW; LocalAgreement; Průběžné zpracování; Přiřazení mluvčího; Sortformer; Automatic Speech Recognition; DiCoW; LocalAgreement; Sortformer; Speaker Attribution; Speaker Diarization; Streaming
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/258904