Název:
ETL proces v systému hlasování zastupitelských orgánů
Překlad názvu:
ETL Process in the Voting System of Representative Bodies
Autoři:
Janošík, Adam ; Burget, Radek (oponent) ; Zaklová, Kristýna (vedoucí práce) Typ dokumentu: Diplomové práce
Rok:
2026
Jazyk:
cze
Nakladatel: Vysoké učení technické v Brně. Fakulta informačních technologií
Abstrakt: [cze][eng]
Cílem této práce bylo vytvoření nástrojů, jež zefektivní ETL proces v rámci systému pro analýzu dat z hlasování státních orgánů. Byly vytvořeny celkem tři nástroje. První z nich vylepšuje a rozšiřuje původní řešení pro transformaci surových dat z hlasování zastupitelstev do referenčního datového modelu. Druhý nástroj zajišťuje nahrávání transformované datové sady do databáze, která je součástí aplikace pro vizualizaci těchto dat. Třetí komponenta provádí klasifikaci jednotlivých textových předmětů o hlasováních. Všechny nástroje byly vytvořeny v jazyce Python. Funkcionalita transformačního a databázového modulu byla ověřena pomocí komplexního testování, které garantují datovou integritu mezi vstupem a výstupem. Klasifikační modul byl podroben experimentálnímu testování s využitím různých přístupů, přičemž byla zkoumána sémantická dostatečnost textových předmětů na vstupu. Výsledná klasifikace byla ověřena pomocí kvalitativních i kvantitativních metrik. Vytvořené řešení jako celek usnadňuje zpracování a integraci datových sad v rámci ETL procesu. Klasifikační modul navíc přináší přístupy k automatické kategorizaci textových dat z politických hlasování.
The aim of this thesis was to design and implement software tools that extend the ETL process within a system for analyzing voting data from state authorities. A total of three tools were developed. The first tool improves and extends the original solution for transforming raw data from municipal council voting into a reference data model. The second tool ensures the loading of the transformed dataset into a database, which is a part of application that performs subsequent visualization of the data. The third component performs the classification of individual text subjects of the votings. All tools were developed in the Python programming language. The functionality of the transformation and database modules was verified using end-to-end tests, which guarantee data integrity between input and output. The classification module underwent experimental testing using various approaches, while investigating the semantic sufficiency of the input text subjects. The developed solution as a whole facilitates the processing and integration of diverse datasets within the ETL process. Furthermore, the classification module introduces a standalone approach for the automatic categorization of text data from political voting.
Klíčová slova:
BERTopic; dolování z dat; ETL proces; hlasování zastupitelstva; klasifikace textu; Python; BERTopic; council voting; data mining; ETL process; Python; text classification
Instituce: Vysoké učení technické v Brně
(web)
Informace o dostupnosti dokumentu:
Plný text je dostupný v Digitální knihovně VUT. Původní záznam: http://hdl.handle.net/11012/260655