Original title:
Nástroj pro efektivní označování témat v textových kolekcích
Translated title:
Tool for Efficient Topic Labeling in Text Collections
Authors:
Juřica, Richard ; Kišš, Martin (referee) ; Hradiš, Michal (advisor) Document type: Bachelor's theses
Year:
2026
Language:
cze Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[cze][eng]
Manuální sémantická anotace rozsáhlých historických korpusů představuje pro badatele v digitálních humanitních vědách časově i kognitivně náročný proces. Tato práce představuje webový anotační nástroj, vyvinutý jako součást platformy semAnt, který integruje velké jazykové modely (LLM) a vektorové databáze pro realizaci asistovaného kódování v architektuře „Human-in-the-loop“ s využitím sémantického vyhledávání. Evaluace na historických periodikách prokázala nárůst informační výtěžnosti o 27,1 % a průměrnou úsporu času o 9,5 %. Mezianotátorská shoda se díky asistenci AI zvýšila o 23,3 %. Výsledkem je nástroj, který zefektivňuje analýzu textových dat a pomáhá sjednotit interpretaci komplexních sémantických kategorií.
Manual semantic annotation of large historical corpora represents a time-consuming and cognitively demanding process for digital humanities researchers. This thesis presents a web-based annotation tool, developed as a part of the semAnt platform, which integrates large language models (LLMs) and vector databases to implement assisted coding within a "Human-in-the-loop" architecture using semantic search. Evaluation on historical periodicals demonstrated a 27.1 % increase in information yield and an average time saving of 9.5 %. Inter-coder reliability increased by 23.3 % due to AI assistance. The result is a tool that streamlines the analysis of text data and helps unify the interpretation of complex semantic categories.
Keywords:
digital humanities; FastAPI; large language models (LLM); natural language processing (NLP); Quasar; semantic annotation; semantic search; text analysis; text coding; vector databases; Weaviate; web tool; analýza textu; digitální humanitní vědy; FastAPI; kódování textu; Quasar; sémantická anotace; sémantické vyhledávání; vektorové databáze; velké jazykové modely (LLM); Weaviate; webový nástroj; zpracování přirozeného jazyka (NLP)
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/258775