Original title:
Monolingvální adaptace vícejazyčných jazykových modelů prostřednictvím zarovnání slovníku
Translated title:
Monolingual Adaptation of Multilingual Language Models through Vocabulary Alignment
Authors:
Makaiová, Lucia ; Hradiš, Michal (referee) ; Fajčík, Martin (advisor) Document type: Master’s theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Táto práca skúma adaptáciu slovníka – proces prispôsobenia tokenizéra a embeddingov modelu konkrétnemu jazyku – ako prostriedok špecializácie viacjazyčného LLM na použitie v konkrétnom jazyku, so zameraním na češtinu. Práca porovnáva existujúce metódy a analyzuje vplyv kvality a množstva zarovnaní medzi slovníkmi zdrojového a cieľového tokenizéra na inicializáciu embeddingov. Taktiež vyhodnocujeme dopad na efektivitu tokenizácie, jazykové modelovanie a výkon v cieľových úlohách (downstream tasks). Na základe týchto zistení navrhujeme novú metódu kombinujúcu inicializáciu pomocou Trans-Tokenizácie s trénovateľným “low-rank” adaptérom. Adaptér je po trénovaní zlúčený priamo s embeddingovou maticou, čo nezavádza žiadnu výpočtovú réžiu pri inferencii. Napriek tomu náš prístup dosahuje najnižšiu perplexitu na úrovni slov spomedzi všetkých testovaných metód pri rovnakom čase trénovania. Na cieľových úlohách z českého benchmarku BenCzechMark dosahujú adaptované modely výsledky porovnateľné s pôvodným modelom alebo lepšie v 70% prípadoch. Nový tokenizér navyše zabezpečuje o 32% lepšiu efektivitu tokenizácie, čo vedie k 25% zrýchleniu inferencie. Výsledný česky adaptovaný model Llama 3.2 3B bude verejne dostupný na podporu ďalšieho výskumu a aplikácií v oblasti českého NLP.
This work investigates vocabulary adaptation – the process of tailoring a model’s tokenizer and embeddings to a specific language – as a means of specializing a multilingual LLM for monolingual use targeting Czech. We benchmark existing methods, and analyze how quality and quantity of the alignments between source and target tokenizer vocabularies affect embedding initialization. We also evaluate the impact on tokenization efficiency, language modeling, and downstream task performance. Building on these findings, we propose a novel method combining Trans-Tokenization-based initialization with a low-rank vocabulary adapter. After training, the adapter is merged directly into the embedding matrix, introducing no computational overhead at inference time. Yet, our approach outperforms any individual method in terms of language modeling performance, under the same computational budget, as measured by word-level perplexity. On downstream tasks from BenCzechMark, the adapted model reaches performance competitive with or better than the original model on 70% of benchmarks. The new tokenizer reduces fertility by approximately 32% which leads to improved inference speed by around 25%. The resulting Czech-adapted Llama 3.2 3B model will be released publicly to support further research and applications in Czech NLP.
Keywords:
adaptácia slovníka; inicializácia embeddingov; tokenizácia; veľké jazykové modely; viacjazyčné modely; embedding initialization; large language models; multilingual models; tokenization; vocabulary transfer
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/260316