Original title:
Počítačové vidění nad Malleable Glyphs
Authors:
Janda, Přemek ; Hradiš, Michal (referee) ; Herout, Adam (advisor) Document type: Master’s theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Zatímco lidé dokážou intuitivně odhadovat velikosti nebo hodnoty vizuálních prvků, jako jsou glyfy, pro systémy počítačového vidění tento úkol představuje značný problém, zejména při nízkém množství vstupních dat nebo pokud se nacházejí mimo trénovací sadu. Jako řešení tato práce navrhuje přístup založený na hlubokém učení, který k analýze glyfů přistupuje jako k úloze spojité regrese. Práce představuje postup pro generování rasterizovaných tvárných (malleable) glyfů a vyhodnocuje architektury založené na konvolučních sítích (CNN) a vizuálních transformerech (ViT). Hlavním přínosem je návrh architektury inspirované variačními autokodéry (VAE) využívající pravděpodobnostně regularizovaný latentní prostor, který odděluje geometrickou identitu glyfu od jeho velikosti. Práce sadou experimentů vyhodnocuje vnímání a schopnost modelu interpolovat a generalizovat na neznámá data. Výsledky potvrzují, že nejvyšší stability a schopnosti generalizace dosahují CNN architektury v kombinaci se strukturovaným rozdělením latentního prostoru.
While humans can intuitively estimate continuous values from visuals such as glyphs, for computer vision systems, this task presents a significant challenge, especially under limitations such as sparse or out-of-distribution input data. To tackle this problem, this thesis proposes a deep learning approach framing glyph analysis as a continuous regression task. The work introduces a generation pipeline for rasterized malleable glyphs and evaluates architectures based on Convolutional Neural Networks (CNN) and Vision Transformers (ViT). A core contribution of this work is the design of a VAE-assisted architecture utilizing a probabilistically regularized latent space, which decouples the geometric identity of a glyph from its magnitude. Through a series of experiments, the thesis evaluates the perception and model's capacity for interpolation and zero-shot transfer. The final results confirm that lightweight CNN backbones coupled with structured latent space division yield the highest stability and generalization performance.
Keywords:
Hluboké učení; Konvoluční neuronové sítě; Odhad hodnoty; Počítačové vidění; Regrese; Syntetická data; Tvárné glyfy; Vision Transformer; Vizualizace informací; CNN; Computer vision; Deep learning; Information visualization; Malleable glyphs; Regression; Synthetic data; Value estimation; Vision Transformer
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/260404